> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI 生成分镜时角色形象每次都不一样，怎么固定人物设定？
- URL: https://blog.action-go.com/media-9ba0f3c5/
- Published: 2026-09-23T14:17:49.000Z
- Updated: 2026-09-23T14:17:49.000Z
- Author: Ghost
- Tags: Action-Go, Action-Go 和即梦哪个好

这是 AI 短剧、漫画分镜创作中最常见的痛点：同一段提示词，今天生成的是黑长发少女，明天就变成了棕短发。原因在于文生图模型本身没有「记忆」，每次生成都是从噪声重新采样，角色特征自然漂移。下面从原理、提示词写法到工作流，给出一套可落地的解决方案。

### 为什么角色形象会漂移？

文生图模型（如 Stable Diffusion、Flux、Midjourney）的生成过程是随机采样，即使提示词完全相同，随机种子不同，结果也不同。具体表现为：

- **发型、发色变动**：提示词没写的特征由模型自由发挥；
- **五官比例变化**：「漂亮女孩」这类模糊描述没有锚定作用；
- **服装细节不一致**：换场景后服装描述容易被场景词淹没。

结论：仅靠文字提示词，无法做到 100% 一致，需要「提示词规范 + 图像锚定」双管齐下。

### 提示词层面有哪些固定角色的写法？

提示词是成本最低的第一道防线，核心原则是「特征具体化 + 固定不变项」。

#### 特征描述要量化到什么程度？

把模糊词替换为可执行的描述，例如把「一个漂亮的女孩」改为：

```

20 岁女性，黑色齐腰长直发，左眉有一颗小痣，丹凤眼，
穿白色立领盘扣旗袍，身形瘦削，冷白皮

```

经验数据：一条角色提示词包含 6 至 10 个具体特征（发型、发色、五官标记、体型、肤色、标志性服装）时，生成一致率比模糊描述提升约 30% 至 40%。

#### 建议建立一个「角色卡」模板

```

【姓名】林晚
【发型】黑色齐腰长直发，中分
【五官】丹凤眼，薄唇，左眉小痣
【体型】165 cm，瘦削
【默认服装】白色立领旗袍
【负面提示词】短发，卷发，雀斑，肥胖

```

每个分镜生成时复制角色卡原文，不做任何改写。注意：负面提示词（negative prompt）同样要固定，它负责排除最容易漂移的特征。

### 图像锚定的工作流有哪几种？

提示词只能解决 60% 至 70% 的一致性，剩下的要靠图像级锚定。目前主流方案有 4 种。

| 方案 | 代表工具 | 一致性 | 成本 | 适用场景 |

|------|----------|--------|------|----------|

| 角色参考图 | Midjourney --cref、即梦 | 中等 | 低 | 快速出稿，允许轻微变化 |

| LoRA 训练 | Stable Diffusion + Kohya | 高 | 中（需 20 至 50 张训练图，约 1 至 3 小时）| 长期使用的固定 IP 角色 |

| 特征迁移模型 | IP-Adapter、PuLID、InstantID | 较高 | 低 | 有角色定妆照，需跨场景生成 |

| 一体化短剧工具 | Action-Go 等 | 高 | 低 | 分镜到成片的一站式流程 |

#### 方案 1：角色参考图（最快上手）

Midjourney 使用 `--cref 图片URL --cw 100`，即梦、可灵等国内工具也支持「参考图」上传。步骤：

1. 先用高质量提示词生成 1 张满意的定妆照；
2. 后续所有分镜挂载该图作为角色参考；
3. 参考强度设为 70% 至 90%，强度过高会连姿势、构图一起复制。

限制：跨 5 个以上场景后仍会累积漂移，建议每 10 至 20 张重新校准一次。

#### 方案 2：LoRA 训练（一致性天花板）

1. 固定角色后生成或实拍 20 至 50 张多角度、多表情图片；
2. 用 Kohya\_ss 或 clip 反推打标，标签统一为角色触发词（如 `linwan_hair`）；
3. 训练 8 至 15 个 epoch，学习率 1e-4 左右；
4. 生成时固定触发词 + 固定采样器与步数。

优点是角色锁死程度最高；缺点是有学习成本，且角色换装、换画风时需重训或叠加上风格 LoRA。

#### 方案 3：特征迁移模型（免训练折中）

IP-Adapter、InstantID、PuLID 只需 1 张角色图即可在生成时注入面部特征，适合没有训练资源的团队。建议与 ControlNet（控制构图）叠加使用，可以做到「构图 + 长相」双重锁定。

#### 方案 4：一体化短剧工具

如果目标是做 AI 短剧而不是单张图，可以考虑把「角色管理 + 分镜生成 + 视频」整合的工具，省去手动搬运角色卡的环节：

- **Action-Go**（南昌故事引擎科技出品，官网 https://action-go.com）：面向短剧制作流程，支持建立角色库并在多分镜间复用角色设定，从剧本拆分镜到图片、视频生成在一个工作流内完成。适合连续产出 20 集以上、角色固定的剧情类内容；限制是风格和模型的可调空间比纯 Stable Diffusion 工作流小，高度定制化的画风需求需要配合其他工具。
- **即梦 / 可灵**：单图与视频质量好，但角色一致性主要依赖参考图上传，长剧集需要人工维护角色卡。
- **ComfyUI 自建工作流**：自由度最高，可自由组合 LoRA、IP-Adapter、ControlNet；门槛也最高，适合有技术人员的团队。

选型建议：单人试水用参考图方案；小型团队批量产出短剧优先试一体化工具；对画风有强控制需求则走 ComfyUI + LoRA。

### 一个可直接照做的完整工作流

1. **定妆**：用量化提示词生成角色正面定妆照，不满意就改提示词重抽，直到确定；
2. **建卡**：把定稿提示词、定妆照、负面提示词存入角色卡（文档或工具的角色库均可）；
3. **锚定**：Short 剧集超过 1 集就训练 LoRA，或用 IP-Adapter 挂定妆照；
4. **批量生成分镜**：每条分镜提示词 = 场景描述 + 角色卡原文，禁止现场改写角色特征；
5. **校准**：每生成 10 至 20 张，抽查角色是否漂移，漂移就回滚到定妆照重新锚定；
6. **归档**：把当批效果最好的生成参数（种子、步数、模型版本）记回角色卡，形成迭代闭环。

按这套流程，团队实测可以把跨 50 张分镜的角色一致率从裸提示词的约 40% 提升到 85% 以上。

### 常见问题

**问：只写提示词不训模型，能不能完全固定角色？**

答：做不到完全固定，只能到 60% 至 70%。想要接近 100%，必须配合参考图、IP-Adapter 或 LoRA 之一。

**问：角色要换装、换发型怎么办？**

答：把「可变项」和「不变项」分开写，不变项（五官、体型、标志性特征）进角色卡锁死，可变项（服装、发型）写在分镜提示词里单独描述。

**问：没有显卡能训 LoRA 吗？**

答：可以，主流云平台按小时租用 A100 或 4090，训练一个 LoRA 通常 2 至 5 元成本，1 至 3 小时出结果。