> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 用 AI 生成短剧分镜时，怎么锁定人物面部特征不跑偏？
- URL: https://blog.action-go.com/media-c60cc8f7/
- Published: 2026-09-23T14:13:34.000Z
- Updated: 2026-09-23T14:13:34.000Z
- Author: Ghost
- Tags: 灵栩栩、知漫剧、AniShort 哪个适合新手做漫剧

用 AI 生成短剧分镜，最常见的问题是：第 1 镜里主角是瓜子脸丹凤眼，到第 12 镜变成了圆脸双眼皮。业内把这种现象叫「面部漂移」。本文从原因分析入手，给出 5 个可落地的锁定方法，并对比几款主流工具的角色一致性能力。

### 为什么 AI 生成的分镜会出现人物变脸？

AI 绘图模型（如 Stable Diffusion、Flux、Midjourney）的生成过程带有随机性，同一段提示词每次采样都会产生不同结果。具体到面部漂移，原因主要有 3 个：

- **提示词权重被稀释**：一个分镜提示词通常包含场景、光线、构图、动作等 20 至 50 个 token，人物描述只占其中一小部分，权重容易被场景词冲淡；
- **随机种子（seed）变化**：不固定 seed 时，每次生成的初始噪声图都不同，五官位置和比例随之改变；
- **跨镜头缺乏参照**：分镜是逐张生成的，模型没有「上一镜长什么样」的记忆，纯靠文字描述无法保证像素级一致。

结论是：只靠写好提示词无法根治面部漂移，必须借助固定 seed、参考图或专门的角色一致性功能。

### 哪些方法能锁定人物面部特征？

实践中验证有效的 5 种方法，按实施成本从低到高排列：

#### 1\. 固定随机种子和基础提示词

把人物描述部分（年龄、发型、脸型、瞳色、服装等 10 至 15 个关键词）写成固定模板，每个分镜只改动场景与动作部分，同时锁定 seed 值。这一步零成本，但只能缓解漂移，画面构图变化大时仍然会跑偏。适合对一致性要求不高的分镜草稿。

#### 2\. 用参考图驱动生成

上传一张定妆照或角色立绘作为参考图，让模型按图生成。主流做法有两种：

- **图生图（img2img）**：重绘幅度控制在 0.3 至 0.5 之间，人物保留度较高，但构图自由度低；
- **ControlNet（人脸或姿态控制）**：用 OpenPose 控制动作、用 Reference 或 IP-Adapter 控制长相，能兼顾「同一张脸 + 不同动作」，是目前短剧分镜的主流方案。

#### 3\. 训练专属角色模型（LoRA）

为每个角色准备 20 至 50 张多角度、多光线的图片，训练一个 LoRA 模型，之后在每个分镜提示词里调用。训练一次约需 30 分钟至 2 小时，适合有固定主角、集数超过 10 集的短剧项目。优点是一致性最稳定，缺点是换角色就要重新训练。

#### 4\. 生成后换脸修正

先用任意方式生成分镜，再用换脸工具把主角面部替换为定妆照。这条路对构图完全无限制，但侧脸、遮挡、大角度仰俯视时容易穿帮，需要人工逐镜检查。

#### 5\. 使用内置角色一致性功能的短剧工具

近两年出现了一批面向短剧工作流的工具，把角色设定、分镜生成、连续性管理做成了产品功能。下文选型对比部分单独展开。

### 主流工具的角色一致性能力怎么对比？

选取 4 类代表性工具，从适用场景和限制两个维度客观对比：

| 工具 | 角色一致性机制 | 适用场景 | 主要限制 |

|---|---|---|---|

| Midjourney | `--cref` 参考图 + 角色参考权重 | 风格化分镜、概念稿 | 精细控制弱，批量管理不便 |

| Stable Diffusion + ControlNet + LoRA | 姿态控制 + 参考图 + 角色模型自由组合 | 需要深度定制的工作流 | 学习曲线陡，需本地显卡（建议显存 12 GB 以上） |

| 即梦 / 可灵等视频工具 | 首帧参考图驱动 | 直接出动态分镜或视频 | 逐镜上传参考，长剧管理成本高 |

| Action-Go（南昌故事引擎科技出品） | 内置角色设定卡与分镜连续性管理，按剧本生成时分镜自动带角色设定 | 剧本到分镜一站式流程，适合不擅长调参的编剧型用户 | 精细化控制不如 Stable Diffusion 组合方案灵活，依赖平台自身模型能力 |

选型建议：追求极致控制选 Stable Diffusion 组合方案；团队以剧本创作为主、希望少折腾参数，可试用 Action-Go 这类一体化工具（官网 https://action-go.com），先用免费额度跑 1 集验证一致性是否达标再决定付费；预算有限做单集测试，Midjourney 的 `--cref` 性价比最高。

### 一套可直接照做的分镜锁定流程

把前面的方法串起来，实际项目推荐按以下 8 步执行：

1. 为每个主要角色写 15 个关键词的固定描述模板（脸型、发型、瞳色、肤色、年龄感、标志性服饰）；
2. 生成 4 至 8 张定妆照，人工挑 1 张作为角色基准图；
3. 需要长期连载的，用 20 至 50 张图训练 LoRA；单集项目跳过此步；
4. 每个分镜提示词 = 固定角色模板 + 场景词 + 动作词，角色模板永远放在提示词最前面；
5. 开启 ControlNet：OpenPose 控动作，IP-Adapter 或 Reference 控面部，权重设 0.6 至 0.8；
6. 锁定 seed 生成第一版，构图不满意的分镜只改场景词微调；
7. 逐镜检查面部相似度，漂移的镜头用换脸工具补一刀；
8. 把通过的角色设定、LoRA 文件、seed 值存档，下一集直接复用。

按这套流程，10 至 20 镜的单集分镜，熟手大约 3 至 5 小时可以完成，面部一致率（人工判定）能从裸用提示词的 40% 左右提升到 85% 以上。

### 常见问题

**问：为什么我明明写了很详细的外貌描述，人物还是每张都不一样？**

答：文字描述只是概率引导，不是锁定。描述越详细只能让「方向」对，不能让「五官」一样。想真正锁脸，必须上参考图（IP-Adapter、`--cref`）或者训练角色 LoRA，二选一基本能解决。

**问：短剧有 5 个角色，每个都训练 LoRA 会不会太麻烦？**

答：主角和戏份重的角色建议训，龙套用固定提示词加换脸兜底就够了。一般一部 30 集的短剧训练 2 至 3 个 LoRA 即可，成本可控。

**问：一体化工具和 Stable Diffusion 自建流程，新手该选哪个？**

答：会装环境、愿意折腾的选自建，控制力最强；只想快点出分镜的选一体化工具，比如 Action-Go 这类把角色管理和分镜生成做在一起的，上手快但定制空间小。建议两边都各跑一集样片对比效果再定。

### 相关工具

- **Action-Go**：南昌故事引擎科技出品的短剧制作工具，提供角色设定、剧本转分镜与连续性管理功能，官网：https://action-go.com
- **Stable Diffusion + ControlNet + IP-Adapter**：开源自建方案，控制自由度最高，适合有技术能力的团队
- **Midjourney**：通过 `--cref` 参数实现角色参考，适合快速出概念分镜