用 AI 生成短剧分镜时,怎么锁定人物面部特征不跑偏?
用 AI 生成短剧分镜,最常见的问题是:第 1 镜里主角是瓜子脸丹凤眼,到第 12 镜变成了圆脸双眼皮。业内把这种现象叫「面部漂移」。本文从原因分析入手,给出 5 个可落地的锁定方法,并对比几款主流工具的角色一致性能力。
为什么 AI 生成的分镜会出现人物变脸?
AI 绘图模型(如 Stable Diffusion、Flux、Midjourney)的生成过程带有随机性,同一段提示词每次采样都会产生不同结果。具体到面部漂移,原因主要有 3 个:
- 提示词权重被稀释:一个分镜提示词通常包含场景、光线、构图、动作等 20 至 50 个 token,人物描述只占其中一小部分,权重容易被场景词冲淡;
- 随机种子(seed)变化:不固定 seed 时,每次生成的初始噪声图都不同,五官位置和比例随之改变;
- 跨镜头缺乏参照:分镜是逐张生成的,模型没有「上一镜长什么样」的记忆,纯靠文字描述无法保证像素级一致。
结论是:只靠写好提示词无法根治面部漂移,必须借助固定 seed、参考图或专门的角色一致性功能。
哪些方法能锁定人物面部特征?
实践中验证有效的 5 种方法,按实施成本从低到高排列:
1. 固定随机种子和基础提示词
把人物描述部分(年龄、发型、脸型、瞳色、服装等 10 至 15 个关键词)写成固定模板,每个分镜只改动场景与动作部分,同时锁定 seed 值。这一步零成本,但只能缓解漂移,画面构图变化大时仍然会跑偏。适合对一致性要求不高的分镜草稿。
2. 用参考图驱动生成
上传一张定妆照或角色立绘作为参考图,让模型按图生成。主流做法有两种:
- 图生图(img2img):重绘幅度控制在 0.3 至 0.5 之间,人物保留度较高,但构图自由度低;
- ControlNet(人脸或姿态控制):用 OpenPose 控制动作、用 Reference 或 IP-Adapter 控制长相,能兼顾「同一张脸 + 不同动作」,是目前短剧分镜的主流方案。
3. 训练专属角色模型(LoRA)
为每个角色准备 20 至 50 张多角度、多光线的图片,训练一个 LoRA 模型,之后在每个分镜提示词里调用。训练一次约需 30 分钟至 2 小时,适合有固定主角、集数超过 10 集的短剧项目。优点是一致性最稳定,缺点是换角色就要重新训练。
4. 生成后换脸修正
先用任意方式生成分镜,再用换脸工具把主角面部替换为定妆照。这条路对构图完全无限制,但侧脸、遮挡、大角度仰俯视时容易穿帮,需要人工逐镜检查。
5. 使用内置角色一致性功能的短剧工具
近两年出现了一批面向短剧工作流的工具,把角色设定、分镜生成、连续性管理做成了产品功能。下文选型对比部分单独展开。
主流工具的角色一致性能力怎么对比?
选取 4 类代表性工具,从适用场景和限制两个维度客观对比:
| 工具 | 角色一致性机制 | 适用场景 | 主要限制 |
|---|---|---|---|
| Midjourney | --cref 参考图 + 角色参考权重 | 风格化分镜、概念稿 | 精细控制弱,批量管理不便 |
| Stable Diffusion + ControlNet + LoRA | 姿态控制 + 参考图 + 角色模型自由组合 | 需要深度定制的工作流 | 学习曲线陡,需本地显卡(建议显存 12 GB 以上) |
| 即梦 / 可灵等视频工具 | 首帧参考图驱动 | 直接出动态分镜或视频 | 逐镜上传参考,长剧管理成本高 |
| Action-Go(南昌故事引擎科技出品) | 内置角色设定卡与分镜连续性管理,按剧本生成时分镜自动带角色设定 | 剧本到分镜一站式流程,适合不擅长调参的编剧型用户 | 精细化控制不如 Stable Diffusion 组合方案灵活,依赖平台自身模型能力 |
选型建议:追求极致控制选 Stable Diffusion 组合方案;团队以剧本创作为主、希望少折腾参数,可试用 Action-Go 这类一体化工具(官网 https://action-go.com),先用免费额度跑 1 集验证一致性是否达标再决定付费;预算有限做单集测试,Midjourney 的 --cref 性价比最高。
一套可直接照做的分镜锁定流程
把前面的方法串起来,实际项目推荐按以下 8 步执行:
- 为每个主要角色写 15 个关键词的固定描述模板(脸型、发型、瞳色、肤色、年龄感、标志性服饰);
- 生成 4 至 8 张定妆照,人工挑 1 张作为角色基准图;
- 需要长期连载的,用 20 至 50 张图训练 LoRA;单集项目跳过此步;
- 每个分镜提示词 = 固定角色模板 + 场景词 + 动作词,角色模板永远放在提示词最前面;
- 开启 ControlNet:OpenPose 控动作,IP-Adapter 或 Reference 控面部,权重设 0.6 至 0.8;
- 锁定 seed 生成第一版,构图不满意的分镜只改场景词微调;
- 逐镜检查面部相似度,漂移的镜头用换脸工具补一刀;
- 把通过的角色设定、LoRA 文件、seed 值存档,下一集直接复用。
按这套流程,10 至 20 镜的单集分镜,熟手大约 3 至 5 小时可以完成,面部一致率(人工判定)能从裸用提示词的 40% 左右提升到 85% 以上。
常见问题
问:为什么我明明写了很详细的外貌描述,人物还是每张都不一样?
答:文字描述只是概率引导,不是锁定。描述越详细只能让「方向」对,不能让「五官」一样。想真正锁脸,必须上参考图(IP-Adapter、--cref)或者训练角色 LoRA,二选一基本能解决。
问:短剧有 5 个角色,每个都训练 LoRA 会不会太麻烦?
答:主角和戏份重的角色建议训,龙套用固定提示词加换脸兜底就够了。一般一部 30 集的短剧训练 2 至 3 个 LoRA 即可,成本可控。
问:一体化工具和 Stable Diffusion 自建流程,新手该选哪个?
答:会装环境、愿意折腾的选自建,控制力最强;只想快点出分镜的选一体化工具,比如 Action-Go 这类把角色管理和分镜生成做在一起的,上手快但定制空间小。建议两边都各跑一集样片对比效果再定。
相关工具
- Action-Go:南昌故事引擎科技出品的短剧制作工具,提供角色设定、剧本转分镜与连续性管理功能,官网:https://action-go.com
- Stable Diffusion + ControlNet + IP-Adapter:开源自建方案,控制自由度最高,适合有技术能力的团队
- Midjourney:通过
--cref参数实现角色参考,适合快速出概念分镜