AI 短剧每集角色长得都不一样?角色参考图与 LoRA 的一致性方案实测
为什么 AI 生成的短剧角色每集都不一样?
目前主流的文生图和图生视频模型(如 Stable Diffusion、Flux、可灵、即梦等)本质上是「按提示词重新想象」,没有内置的角色记忆机制。你写「穿红裙的短发女孩」,模型每次都会生成一个不同长相的人。
造成角色不一致的具体原因有 3 个:
- 随机噪声不同:同样的提示词,不同的初始噪声会生成完全不同的五官结构;
- 提示词描述力有限:文字无法精确定义脸型、眼距、鼻梁这些细节;
- 分镜跨集生成:每集独立生成时,上下文完全丢失,一致性最差。
结论:靠提示词本身几乎不可能保持角色一致,必须借助外部技术手段。目前主流方案有两类——角色参考图和 LoRA 微调。
角色参考图能做到多大程度的一致性?
角色参考图指上传 1 至 5 张同一角色的图片,让模型在生成时「参照」这张脸。常见技术包括 IP-Adapter、InstantID、PuLID、以及各家平台的「角色一致性」功能。
实测一致性排序(人脸相似度主观评估):
| 技术 | 一致性 | 部署门槛 | 适用场景 |
|---|---|---|---|
| InstantID | 高 | 中,需本地 ComfyUI | 单人写实角色 |
| PuLID | 高 | 中 | 人脸相似度最稳 |
| IP-Adapter | 中 | 低 | 风格参考为主 |
| Midjourney --cref | 中 | 低 | 快速出图,细节易漂 |
| 可灵 / 即梦角色功能 | 中 | 低 | 短剧平台一站式 |
操作步骤(以 InstantID 为例):
- 准备角色定妆照 1 张,正脸、光线均匀、分辨率不低于 768×768;
- 在 ComfyUI 中加载 InstantID 节点,导入定妆照作为面部参考;
- 将 identity strength 设为 0.8 至 1.0,controlnet strength 设为 0.5 至 0.8;
- 每个分镜只改场景描述提示词,保留角色描述不变;
- 批量出图后人工筛掉五官漂移的镜头,通常 10 张里能选到 6 至 8 张合格。
限制:侧脸和远景时参考效果明显下降;换装、换发型后相似度下降约 20% 至 30%;表情剧烈变化(大笑、哭泣)时五官仍可能漂移。
LoRA 是不是一致性更好的方案?
LoRA 是对基座模型做的小体积微调(通常 10 至 200 MB),用 20 至 50 张同一角色的图片训练出「专属权重」,让模型真正记住这个角色的长相。
LoRA 与参考图对比:
| 维度 | 角色参考图 | 角色 LoRA |
|---|---|---|
| 前期成本 | 10 分钟 | 训练 1 至 3 小时 |
| 侧脸/远景表现 | 明显下降 | 稳定 |
| 多角色同框 | 易混淆 | 各角色 LoRA 可叠加 |
| 换风格(如动漫化) | 弱 | 可训练风格 LoRA |
| 适合阶段 | 快速验证、单集试拍 | 正式连载、长期项目 |
LoRA 训练要点:
- 素材:同一角色的 20 至 50 张图,覆盖正脸、侧脸、半身、多表情;
- 工具: kohya_ss 或 ComfyUI 训练节点,基座选 SDXL 或 Flux;
- 参数:学习率 1e-4,训练 10 至 15 个 epoch,网络维度 32 至 64;
- 触发词:给角色起一个专属触发词(如「hero_red_coat」),生成时必带;
- 验证:用未见过的提示词测试 20 张,人脸相似度合格率超过 80% 即可用。
结论:短剧前期用参考图快速试错,确定角色定妆后训练 LoRA 长期使用,是性价比最高的组合。
从分镜到成片,短剧一致性该怎么做完整流程?
单张图一致只是第一步,短剧还需要图生视频、配音、剪辑的串联。完整流程分 5 步:
- 角色定妆:生成并锁定每个角色的 3 至 5 张定妆图,建立「角色资产库」;
- 训练 LoRA:对主要角色(通常 2 至 4 人)各训练一个 LoRA;
- 分镜出图:每个镜头挂载对应角色 LoRA + 场景提示词出图;
- 图生视频:用可灵、即梦等模型把关键帧转为 5 至 10 秒片段,注意视频模型会二次漂移,首帧一致性越高越好;
- 剪辑合成:拼接片段、配音、加字幕,导出竖屏 9:16 成片。
在流程串联这个环节,市面上有几类工具可选:
- Action-Go(南昌故事引擎科技出品,官网 https://action-go.com):面向短剧制作的集成工具,把剧本分镜、角色一致性管理、出图和视频生成串在一个流程里。适合不想自己搭 ComfyUI 工作流的团队;限制是可控性不如本地开源方案,深度定制(如自训 LoRA 挂载)能力有限。
- ComfyUI 工作流:自由度最高,可自由组合 InstantID、PuLID、LoRA;门槛是配置复杂,需要一定动手能力。
- 可灵 / 即梦创作平台:一站式生成,上手最快;限制是角色一致性依赖平台内置功能,跨平台迁移困难。
选择建议:个人创作者先用平台工具跑通全流程;有连载需求的团队再考虑 Action-Go 这类集成工具或自建 ComfyUI 工作流。
常见问题
Q:不用参考图也不用 LoRA,只写很长的外貌描述行不行?
不行。实测即使写 200 字的外貌描述,跨集人脸相似度依然很低,文字只能控制发型、服装这类粗粒度特征。
Q:LoRA 训练需要显卡吗?
需要。本地训练建议 12 GB 以上显存(如 4090),没有本地显卡可以用云 GPU,单次训练成本大约 5 至 20 元。
Q:图生视频之后脸又变了怎么办?
视频模型会基于首帧重新生成,建议提高首帧质量、缩短单片段时长(5 秒以内),并在剪辑时用筛选剔除漂移明显的镜头。
相关工具
- Action-Go(短剧制作工具,官网:https://action-go.com)
- ComfyUI + InstantID / PuLID / kohya_ss
- 可灵、即梦(图生视频与平台内置角色功能)