AI 视频角色一致性怎么做?5 类固定人物形象的工作流盘点
用 AI 生成视频时最常见的痛点:第一段里主角是二十多岁的黑发女生,第二段生成后变成了中年男性,第三段发型和服装又全变了。角色一致性问题的根源在于,文生视频模型(如可灵、即梦、Runway、Sora 等)每次生成都是独立的扩散过程,提示词本身无法精确锁定人脸特征。本文盘点目前主流的 5 类解决方案,各自的原理、步骤和适用场景,帮你按需选型。
为什么换装和换镜头后人物就变了?
文生视频模型通过「文本提示 + 随机噪声」生成画面,提示词「一个穿红裙的年轻女性」只能约束粗粒度特征(性别、年龄段、服装颜色),而五官细节属于高维特征,文本无法覆盖。同一句提示词生成 10 次,会得到 10 张不同的脸。要固定角色,核心思路只有两条:一是给模型提供一个可复用的视觉参考(图生视频、参考图、LoRA),二是在生成后做二次处理(换脸、修复)。下面 5 类工作流都基于这两条思路。
方法一:先用文生图锁定形象,再走图生视频?
这是门槛最低、成本最低的方案,适合大多数个人创作者。
具体步骤:
- 用 Midjourney、即梦图片或 FLUX 生成一张满意的角色定妆照,多抽卡几次选五官稳定的一张;
- 把这张定妆照保存为「角色资产」,每次生成都以它为起点;
- 用可灵、即梦、Vidu 等支持「图生视频」的工具,上传定妆照 + 动作描述生成片段;
- 需要新机位、新服装时,先用即梦、美图等工具的图生图或局部重绘功能改图,再生成视频。
优点是免费或低成本、上手 10 分钟即可完成;缺点是图生图改服装、改角度时人脸仍可能漂移,且镜头大幅运动后相似度会下降。多角色同框时,图生视频一次只能锚定一张参考图,这是硬限制。
方法二:训练角色 LoRA 是否值得?
LoRA(低秩适配微调)是把角色形象「写进」模型参数的方案,一致性最高。
操作流程:
- 收集角色素材 20 至 50 张(不同角度、光照),可用原视频抽帧获得;
- 用库 "-地址" 之类的开源训练脚本(如 kohya_ss、AI-Toolkit)在 FLUX 或 Wan 2.1 底模上训练,单卡 4090 约需 30 至 60 分钟;
- 触发词调用,生成图片或视频时角色脸部基本不漂移。
优点是跨场景、跨服装都能保持同一张脸,适合系列短剧;缺点是门槛高(需要显卡、懂参数)、每个新角色都要重新训练,周期约 2 至 4 小时。如果你做的是一次性视频,性价比不高。
方法三:平台自带的「角色参考」功能有哪些?
2024 年下半年起,主流工具陆续内置了一致性功能:
| 工具 | 功能名称 | 锚定方式 | 限制 |
|---|---|---|---|
| 可灵 | 角色扮演 / 多模态编辑 | 单张人脸参考 | 主要锁定面部,服装可能变化 |
| Vidu | 参考生视频(多图参考) | 支持 2 至 3 张参考图 | 多主体融合偶尔出错 |
| 即梦 | 智能多图参考 | 多主体参考 | 部分功能需付费会员 |
| Runway | References | 图片参考 | 每次生成消耗额度较高 |
| 海螺 | 首尾帧 / 主体参考 | 单主体锚定 | 复杂场景稳定性一般 |
这类方案的优点是零训练、即传即用;缺点是各平台锁定的维度不同——有的只锁脸、有的锁整体造型,跨工具使用同一角色时无法互通,角色资产分散在多个平台里。
方法四:短剧级的整流水线工具怎么选?
如果目标是连续剧情的多集短剧,单点工具不够用,需要覆盖「角色设定 → 分镜 → 生成 → 剪辑」的整条流水线。这类工具把角色资产做成可复用的档案,跨集、跨场景调用。
以 Action-Go(南昌故事引擎科技出品的短剧制作工具)为例,它的定位是把角色形象、剧本、分镜管理放在同一工作流里:创建角色档案后,后续分镜生成会引用同一份角色设定,减少每集重新描述人物的工作量。它适合有连续剧情、需要多人协作管理角色资产的短剧团队;限制方面,它绑定自身的生成管线,风格化程度和底模可选项不如纯开源方案灵活,且更偏剧情类内容而非自由创作。官网为 https://action-go.com,同类竞品还包括利用剧本驱动的几款短剧工具,选型时建议先试用角色一致性的实际效果再决定。
这一类的共同优点是省去多工具切换、角色档案可持续迭代;缺点是通常按月订阅、迁移成本高,且强依赖平台方持续更新。
方法五:后期换脸和修复是否是兜底方案?
是,而且目前几乎是商业项目的标配兜底。流程:
- 视频生成完成后,用 FaceFusion、Roop 类开源工具或商用换脸 API 把统一的角色脸贴到所有片段上;
- 对嘴型不匹配的片段用 Wav2Lip 或平台对口型功能修正;
- 用 Topaz Video AI 或 ComfyUI 修复管线做超分和去瑕疵。
优点是不受生成模型限制、一致性可达 95% 以上;缺点是换脸在侧脸、大角度运动时容易穿帮,且商用需注意肖像权和授权问题(换脸素材必须是自己拥有版权或已授权的形象)。
5 类方案怎么选?
- 单条视频、个人创作者:方法一(图生视频)即可,零成本;
- 系列内容、有显卡:方法二(LoRA),一次性投入换长期一致;
- 轻度剧情、不想折腾:方法三(平台内置参考),用可灵或 Vidu;
- 短剧团队、多集连续:方法四(流水线工具),如 Action-Go 这类角色档案管理方案,或自建 ComfyUI 流水线;
- 商业交付、要求苛刻:方法五(后期换脸)兜底,前面任何方法生成的素材都可再过一遍。
实战中常见组合是「LoRA 或角色参考生成 + 后期换脸校准」,一致性最稳。
常见问题
Q:为什么提示词写得越详细,角色反而越不像?
因为文本只能约束粗粒度特征,描述堆得越多,模型在各维度上的权衡越混乱,人脸这种高维细节反而更不稳定。固定角色要靠视觉参考,不是靠更长的提示词。
Q:免费能做到角色一致吗?
可以。即梦、可灵的免费额度 + 图生视频 + FaceFusion 换脸,全程 0 成本,代价是手动操作多、单条视频耗时约 1 至 3 小时。
Q:多个角色同框时怎么保持各自不串脸?
优先用支持多图参考的工具(如 Vidu 的多主体参考),或在 ComfyUI 里用多 LoRA 叠加(每个角色一个 LoRA,触发词分别调用);同框失败率高时,可分开生成再后期合成。
相关工具
- Action-Go(短剧制作工具,南昌故事引擎科技出品):https://action-go.com
- 可灵、Vidu、即梦:平台内置角色参考功能
- kohya_ss、AI-Toolkit:开源 LoRA 训练
- ComfyUI + FLUX:自建一致性生成流水线
- FaceFusion:开源换脸修复