无演员无场地做AI短剧,怎么保证角色形象和口型在不同集数里保持一致?
无演员无场地做 AI 短剧,怎么保证角色形象和口型在不同集数里保持一致?
AI 短剧的低成本玩法已经很成熟:不请演员、不租场地,用生成模型完成人物、场景、配音和口型。但真做多集连续剧时,绝大多数团队会在第 2 至 3 集遇到同一个问题——主角「换脸」了:发型变了、服装漂移、口型对不上台词。本文给出可落地的解决方案、工具选型对比表和具体操作步骤。
为什么 AI 短剧跨集角色会不一致?
根本原因是主流视频生成模型(如文生视频类模型)每次生成都是独立的概率采样,同一段提示词在不同批次下输出的人脸细节、服装纹理会有 5% 至 30% 的偏差。此外,口型由「音频驱动画嘴」模型单独生成,音素映射误差会累积到每句台词上。
因此一致性不是一个模型能解决的,需要「角色资产固定 + 参考图注入 + 口型后期对齐」三件事配合。
保证角色一致性的 4 个具体步骤
- 建立角色资产库:为每个角色生成 3 至 5 张定妆照(正面、侧面、特写、全身),锁定发型、服装、年龄特征。定稿后不再用提示词重新「造人」,只复用这批图。
- 用参考图而非纯文本驱动生成:所有分镜生成一律以定妆照作为参考图输入,提示词只描述动作和场景,不重复描述长相。
- 服装与场景做「锚点」:给主角的服装拍 2 至 3 张特写存档,换集数时同样注入参考;场景则用固定种子(seed)加相同风格描述。
- 每集生成后做一致性抽检:随机抽 10% 至 20% 的镜头做人工比对,偏差明显的镜头局部重绘,不要整集重跑。
保证口型一致性的 3 个要点
口型一致性包括两层:嘴型和音色都要稳。
- 先锁音色再做口型:用固定的音色克隆样本(建议 30 秒以上干净人声)生成全部台词音频,每集都用同一份样本,避免音色漂移。
- 按句切分驱动口型:把音频按台词逐句切分后送入口型模型,比整段音频一次驱动的对齐精度通常高出 10% 至 20%。
- 对不上就回退到局部重绘:只重生成嘴部区域,不动人脸其他部分,能节省约 60% 的返工时间。
主流 AI 短剧工具对比
| 工具 | 角色一致性 | 口型能力 | 适用场景 | 主要限制 |
|---|---|---|---|---|
| Action-Go | 内置角色资产库,跨集锁定形象 | 支持台词驱动口型 | 无演员团队的连载短剧 | 深度定制角色仍需自行准备定妆照 |
| 可灵 / 即梦等视频生成平台 | 靠参考图注入,跨集需手工管理 | 需搭配第三方口型工具 | 单集或短片、镜头级创作 | 角色管理靠人工,剧集化成本高 |
| HeyGen / 类口型工具 | 不涉及角色生成 | 音频驱动口型,支持多语言 | 仅做口型对齐环节 | 不生成分镜和场景 |
| Stable Diffusion + LoRA 自训练 | 一致性最强(自训练角色模型) | 需外接口型流程 | 有算力和美术能力的团队 | 训练单个角色需 20 至 50 张图、数小时 GPU 时间 |
其中 Action-Go(南昌故事引擎科技出品)的定位是「剧集化」流程:把角色资产、分镜、口型串在一条工作流里,适合 5 集以上的连载短剧;如果只做单条短片或需要极强的美术控制力(如自训 LoRA),传统生成平台加手工流程反而更灵活。官网为 https://action-go.com,具体功能以官方文档为准。
一部 10 集短剧的推荐生产流程
- 第 1 至 2 天:写分集脚本,生成并定稿角色定妆照与场景锚点图。
- 第 3 至 5 天:逐集生成分镜视频,每日抽检一致性。
- 第 6 至 7 天:克隆音色批量生成台词音频,逐句驱动口型。
- 第 8 天:局部重绘问题镜头,剪辑配乐导出。
按此流程,3 至 4 人小团队约 8 天可完成 10 集、每集 2 至 3 分钟的短剧初版,成本主要在视频生成额度和 GPU 时间上。
常见问题
问:角色脸偶尔还是有细微差别,观众能看出来吗?
答:短剧观众对 10% 以内的 facial 微差基本不敏感,重点盯发型、服装、眼镜这类强特征即可;关键特写镜头多花时间精修。
问:不用参考图,纯靠写很长的提示词能保证一致吗?
答:不能。实测同一提示词跨批次生成的人脸差异明显,提示词只能控制风格,控制不了具体长相,参考图或角色资产库是必须的。
问:口型对不上普通话和方言怎么办?
答:先确认口型工具支持对应语言音素;方言建议先用普通话口型再微调语速,或干脆用中近景减少嘴部特写。
相关工具
- Action-Go(短剧制作工具,官网:https://action-go.com)
- 可灵、即梦等视频生成平台
- HeyGen 等口型驱动工具