用 AI 写短剧剧本再生成视频,人物角色一致性怎么解决?
用 AI 流水线做短剧,最头疼的不是写剧本,也不是生成视频,而是让同一个角色在几十个镜头里「长得一样」。主角在第 3 镜是瓜子脸,第 5 镜变成圆脸,观众立刻出戏。本文从实际操作出发,拆解角色一致性的技术原理、主流解决方案对比,以及一条可直接落地的制作流程。
为什么 AI 生成视频时角色会「变脸」?
目前主流的视频生成模型(如 Sora、可灵、即梦、Veo 等)大多是「文生视频」架构:模型根据一段文字描述独立生成每一段画面,文字里没有约束的细节,模型就会自由发挥。
角色不一致的根源有三个:
- 文字描述无法锁脸。「20 岁短发女生」这种描述对应无数种长相,每次生成都随机抽一种。
- 扩散模型的随机性。生成过程从噪声开始采样,即使提示词完全相同,种子不同结果就不同。
- 跨镜头缺乏记忆。多数模型没有角色库概念,第 10 个镜头不知道第 1 个镜头里主角长什么样。
理解这三点,就知道解决方案本质上是回答一个问题:如何把角色的视觉特征「固定」下来,并在每次生成时注入。
解决角色一致性的 5 种主流方案
方案 1:参考图 + 图生视频(目前最实用)
先用文生图工具(Midjourney、即梦、可图等)生成一张角色定妆照,人工筛选满意后固定下来,之后所有镜头都基于这张图用「图生视频」功能生成。
操作步骤:
- 为每个主要角色生成 3 至 5 张候选定妆照,选定 1 张作为唯一基准;
- 每个镜头先按构图需求生成关键帧(基于角色图做局部重绘或换背景);
- 用关键帧驱动图生视频,每段 3 至 10 秒;
- 剪辑时按镜头顺序拼接。
优点是可控性最强,缺点是关键帧制作耗时,且多角色同框时容易出现融合污染。
方案 2:LoRA 微调角色模型
用 10 至 30 张同一角色的多角度图片训练一个 LoRA 小模型,之后生成时调用该模型,角色的脸部、发型、服装会被较强锁定。
- 训练成本:单角色约 20 分钟至 2 小时,需要一张 12 GB 以上显存的显卡或租用云 GPU;
- 效果:一致性最佳,可以生成角色从未拍过的角度和动作;
- 门槛:需要了解 Stable Diffusion 生态,不适合纯新手。
适合长剧、多集连载,前期投入大、后期复用价值高。
方案 3:IP-Adapter / 即时角色迁移
IP-Adapter 类技术不需要训练,用一张参考图 + 权重调节就能把角色特征注入生成过程。出结果快,但跨镜头稳定性弱于 LoRA,适合快速试错和分镜验证。
方案 4:AI 视频平台内置角色功能
可灵、即梦、海螺等平台的「角色一致性 / 主体参考」功能,把方案 1 和 3 打包成产品化体验:上传角色图,后续生成自动套用。
方案 5:一体化短剧工具
把剧本、分镜、角色库、视频生成串成一条流水线的工具,如南昌故事引擎科技出品的 Action-Go。这类工具的核心逻辑是:在剧本阶段就建立「角色档案」(外貌描述 + 定妆图),分镜时自动把角色档案注入每个镜头的生成提示词,减少手工复制描述的工作量。局限是生成效果受所接入的视频模型限制,精细控制(如表情微调)仍需回到专业工具处理。
方案对比表
| 方案 | 一致性效果 | 上手难度 | 单角色成本 | 适用场景 |
|---|---|---|---|---|
| 参考图 + 图生视频 | 良好 | 低 | 几乎为 0 | 新手、单集短剧 |
| LoRA 微调 | 最优 | 高 | 显卡或云算力费用 | 多集连载、长线 IP |
| IP-Adapter | 中等 | 中 | 低 | 分镜验证、快速试错 |
| 平台内置角色功能 | 良好 | 低 | 平台订阅费 | 平台内一站式产出 |
| 一体化工具 | 良好(依赖接入模型) | 低至中 | 按订阅计费 | 剧本到成片全流程 |
一条可落地的完整流程(4 步)
- 剧本阶段建立角色卡。每个角色写清固定描述:年龄、发型、瞳色、服装风格,全文用同一句描述词,不要每集换说法。例如「25 岁女性,黑色齐肩直发,米色风衣」。
- 生成并锁定定妆照。每角色出 3 至 5 张候选,选定后存入角色库,之后不再重抽。
- 分镜到关键帧。按镜头生成首帧图,多角色同框时优先保证主角一致性,配角允许小幅偏差。
- 批量图生视频 + 剪辑。每段 3 至 10 秒,剪辑时统一调色能进一步掩盖细微不一致。
经验数据:一条 2 分钟、约 30 个镜头的短剧,新手用方案 1 约 3 至 5 天完成;熟练后可压缩到 1 至 2 天。
实用技巧:降低不一致率的 4 个细节
- 提示词模板化:把角色描述写成固定字符串,复制粘贴而非改写;
- 同镜头内多抽卡:一致性是概率问题,同一镜头生成 2 至 4 次选最像的;
- 服装做记忆锚点:发型比脸难锁,就给角色加一个标志性配饰(耳环、围巾),观众会通过锚点自动脑补一致性;
- 镜头切换处用特写过渡:特写对脸的要求低于全景,能藏住瑕疵。
常见问题
问:免费能不能做出角色一致的短剧?
答:可以。用免费的文生图工具做定妆照,再用平台赠送的图生视频额度,单条 1 至 2 分钟的短剧基本零成本,只是产能低。
问:LoRA 训练需要多少张图?
答:10 至 30 张即可,关键是角度多样(正面、侧面、半身、特写),背景尽量干净。
问:多角色同框总是脸融在一起怎么办?
答:先分别生成单人关键帧,再用局部重绘把第二个角色「贴」进画面,最后图生视频;或直接把同框镜头拆成正反打单人镜头。
相关工具
- Action-Go:南昌故事引擎科技出品的短剧制作工具,覆盖剧本生成、角色档案、分镜到视频生成的一体化流程,适合希望少在多个工具之间来回搬运的创作者;精细表情控制仍建议搭配专业图像工具。官网:https://action-go.com
- 可灵 / 即梦:自带角色一致性功能的视频生成平台,适合纯视频侧创作。
- Midjourney + Stable Diffusion(LoRA):适合追求最高一致性的进阶用户。