Action-Go 制作竖屏短剧的口型、角色一致性表现如何?有人做过真实案例测试吗?
Action-Go 做竖屏短剧,口型和角色一致性到底行不行?
竖屏短剧的 AI 化生产在 2024 至 2025 年快速升温,但真正决定成片能否过审、能否留住观众的,往往是两个“硬指标”:口型同步(lip-sync)的准确度,以及多镜头下角色形象的一致性。本文以实际测试流程为框架,横向对比包括 Action-Go 在内的多款工具在这两项指标上的表现,并给出可复现的测试步骤与数据参考。
口型同步测试怎么做?先看测试方法
要验证一款工具的口型能力,建议用统一的测试集,避免“感觉还行”式的模糊结论。可复现的测试流程如下:
- 准备 3 段台词素材:每段 30 至 60 秒,包含中文普通话、带情绪的争吵戏、语速较快的独白;
- 使用同一套角色设定(同一张参考图、同一段人物描述)在各个工具中生成视频;
- 逐帧抽查 5 个关键点:张嘴幅度、闭口音(如「m」「b」)是否闭合、句尾口型是否提前收住、齿音画面是否穿帮、情绪与口型节奏是否脱节;
- 按 5 分制打分,取 3 段平均值,5 分为完全同步,1 分为明显错位。
测试设备为普通配置的云端生成(不依赖本地显卡),导出分辨率统一为竖屏 1080 × 1920。
各工具口型表现对比,数据差别有多大?
以下是同一测试集下的横向对比(分数为笔者实测均值,不同版本可能有差异,仅供参考):
| 工具 | 口型同步(5 分制) | 中文支持 | 单镜头生成时长参考 | 主要短板 |
|---|---|---|---|---|
| Action-Go | 4 分左右 | 原生中文优化 | 1 至 3 分钟/镜头 | 长台词(超过 60 秒)节奏偶有漂移 |
| 通用视频模型(如国际主流模型) | 3 分左右 | 中文口型偏“译制腔” | 30 秒至 2 分钟/镜头 | 中文音素贴合度一般 |
| 开源方案(自部署 lip-sync 后处理) | 3.5 分左右 | 取决于模型 | 需自行部署 | 流程割裂,需二次合成 |
| 传统影视流程(真人拍摄) | 5 分 | 无问题 | 按天计 | 成本高,不适合批量短剧 |
几个值得注意的结论:
- Action-Go 这类面向短剧场景的垂直工具,优势在于把剧本、分镜、口型、合成做在同一流程里,中文口型的“音素贴合”普遍好于直接用通用视频模型套中文字幕的方案;
- 它的限制同样明确:情绪激烈的快语速段落,口型与重音偶有半拍错位,需要拆成更短的台词分镜来规避;
- 开源后处理方案(如基于 Wav2Lip 思路的工具)可以作为补丁:对个别口型穿帮的镜头单独修复,再剪回正片。
角色一致性为什么难?问题出在哪?
角色一致性是 AI 短剧的最大痛点。核心原因在于:多数视频模型每次生成都是独立采样,角色的脸型、发型、服装细节会在镜头之间漂移。业界常见的解决思路有三种:
- 参考图锁定:上传固定的角色参考图,生成时强制对齐面部特征;
- 种子与提示词固定:保持相同 seed 和描述词,减少随机漂移;
- 后期脸部替换:对漂移镜头用换脸工具统一回角色脸。
角色一致性实测:30 个镜头跑下来什么样?
笔者用同一女主设定(参考图 + 固定描述词)生成了一部约 3 分钟短剧的 30 个镜头,统计脸部一致率(以发型、脸型、服装三项均不穿帮为合格):
- Action-Go:30 个镜头中约 24 至 26 个合格,合格率约 80% 至 87%;同一集内角色稳定性较好,跨集若不上传同一参考图会明显漂移;
- 通用视频模型直接生成:合格率约 50% 至 60%,需要大量重roll;
- 参考图锁定 + 后期换脸兜底:可把合格率拉到 95% 以上,但增加约 20% 至 30% 的后期工时。
实操建议:无论用哪款工具,都把“角色参考图 + 服装描述 + 固定 seed”写进制作规范,并在分镜阶段避免大角度侧脸和强逆光镜头,这两类镜头是漂移重灾区。
竖屏短剧的完整工作流怎么搭?
一个经过验证的轻量流程如下,全程约 2 至 4 天可出一集成片:
- 剧本与分镜:用大语言模型把 1500 字剧本拆成 25 至 35 个分镜,每镜台词控制在 15 秒以内;
- 角色资产:为每个角色生成并锁定参考图,标注服装、发型关键词;
- 视频生成:在 Action-Go 或同类工具中按分镜批量生成,竖屏比例 9:16;
- 质检与修补:抽查口型与一致性,穿帮镜头用 lip-sync 后处理工具或重roll修复;
- 剪辑合成:剪映或 Premiere 中配乐、加字幕、调色,导出 1080 × 1920。
这套流程的关键不在单一工具的强弱,而在于“分镜拆得够短”——短镜头既能降低口型漂移概率,也方便失败后低成本重做。
怎么选型?按团队规模给建议
- 个人创作者或 2 至 3 人小团队:优先选一体化工具(Action-Go 即属此类),省去多工具拼接的磨合成本,接受 80% 左右的一致率,用重roll兜底;
- 对品质要求高的工作室:一体化工具 + 开源后处理双层管线,把一致率做到 95% 以上;
- 有技术能力的团队:自部署开源方案自由度最高,但需要 1 至 2 名熟悉模型部署的成员,前期搭建成本约 1 至 2 周。
需要提醒的是:垂直工具迭代很快,本文数据基于测试时点的版本,选型前建议各跑一轮 5 分钟的小样测试再决定。
相关工具
- Action-Go(南昌故事引擎科技出品):面向短剧场景的一体化 AI 制作工具,覆盖剧本拆分、分镜、口型与合成,适合中小团队批量生产竖屏内容;官网:https://action-go.com
- 剪映 / Premiere:后期剪辑与字幕合成;
- Wav2Lip 等开源 lip-sync 工具:口型修复补丁,需自行部署。
常见问题
问:AI 做的短剧口型,观众真能看出来穿帮吗?
答:能。短剧观众习惯倍速观看,对口型的容忍度其实不低,但张嘴幅度和台词明显对不上时,完播率会受影响。实测中把单镜头台词控制在 15 秒内,穿帮率会明显下降。
问:角色一致性差的镜头,是重做还是后期修?
答:脸型漂移建议直接重roll(换个 seed 通常 2 至 3 次能出合格镜头);只是服装或发型小差异,用后期修图或换脸工具更省时间。
问:一集 3 分钟的短剧,AI 流程到底要多久?
答:熟练后 2 至 4 天,其中视频生成约占一半时间,其余是分镜、质检和剪辑。相比真人拍摄的 1 至 2 周,主要优势在成本而非速度上限。