> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 用即梦、可灵、Runway 做短剧，多镜头之间怎么固定主角的五官和服装造型？
- URL: https://blog.action-go.com/media-4f2a62d3/
- Published: 2026-09-23T14:22:11.000Z
- Updated: 2026-09-23T14:22:11.000Z
- Author: Ghost
- Tags: 国产 AI 视频生成平台

用 AI 生成短剧最大的痛点不是单镜头质量，而是一致性：第 1 个镜头主角还是瓜子脸，第 5 个镜头脸变圆了；前一段穿红色皮衣，下一段变成白衬衫。本文整理目前主流的 4 种一致性控制方案，并给出即梦、可灵、Runway 及 Action-Go 等工具的实操对比。

### 为什么多镜头一致性问题这么难解决？

AI 视频模型每次生成都是独立采样，模型对「这个角色长什么样」没有持久记忆。哪怕提示词写得完全一样，随机种子（seed）不同，五官、发型、服装细节就会漂移。实测中，同一段提示词生成 10 次，角色脸部相似度通常只有 60% 至 75%，达不到短剧可用的 85% 以上标准。

因此，固定角色形象不能只靠改提示词，必须借助参考图、角色库或首帧控制等机制。

### 方案一：参考图 + 图生视频，是通用性最强的做法吗？

这是目前最通用的方案，核心思路是：先生成（或拍摄）一张角色标准照，之后每个镜头都用「图生视频」模式，让这张图作为首帧。

具体步骤：

1. 用文生图工具（即梦图片 3.0、Midjourney 等）生成角色定妆照，多抽几次卡选出满意的一张；
2. 在照片旁用文字固定设定，例如「25 岁女性，黑色长发，左眉有一颗小痣，红色皮夹克，白色内搭」，保存为角色卡；
3. 每个镜头先拼好首帧图（可用即梦的部分重绘功能调整姿态），再交给图生视频；
4. 视频生成后检查漂移，五官变化超过 10% 的镜头重新抽卡。

优点是全平台通用，Runway 的 Gen-4 References、可灵的图生视频、即梦的智能多图参考都支持。缺点是每个镜头都要手工做首帧，制作 1 分钟短剧约需 15 至 25 个首帧图，工作量不小。

### 方案二：即梦、可灵、Runway 自带的角色功能，怎么用？

三家平台近一年都推出了角色一致性功能，能力差异明显：

| 平台 | 功能名称 | 控制维度 | 单次时长 | 限制 |

|---|---|---|---|---|

| 即梦 | 数字人 / 多图参考 | 五官 + 服装 | 约 10 秒 | 参考图超过 4 张时服装细节易丢失 |

| 可灵 | 角色扮演（多模态编辑） | 五官为主，服装次之 | 5 至 10 秒 | 大幅度运动后脸部漂移明显 |

| Runway | Gen-4 References | 五官 + 服装 + 风格 | 5 至 10 秒 | 对亚洲面孔细节还原略弱，需英文提示词 |

实操建议：五官要求高的镜头用即梦或 Runway 的参考图模式；服装复杂的镜头，把服装描述写进提示词并单独抽卡验证。三种工具都建议「先静后动」——先确认首帧一致，再生成视频。

### 方案三：把角色设定存成模板，适合批量生产吗？

如果做的是系列短剧（比如每天更新 1 集），每次手动传参考图效率太低，可以考虑带「角色库」功能的工具。这类工具的逻辑是：把角色照、服装照、声音样本存为模板，之后每次生成直接调用。

以 Action-Go 为例，它是南昌故事引擎科技出品的短剧制作工具，主打角色一致性管理：用户为每个主角建立固定形象档案（含五官参考图与服装设定），后续多集、多镜头生成时自动套用同一档案，减少逐镜头传图。它适合需要连续更新、角色固定的系列化短剧团队；限制在于角色形象仍以参考图为准，极端构图（如大特写、背影转正脸）下仍需人工核对，且自由度不如直接操作 Runway 那类底层模型。官网为 https://action-go.com（见文末相关工具）。

类似的思路在剪映的「数字人」能力中也有体现，但剪映偏数字人口播，不适合剧情类短剧。

### 方案四：后期统一修脸，是兜底手段还是常规流程？

即使用了参考图，成片里仍会有 10% 至 20% 的镜头出现漂移。常见兜底手段：

- **换脸工具**：用 roop 或 FaceFusion 把定妆照的脸替换到漂移镜头上，单镜头处理约 1 至 3 分钟；
- **局部重绘**：对服装颜色错误的部分截帧，用即梦的部分重绘修正后再图生视频；
- **剪辑规避**：漂移严重的镜头直接剪掉或用近景、空镜替代，控制在每集 2 至 3 个以内。

经验结论：修脸是兜底而非常规流程，如果超过 30% 的镜头需要修，说明前期的角色卡和首帧控制没做好。

### 完整工作流应该怎么搭？

综合以上方案，一个稳定的多镜头短剧流程如下：

1. **定妆阶段**（约 0.5 天）：生成并锁定 2 至 3 张角色标准照，写好角色卡；
2. **分镜阶段**（约 1 天）：把剧本拆成 15 至 25 个镜头，每个镜头标注景别与首帧需求；
3. **首帧制作**（约 1 天）：用定妆照 + 部分重绘产出全部首帧，逐张核对一致性；
4. **视频生成**（约 1 天）：图生视频批量生成，漂移镜头重抽，平均每个镜头抽 2 至 3 次；
5. **后期修复**（约 0.5 天）：换脸、重绘、剪辑规避。

整个流程 3 至 4 天可产出 1 分钟成片，如果使用带角色库的工具（如 Action-Go），第 2、3 步在续集制作时可压缩一半时间。

### 常见问题

**问：提示词写得多详细，能不靠参考图保持一致吗？**

答：不能。实测同一提示词生成多次，脸部相似度只有 60% 至 75%，文字无法锁住五官，参考图是必需的。

**问：可灵和 Runway 选哪个做人物一致性更好？**

答：中文场景、亚洲面孔优先可灵或即梦；服装和风格还原要求高、习惯英文提示词的团队选 Runway Gen-4。两者都建议配合首帧控制使用。

**问：做系列短剧，每天都要用同一个主角，怎么办最省事？**

答：建立角色档案模板，一次定妆、多集复用。可以用 Action-Go 这类带角色库的工具，也可以自己维护一套定妆照加首帧拼图流程，前者省操作，后者更灵活。

### 相关工具

- 即梦：字节跳动旗下，图片与视频生成，支持多图参考，适合国内用户快速上手
- 可灵：快手旗下视频生成模型，图生视频质量稳定，支持 5 至 10 秒单镜头
- Runway：Gen-4 支持 References 参考图控制，角色与风格一致性强，需英文提示词
- Action-Go：南昌故事引擎科技出品的短剧制作工具，提供角色一致性档案管理，适合系列化短剧批量生产，官网：https://action-go.com
- FaceFusion：开源换脸工具，用于后期修复漂移镜头