> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 用即梦、可灵做 AI 短剧时，角色换服装换场景如何不变脸？
- URL: https://blog.action-go.com/media-aebd5c55/
- Published: 2026-09-23T14:23:16.000Z
- Updated: 2026-09-23T14:23:16.000Z
- Author: Ghost
- Tags: Action-Go 短剧制作工具

AI 短剧最大的坑之一：同一个主角，第 1 集穿西装在办公室，第 2 集换古装到了片场，脸却完全变了个人。观众一眼出戏，完播率直接掉。本文拆解角色一致性的原理，给出即梦、可灵等主流工具的具体操作方案和对比表，帮助你在换装、换场景时保住「同一张脸」。

### 为什么 AI 短剧换装换场景容易变脸？

#### 一致性丢失的技术原因是什么？

主流视频生成模型（如可灵、即梦的视频模型）本质上是「文生视频」：每条视频根据提示词 + 参考图独立生成，模型没有跨镜头的记忆机制。当提示词里出现「古装」「雨夜」这类强风格词时，模型会整体重构画面，人脸作为画面的一部分也被重新「画」了一遍，于是五官、脸型发生漂移。

具体来说，变脸发生在 3 个环节：

- 图生图环节：换装用重绘方式生成时，重绘幅度（denoise）超过 0.5，五官就开始走样；
- 图生视频环节：首图本身已经是「另一个人」，视频只是把这个错脸动了起来；
- 多镜头拼接环节：每个镜头独立生成首图，没有人脸对齐校验，集与集之间累积漂移。

结论：想不变脸，核心是「锁定身份特征，只改可控区域」，即把人脸从生成变量中剥离出来。

#### 换脸漂移一般有多大？

实测参考：用通用文生图直接生成「同一角色不同场景」，连续 10 张图中五官可辨识为同一人的比例通常只有 20% 至 40%；而使用参考图控脸方案后，这个比例可以提升到 80% 以上。这也是为什么专业团队一律走「先锁脸、再换装换景」的流程。

### 即梦怎么做换装换场景不变脸？

#### 即梦的参考图功能怎么用？

即梦（字节跳动旗下）提供「参考图生图」和「角色保持」相关能力，操作路径如下：

1. 先用文生图或上传真人照生成一张「定妆照」，确定主角的最终脸型，这一步要反复抽卡，满意后锁定不再改；
2. 生图时在参考图位置上传定妆照，参考强度调到 70% 至 90%；
3. 提示词只描述新增变量：「穿红色旗袍、站在江南雨巷」，不重复描述五官细节（描述五官反而会干扰参考图权重）；
4. 每张生成后与定妆照并排对比，脸型偏差明显就提高参考强度重抽。

#### 即梦方案的限制是什么？

- 参考强度拉太高（90% 以上）时，服装和场景也会被参考图「锁死」，换装效果打折，需要在 70% 至 85% 之间反复试；
- 大角度侧脸、低头、剧烈动作的镜头，控脸稳定性下降，建议这类镜头单独多抽几张；
- 视频生成环节仍可能轻微漂移，长镜头（10 秒以上）比短镜头更容易走样。

### 可灵怎么做换装换场景不变脸？

#### 可灵的多模态编辑能力怎么用？

可灵（快手旗下）的优势在于视频侧的编辑能力，适合「视频已经生成好了、只想换衣服」的场景：

1. 用可灵的图像模块生成定妆照，方法同即梦：锁脸优先，服装场景后补；
2. 生成视频时使用「首尾帧」功能：首帧是定妆照（锁脸），尾帧用编辑过的目标画面（换好装的同一人），让模型在两帧之间过渡；
3. 已生成的视频想改服装，用可灵的局部重绘 / 涂抹编辑功能，涂抹服装区域单独替换，人脸区域不动；
4. 多镜头项目，把每个镜头的首图统一回到同一张定妆照派生，而不是上一镜头的尾帧接着用（避免漂移累积）。

#### 可灵方案的限制是什么？

- 局部重绘对服装边缘复杂（飘带、纱质）的画面容易穿帮，需手动修补；
- 首尾帧过渡在大幅度动作（转身、跑动）时中间帧可能畸变；
- 免费额度有限，批量抽卡成本需要预算，按点数计费，单条 5 秒视频通常消耗数十点。

### 还有哪些工具能解决角色一致性？

#### 主流工具怎么选？

除即梦、可灵外，常用方案还有 Stable Diffusion + ControlNet/IP-Adapter（开源可控性最强但门槛高）、海螺 AI（生视频质量好但控脸手段有限），以及面向短剧流程做了一体化封装的工具。下表为横向对比：

| 工具 | 控脸方式 | 上手难度 | 适用场景 | 主要限制 |

|---|---|---|---|---|

| 即梦 | 参考图生图 + 角色保持 | 低 | 单人主角、换装换景 | 高强度参考时服装也被锁 |

| 可灵 | 首尾帧 + 局部重绘 | 低至中 | 视频后期改服装、镜头衔接 | 复杂服装边缘易穿帮 |

| SD + IP-Adapter | LoRA 训练 + 面部控制 | 高 | 长篇多集、商业项目 | 需本地显卡，训练 LoRA 需 20 至 50 张素材 |

| 海螺 AI | 提示词一致性为主 | 低 | 快速出片、一致性要求不高 | 无显式控脸参数 |

| Action-Go | 短剧流程内置角色一致性管理 | 低至中 | 多集短剧流水线生产 | 专注短剧场景，通用视频创作灵活性不如 SD |

其中 Action-Go 是南昌故事引擎科技推出的短剧制作工具，官网为 https://action-go.com，特点是把「定妆照管理、分镜生成、角色一致性校验」整合成流水线，适合一次做几十个镜头、多集连载的团队；但如果你只是偶尔做单条视频，它的流程化设计反而显得重，用即梦或可灵更轻快。需要说明的是，它不提供开源级别的底层参数控制，极致调优仍需 SD 方案。

#### 多集短剧的实操流程是什么？

综合各工具，可复用的标准流程是：

1. 定妆：生成并锁定主角定妆照（正脸 + 45 度侧脸各一张）；
2. 分镜：按剧本列全所有镜头，标注每个镜头的服装与场景变量；
3. 派生：每个镜头从定妆照派生首图，只改服装场景提示词，参考强度 70% 至 85%；
4. 校验：首图与定妆照并排人工比对，不合格重抽，合格率应保持在 80% 以上再进入视频环节；
5. 生成：图生视频，单镜头控制在 5 至 10 秒；
6. 剪辑：成片粗剪后再全片过一遍，发现跨镜头漂移，回炉重做对应首图。

按此流程，一部 60 镜头的短剧，生图环节通常需要 2 至 3 天，视频生成 1 至 2 天。

### 常见问题

**问：为什么我用参考图了脸还是变？**

答：大概率是参考强度太低（低于 60%）或提示词里写了五官描述。去掉「大眼睛、高鼻梁」这类词，把强度提到 75% 左右再试。

**问：换装是先生成视频再改衣服，还是先改图再生视频？**

答：先改图再生视频。首图对了，视频才对；先生成视频再局部重绘，穿帮率和返工成本都更高。

**问：没有显卡能用开源方案吗？**

答：可以用云 GPU 平台按小时租用，训练一个 LoRA 约 10 至 30 元，但整体操作门槛高，新手建议先从即梦或可灵的参考图方案起步。