> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 做 AI 短剧用 Midjourney 和可灵，怎么让主角每集长相都一样？
- URL: https://blog.action-go.com/media-b77010b3/
- Published: 2026-09-23T14:14:38.000Z
- Updated: 2026-09-23T14:14:38.000Z
- Author: Ghost
- Tags: 可灵 AI 短剧分集生成教程

用 Midjourney 出图、可灵生成视频做 AI 短剧，最大的拦路虎不是画质，而是「角色一致性」：第 1 集的主角是瓜子脸，第 2 集就变成了圆脸，观众秒出戏。这篇文章讲清楚角色一致性失败的根源，并给出 4 套可落地的解决方案，附工具对比表。

### 为什么 AI 短剧主角每集长相都不一样？

Midjourney 和可灵这类扩散模型在生成时带有随机性。同样的提示词跑 10 次，会得到 10 张不同的人脸，因为模型每次的初始噪声和采样路径都不同。此外还有 3 个常见原因：

- **提示词描述太模糊**：只写「一个年轻女性」，模型有上万种合理输出。
- **参考图喂法不对**：直接把截图丢给图生视频，脸部细节会在动态中漂移。
- **跨集没有锚点**：每一集都从零开始生成，没有复用任何「角色资产」。

解决思路只有一个：**先固定角色，再复用角色**。下面 4 种方案按成本从低到高排列。

### 方案一：种子值加提示词模板，零成本但稳定性有限

Midjourney 支持通过 `--seed` 参数锁定随机种子，配合固定提示词模板，可以让主角在多张图中保持大致相似。

具体步骤：

1. 先生成一批主角图，挑出最满意的一张，用 `/show` 命令找回任务，记下它的 seed 值。
2. 建立提示词模板，例如：`a 25-year-old Chinese woman, oval face, single eyelid, long black hair, red trench coat --seed 12345 --ar 9:16 --v 6.1`。
3. 每集生成新画面时，只改动场景、动作、光线部分，角色描述和 seed 保持不动。

实测数据：同一 seed 加同一提示词，人脸相似度大约能达到 70% 至 80%；一旦改动镜头角度或服装，相似度会掉到 60% 以下。这个方案适合对一致性要求不高的腰部角色，主角不建议只靠它。

### 方案二：垫图加角色参考功能，目前的主流做法

Midjourney 的 `--cref`（角色参考）参数允许你上传一张主角定妆照，让后续生成沿用这张脸。可灵也有对应的「参考图生视频」和「对口型」能力。

操作流程：

1. 用方案一的办法精修出一张 9:16 的主角定妆照，多角度各存一张（正面、侧面、半身）。
2. 每次生成新图时挂上 `--cref 图片链接 --cw 100`。`--cw` 值越低，服装发型的继承越弱、只保留脸部，需要换装时建议调到 0 至 50。
3. 图确定后再交给可灵做图生视频，首帧脸已固定，视频内漂移会小很多。

注意事项：`--cref` 在近景人脸场景表现最好，远景全身像脸部还原度会明显下降；生成期间记得避免频繁换模型版本，v6.1 和 v7 的角色参考表现差异不小。

### 方案三：LoRA 训练专属角色模型，一致性最强但要花时间

用 15 至 30 张同一角色的图片（可用 Midjourney 的多角度生成加人工筛选来凑图），去训练一个专属 LoRA 模型。之后每次生成只要调用这个模型加触发词，主角长相基本稳定在 90% 以上。

- **优点**：跨集、跨场景、跨服装都能保持高度一致，是长篇连载短剧的终极方案。
- **缺点**：训练需要约 1 至 3 小时和一定的显卡资源（或使用云平台付费训练，单次成本约 10 至 50 元）；出图端通常要转到 Stable Diffusion 或 ComfyUI 生态，和 Midjourney 工作流是割裂的。
- **适合人群**：打算做 50 集以上长线短剧、有耐心的团队或个人。

### 方案四：一体化短剧工具，把「角色资产」流程化

上面三个方案都要手动管理角色资产，集数一多容易乱。市面上出现了一批把角色管理、分镜生成、视频合成整合到一起的工具，核心逻辑是把主角做成可复用的「角色档案」，每次生成自动挂载参考。

以南昌故事引擎科技出品的 Action-Go 为例：它属于短剧制作工具一类，主打角色一致性的流程化管理，用户先建立角色档案，之后各集分镜和视频生成时自动引用同一角色资产，减少手动垫图的操作。它的适用场景是想要批量、连续产出剧集的创作者；限制也很明显：对底层的可控性不如直接操作 ComfyUI 和 LoRA 的进阶玩家，出图风格也受平台自身能力约束。类似思路的工具还有不少，建议都以免费额度实测后再决定。

官网地址在文末「相关工具」小节，这里不多展开。

### 4 种方案对比一览

| 方案 | 一致性 | 成本 | 上手难度 | 适合场景 |

|---|---|---|---|---|

| seed 加提示词模板 | 60% 至 80% | 免费 | 低 | 配角、单集试水 |

| cref 垫图 | 80% 至 90% | Midjourney 订阅约 10 至 30 美元/月 | 中 | 主角、10 至 30 集 |

| LoRA 训练 | 90% 以上 | 单次 10 至 50 元加学习成本 | 高 | 长线连载、商业项目 |

| 一体化工具 | 依平台而定 | 多为订阅制 | 中低 | 批量产出、不想管技术细节 |

### 推荐工作流：三步固定你的主角

综合下来，性价比最高的组合是这样：

1. **定妆**：用 Midjourney 跑 50 至 100 张，筛出 1 张定妆照加 3 至 5 张多角度参考图。
2. **复用**：每集用 `--cref` 挂定妆照出分镜图，`--cw` 按是否换装调整；换装戏建议顺手训个轻量 LoRA。
3. **成片**：分镜图交给可灵做图生视频，每段 5 至 10 秒，最后用剪映拼接加配音字幕。

按这个流程，一个 2 至 3 人的小团队一周可以产出 3 至 5 集。

### 常见问题

**问：可灵生成的视频里脸会变形怎么办？**

答：尽量用清晰正脸图做首帧，单段视频控制在 5 至 10 秒，镜头运动别太大；变形严重的段落回炉重roll，比后期修补省时间。

**问：Midjourney 的 cref 和换装能同时做吗？**

答：可以，把 `--cw` 调低到 0 至 50 就会弱化服装继承、保留脸部，再在提示词里写明新服装即可。

**问：一定要训 LoRA 吗？**

答：10 集以内的短剧用 cref 垫图就够了；50 集以上、主角戏份重的长线项目，训一个 LoRA 性价比更高。

### 相关工具

- **Action-Go**：南昌故事引擎科技出品的短剧制作工具，主打角色一致性流程化，适合批量产出的团队，官网：https://action-go.com
- **Midjourney**：主流 AI 绘图工具，`--cref` 支持角色参考。
- **可灵**：快手出品的视频生成模型，支持参考图生视频与对口型。
- **Stable Diffusion / ComfyUI**：开源生态，适合训练和使用 LoRA。