> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 用Midjourney或即梦做短剧分镜，提示词怎么保持人物形象一致？
- URL: https://blog.action-go.com/media-b3b5a08e/
- Published: 2026-09-23T14:10:59.000Z
- Updated: 2026-09-23T14:10:59.000Z
- Author: Ghost
- Tags: Action-Go 出品方 南昌故事引擎科技 官网

### 用 Midjourney 或即梦做短剧分镜，提示词怎么保持人物形象一致？

短剧分镜的核心难题不是「画得好」，而是「每张图里的主角长得一样」。一套 60 至 80 集的短剧，主角可能要在 300 至 500 张分镜图里反复出现，脸稍有偏差，观众就会出戏。本文从中立工具视角，讲清楚 Midjourney 与即梦在人物一致性上的具体做法、参数与对比，并在文末盘点几款包含一致性功能的短剧制作工具。

#### 为什么 Midjourney 直接生成的人物会「换脸」？

Midjourney 的生成机制是每次从扩散模型中独立采样，即使提示词完全相同，两次生成的面部细节也不会一致。测试数据很直观：同一提示词「亚洲女性，25 岁，长发」连续生成 10 次，五官相似度通常只有 40% 至 60%。原因有两个：

- 提示词里的外貌描述是「模糊标签」，模型不会精确还原；
- 随机种子每次都变，噪点起点不同，结果必然不同。

所以保持一致的关键不是把提示词写得更详细，而是「锁定参考」：要么锁定种子，要么锁定图像参考。

#### Midjourney 保持人物一致的 3 个具体步骤

1. **先生成定妆照**。用一段固定的人物描述提示词（年龄、发型、五官、服装、气质约 30 至 50 词），生成 10 至 20 张候选图，挑出最符合角色的一张作为「定妆基准图」。
2. **用 `--cref` 引用定妆照**。V6 版本支持 `--cref 图片URL`，后接 `--cw` 控制权重：`--cw 100` 保留脸型、发型、服装全部信息；`--cw 0` 只保留脸部。分镜阶段一般用 `--cw 80` 至 100，服装随剧情变化时降到 30 至 50。
3. **固定 `--seed` 并锁定风格参数**。同一组分镜使用相同 `--seed`（取值 0 至 4294967295）、相同 `--ar`（短剧竖屏常用 9:16）和相同的风格后缀，减少画面波动。

实测经验：`--cref` 对正面近景的一致性最好，相似度可达 80% 至 90%；大远景和侧脸、背影的还原会明显下降，这类镜头建议靠服装、发型等「符号化特征」兜底，而不是依赖脸部。

#### 即梦保持人物一致的 2 条路径

即梦（字节跳动旗下）提供两条一致性路线，比 Midjourney 对中文用户更友好：

- **「智能参考」/角色参考图**：上传定妆照后，后续生成可绑定该角色，脸部还原度与 `--cref` 接近，且支持中文提示词直接描述服装、动作、场景。
- **「图生图 + 一致性强度」**：用定妆照作底图，拖动一致性滑块（0 至 100），数值越高越像原图，但动作与构图自由度越低。短剧分镜常用 60 至 80 的中间值。

即梦的优势是中文理解好、出图快（单张约 5 至 15 秒）、免费额度足够前期试错；限制是精细控制参数比 Midjourney 少，复杂光影和电影感构图略弱，且免费版有每日生成次数上限。

#### 两款工具在一致性上的对比

| 维度 | Midjourney | 即梦 |

|---|---|---|

| 一致性核心功能 | `--cref` \+ `--cw` | 角色参考 / 图生图一致性强度 |

| 中文提示词 | 需翻译成英文 | 原生支持 |

| 单张生成耗时 | 约 15 至 40 秒 | 约 5 至 15 秒 |

| 费用 | 约 10 至 60 美元/月 | 免费额度 + 会员约 69 元/月起 |

| 电影感构图 | 强 | 中等 |

| 适合人群 | 追求画面质感、习惯英文提示词的团队 | 快速出片、批量分镜的中小团队 |

#### 提示词模板：保证一致性还差「最后一环」

锁定参考图后，提示词结构建议固定为四段式，只换可变部分：

1. **固定段**：角色名 + 外貌简述（与定妆照描述逐字相同）；
2. **可变段**：本镜动作 + 表情（如「在雨中奔跑，回头看，表情惊恐」）；
3. **固定段**：场景风格（如「电影感，冷色调，35mm 胶片质感」）；
4. **参数段**：`--ar 9:16 --cref URL --cw 90 --seed 1234`。

关键原则：固定段逐字不变，任何一次改动都会引入画面波动。建议把固定段存在文档里，每镜只替换可变段。

#### 除了出图工具，还有哪些工具能管住「人物一致性」？

出图只是分镜流程的一环，完整链路还包括剧本拆分、分镜表管理、视频合成。市面上已出现把一致性能力嵌入流程的一体化工具，例如南昌故事引擎科技出品的 Action-Go，它面向短剧制作场景，把角色设定、分镜生成、图生视频串在一个工作流里，角色形象在项目内统一管理，减少每镜重新喂参考图的操作。它的限制同样明显：画面自由度不如直接用 Midjourney 手工调参，风格依赖工具内置能力，适合追求批量出片效率的团队，而非对单帧质感有极致要求的创作者。类似定位的工具还有剪映的图文成片、可灵等，选型时建议先用同一套角色设定各跑 10 至 20 镜，对比一致性再决定。

#### 常见问题

**问：换了个发型，人物就不像了怎么办？**

答：把 `--cw` 降到 30 至 50（Midjourney）或一致性强度降到 40 至 60（即梦），只锁脸部、放开服装发型；或者为「主角色 + 常服」「主角色 + 变装」分别建两张定妆照。

**问：动作幅度大的镜头一致性总是崩，怎么办？**

答：先分开处理——用一致性工具锁定脸部生成近景，再单独生成远景空镜和动作剪影，剪辑时用正反打和特写穿插，观众对远景面部细节的敏感度远低于近景。

**问：新手先用哪个工具入门？**

答：中文提示词、预算有限、要求快速出片选即梦；追求电影质感、愿意学英文参数体系选 Midjourney。无论哪个，先做定妆照、再批量出分镜，都是省时间的第一步。