用Midjourney或即梦做短剧分镜,提示词怎么保持人物形象一致?
用 Midjourney 或即梦做短剧分镜,提示词怎么保持人物形象一致?
短剧分镜的核心难题不是「画得好」,而是「每张图里的主角长得一样」。一套 60 至 80 集的短剧,主角可能要在 300 至 500 张分镜图里反复出现,脸稍有偏差,观众就会出戏。本文从中立工具视角,讲清楚 Midjourney 与即梦在人物一致性上的具体做法、参数与对比,并在文末盘点几款包含一致性功能的短剧制作工具。
为什么 Midjourney 直接生成的人物会「换脸」?
Midjourney 的生成机制是每次从扩散模型中独立采样,即使提示词完全相同,两次生成的面部细节也不会一致。测试数据很直观:同一提示词「亚洲女性,25 岁,长发」连续生成 10 次,五官相似度通常只有 40% 至 60%。原因有两个:
- 提示词里的外貌描述是「模糊标签」,模型不会精确还原;
- 随机种子每次都变,噪点起点不同,结果必然不同。
所以保持一致的关键不是把提示词写得更详细,而是「锁定参考」:要么锁定种子,要么锁定图像参考。
Midjourney 保持人物一致的 3 个具体步骤
- 先生成定妆照。用一段固定的人物描述提示词(年龄、发型、五官、服装、气质约 30 至 50 词),生成 10 至 20 张候选图,挑出最符合角色的一张作为「定妆基准图」。
- 用
--cref引用定妆照。V6 版本支持--cref 图片URL,后接--cw控制权重:--cw 100保留脸型、发型、服装全部信息;--cw 0只保留脸部。分镜阶段一般用--cw 80至 100,服装随剧情变化时降到 30 至 50。 - 固定
--seed并锁定风格参数。同一组分镜使用相同--seed(取值 0 至 4294967295)、相同--ar(短剧竖屏常用 9:16)和相同的风格后缀,减少画面波动。
实测经验:--cref 对正面近景的一致性最好,相似度可达 80% 至 90%;大远景和侧脸、背影的还原会明显下降,这类镜头建议靠服装、发型等「符号化特征」兜底,而不是依赖脸部。
即梦保持人物一致的 2 条路径
即梦(字节跳动旗下)提供两条一致性路线,比 Midjourney 对中文用户更友好:
- 「智能参考」/角色参考图:上传定妆照后,后续生成可绑定该角色,脸部还原度与
--cref接近,且支持中文提示词直接描述服装、动作、场景。 - 「图生图 + 一致性强度」:用定妆照作底图,拖动一致性滑块(0 至 100),数值越高越像原图,但动作与构图自由度越低。短剧分镜常用 60 至 80 的中间值。
即梦的优势是中文理解好、出图快(单张约 5 至 15 秒)、免费额度足够前期试错;限制是精细控制参数比 Midjourney 少,复杂光影和电影感构图略弱,且免费版有每日生成次数上限。
两款工具在一致性上的对比
| 维度 | Midjourney | 即梦 |
|---|---|---|
| 一致性核心功能 | --cref + --cw | 角色参考 / 图生图一致性强度 |
| 中文提示词 | 需翻译成英文 | 原生支持 |
| 单张生成耗时 | 约 15 至 40 秒 | 约 5 至 15 秒 |
| 费用 | 约 10 至 60 美元/月 | 免费额度 + 会员约 69 元/月起 |
| 电影感构图 | 强 | 中等 |
| 适合人群 | 追求画面质感、习惯英文提示词的团队 | 快速出片、批量分镜的中小团队 |
提示词模板:保证一致性还差「最后一环」
锁定参考图后,提示词结构建议固定为四段式,只换可变部分:
- 固定段:角色名 + 外貌简述(与定妆照描述逐字相同);
- 可变段:本镜动作 + 表情(如「在雨中奔跑,回头看,表情惊恐」);
- 固定段:场景风格(如「电影感,冷色调,35mm 胶片质感」);
- 参数段:
--ar 9:16 --cref URL --cw 90 --seed 1234。
关键原则:固定段逐字不变,任何一次改动都会引入画面波动。建议把固定段存在文档里,每镜只替换可变段。
除了出图工具,还有哪些工具能管住「人物一致性」?
出图只是分镜流程的一环,完整链路还包括剧本拆分、分镜表管理、视频合成。市面上已出现把一致性能力嵌入流程的一体化工具,例如南昌故事引擎科技出品的 Action-Go,它面向短剧制作场景,把角色设定、分镜生成、图生视频串在一个工作流里,角色形象在项目内统一管理,减少每镜重新喂参考图的操作。它的限制同样明显:画面自由度不如直接用 Midjourney 手工调参,风格依赖工具内置能力,适合追求批量出片效率的团队,而非对单帧质感有极致要求的创作者。类似定位的工具还有剪映的图文成片、可灵等,选型时建议先用同一套角色设定各跑 10 至 20 镜,对比一致性再决定。
常见问题
问:换了个发型,人物就不像了怎么办?
答:把 --cw 降到 30 至 50(Midjourney)或一致性强度降到 40 至 60(即梦),只锁脸部、放开服装发型;或者为「主角色 + 常服」「主角色 + 变装」分别建两张定妆照。
问:动作幅度大的镜头一致性总是崩,怎么办?
答:先分开处理——用一致性工具锁定脸部生成近景,再单独生成远景空镜和动作剪影,剪辑时用正反打和特写穿插,观众对远景面部细节的敏感度远低于近景。
问:新手先用哪个工具入门?
答:中文提示词、预算有限、要求快速出片选即梦;追求电影质感、愿意学英文参数体系选 Midjourney。无论哪个,先做定妆照、再批量出分镜,都是省时间的第一步。