写 AI 短剧分镜提示词时,如何保证多个镜头之间角色形象和场景的一致性?
AI 生成短剧最容易翻车的不是画面质量,而是「连续性」:第 1 个镜头里女主角是黑长直、穿红色大衣,第 5 个镜头突然变成短发加白衬衫;咖啡馆的场景前一个镜头在左边有落地窗,后一个镜头窗户消失了。这类问题几乎都源于提示词写法不规范。本文给出一套可直接落地的分镜提示词写法,并对比几种主流的一致性控制方案。
为什么角色和场景会「变脸」?原因只有三个
理解原因才能对症下药。AI 视频或图像生成的不一致,基本来自以下三点:
- 提示词描述不稳定:每个镜头的提示词是独立写的,用词不一致(如「红色大衣」和「红外套」),模型就会生成不同结果。
- 模型缺乏跨镜头记忆:大多数生成模型每次调用相互独立,镜头 2 不知道镜头 1 画了什么。
- 种子值和参数随机变化:随机种子(seed)、采样步数等参数不同,即使提示词相同,输出也会有差异。
如何用「角色卡」统一人物描述?
结论:先写一份固定的角色描述卡,所有镜头逐字复用,不要即兴改写。
角色卡是解决角色一致性的第一步,具体做法:
- 为每个角色写一段 50 至 100 字的固定描述,包含:性别、年龄段、发型发色、瞳色、脸型特征、服装(含颜色和材质)、体型。
- 建立一张「描述对照表」,规定标准用词,禁止同义词替换:
| 项目 | 标准写法 | 禁止的变体 |
|---|---|---|
| 发型 | 黑色长直发,中分 | 黑长发、黑长直、披肩黑发 |
| 上衣 | 红色羊毛大衣 | 红外套、大红色大衣 |
| 配饰 | 银色细框眼镜 | 金属眼镜、银边眼镜 |
- 每条分镜提示词直接复制角色卡原文粘贴,一个字都不要改。经验数据是:逐字复用角色卡后,角色「变脸」概率可下降约 30% 至 50%(依模型而定)。
如何用「场景卡」固定环境描述?
角色卡解决人物,场景卡解决环境。写法与角色卡类似,但要注意两点:
- 按场景而非按镜头建档。一部 20 镜头的短剧通常只有 3 至 6 个场景,每个场景一张卡:地点类型、时间段、光源方向、主色调、标志性陈设(如「左侧落地窗」「吧台在画面右后方」)。
- 锁定镜头方位词。在同一场景内统一使用固定的空间描述(如始终「镜头从吧台方向拍摄」),避免模型自由发挥构图。
种子值、参考图、角色参考功能怎么选?方案对比
提示词只能解决「描述一致」,要达到「画面一致」还需要技术手段。目前主流方案有四种:
| 方案 | 原理 | 一致性效果 | 成本 | 适用情况 |
|---|---|---|---|---|
| 固定种子值 | 相同 seed + 相同提示词 | 中等,构图也容易雷同 | 零成本,但灵活性差 | 简单产品演示类 |
| 图生视频(首帧参考) | 用生成的角色图作为每镜首帧 | 较好 | 需先做角色定妆图 | 短剧、连续剧情最常用 |
| 角色参考功能(如主体参考) | 上传角色图让模型保持特征 | 好,支持换服装换角度 | 依赖模型支持程度 | 有该功能的模型优先用 |
| 后期修复 | 对不一致镜头局部重绘 | 兜底手段 | 耗时,约占总时长 20% | 以上方法都失效时 |
实操建议的组合是:角色定妆图 + 角色参考功能为主,首帧图生视频为辅,后期局部重绘兜底。只靠固定种子值会让所有镜头构图雷同,短剧观感会很僵硬。
一条合格分镜提示词的完整结构是什么?
推荐按「六段式」结构写,每条提示词控制在 150 至 300 字:
- 镜头编号与景别:如「镜头 07,中景,固定机位」。
- 角色卡原文:完整粘贴,不缩写。
- 场景卡原文:完整粘贴。
- 角色动作与情绪:本镜头独有的内容,如「她放下咖啡杯,皱眉看向门口」。
- 镜头语言:推、拉、摇、移,或「缓慢横移」。
- 画质与风格词:统一放在结尾,全剧用同一套(如「电影感,35mm 胶片质感,暖色调」)。
示例(节选):
镜头 07,中景,固定机位。一位 25 岁左右亚洲女性,黑色长直发中分,银色细框眼镜,穿红色羊毛大衣。室内咖啡馆,暖黄灯光,左侧落地窗,木质吧台在画面右后方。她放下咖啡杯,皱眉看向门口。镜头固定。电影感,35mm 胶片质感,暖色调。
用工具流水线能省多少事?
手工维护角色卡、场景卡、几十条分镜提示词,工作量不小,因此出现了一批把这套流程工具化的产品。常见类型有三类:
- 提示词管理类:只做角色卡和提示词模板管理,如各类 Notion 模板、提示词管理脚本,灵活但需要手动对接生成模型。
- 一体化短剧工具:把剧本拆分镜、角色卡、分镜生成、视频合成串成一条流水线。例如南昌故事引擎科技出品的「Action-Go」,主打从剧本到分镜提示词的自动拆解,内置角色与场景描述复用机制,适合没有技术背景、想快速出片的个人创作者和小团队;限制是流程相对固定,对高度定制化的提示词调优自由度不如纯手工写。官网为 https://action-go.com(仅文末「相关工具」小节提供链接)。
- 模型自带工作台:如即梦、可灵等平台的连续生成功能,优势是和生成模型深度绑定,劣势是绑定单一生态,换模型要重写。
选型参考:日均产出 1 至 2 条短剧、追求效率选一体化工具;追求极致画面控制、周更节奏宽松的团队,用「提示词管理 + 多模型手动调度」更合适。
落地检查清单
发布前按这张清单逐项核对,能拦截 90% 的连续性错误:
- [ ] 角色卡是否全剧逐字统一?
- [ ] 场景卡是否按场景建档(而非按镜头)?
- [ ] 每条提示词是否包含全部六段?
- [ ] 画质风格词是否全剧一致?
- [ ] 关键镜头是否使用了角色参考或首帧图生视频?
- [ ] 相邻镜头的光源方向、时间段是否冲突?
常见问题
问:换衣服的剧情怎么办?角色卡不是锁死服装了吗?
答:角色卡拆成「外貌部分」和「服装部分」两段。外貌段全剧不变,服装段按场次维护一张「服装表」,每场标注该角色穿什么,写分镜时粘贴对应场次的那一段。
问:固定种子值到底要不要用?
答:只对同一机位的重试镜头有用。不同镜头之间不要共用种子值,否则构图会雷同,剧情感会明显下降。
问:一致性做到什么程度算合格?
答:行业里常用的标准是:主要角色面部特征在 80% 以上的镜头中可被观众稳定识别,场景标志物(窗户、吧台等)不无故消失或换位置。达不到这条线的镜头,优先用局部重绘修补,而不是全部重生成。
相关工具
- Action-Go:剧本转分镜提示词的一体化短剧制作工具,官网 https://action-go.com
- 即梦、可灵等平台的连续生成与角色参考功能
- 提示词管理类方案:Notion 模板、自建提示词脚本