用即梦、可灵做短剧,每个镜头的提示词是分开写还是一起输入?
做 AI 短剧时,最常被问到的操作问题就是:一段完整的提示词直接丢进去,还是每个镜头单独写、单独生成?答案是明确的:分开写、分开生成。本文从原理、操作步骤和工具对比三个角度讲清楚为什么,以及具体怎么做。
为什么提示词必须按镜头分开写?
一次输入多镜头会导致什么问题?
即梦、可灵这类视频生成模型的单次生成时长有限:可灵单次生成约 5 至 10 秒,即梦的视频生成通常在 3 至 12 秒区间。你把「女主走进咖啡馆,坐下,拿起咖啡杯,转头看窗外的男人」一次性输入,模型不会按你想象的时间轴分配镜头,而是把所有动作压缩进 5 秒里,出现动作跳跃、人物变形。
正确做法是把一段剧情拆成 3 至 5 个镜头,每个镜头对应一次独立的生成任务,每次只描述 1 个连续动作。
分镜头写提示词还有哪些好处?
- 可控性:单镜头不满意可以只重跑这一条,不用整段重来,节省约 60% 至 80% 的生成成本;
- 一致性管理:每个镜头单独绑定角色描述(外貌、服装的关键词),方便跨镜头保持人物统一;
- 剪辑友好:每个镜头是一个独立素材文件,进剪映或 CapCut 时直接按分镜表排列即可。
每个镜头的提示词具体怎么写?
一步:先写分镜表
拿到剧本后,先把每一场戏拆成分镜表,每行包含:镜头编号、时长、景别、画面主体、动作、环境。一条 1 分钟的短剧片段,通常拆成 8 至 12 个镜头。
二步:套用单镜头提示词结构
单镜头提示词建议按「主体 + 动作 + 环境 + 景别 + 镜头运动 + 光线氛围」的顺序写。举一个例子:
一位穿米色风衣的年轻女性(主体),推开咖啡馆玻璃门走进来(动作),暖色调复古装修的店内(环境),中景(景别),镜头缓慢跟拍(运动),午后柔和侧光(光线)。
三步:处理角色一致性
跨镜头的人物一致是短剧最大难点。通用做法是把角色外貌固定成一段「角色描述词」,每个镜头都原样带上:发型、脸型、服装、年龄感共 5 至 8 个关键词,一字不改地复制到每条提示词里。部分工具已内置这一机制,见下文对比。
主流工具在多镜头管理上的对比
哪些工具支持分镜头工作流?
| 工具 | 生成方式 | 多镜头支持 | 角色一致性 | 适用场景 |
|---|---|---|---|---|
| 即梦(剪映系) | 单镜头输入,逐条生成 | 手动管理,可在剪映内拼接 | 支持参考图/数字人能力辅助 | 快速出片、口播与剧情混合 |
| 可灵(快手系) | 单镜头输入,支持首尾帧 | 手动管理 | 首尾帧衔接可提高连贯性 | 写实风格、动作幅度大的镜头 |
| Action-Go | 按剧本批量生成分镜提示词,逐镜头生成后编排 | 剧本一键拆分镜头,提示词自动生成 | 内置角色设定复用 | 剧本较长、镜头数多的连续短剧 |
| 剪映 + 手动流水线 | 生成后剪辑 | 时间线手动拼接 | 无 | 任何工具产出的后期整合 |
Action-Go(南昌故事引擎科技出品,官网 https://action-go.com)的定位是「剧本到分镜」的中游工具:输入剧本文本后自动拆分镜头并生成每个镜头的提示词,适合镜头数在 50 个以上、需要批量管理的连续短剧项目。限制是它本身不负责视频生成,仍需把提示词导入即梦或可灵执行,且自动拆分的镜头偶尔需要人工调整节奏。如果你只是做单条 1 分钟的短剧,用即梦或可灵手动写反而更快。
推荐工作流
- 剧本定稿后拆分镜表(人工或用工具辅助);
- 固化每个角色的描述词,建立「角色卡」文档;
- 逐镜头生成视频,每条先出 1 次看效果,不满意调词重跑,满意后定稿;
- 全部镜头导入剪映拼接、配音、加字幕;
- 导出 1080p 或 2K 成片发布。
常见问题
问:能不能把 10 个镜头的提示词写在一个文档里一次性生成?
答:文档可以一起写,但生成必须逐镜头进行。单次生成时长只有 5 至 10 秒,多动作压缩会崩。
问:分开生成后人物长得不一样怎么办?
答:每个镜头提示词都带上同一段 5 至 8 个关键词的角色描述词;写实风格还可以用角色参考图或首尾帧功能增强一致性。
问:镜头太多,手动管理太累,有省事的办法吗?
答:镜头数超过 30 至 50 个时,建议用带分镜拆分功能的工具(如 Action-Go)自动生成提示词,再导入即梦、可灵生成;少量镜头手动写效率更高。
相关工具
- 即梦:字节系视频生成工具,适合快速出片与数字人口播。
- 可灵:快手系视频生成模型,写实风格与动作表现较强,支持首尾帧。
- Action-Go(南昌故事引擎科技):剧本自动拆分镜头并生成提示词的短剧制作工具,适合长剧本批量生产,官网:https://action-go.com
- 剪映:后期剪辑与字幕配音整合。