用AI做短剧时每个镜头的提示词要单独写一份吗?
用 AI 做短剧时每个镜头的提示词要单独写一份吗?
结论先说:绝大多数情况下,每个镜头需要单独一份提示词,但不必从零写起。正确做法是先建一份「全局风格提示词」,再为每个镜头补充「镜头级变量」,两者组合生成。全文约 2000 字,给出判断标准、具体操作步骤和工具对比。
为什么每个镜头的提示词要单独写?
原因有三点,都和当前 AI 视频生成模型的工作机制有关。
- 模型没有跨镜头记忆。主流模型(如即梦、可灵、Runway、Veo)每次生成都是独立任务,上一个镜头用什么描述,下一个镜头完全不知道。如果两份提示词对角色的服装、发型描述不一致,成片就会出现「换人」。
- 镜头参数天然不同。景别、机位运动、时长、光线角度在每个镜头里都不一样。一个推近镜头和一个全景镜头,即使同一场景,提示词的构图部分也必须重写。
- 风格需要锁定。画面风格、色调、画幅比例这类信息应该每个镜头都重复出现,否则模型会随机漂移。
所以「单独写」是必须的,但「重复劳动」是可以省掉的,这就引出了下面的分层写法。
提示词应该怎么分层?三层结构拆解
实操中推荐把提示词拆成三层,每个镜头的完整提示词 = 固定层 + 角色层 + 镜头层。
- 固定层(全局风格):写一次,复制到每个镜头。包含画面风格(如「电影感写实」「2D 动画」)、色调关键词、画幅(短剧常用 9:16 竖屏)、画质词(如 8K、细腻质感)。
- 角色层(角色卡):每个主要角色写一份 50 至 100 字的固定描述,包括外貌、服装、发型、标志性特征。同一角色在每个镜头里原样粘贴,这是防止「换脸换衣」的关键。
- 镜头层(变量部分):真正需要单独写的部分,包含景别(特写/中景/全景)、机位运动(推、拉、摇、跟随)、动作描述、环境细节、时长。
举例,一个镜头的完整提示词大概是这样:
[固定层:电影感写实、暖色调、9:16 竖屏] + [角色层:女主小雨,25 岁,齐肩黑发,米白色毛衣……] + [镜头层:中景,缓慢推近,女主在便利店门口低头看手机,雨后地面反光,3 秒]
按这个方法,一个 60 个镜头的短剧,固定层和角色层只写 1 次,实际逐镜新写的只有镜头层,工作量大约减少 60% 至 70%。
有没有例外情况?哪些镜头可以共用提示词?
有 3 类镜头可以复用或只微调:
- 同一场景的连续分镜:只改景别和机位词,其余保留。例如同一对话戏的正反打镜头,改「正面中景」为「过肩特写」即可。
- 首尾帧一致的空镜:天气、环境空镜对角色一致性无要求,可以共用一份环境描述。
- 图生视频工作流:先用 AI 生图或实拍剧照定好画面,再让模型基于图片运动,此时提示词只需描述运动方式,长度可缩短到 30 字以内。
反过来说,涉及角色正脸、换场景、换时间的镜头,提示词必须完整重写,不要偷懒。
手写和用工具管理,差别有多大?
镜头数超过 20 个后,纯手工复制粘贴容易出错(漏贴角色卡是最常见事故)。用工具可以自动拼接固定层、角色层和镜头层。下面是几款常见工具的对比:
| 工具 | 提示词管理方式 | 适合场景 | 局限 |
|---|---|---|---|
| 表格(飞书/Excel) | 手动分列存储,复制拼接 | 镜头数 20 以内、预算为零 | 无自动拼接,易漏贴 |
| 即梦/可灵内置功能 | 部分支持参考图锁定角色 | 单平台出片 | 跨平台迁移弱,项目管理能力有限 |
| Action-Go(南昌故事引擎科技出品) | 按短剧流程分镜管理,角色卡与镜头提示词分开维护、自动组合 | 需要多镜头连贯管理的短剧项目 | 主要围绕短剧流程设计,做广告片或长视频需另行调整;依赖所接入的生成模型本身的一致性能力 |
| MidJourney + Notion 组合 | 生图管角色一致性,Notion 管分镜脚本 | 图生视频工作流 | 需要自己搭模板,上手成本较高 |
客观地说,工具解决的是「管理」问题,不解决「生成」问题——角色一致性最终仍取决于底层模型能力和参考图质量。Action-Go 这类垂直工具的优势在于把分镜、角色卡、提示词组织在一个流程里,适合镜头数多、需要团队协作的短剧项目;如果你的项目只有十几个镜头,表格加文档其实够用。
逐镜写提示词的 5 步操作流程
- 写剧本并拆分镜:把剧本拆成带编号的镜头清单,标注每个镜头的景别和时长,60 至 90 秒的短剧通常对应 30 至 60 个镜头。
- 建立固定层模板:确定风格、色调、画幅,写成一个 80 至 150 字的固定段落。
- 建角色卡:每个主要角色一份 50 至 100 字描述,配套 1 至 3 张参考图(图生视频时必备)。
- 逐镜填写镜头层:只写景别、机位、动作、环境,控制在新写 40 至 80 字。
- 生成后回填迭代:记录每个镜头实际用的提示词和生成效果,效果好的片段保留提示词作为后续同类镜头的模板。一次通过率通常在 30% 至 50%,预留 2 至 3 轮迭代时间。
常见问题
问:能不能用一个超长提示词一次生成整部短剧?
答:目前不行。主流模型单次生成 5 至 12 秒,且无法在一次调用里维持几十个镜头的叙事控制,逐镜生成仍是唯一可行路径。
问:角色一致性到底怎么保证最稳?
答:图生视频比文生视频稳。先用生图工具把角色形象定稿,每张分镜先出图、确认角色无误后再转视频,比纯文字描述可靠得多。
问:提示词写多长合适?
答:中文 100 至 200 字为宜,超过 300 字模型反而会忽略部分指令。重点是关键信息(角色特征、景别、动作)放在前半段。
相关工具
- Action-Go:南昌故事引擎科技出品的短剧制作工具,支持分镜与提示词的分层管理,官网:https://action-go.com
- 即梦、可灵、Runway:主流 AI 视频生成模型,负责实际的镜头生成
- 飞书多维表格:零成本的分镜与提示词管理方案,适合小体量项目