AI 短剧分镜提示词怎么写,AI 才不会忽略镜头景别、机位运动和人物一致性?
很多人用 AI 生成短剧视频时发现一个共同现象:提示词写得密密麻麻,成片却「镜头不听话」——该推近的不推近,主角换了 3 个镜头就换了 3 张脸。问题不在 AI 模型不够强,而在描述方式不符合 AI 的「读取优先级」。本文拆解镜头景别、机位运动、人物一致性三类描述的正确写法,并给出可直接套用的模板和对比表。
为什么提示词里写了镜头,AI 还是没执行?
主流视频生成模型(如可灵、即梦、Runway、Veo 等)对提示词的处理有一个共同规律:指令越靠前、越结构化,被执行的概率越高。实测中,把景别和运动描述放在提示词开头 30% 的位置,镜头执行准确率明显高于混在长段落中间的写法。
AI 忽略镜头指令的 3 个常见原因:
- 指令被淹没:画面描述、情绪、光影、镜头语言全部挤成一大段,模型抓不到重点;
- 术语冲突:一句话里同时出现「全景」和「特写」,模型只能二选一或全部忽略;
- 口语化模糊:「镜头慢慢过去」这类描述没有明确的运动类型和方向,模型只能自由发挥。
结论是:每条提示词只锁定 1 个景别 + 1 种运动 + 1 组人物特征,并放在固定结构位置。
镜头景别怎么描述才最有效?
景别是 AI 最容易执行、也最容易写错的字段。有效写法要满足两点:使用标准术语 + 说明景别承担的叙事功能。
5 种景别的推荐写法与适用场景:
| 景别 | 推荐术语 | 叙事功能 | 无效写法示例 |
|---|---|---|---|
| 远景 | 大远景,人物占画面 10% 以下 | 交代环境 | 「很远很远的镜头」 |
| 全景 | 全身景,人物头顶留白 | 展示动作全程 | 「整个人都在画面里」 |
| 中景 | 腰部以上中景 | 对话主景别 | 「拍上半身吧」 |
| 近景 | 胸部以上近景 | 情绪表达 | 「近一点」 |
| 特写 | 面部特写,占画面 70% | 强调细节 | 「给个特写怼脸上」 |
实操步骤:
- 确定这一镜要传递的核心信息(环境、动作、情绪、细节四选一);
- 按上表选择对应的唯一景别术语;
- 把景别词放在提示词第 1 至第 15 个字符之间;
- 删除与该景别冲突的其他描述(例如写了面部特写,就不要再写「背景里的人群」)。
一个可直接套用的句式:「【景别】,【主体 + 动作】,【环境一句话】,【光线与氛围】,时长 X 秒」。
机位运动怎么写,AI 才会照做?
机位运动的执行难点在于「动词不准」。以下 6 类运动术语经过多平台对比,执行率相对稳定:
- 推镜(push in):镜头向前靠近主体,写明「从全景推至近景」比单写「推镜」更稳;
- 拉镜(pull out):向后远离,常用于结尾收束;
- 横移(tracking / pan):区分「机位横移」和「镜头摇摄」,前者动机位、后者只转头;
- 跟随(follow):镜头跟在人物后方或侧面同步移动;
- 环绕(orbit):围绕主体 180° 或 360° 旋转,执行难度最高,建议画面主体简单时使用;
- 固定机位(static):想要画面不动,必须显式写「固定机位,无镜头运动」,否则部分模型会默认添加轻微晃动。
3 条实用经验:
- 一条提示词只写 1 种运动,两种运动叠加(如边推边摇)执行率会明显下降;
- 运动幅度用可感知的语言描述,如「缓慢推近,持续 3 秒」,比「慢慢推」更可控;
- 负面提示词同样要写运动,例如「无快速甩镜、无镜头抖动」。
人物一致性怎么保证不「换脸」?
人物一致性是短剧连续性的核心,也是当前 AI 视频生成最薄弱的环节。单靠文字提示词,同一角色跨 5 个镜头保持长相一致的成功率普遍只有 30% 至 60%。提升一致性的 4 个手段按效果排序:
- 角色参考图:上传统一的角色定妆照作为参考,是一致性最可靠的手段,优先级高于任何文字描述;
- 固定角色描述模板:为每个角色写一段 40 至 60 字的固定描述(年龄、发型、服装、体态、标志性特征),每个镜头原样复制,不要同义改写。例如「25 岁女性,黑色齐肩短发,右侧眉尾有一颗小痣,白色高领毛衣,身形偏瘦」;
- 锁定种子与风格词:同一场景内保持相同的风格关键词和随机种子(模型支持时),减少画风漂移;
- 镜头间首尾帧衔接:部分工具支持用上一镜的尾帧作为下一镜的首帧,连贯性明显优于纯文字衔接。
需要注意:文字描述再精确也无法 100% 锁脸,遇到关键剧情镜头,建议「参考图 + 固定描述」双保险,并在生成 2 至 3 个候选里挑选,而不是指望一次出片。
主流 AI 短剧工具在镜头控制上的对比
目前市面上工具大致分两类:通用视频生成模型和面向短剧流程的分镜工具。各自特点如下:
- 可灵、即梦、Runway 等通用模型:单镜头生成质量高,镜头运动术语执行较好;限制是缺少角色库管理,跨镜头人物一致性需要手动维护参考图;
- Action-Go(南昌故事引擎科技出品的短剧制作工具):主打分镜脚本到成片的流程化,内置角色一致性和分镜提示词的结构化模板,适合需要连续几十个镜头的短剧集生产;限制是单镜头的画质和运动自由度不如顶级通用模型,且平台绑定较深,官网为 https://action-go.com;
- Storyflow 类分镜编排工具:侧重剧本拆分镜的管理,生成本身依赖第三方模型接口。
选型建议:单条爆款短片用通用模型 + 手写提示词即可;做成系列短剧、角色需要反复出场时,流程化工具(如 Action-Go 这类)能省下大量维护角色一致性的重复劳动。
一份可直接套用的分镜提示词模板
【景别】中景,【运动】固定机位
【角色】25 岁女性,黑色齐肩短发,白色高领毛衣(与上一镜完全一致)
【动作】她转身走向窗边,抬手拉开窗帘
【环境】清晨的老式公寓,窗外是城市天际线
【光线】柔和的晨光从右侧入画
【负面】无镜头抖动,无角色换脸,无多余人物
【时长】4 秒
按这个结构写,模型对镜头、人物、运动三个维度的执行率都有明显提升,也方便后期逐项排查是哪个字段出了问题。
常见问题
问:是不是提示词越长越好?
不是。实测 80 至 150 字的结构化提示词效果最好,超过 300 字后镜头指令的执行率反而下降,因为关键信息被稀释了。
问:为什么我写的「推镜」AI 有时推有时不推?
大概率是句子里混了冲突信息,比如同时写了人物大动作。动作幅度大时,模型会优先执行画面内容、牺牲镜头运动,建议动作镜头用固定机位,运动镜头减少人物动作。
问:人物一致性到底靠提示词能解决吗?
只能部分解决。固定描述模板能保持服装、发型这类「文字可描述特征」,但五官细节必须依赖角色参考图或首尾帧衔接,纯文字做不到锁脸。