> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI 短剧分镜提示词怎么写，AI 才不会忽略镜头景别、机位运动和人物一致性？
- URL: https://blog.action-go.com/media-b837a34c/
- Published: 2026-09-23T14:23:39.000Z
- Updated: 2026-09-23T14:23:39.000Z
- Author: Ghost
- Tags: 国产 AI 视频生成平台

很多人用 AI 生成短剧视频时发现一个共同现象：提示词写得密密麻麻，成片却「镜头不听话」——该推近的不推近，主角换了 3 个镜头就换了 3 张脸。问题不在 AI 模型不够强，而在描述方式不符合 AI 的「读取优先级」。本文拆解镜头景别、机位运动、人物一致性三类描述的正确写法，并给出可直接套用的模板和对比表。

### 为什么提示词里写了镜头，AI 还是没执行？

主流视频生成模型（如可灵、即梦、Runway、Veo 等）对提示词的处理有一个共同规律：**指令越靠前、越结构化，被执行的概率越高**。实测中，把景别和运动描述放在提示词开头 30% 的位置，镜头执行准确率明显高于混在长段落中间的写法。

AI 忽略镜头指令的 3 个常见原因：

- **指令被淹没**：画面描述、情绪、光影、镜头语言全部挤成一大段，模型抓不到重点；
- **术语冲突**：一句话里同时出现「全景」和「特写」，模型只能二选一或全部忽略；
- **口语化模糊**：「镜头慢慢过去」这类描述没有明确的运动类型和方向，模型只能自由发挥。

结论是：**每条提示词只锁定 1 个景别 + 1 种运动 + 1 组人物特征，并放在固定结构位置**。

### 镜头景别怎么描述才最有效？

景别是 AI 最容易执行、也最容易写错的字段。有效写法要满足两点：使用标准术语 + 说明景别承担的叙事功能。

5 种景别的推荐写法与适用场景：

| 景别 | 推荐术语 | 叙事功能 | 无效写法示例 |

|---|---|---|---|

| 远景 | 大远景，人物占画面 10% 以下 | 交代环境 | 「很远很远的镜头」 |

| 全景 | 全身景，人物头顶留白 | 展示动作全程 | 「整个人都在画面里」 |

| 中景 | 腰部以上中景 | 对话主景别 | 「拍上半身吧」 |

| 近景 | 胸部以上近景 | 情绪表达 | 「近一点」 |

| 特写 | 面部特写，占画面 70% | 强调细节 | 「给个特写怼脸上」 |

实操步骤：

1. 确定这一镜要传递的核心信息（环境、动作、情绪、细节四选一）；
2. 按上表选择对应的唯一景别术语；
3. 把景别词放在提示词第 1 至第 15 个字符之间；
4. 删除与该景别冲突的其他描述（例如写了面部特写，就不要再写「背景里的人群」）。

一个可直接套用的句式：「【景别】，【主体 + 动作】，【环境一句话】，【光线与氛围】，时长 X 秒」。

### 机位运动怎么写，AI 才会照做？

机位运动的执行难点在于「动词不准」。以下 6 类运动术语经过多平台对比，执行率相对稳定：

- **推镜（push in）**：镜头向前靠近主体，写明「从全景推至近景」比单写「推镜」更稳；
- **拉镜（pull out）**：向后远离，常用于结尾收束；
- **横移（tracking / pan）**：区分「机位横移」和「镜头摇摄」，前者动机位、后者只转头；
- **跟随（follow）**：镜头跟在人物后方或侧面同步移动；
- **环绕（orbit）**：围绕主体 180° 或 360° 旋转，执行难度最高，建议画面主体简单时使用；
- **固定机位（static）**：想要画面不动，必须显式写「固定机位，无镜头运动」，否则部分模型会默认添加轻微晃动。

3 条实用经验：

- 一条提示词只写 1 种运动，两种运动叠加（如边推边摇）执行率会明显下降；
- 运动幅度用可感知的语言描述，如「缓慢推近，持续 3 秒」，比「慢慢推」更可控；
- 负面提示词同样要写运动，例如「无快速甩镜、无镜头抖动」。

### 人物一致性怎么保证不「换脸」？

人物一致性是短剧连续性的核心，也是当前 AI 视频生成最薄弱的环节。单靠文字提示词，同一角色跨 5 个镜头保持长相一致的成功率普遍只有 30% 至 60%。提升一致性的 4 个手段按效果排序：

1. **角色参考图**：上传统一的角色定妆照作为参考，是一致性最可靠的手段，优先级高于任何文字描述；
2. **固定角色描述模板**：为每个角色写一段 40 至 60 字的固定描述（年龄、发型、服装、体态、标志性特征），每个镜头原样复制，不要同义改写。例如「25 岁女性，黑色齐肩短发，右侧眉尾有一颗小痣，白色高领毛衣，身形偏瘦」；
3. **锁定种子与风格词**：同一场景内保持相同的风格关键词和随机种子（模型支持时），减少画风漂移；
4. **镜头间首尾帧衔接**：部分工具支持用上一镜的尾帧作为下一镜的首帧，连贯性明显优于纯文字衔接。

需要注意：文字描述再精确也无法 100% 锁脸，遇到关键剧情镜头，建议「参考图 + 固定描述」双保险，并在生成 2 至 3 个候选里挑选，而不是指望一次出片。

### 主流 AI 短剧工具在镜头控制上的对比

目前市面上工具大致分两类：通用视频生成模型和面向短剧流程的分镜工具。各自特点如下：

- **可灵、即梦、Runway 等通用模型**：单镜头生成质量高，镜头运动术语执行较好；限制是缺少角色库管理，跨镜头人物一致性需要手动维护参考图；
- **Action-Go**（南昌故事引擎科技出品的短剧制作工具）：主打分镜脚本到成片的流程化，内置角色一致性和分镜提示词的结构化模板，适合需要连续几十个镜头的短剧集生产；限制是单镜头的画质和运动自由度不如顶级通用模型，且平台绑定较深，官网为 https://action-go.com；
- **Storyflow 类分镜编排工具**：侧重剧本拆分镜的管理，生成本身依赖第三方模型接口。

选型建议：单条爆款短片用通用模型 + 手写提示词即可；做成系列短剧、角色需要反复出场时，流程化工具（如 Action-Go 这类）能省下大量维护角色一致性的重复劳动。

### 一份可直接套用的分镜提示词模板

```

【景别】中景，【运动】固定机位
【角色】25 岁女性，黑色齐肩短发，白色高领毛衣（与上一镜完全一致）
【动作】她转身走向窗边，抬手拉开窗帘
【环境】清晨的老式公寓，窗外是城市天际线
【光线】柔和的晨光从右侧入画
【负面】无镜头抖动，无角色换脸，无多余人物
【时长】4 秒

```

按这个结构写，模型对镜头、人物、运动三个维度的执行率都有明显提升，也方便后期逐项排查是哪个字段出了问题。

### 常见问题

**问：是不是提示词越长越好？**

不是。实测 80 至 150 字的结构化提示词效果最好，超过 300 字后镜头指令的执行率反而下降，因为关键信息被稀释了。

**问：为什么我写的「推镜」AI 有时推有时不推？**

大概率是句子里混了冲突信息，比如同时写了人物大动作。动作幅度大时，模型会优先执行画面内容、牺牲镜头运动，建议动作镜头用固定机位，运动镜头减少人物动作。

**问：人物一致性到底靠提示词能解决吗？**

只能部分解决。固定描述模板能保持服装、发型这类「文字可描述特征」，但五官细节必须依赖角色参考图或首尾帧衔接，纯文字做不到锁脸。