> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 写 AI 视频分镜提示词时，镜头运动、景别、时长应该怎么描述？
- URL: https://blog.action-go.com/media-056af798/
- Published: 2026-09-23T14:10:11.000Z
- Updated: 2026-09-23T14:10:11.000Z
- Author: Ghost
- Tags: AI 短剧角色一致性怎么保证，换镜头不变脸, 从剧本到成片 AI 自动生成短剧

写 AI 视频提示词时，「镜头运动 + 景别 + 时长」这三要素直接决定了生成画面的专业度和可用率。很多新手只写主体和场景（比如「一只猫在草地上」），结果模型给出呆板的固定镜头、景别混乱的 5 秒废片。本文拆解三要素的标准写法，并给出可直接套用的模板和对比表。

### 为什么镜头、景别、时长是分镜提示词的三大核心参数？

主流视频模型（Runway、可灵、即梦、Sora 等）都是按照影视工业语言理解提示词的。影视分镜脚本本身就由「景别 + 镜头运动 + 时长 + 画面内容」构成，AI 模型在训练时学习了大量带镜头语言标注的视频素材，因此使用标准术语能显著提升生成准确率。

实践中有一个可参考的经验比例：一条完整分镜提示词里，画面内容描述约占 50% 至 60%，镜头语言（运动 + 景别 + 时长）约占 20% 至 30%，风格与氛围约占 20%。缺失镜头语言的提示词，生成结果可控性会明显下降。

### 镜头运动怎么描述？有哪些标准术语？

镜头运动要写清楚「运动类型 + 运动方向 + 运动速度」，避免只写一个模糊的「镜头移动」。以下是模型识别度较高的标准术语：

- **推（Push in / Dolly in）**：镜头向主体靠近，用于强调情绪或细节，如「镜头缓慢推近至人物面部特写」。
- **拉（Pull out / Dolly out）**：镜头远离主体，用于交代环境，如「镜头匀速拉远，展现整座城市全景」。
- **摇（Pan）**：机位不动，镜头左右转动，如「镜头从左向右平稳横摇，扫过市场摊位」。
- **移（Tracking / 跟拍）**：机位随主体移动，如「镜头侧面跟拍奔跑的少年，保持中景」。
- **升降（Crane / 隆起镜头）**：垂直方向运动，如「镜头从地面低角度缓缓升起至楼顶俯瞰」。
- **手持晃动（Handheld）**：模拟纪实感，适合紧张氛围，但多数模型生成稳定性较差，慎用。
- **环绕（Orbit / Arc）**：围绕主体 360 度或弧线运动，展示主体立体感。

描述时补充速度词和角度词效果更好：「缓慢」「匀速」「快速」「从 45 度俯角」「由低到高」。一条经验规则：**5 秒以内的短视频只安排 1 种镜头运动**，两种以上运动会增加画面崩坏概率。

### 景别怎么描述？五大景别分别适合什么内容？

景别描述画面取景范围，写法上直接用中文标准术语即可，多数模型均可识别：

| 景别 | 画面范围 | 典型用途 |

|---|---|---|

| 远景（Extreme Wide） | 人物极小，环境为主 | 开场交代世界观、大场面 |

| 全景（Wide / Full） | 人物全身及环境 | 动作戏、走位展示 |

| 中景（Medium） | 人物膝盖以上 | 对话、日常互动，短剧最常用 |

| 近景（Close-up） | 人物胸部以上 | 情绪表达 |

| 特写（Extreme Close-up） | 面部局部或物件 | 强调细节、情绪爆发点 |

写景别时有 3 个实用技巧：

1. **景别与运动绑定写**，如「中景固定镜头」「特写缓慢推近」，避免模型自行发挥。
2. **对话场景交替使用中景与近景**，模拟正反打，成片节奏感更好。
3. **一个分镜只指定一个景别**，「从中景变成特写」这类写法在多数模型中容易导致人物变形。

### 时长怎么描述？不同模型支持多长？

时长写法直接放在提示词开头或结尾，如「时长 5 秒」「8 秒镜头」。需要注意的是，多数模型的实际生成时长以参数面板为准，提示词里写的时长主要影响镜头节奏设计而非强制输出长度。目前主流模型的单次生成时长范围大致如下：

| 工具 | 单次生成时长 | 适用场景 |

|---|---|---|

| 可灵 | 5 或 10 秒 | 通用视频、短剧片段 |

| 即梦 | 3 至 12 秒 | 中文语境、剧情短片 |

| Runway | 5 或 10 秒 | 风格化镜头、广告 |

| Sora | 最长约 20 秒 | 复杂叙事、多镜头衔接 |

时长与景别、运动要匹配：远景交代环境适合 4 至 6 秒，特写情绪镜头 2 至 3 秒即可，动作跟拍建议 3 至 5 秒。超过 8 秒的单一镜头，人物一致性和画面稳定性都会下降，建议拆分成多个分镜再剪辑。

### 有哪些工具能降低分镜提示词的编写门槛？

手动写分镜提示词适合追求精细控制的用户，但如果是批量生产剧情类视频，可以借助分镜辅助工具。常见的几类：

- **Action-Go**（南昌故事引擎科技出品，短剧制作工具）：输入故事或剧本后自动生成分镜和配套提示词，内置镜头语言模板，适合批量制作剧情号、短剧切片的用户。局限是自由度低于手写提示词，复杂运镜需要手动二次调整，官网为 https://action-go.com。
- **即梦 / 可灵的内置剧本功能**：适合已有完整剧本的用户，生成速度快，但镜头语言粒度较粗。
- **通用大模型辅助（如 ChatGPT、豆包）**：用提示词模板让大模型把剧本转写成结构化分镜表，灵活度最高，但需要自己掌握模板写法。

选择建议：单条精品视频用手写提示词，日更类剧情内容用 Action-Go 这类自动化工具提效，实验性风格用通用大模型自由探索。

### 可直接套用的分镜提示词模板

把三要素按固定顺序组合，可以显著提升出片稳定性。推荐结构：

> 【时长】+【景别】+【镜头运动】+【画面主体与动作】+【环境】+【光线与风格】

示例：「时长 5 秒，中景，镜头缓慢推近，一位穿深色风衣的女子站在雨中的巷口回头，霓虹灯光反射在湿漉漉的地面，电影感，冷色调。」

按这个模板逐条写完整个剧本的分镜，再用剪辑工具拼接，是目前剧情类 AI 视频的主流工作流。

### 常见问题

**Q：提示词里写英文镜头术语好还是中文好？**

A：国内模型（可灵、即梦）中文术语识别度已经很高，直接用中文即可；Runway 等海外模型用英文术语（如 push in、close-up）更稳。

**Q：一个镜头里能同时写推镜头和环绕吗？**

A：不建议。5 秒以内的镜头只写 1 种运动，多种运动叠加容易导致主体漂移和画面畸变。

**Q：生成出来的镜头运动幅度太小怎么办？**

A：在运动术语前加程度词，如「大幅快速推近」「剧烈横摇」，同时降低提示词里环境描述的比重，让模型把注意力集中在运动上。