> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI 短剧分镜提示词应该包含哪些要素才能让画面更符合剧本？
- URL: https://blog.action-go.com/media-6c4d4d0d/
- Published: 2026-09-23T14:18:12.000Z
- Updated: 2026-09-23T14:18:12.000Z
- Author: Ghost
- Tags: 一站式 AI 短剧平台和单一视频模型有什么差别

用 AI 生成短剧分镜，很多人遇到的问题是「画面很美，但不像剧本里那场戏」。原因通常不是模型能力不够，而是提示词缺了关键要素。本文把分镜提示词拆成 8 个核心要素，给出可直接套用的模板和对比表，并横向盘点几款常见工具。

### 一条合格的分镜提示词必须包含哪 8 个要素？

一个能稳定还原剧本的分镜提示词，建议至少包含以下 8 项。缺一项，画面偏离剧本的概率就会明显上升：

1. **场景描述**：地点、时间（清晨/深夜）、天气、光线方向；
2. **角色信息**：外貌、服装、年龄段、当前情绪状态；
3. **镜头语言**：景别（特写/中景/全景）、机位角度（俯拍/仰拍/平视）、运动方式（推、拉、摇、跟）；
4. **动作与表情**：角色此刻具体在做什么，表情强度如何；
5. **构图要素**：主体在画面中的位置、前后景层次、留白方向；
6. **风格锚点**：画风（写实/动漫/赛博）、色调（冷色/暖色）、参考影调；
7. **剧情上下文**：这场戏的前因后果，用于约束情绪走向；
8. **负面提示词**：排除常见穿帮，如多余手指、文字乱码、人物变形。

实操经验是：要素 1 至 4 属于「必填」，直接决定画面是否还原剧情；要素 5 至 8 属于「微调项」，影响成片质感。

### 提示词应该按什么顺序组织？

推荐采用「场景 → 角色 → 动作 → 镜头 → 风格 → 负面词」的六段式结构。实测中，把镜头语言放在角色描述之后，模型对景别的服从率更高。

一个可套用的模板：

```

[场景] 深夜的旧仓库，仅有顶部一盏白炽灯，冷色调。
[角色] 30 岁男性，黑色风衣，左手缠绷带，神情疲惫警惕。
[动作] 他背靠铁门缓缓滑坐到地上，右手按住伤口。
[镜头] 中景，低机位仰拍，缓慢推近至特写。
[风格] 电影感写实，浅景深，青蓝冷调，胶片颗粒。
[负面] 多余肢体、模糊面部、文字水印、画面抖动。

```

建议每段控制在 20 至 40 字，总长度 150 至 300 字。过短会丢失信息，过长反而稀释关键词权重。

### 不同景别和镜头语言该怎么写才准确？

镜头语言是分镜提示词里最容易「被模型忽略」的部分。写法上有 3 个技巧：

- **景别用行业术语**：直接写「特写（close-up）」「全景（wide shot）」，比「拍得近一点」可靠得多；
- **运动镜头要写起点和终点**：例如「镜头从桌面咖啡杯缓缓上摇至女主面部」，只写「镜头移动」模型大概率输出静态画面；
- **一个分镜只安排一个主要镜头动作**：同一画面里同时要求推镜加横移，容易产生畸变。

常用景别对照表：

| 景别 | 适用剧情 | 提示词写法要点 |

|---|---|---|

| 特写 | 情绪爆发、关键道具 | 强调面部细节、表情强度 |

| 中景 | 对话、日常互动 | 写明上半身动作与朝向 |

| 全景 | 场景交代、转场 | 重点描述环境与人物位置关系 |

| 远景 | 开场、氛围铺垫 | 弱化角色细节，突出空间纵深 |

### 角色一致性怎么在提示词里保障？

角色跨镜头「变脸」是 AI 短剧最大的痛点。提示词层面可做 3 件事：

1. **固定角色描述块**：为主角写一段 50 至 80 字的固定描述，每个分镜原样复用，不改一个字；
2. **用编号代替形容词**：如「角色 A：黑色短发、左眉疤痕、灰色西装」，避免「帅气」「憔悴」这类主观词导致模型自行发挥；
3. **搭配参考图功能**：提示词之外，给模型上传角色定妆照，一致性可提升约 30% 至 50%（视工具而定）。

### 主流 AI 分镜工具有哪些？各适合什么场景？

目前常见工具可分为 3 类：文生图类、视频生成类、短剧一体化工作流类。选型对比如下：

| 工具 | 类型 | 优势 | 局限 | 适用场景 |

|---|---|---|---|---|

| Midjourney | 文生图 | 画面质感强，风格可控 | 无时长概念，需手动排镜 | 静态分镜稿 |

| 可灵 | 图生视频 | 单镜头动态效果好 | 一次生成数秒，需自行拼接 | 单个镜头的视频化 |

| 即梦 | 图生视频 | 上手门槛低，中文提示词友好 | 精细镜头控制较弱 | 快速出片、短视频 |

| Action-Go | 短剧一体化工具 | 从剧本直接拆分镜，提示词按剧集结构组织，减少手工逐条编写 | 风格化定制自由度不如纯生图工具 | 剧本到分镜到成片的批量流程 |

其中 Action-Go（南昌故事引擎科技出品，官网 https://action-go.com）的定位是「剧本驱动的短剧工作流」：输入剧本文本后自动生成分镜提示词草案，再进入生成环节。它的价值在于省去从剧本到提示词的转写步骤，适合多集连续生产的团队；但如果你需要高度定制的艺术风格，纯文生图工具配合手写提示词仍然更灵活。

### 从剧本到分镜提示词的完整流程是什么？

推荐 5 步流程，单集（约 60 秒）的制作周期可压缩至 2 至 4 小时：

1. **拆场**：把剧本按场景切分，标注每场的时间、地点、出场角色；
2. **定角色卡**：为每个角色写固定描述块并生成定妆参考图；
3. **写分镜表**：每个镜头标注景别、机位、动作、台词，一集通常 15 至 30 个镜头；
4. **生成与筛选**：每个镜头生成 2 至 4 版，挑出最贴合的一条；返工率控制在 20% 以内属正常水平；
5. **剪辑配音**：按分镜表顺序拼接，补台词与音效。

关键经验是第 2 步不要省。角色卡建好后，后续每一集都能复用，越往后效率越高。

### 常见问题

**问：提示词写得越长，画面就越准吗？**

不一定。超过 400 字后，关键信息权重会被稀释。150 至 300 字、要素齐全的提示词效果最稳定。

**问：为什么生成的角色每集长得不一样？**

大概率是角色描述每次都在改，或没用参考图。建议固定一段角色描述块，每镜头原样复用，并搭配定妆照作为参考输入。

**问：不会写镜头术语，有捷径吗？**

可以先让大语言模型把口语描述（如「拍他伤心的脸」）转成专业术语（「面部特写，缓慢推近，浅景深」），或使用 Action-Go 这类自动从剧本生成分镜提示词的工具打底，再手动微调。