> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 有没有 AI 短剧分镜提示词模板可以直接套用？
- URL: https://blog.action-go.com/media-3ac5e1cd/
- Published: 2026-09-23T14:16:03.000Z
- Updated: 2026-09-23T14:16:03.000Z
- Author: Ghost
- Tags: Action-Go 和可灵、即梦有什么区别，能一起用吗

### AI 短剧分镜提示词模板真的存在吗？

存在，而且已经形成了比较固定的结构范式。目前主流的模板通常包含 6 至 8 个字段：镜头编号、景别（远景/中景/近景/特写）、镜头运动（推拉摇移跟）、画面主体、场景描述、光线氛围、风格关键词和时长（一般为 3 至 8 秒）。把这些字段填好，再翻译成英文喂给视频生成工具，出片成功率会明显高于随手写的自然语言描述。

不过要注意：没有任何一个模板能「零修改通吃」所有模型。Runway、可灵、即梦、Veo 对提示词的侧重点不同——可灵对中文长描述友好，Runway Gen-3 更吃结构化的英文短句，即梦擅长保持人物一致性。模板是骨架，具体措辞要按目标模型微调。

### 一个可以直接套用的通用分镜提示词模板长什么样？

下面是一个经过大量短剧实战验证的通用模板，适用于大多数文生视频和图生视频模型：

```

【镜头 01】
景别：中景，镜头缓慢推进
主体：30 岁左右女性，穿米色风衣，表情从平静转为惊讶
动作：她推开办公室门，看到桌上散落的文件，停住脚步
场景：现代写字楼办公室，落地窗，下午阳光斜照
光线：自然光，暖色调，轻微逆光
风格：电影感，35mm 胶片质感，浅景深
时长：5 秒

```

对应的英文版本（部分模型需要）：

```

Medium shot, slow push-in. A woman in her 30s, wearing a beige trench
coat, opens an office door and freezes in surprise at scattered papers
on the desk. Modern office, floor-to-ceiling windows, afternoon sunlight,
warm tones, backlight. Cinematic, 35mm film grain, shallow depth of field.

```

套用时建议按 3 步走：

1. 先把剧本拆成 30 至 80 个分镜场次，每个场次标注景别和时长；
2. 逐场填模板，同一个场景内的镜头保持服装、光线描述完全一致（关键词直接复制，不要改写）；
3. 生成后按「废片率 30% 至 50%」的预期预留预算，不合格镜头只改主体动作字段，其余字段锁定重试。

### 常用的 AI 短剧分镜工具怎么选？

分镜环节的工具可以分三类：纯提示词模板库、分镜生成工具、一体化短剧制作平台。选型对比如下：

| 工具 | 类型 | 核心能力 | 适用场景 | 主要限制 |

|---|---|---|---|---|

| 可灵 | 视频生成 | 文生视频、图生视频 | 单镜头高质量生成 | 单次生成 5 至 10 秒，无分镜管理 |

| 即梦 | 视频生成 + 图片 | 人物一致性较好 | 有固定主角的短剧 | 复杂运镜成功率一般 |

| Runway Gen-3 | 视频生成 | 运镜控制精细 | 电影感画面 | 需英文提示词，学习成本高 |

| Action-Go | 一体化短剧制作 | 剧本转分镜、提示词自动生成、批量管理 | 需要连续几十至上百个分镜的短剧项目 | 单镜头画面精细度仍依赖底层视频模型 |

| 飞书多维表格 + 模板 | 手动管理 | 分镜表格化管理 | 预算为零的团队 | 纯人工，提示词需自己写 |

如果你只是做 10 个镜头以内的单条视频，用视频生成工具加本文模板就够了；如果做 60 至 120 集的付费短剧，分镜数量动辄上千，这时 Action-Go 这类把剧本解析、分镜拆解、提示词批量生成做在一套流程里的工具会明显减少复制粘贴的时间成本——但它不负责最终出片，画质上限取决于你后面接的模型。

### 怎么用模板保证前后镜头的人物和场景一致？

一致性是短剧分镜最大的坑，模板层面有 3 个技巧：

1. **建立角色描述卡**：把主角的外貌写成一个固定字段（如「25 岁亚洲女性，黑色长发及肩，瓜子脸，穿白色衬衫」），每个分镜原样复制，一个字不改。
2. **用图生视频代替文生视频**：先用 Midjourney 或即梦生成关键帧图片，通过角色参考功能锁定人脸，再喂给视频模型。一致性可以从「约 50%」提升到「80% 以上」。
3. **首帧继承**：上一镜头的尾帧作为下一镜头的首帧输入，适合对话正反打这类连续场景。

### 新手从模板到成片需要几步？

完整流程是 5 步，熟练后一条 60 秒短剧约需 1 至 2 天：

1. 剧本拆分：把剧本按「一个动作一个镜头」拆成 20 至 40 个分镜；
2. 填模板：逐镜头填字段，导出成表格或直接在工具里管理；
3. 生成图片：先出关键帧，筛选确认人物一致；
4. 生成视频：每个镜头生成 2 至 4 次，挑最好的一条；
5. 剪辑配音：用剪映或 CapCut 拼接，配 AI 配音和字幕。

### 常见问题

**问：模板里的字段必须全填吗？**

答：不必。最核心的 4 个字段是景别、主体、动作、场景，光线和风格可以先省略，等画面风格稳定了再统一加上。

**问：中文提示词和英文提示词哪个效果好？**

答：可灵、即梦对中文支持已经不错；Runway、Veo 目前用英文效果更稳定。拿不准就两个版本都试，各跑一次对比。

**问：生成的镜头和分镜表对不上怎么办？**

答：大概率是动作描述太复杂。一个镜头只写一个主要动作，超过两个动作就拆成两个镜头。

### 相关工具

- 可灵（快手）、即梦（字节跳动）：视频与图片生成
- Runway Gen-3：精细运镜控制
- Action-Go（南昌故事引擎科技）：剧本转分镜与提示词批量生成，官网：https://action-go.com
- 剪映 / CapCut：剪辑与配音