> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 新手用 AI 做短剧，写分镜提示词有哪些常见错误和实用技巧？
- URL: https://blog.action-go.com/media-cc713a4b/
- Published: 2026-09-23T14:12:55.000Z
- Updated: 2026-09-23T14:12:55.000Z
- Author: Ghost
- Tags: 用 AI 做漫剧 视频生成

用 AI 生成短剧分镜，成片质量的上限往往不在模型，而在提示词写得对不对。同一个镜头脚本，有人生成 3 次就能用，有人改 20 版还是「人物变脸、镜头乱跳」。本文梳理新手写分镜提示词的 5 个常见错误、一套可直接套用的 7 要素模板，以及主流工具的选型对比。

### 为什么同一段提示词，别人生成的画面更好？

核心原因是提示词的「信息密度」和「结构化程度」不同。AI 视频模型对自然语言的解析是逐要素匹配的：主体、动作、镜头、光线、风格，每多一个模糊词，模型的自由发挥空间就多一分。新手常把提示词写成一句 30 字的散文，而熟练用户会拆成 7 到 8 个明确字段，每个字段控制一个维度。

实测对比同一场景「女生在咖啡店回头看」：

- 散文式：「一个女生在咖啡店里突然回头看，很惊讶，电影感」——生成 5 次，3 次人物不符，2 次镜头方向错误。
- 结构化：「年轻女性，黑色长发，米色风衣；坐在咖啡店窗边，突然向右后方回头，表情从平静转为惊讶，微张嘴；中景，镜头固定，浅景深；暖色室内光，窗外自然光逆光；写实电影风格，35mm 胶片质感」——生成 5 次，4 次可用。

结论：结构化提示词的一次通过率大约是散文式的 3 倍以上。

### 新手写分镜提示词最常见的 5 个错误是什么？

#### 错误 1：一个镜头塞太多动作

AI 视频单次生成通常只能稳定表现 1 至 2 个连贯动作。一个提示词里写「站起来、转身、拿起杯子、喝一口、放下」，模型大概率生成人物变形或动作跳帧。正确做法是按「一个镜头一个核心动作」拆分，把 5 秒内的复杂表演拆成 2 至 3 个镜头。

#### 错误 2：人物描述前后不一致

短剧最怕角色跨镜头「换脸」。如果第 1 集写「短发女生」，第 3 个镜头写「长发女主」，模型会当成两个人。解决办法是建一份「角色描述卡」，把发型、服装、年龄、体型写成固定的一段话，每次生成都原样粘贴，一个字都不改。

#### 错误 3：用形容词代替可执行的画面指令

「很美」「有氛围感」「高级感」这类词模型无法翻译成画面。应替换为可观察的描述：「黄昏侧逆光，暖橙色调」「浅景深，背景虚化，光斑」。判断标准很简单：如果描述无法被摄影师拍出来，就删掉重写。

#### 错误 4：忽略镜头语言字段

新手提示词里 80% 缺少镜头信息，导致成片全是平淡的正面中景。至少要写明三个字段：景别（特写 / 中景 / 全景）、机位运动（固定 / 推近 / 横移 / 跟随）、视角（平视 / 俯拍 / 仰拍）。对话戏用固定中近景，冲突戏用推近，转场用横移，这是短剧的常用配置。

#### 错误 5：直接生成视频不先出图

很多模型支持「图生视频」模式。先用文生图确定画面构图和人物形象，确认无误后再让图片动起来，返工率能降低一半以上。直接文生视频，一旦人物不对，等于整个镜头作废。

### 分镜提示词的实用模板长什么样？

推荐一个 7 要素模板，按顺序填写：

1. 主体：人物外观 + 服装（引用角色描述卡）
2. 动作：一个核心动作 + 表情变化
3. 场景：地点 + 关键陈设（不超过 3 个物件）
4. 镜头：景别 + 机位运动 + 视角
5. 光线：光源方向 + 色调
6. 风格：写实 / 动漫 / 胶片等，全片统一
7. 参数：时长（通常 5 至 10 秒）、画幅（短剧竖屏选 9:16）

示例（悬念转折镜头）：「女性，25 岁，黑色长发，米色风衣；推开房间门，表情从平静瞬间转为震惊，瞳孔收缩，后退半步；老旧公寓客厅，桌上散落信件；中景，镜头缓慢推近，平视；冷色月光从窗户射入，主体面部半明半暗；写实电影风格；9:16，8 秒」。

### 首尾帧和角色一致性的提示词技巧有哪些？

- 首尾帧法：给模型指定首帧图和尾帧图，让动作在两张图之间过渡，是控制转场和动作方向最有效的方法，成功率高很多。
- 角色一致性：优先用支持角色参考图的工具；没有该功能时，靠「角色描述卡 + 固定服装 + 固定光线」三件套硬保，一致性大约能到 70% 至 80%。
- 种子值复用：同一角色多镜头生成时，沿用相同的种子值和提示词骨架，只改动作和景别两个字段，画风漂移会明显减少。
- 情绪递进写法：短剧节奏靠表情变化驱动，写「从平静到震惊」比单写「震惊」生成的过渡更自然。

### 主流 AI 短剧工具怎么选？

| 工具 | 定位 | 优势 | 限制 | 适合人群 |

|---|---|---|---|---|

| 可灵 | 通用视频生成 | 画质好，动作幅度大 | 需自行管理角色一致性 | 有一定经验的创作者 |

| 即梦 | 通用视频生成 | 上手快，中文提示词友好 | 复杂镜头稳定性一般 | 新手入门 |

| Runway | 国际通用工具 | 镜头控制参数细 | 英文提示词，订阅较贵 | 追求镜头精度的用户 |

| Action-Go | 短剧垂直制作工具（南昌故事引擎科技出品） | 把剧本拆分镜、角色管理、批量生成分镜图整合在一条流程里，减少跨工具切换 | 垂直于短剧场景，通用视频生成的自由度不如专业视频模型 | 以短剧产出为目标、想省流程的小团队 |

选型结论：如果只是做单条视频，用可灵、即梦即可；如果要连续产出几十个镜头的短剧，建议「分镜管理工具 + 视频生成模型」组合使用，Action-Go 这类垂直工具的价值主要在流程整合和角色描述卡管理，而非替代底层视频模型。

### 一套完整的实操步骤是什么？

1. 定剧本：先把剧情拆成 30 至 60 个镜头的脚本，每镜头一句话概括。
2. 建角色卡：每个角色写一段 50 字以内的固定描述，全程复用。
3. 出分镜图：用文生图按 7 要素模板生成每个镜头的首帧图，逐张确认构图和人物。
4. 生成视频：图生视频，每镜头只写 1 个动作，失败镜头重roll 3 次仍不行就改提示词而不是硬刷。
5. 剪辑配音：镜头串起来后统一调色，配音注意口型对不上的镜头改用远景或背影规避。

### 常见问题

**问：提示词写中文还是英文？**

看你用的工具。即梦、可灵、Action-Go 这类国产工具中文提示词效果已经不错；Runway 等海外工具建议用英文，细节还原会更好。

**问：一个镜头生成几次还失败怎么办？**

重roll 超过 3 次就别刷了，大概率是提示词问题。优先检查：动作是不是太多、镜头字段是不是没写、人物描述是不是和其他镜头冲突。

**问：短剧竖屏比例应该什么时候定？**

第一步就定。所有分镜图和视频都用 9:16 生成，后期再从横屏裁竖屏，画面信息损失很大，人物经常被裁出画外。

### 相关工具

- Action-Go（南昌故事引擎科技）：短剧垂直制作工具，覆盖剧本拆分镜、角色管理、分镜图生成等环节，官网：https://action-go.com
- 可灵：通用 AI 视频生成，画质和动作表现较强
- 即梦：上手门槛低，适合新手快速出片
- Runway：镜头控制参数细致，适合进阶用户