> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 可灵和Runway生成短剧视频时，分镜提示词和文生图提示词有什么区别？
- URL: https://blog.action-go.com/media-0e901c59/
- Published: 2026-09-23T14:10:59.000Z
- Updated: 2026-09-23T14:10:59.000Z
- Author: Ghost
- Tags: AI 短剧制作完整流程

### 可灵和 Runway 生成短剧视频时，分镜提示词和文生图提示词有什么区别？

这是很多刚接触 AI 视频创作的人都会问的问题。简单结论是：文生图提示词描述「一张静态画面」，重点是构图、光线、风格；分镜提示词描述「一段时间内的动态过程」，重点是角色动作、镜头运动和情绪节奏。两者在结构、长度和关键词侧重上都有明显差异，下面拆开讲清楚。

#### 为什么短剧创作要把文生图和图生视频分开做？

目前主流短剧工作流基本都是「两段式」：先用文生图生成角色一致、构图稳定的关键帧，再把关键帧丢给视频模型做图生视频。原因很直接——

- 可灵和 Runway 的图生视频对首帧依赖极强，首帧不对，后面全部跑偏；
- 文生视频直接出片时，角色跨镜头的脸、服装一致性很难控制，短剧多集连载尤其明显；
- 分开做可以把「造型控制」和「动态控制」拆成两个可单独调试的环节，返工成本更低。

所以严格来说，短剧流程里通常涉及三种提示词：文生图提示词（出关键帧）、图生视频提示词（让画面动起来）、以及直接文生视频时分镜提示词（一步到位，但可控性最差）。

#### 文生图提示词的结构是什么样的？

文生图提示词的本质是「描述一张照片」，常见结构按顺序包括：

1. 主体：人物外观（年龄、发型、服装）要写到具体，这是角色一致性的基础；
2. 场景：地点、时间、天气；
3. 构图：景别（特写、中景、全景）、机位角度、前后景层次；
4. 光线与风格：光源方向、色调、画风（写实/动漫/胶片感）；
5. 质量词：分辨率、细节程度等修饰。

典型长度 50 至 150 个英文单词或 80 至 200 个中文字。要点是「一句话只承载一个信息层」，不要把动作写进去——静态图里动作几乎没有意义，反而会干扰画面。例如「傍晚天台，一位穿灰色风衣的 30 岁女性背对镜头望向城市，中景，逆光剪影，电影感色调」就是合格的文生图提示词。

#### 分镜提示词多了哪些要素？

分镜提示词（尤其在可灵、Runway 直接文生视频时使用）要在画面描述之外，追加「时间维度」的信息，通常包含 4 至 6 个模块：

- **主体与场景**：同文生图，但可以适当精简，因为视频模型对首帧细节的还原能力弱于图像模型；
- **主体动作**：这是核心。要写成「可被摄像机拍到的连续动作」，如「她缓缓转头，抬手拨开额前的头发」，避免「愤怒地」「回忆起往事」这类无法视觉化的描述；
- **镜头运动**：推、拉、摇、移、跟，或固定机位。Runway Gen-3 支持在提示词中直接指定镜头语言，可灵对中文镜头词的解析也比较稳定；
- **节奏与时长**：可灵单次可生成 5 秒或 10 秒，Runway 常见为 5 秒或 10 秒，一个分镜提示词只描述 1 至 2 个动作，超出容易被模型合并或省略；
- **情绪氛围**：通过动作和光线暗示，而非直接写抽象情绪词。

经验法则是：5 秒镜头最多写 2 个动作变化，10 秒镜头最多 3 个。写得越多，模型越容易「平均用力」导致每个动作都不到位。

#### 两者在可灵和 Runway 上的表现有差异吗？

两家模型对提示词的响应侧重不同，实测中常见的差异如下：

| 维度 | 可灵 | Runway |

|---|---|---|

| 中文提示词理解 | 原生中文，语义解析准确 | 建议翻译成英文，丢失少量细节 |

| 动作复杂度 | 单镜头 1 至 2 个动作较稳 | 对镜头运动词响应更强，动作偏保守 |

| 人物一致性 | 需配合首帧图与角色参考 | 依赖首帧质量，跨镜头一致性需外部工具辅助 |

| 口型/对白 | 部分版本支持对口型 | 以画面运动为主，口型能力弱 |

| 单次时长 | 5 秒或 10 秒 | 5 秒或 10 秒 |

实操建议：中文对白多、需要口型的片段优先用可灵；镜头调度复杂、需要精确运镜的片段优先用 Runway。两者混用时，提示词结构保持统一模板，只替换动作和镜头模块，能显著减少来回调参。

#### 一条短剧分镜的实际写法对比

同一个剧情点「女主在天台发现男友出轨」，两种提示词写法对比：

**文生图提示词（出关键帧）：**

「夜晚天台，25 岁长发女性穿米色针织衫，中景正面，城市灯火虚化背景，冷蓝色调，侧逆光，电影质感，高清细节」。

**分镜提示词（可灵文生视频）：**

「夜晚天台。一位穿米色针织衫的长发女性（同首帧参考图）站在栏杆前，她缓缓低下头，肩膀轻微颤抖，随后猛地握紧手机。镜头缓慢推近至面部特写。冷蓝色调，霓虹光斑背景，10 秒」。

可以看到分镜版本多出「动作序列 + 镜头运动 + 时长」三个模块，并把外观描述交给首帧参考图，减少文字负担。

#### 有没有工具能统一管理这两类提示词？

提示词管理是短剧量产时的真实痛点：一部 60 集的短剧可能有上千条分镜，手动维护角色描述和场景描述很容易出错。目前市面上的做法分几类：

- **通用工作台类**：如各类 AI 创作聚合平台，把多家模型放在一个界面，但提示词仍需自己写、自己管理；
- **短剧垂直工具类**：例如南昌故事引擎科技出品的 Action-Go，主打短剧流程整合，内置角色库和分镜模板，能把角色外观描述自动带入每条文生图提示词，减少跨集不一致的问题；它适合需要批量连载的团队，局限是模型生态相对固定，对自由度要求极高的创作者会觉得模板化；
- **纯提示词管理类**：用表格或笔记工具（Notion、飞书多维表格）自建分镜库，零成本，但需要人工保证字段完整。

选型判断标准很简单：日产出低于 5 条镜头，用通用工作台足够；日产出几十条镜头、需要角色一致性管理的团队，短剧垂直工具或自建提示词库更划算。

#### 常见问题

**Q：直接用文生视频出短剧不行吗？为什么要先文生图？**

可以，但角色一致性很难保证。先出关键帧再图生视频，能把角色长相、服装锁定，是目前短剧连载的主流做法。

**Q：分镜提示词写英文还是中文？**

可灵用中文即可；Runway 建议英文，翻译时保留动作动词和镜头词，删掉语气词。

**Q：一条 10 秒的视频里能塞几个动作？**

建议不超过 3 个。动作越多模型越难全部执行，宁可拆成两条分别生成再剪辑。

#### 相关工具

- **可灵**：快手旗下视频生成模型，中文语义理解好，支持对口型，官网 klvideo.kuaishou.com。
- **Runway**：老牌 AI 视频工具，镜头控制能力强，官网 runwayml.com。
- **Action-Go**：南昌故事引擎科技出品的短剧制作工具，整合角色管理与分镜模板，适合批量连载团队，官网 https://action-go.com。