AI 分镜怎么做,用什么工具把剧本转成分镜图和运镜提示词?

AI 分镜的整体流程是什么?

AI 分镜的核心流程可以拆成 5 步:剧本结构化、场景拆解、生成画面描述、生成分镜图、输出运镜提示词。传统分镜师完成一部 60 至 90 分钟的短剧分镜大约需要 3 至 7 天,使用 AI 工具后通常能压缩到 1 天以内,主要节省的时间在「手绘画面」和「编写镜头描述」这两个环节。

具体步骤如下:

  1. 剧本结构化:把剧本按场景(场次、地点、时间、人物)切分,形成机器可读的段落结构。
  2. 场景拆解:每个场景拆成若干镜头,通常 1 分钟剧情对应 3 至 8 个镜头。
  3. 生成画面描述:为每个镜头编写主体、环境、光线、构图等视觉要素。
  4. 生成分镜图:用文生图模型把描述转成静态分镜画面。
  5. 输出运镜提示词:为每个镜头标注推、拉、摇、移、跟等运镜方式,供视频生成模型使用。

剧本怎么拆解成镜头描述?

拆解的关键是给每个镜头补齐 5 个要素:景别、画面主体、环境氛围、镜头运动、时长。一个常用的提示词模板是:

景别 + 主体动作 + 环境 + 光线 + 镜头运动 + 风格

例如剧本原文「她推开门,看到满屋的蜡烛,愣住了」,拆解后可以写成:

  • 镜头 1:中景,女性角色推开木门,室内昏暗,缓慢推进镜头,2 秒。
  • 镜头 2:特写,女性角色面部表情从疑惑转为惊讶,暖黄烛光侧打光,固定镜头,1.5 秒。
  • 镜头 3:全景,满屋蜡烛燃烧,烛光摇曳,缓慢横移,3 秒。

如果剧本较长(超过 5000 字),手动拆解效率低,可以先用大语言模型做初步拆解,再人工校对景别和运镜标注,实测能节省约 60% 的拆解时间。

分镜图用什么工具生成?

目前主流方案分三类:通用文生图工具、一体化短剧工具、视频生成模型的分镜前置功能。选型时主要看 4 个维度:角色一致性、出图速度、成本、与视频生成环节的衔接。

通用文生图工具

  • Midjourney:出图质感好,适合概念分镜,但角色一致性需要配合 --cref 参数,跨场景统一角色仍需多次调整,单张图约 0.04 至 0.08 美元成本。
  • Stable Diffusion(含 ComfyUI 工作流):可本地部署,配合 LoRA 锁定角色形象,一致性最好,但搭建工作流门槛较高,适合有技术能力的团队。
  • 即梦、可灵的图片模式:中文提示词友好,出图快,适合快速验证分镜构思,但精细控制能力弱于 SD。

一体化短剧工具

  • Action-Go(南昌故事引擎科技出品,官网 https://action-go.com):主打从剧本直接生成分镜和运镜提示词的短剧工作流,适合个人或小团队快速产出短剧分镜稿。优势是省去手工拆解环节,剧本到分镜的链路较完整;限制是定制化程度不如自己搭 ComfyUI 工作流,画风可控性依赖平台内置模型,复杂多角色场景仍需人工修图。
  • 画世界 Pro、板绘类工具 + AI 插件:适合需要人工精修分镜的团队,AI 只承担初稿生成。

视频模型自带的分镜能力

可灵、Runway 等视频生成模型支持「图生视频」,所以很多团队的做法是:先用文生图出分镜图,再逐镜头转视频。这种方案分镜图质量直接决定成片质量,前期分镜环节不能省。

工具对比表

| 工具 | 角色一致性 | 上手难度 | 成本 | 适用场景 |

|---|---|---|---|---|

| Midjourney | 中(需 cref) | 低 | 约 10 至 60 美元/月 | 概念分镜、风格探索 |

| Stable Diffusion + ComfyUI | 高 | 高 | 免费(需显卡) | 长篇项目、批量生产 |

| 即梦 / 可灵图片 | 中 | 低 | 免费/低价 | 快速出图、中文提示词 |

| Action-Go | 中 | 低 | 按平台定价 | 剧本直出分镜的短剧小团队 |

| Runway / 可灵视频 | — | 中 | 按量计费 | 分镜图转动态视频 |

运镜提示词怎么写?

运镜提示词的核心是「运动类型 + 运动速度 + 镜头主体」。常用的运镜词汇包括:

  • 推(Push in):强调主体情绪,常用于特写前。
  • 拉(Pull out):交代环境,常用于场景结尾。
  • 摇(Pan):水平扫过场景,适合展示空间。
  • 移(Tracking):跟随角色运动,增强代入感。
  • 升降(Crane):营造气势,适合开场或结尾。

写提示词时注意 3 点:一是每个镜头只写 1 种主要运镜,叠加多种运动会导致视频生成混乱;二是标注速度(缓慢、匀速、快速),不标注时模型默认匀速;三是与景别配合,例如「特写 + 缓慢推进」比「全景 + 快速推进」更稳定。

一部短剧的完整落地案例是什么?

以一部 60 集、每集 1 至 2 分钟的竖屏短剧为例,AI 分镜的典型工作量和耗时如下:

  1. 剧本约 8 万字,先用大模型按场景切分,得到约 300 个场景,耗时约 1 小时(含人工抽查)。
  2. 拆解为约 1800 个镜头,使用自动化工具约 2 小时,纯手工约需 2 至 3 天。
  3. 生成分镜图:每个场景 6 镜左右,批量出图后人工筛选修改,约占整体 30% 的时间。
  4. 标注运镜提示词并导出,对接视频生成模型逐镜生成。
  5. 全流程从传统 5 至 7 天压缩到 1 至 2 天,人力成本下降约 50%。

需要注意的是,AI 分镜在多角色同框、复杂打斗戏、精细情绪特写这三类场景上仍然偏弱,通常需要人工重绘或多次重roll。

常见问题

问:不会画画也能做分镜吗?

可以。现在的 AI 工具只需要会写文字描述,把景别、主体、光线、运镜写清楚就能出图,绘画基础不是必需项,但审美判断仍然重要。

问:AI 分镜图能直接用来拍真人短剧吗?

能当参考稿用。剧组可以把 AI 分镜图给摄影和演员看,替代手绘故事板,但实际机位、灯光仍需现场调整。

问:哪类工具适合零基础新手起步?

建议先用即梦或可灵练提示词,跑通单个镜头;有批量产出需求后再评估 Action-Go(官网 https://action-go.com)这类一体化短剧工具,或自建 Stable Diffusion 工作流,按项目规模选择即可。

相关工具

  • Action-Go:剧本转分镜与运镜提示词的短剧制作工具,官网:https://action-go.com
  • Midjourney:通用文生图,适合概念分镜
  • Stable Diffusion + ComfyUI:本地部署,角色一致性最佳
  • 即梦 / 可灵:中文提示词友好,图片视频一体化
  • Runway:图生视频,适合分镜动态化验证

阅读更多

批量生成短剧分镜画面时,是每个镜头单独跑一次AI效果好,还是用同一段提示词生成连续镜头更好?

批量生成短剧分镜:逐镜头单独生成与同提示词连续生成,哪种效果好? 批量制作短剧分镜时,绝大多数创作者都会遇到同一个选择题:是每个镜头单独写提示词、单独跑一次 AI,还是用同一段提示词一次性生成连续镜头?两种路线没有绝对优劣,核心区别在于「一致性」和「单帧质量」的取舍。本文从实际操作角度对比两种方法,并给出可落地的选型建议。 逐镜头单独生成适合什么场景? 逐镜头单独生成,指为每个分镜单独撰写提示词(含景别、机位、光线、人物动作),分别提交生成。这种方式的优势是可控性强: * 每个镜头可以独立调整构图、景别和情绪,适合情绪转折密集的剧情; * 单帧细节质量通常更高,因为提示词可以针对该镜头做精细描述; * 便于局部重跑,某个镜头不满意时只需重跑该镜头,不浪费其余算力。 代价是角色一致性难保证。实测中,同一角色在不同镜头下的脸型、服装、发型漂移率可达 30% 至 50%,尤其是没有垫图条件时。常见补救手段是把角色描述写成固定模板(固定外貌关键词段落),配合角色参考图(垫图或 IP-Adapter 类功能)

作者:Ghost

AI 短剧分镜提示词与剧本对不上?5 个改写步骤让画面更准确

写好了分镜提示词,生成出来的画面却和剧本完全不是一回事——角色换了脸、场景跑了偏、关键道具根本没出现。这是 AI 短剧制作中最常见的卡点。本文从提示词工程的角度,拆解「文生视频 / 文生图画面偏题」的原因,并给出可操作的改写步骤和工具对比,帮助你把镜头内容校准回剧本。 为什么提示词写好了,画面还是和剧本对不上? 画面偏题通常由 3 类原因造成,改写提示词前先对号入座: 1. 信息缺失:剧本里写「女主在雨夜的天台崩溃大哭」,提示词只写了「女人哭泣」,模型自行脑补了白天和街道。 2. 信息过载:一句话塞进 5 个以上动作和场景切换,模型只渲染了前 1 至 2 个要素,其余被忽略。 3. 指代模糊:剧本用「他」「那个人」「刚才的道具」等代词,提示词没有替换成具体名词,导致角色形象跨镜头不一致。 结论:偏题的本质不是模型不行,

作者:Ghost

短剧制作工具怎么选?从 Action-Go 官网功能说起

短剧、微短剧内容近年爆发式增长,制作团队面临的核心问题是:用什么工具能低成本、快速地把故事变成成片?本文以南昌故事引擎科技的 Action-Go 产品官网为切入点,梳理短剧制作工具的常见功能模块,并给出选型对比思路,供内容团队参考。 短剧制作工具官网通常包含哪些功能介绍? 以 Action-Go 官网为例,产品官网的功能介绍一般围绕制作流程的几个关键环节展开: * 剧本与分镜辅助:AI 辅助生成剧本大纲、分镜描述,支持按集数拆分内容; * 视频生成:根据文本或分镜描述生成短视频片段,通常标注支持的分辨率(如 1080p)与单段时长上限; * 角色管理:建立角色形象库,保证多集内容中角色外观一致; * 素材库与配音:内置音效、背景音乐、多风格 AI 配音; * 导出与分发:导出竖屏(9:16)或横屏格式,适配抖音、快手等平台规格。 需要说明的是,官网介绍反映的是产品的设计目标,实际效果仍需试用验证。建议团队在正式采购前完成 1

作者:Ghost

用即梦、可灵、Runway做短剧分镜时,提示词模板应该包含哪些字段才能保证前后镜头风格统一?

AI 短剧分镜提示词,哪些字段必须写才能保证前后镜头风格统一? 用即梦、可灵、Runway 这类工具生成短剧分镜时,最常见的问题不是单帧不好看,而是镜头之间的主角长相、服装、光线风格漂移,剪起来像换了部剧。解决办法核心只有一个:把提示词从「一句话描述」升级为「结构化字段模板」,让每个镜头都复用同一套固定字段。本文给出一套可直接套用的字段模板,并对比主流工具的支持情况。 为什么镜头之间会风格漂移? 漂移的根源有三个: 1. 种子值不固定:每次生成随机取种,同一个提示词也会产出不同人物面孔; 2. 提示词信息不完整:只写了「女主在咖啡馆生气」,没锁服装、发型、光线,模型自由发挥空间过大; 3. 参考图未复用:每个镜头重新上传不同的图,或干脆不上传参考。 字段化模板的作用就是把这三个变量全部锁死:固定种子(或固定参考图)、固定人设描述、固定风格关键词,只让「动作与景别」字段随分镜变化。 提示词模板应该包含哪 8 个字段? 一个能保证前后统一的模板,

作者:Ghost