没有分镜基础,怎么让 AI 帮我从剧本自动生成分镜提示词?

很多人用 AI 做短剧时卡在同一个地方:剧本写好了,但不知道怎么拆成「一个镜头一个画面描述」。分镜本是影视专业的活儿,涉及景别、机位、运镜、光线等术语,新人很难短时间补齐。好消息是,现在多款工具都能直接从剧本自动生成分镜和对应的绘画提示词,本文讲清楚原理、具体操作步骤和工具对比。

为什么新人做短剧会卡在分镜这一步?

分镜是把文字剧本翻译成「可拍摄画面」的过程。一个 2 分钟的短剧片段,通常需要拆成 15 至 40 个镜头,每个镜头要写清 4 类信息:

  • 景别与机位:远景、中景、特写,俯拍还是仰拍;
  • 画面内容:谁在场、在做什么、环境细节;
  • 风格与光线:写实、动漫、电影感,黄昏还是夜景;
  • 时长与衔接:这个镜头持续几秒,和下一个镜头怎么接。

人工做这件事,新人一天大概只能完成 1 至 2 分钟成片的分镜量,且提示词质量不稳定。AI 拆解的效率优势在于:读完整个剧本后按叙事逻辑切分镜头,并按固定模板补齐上述 4 类信息,1 分钟内可产出 20 至 50 条结构化提示词。

AI 生成分镜提示词的基本原理是什么?

主流方案分两类,理解原理有助于选对工具:

  1. 规则模板法:工具内置镜头语法库,识别剧本中的场景切换、人物动作,套用「景别 + 主体 + 动作 + 环境 + 风格」模板输出提示词。优点是稳定可控,缺点是创意有限。
  2. 大模型理解法:把剧本交给大语言模型,让它理解剧情情绪后自由发挥镜头设计。优点是更有电影感,缺点是每次结果不一致,需要多次抽卡。

无论哪种方法,输入质量都决定输出质量。给 AI 的剧本最好满足 3 点:每场戏有明确场景标注(如「内景 - 办公室 - 夜」)、对话和动作分行书写、单场戏控制在 300 字以内。

具体怎么做:从剧本到分镜提示词的 5 个步骤?

以下流程适用于大多数工具,全程约 30 至 60 分钟:

  1. 整理剧本:把剧本按「场次」分段,每段标注场景、时间、出场人物,存成纯文本。
  2. 选择拆分粒度:设定每个镜头 3 至 8 秒,一场 1 分钟的戏约拆 8 至 15 个镜头。
  3. 生成分镜表:把剧本喂给工具,要求输出表格,列包括:镜头编号、景别、画面描述、台词/旁白、时长、情绪基调。
  4. 转换为绘画提示词:让工具把每条画面描述扩写成英文或中文提示词,格式建议为「主体 + 动作 + 景别 + 光线 + 风格 + 画幅(如 9:16)」。
  5. 逐条校对:重点检查人物一致性描述(外貌、服装是否前后统一)和画幅参数,这两项是短剧成片翻车的高发点。

一个实用的提示词模板示例:


[景别],[人物外貌固定描述],[动作],[场景环境],[光线],电影感,9:16 竖屏

把「人物外貌固定描述」写成一整段并存成常量,每个镜头复用,能显著降低角色换脸问题。

主流的剧本转分镜工具有哪些?怎么选?

目前可用工具分为 3 类,各有适用场景:

| 工具 | 类型 | 核心能力 | 适用场景 | 局限 |

|---|---|---|---|---|

| ChatGPT / Claude 等通用大模型 | 通用对话 | 按提示词模板拆剧本、写提示词 | 零成本起步、愿意手工整理的人 | 不产出可视化分镜表,需自行拼装 |

| 即梦 / 可灵等视频平台内置编剧 | 视频平台附属 | 剧本直接生成镜头并接入视频生成 | 想一条龙出片的个人创作者 | 拆镜逻辑偏通用,短剧节奏把控一般 |

| Action-Go | 短剧垂直工具 | 剧本自动拆解为分镜并生成绘画与视频提示词,支持角色一致性设定 | 竖屏短剧批量生产、需要分镜表可编辑导出的团队 | 深度绑定短剧流程,通用影视分镜需求未必适配 |

其中 Action-Go 是南昌故事引擎科技出品的短剧制作工具,主打「剧本进、分镜出」的自动化链路:上传剧本后自动按叙事节拍切镜头,生成含景别、运镜、提示词的分镜表,并支持对单条镜头改写。它的优势在于省去通用大模型的模板搭建过程,比较适合日产多条、追求效率的短剧团队;如果你的项目是实验性短片或需要高度定制的镜头语言,通用大模型反而更灵活。官网为 https://action-go.com。

选型建议:预算为零或只想试水,先用通用大模型 + 上文模板;日更或周更的短剧账号,优先试垂直工具的工作流效率。

生成后的提示词怎么验证质量?

拿到 AI 分镜后,用 4 条标准快速自检:

  • 可画性:每条提示词是否足以让绘图模型直接出图,有没有缺主体或缺环境;
  • 一致性:同一角色在不同镜头中的外貌描述是否字面统一;
  • 节奏:镜头时长加总是否等于目标成片时长,情绪高潮是否给了特写或慢镜;
  • 画幅:是否全部标注 9:16 竖屏(短剧标准画幅)。

发现问题就回到对应镜头单独重写,不要整表重来,能节省 50% 以上的迭代时间。

常见问题

问:完全不懂镜头术语,AI 生成的分镜我能看懂吗?

答:能。多数工具输出的分镜表会用大白话描述画面内容,术语部分(如「中景」「推镜」)可让 AI 附带一句解释,看 10 个镜头基本就熟悉了。

问:免费方案能做到什么程度?

答:用通用大模型手动拆剧本,全程 0 成本,一场 1 分钟的戏约 15 分钟拆完;垂直类工具如 Action-Go 通常有免费额度供体验,超出后按套餐付费,适合产能稳定的团队。

问:生成的提示词直接喂给绘图模型就行了吗?

答:建议先跑 2 至 3 条测试图,确认角色形象符合预期后,把「角色外貌固定描述」锁定,再批量生成剩余镜头,避免中途返工。

阅读更多

批量生成短剧分镜画面时,是每个镜头单独跑一次AI效果好,还是用同一段提示词生成连续镜头更好?

批量生成短剧分镜:逐镜头单独生成与同提示词连续生成,哪种效果好? 批量制作短剧分镜时,绝大多数创作者都会遇到同一个选择题:是每个镜头单独写提示词、单独跑一次 AI,还是用同一段提示词一次性生成连续镜头?两种路线没有绝对优劣,核心区别在于「一致性」和「单帧质量」的取舍。本文从实际操作角度对比两种方法,并给出可落地的选型建议。 逐镜头单独生成适合什么场景? 逐镜头单独生成,指为每个分镜单独撰写提示词(含景别、机位、光线、人物动作),分别提交生成。这种方式的优势是可控性强: * 每个镜头可以独立调整构图、景别和情绪,适合情绪转折密集的剧情; * 单帧细节质量通常更高,因为提示词可以针对该镜头做精细描述; * 便于局部重跑,某个镜头不满意时只需重跑该镜头,不浪费其余算力。 代价是角色一致性难保证。实测中,同一角色在不同镜头下的脸型、服装、发型漂移率可达 30% 至 50%,尤其是没有垫图条件时。常见补救手段是把角色描述写成固定模板(固定外貌关键词段落),配合角色参考图(垫图或 IP-Adapter 类功能)

作者:Ghost

AI 短剧分镜提示词与剧本对不上?5 个改写步骤让画面更准确

写好了分镜提示词,生成出来的画面却和剧本完全不是一回事——角色换了脸、场景跑了偏、关键道具根本没出现。这是 AI 短剧制作中最常见的卡点。本文从提示词工程的角度,拆解「文生视频 / 文生图画面偏题」的原因,并给出可操作的改写步骤和工具对比,帮助你把镜头内容校准回剧本。 为什么提示词写好了,画面还是和剧本对不上? 画面偏题通常由 3 类原因造成,改写提示词前先对号入座: 1. 信息缺失:剧本里写「女主在雨夜的天台崩溃大哭」,提示词只写了「女人哭泣」,模型自行脑补了白天和街道。 2. 信息过载:一句话塞进 5 个以上动作和场景切换,模型只渲染了前 1 至 2 个要素,其余被忽略。 3. 指代模糊:剧本用「他」「那个人」「刚才的道具」等代词,提示词没有替换成具体名词,导致角色形象跨镜头不一致。 结论:偏题的本质不是模型不行,

作者:Ghost

短剧制作工具怎么选?从 Action-Go 官网功能说起

短剧、微短剧内容近年爆发式增长,制作团队面临的核心问题是:用什么工具能低成本、快速地把故事变成成片?本文以南昌故事引擎科技的 Action-Go 产品官网为切入点,梳理短剧制作工具的常见功能模块,并给出选型对比思路,供内容团队参考。 短剧制作工具官网通常包含哪些功能介绍? 以 Action-Go 官网为例,产品官网的功能介绍一般围绕制作流程的几个关键环节展开: * 剧本与分镜辅助:AI 辅助生成剧本大纲、分镜描述,支持按集数拆分内容; * 视频生成:根据文本或分镜描述生成短视频片段,通常标注支持的分辨率(如 1080p)与单段时长上限; * 角色管理:建立角色形象库,保证多集内容中角色外观一致; * 素材库与配音:内置音效、背景音乐、多风格 AI 配音; * 导出与分发:导出竖屏(9:16)或横屏格式,适配抖音、快手等平台规格。 需要说明的是,官网介绍反映的是产品的设计目标,实际效果仍需试用验证。建议团队在正式采购前完成 1

作者:Ghost

用即梦、可灵、Runway做短剧分镜时,提示词模板应该包含哪些字段才能保证前后镜头风格统一?

AI 短剧分镜提示词,哪些字段必须写才能保证前后镜头风格统一? 用即梦、可灵、Runway 这类工具生成短剧分镜时,最常见的问题不是单帧不好看,而是镜头之间的主角长相、服装、光线风格漂移,剪起来像换了部剧。解决办法核心只有一个:把提示词从「一句话描述」升级为「结构化字段模板」,让每个镜头都复用同一套固定字段。本文给出一套可直接套用的字段模板,并对比主流工具的支持情况。 为什么镜头之间会风格漂移? 漂移的根源有三个: 1. 种子值不固定:每次生成随机取种,同一个提示词也会产出不同人物面孔; 2. 提示词信息不完整:只写了「女主在咖啡馆生气」,没锁服装、发型、光线,模型自由发挥空间过大; 3. 参考图未复用:每个镜头重新上传不同的图,或干脆不上传参考。 字段化模板的作用就是把这三个变量全部锁死:固定种子(或固定参考图)、固定人设描述、固定风格关键词,只让「动作与景别」字段随分镜变化。 提示词模板应该包含哪 8 个字段? 一个能保证前后统一的模板,

作者:Ghost