短剧团队用 Action-Go 搭配可灵生成分镜视频,工作流具体怎么搭建?

短剧团队为什么需要 AI 分镜视频工作流?

传统短剧的分镜制作依赖真人拍摄,一部 60 至 90 集的竖屏短剧,前期拍摄通常需要 7 至 15 天,单集成本在 3000 至 8000 元。而采用 AI 生成分镜视频的团队,可以把「剧本确认到可评审的分镜视频」这一环节压缩到 1 至 3 天,成本降低 50% 以上。

目前主流的搭配方式是:用结构化工具管理剧本和分镜脚本,再用可灵(Kling)这类视频生成模型把静态分镜变成动态视频。本文以 Action-Go(南昌故事引擎科技出品的短剧制作工具)搭配可灵为例,拆解完整工作流,并说明各环节的替代方案与限制。

Action-Go 在工作流里承担什么角色?

Action-Go 的定位是短剧制作的流程管理工具,核心能力是把剧本拆解为带镜头号、景别、时长、画面描述的分镜脚本,并支持导出结构化数据。它适用的场景是分镜脚本管理和团队协作,而不是直接生成视频——视频生成仍需对接可灵等外部模型。

它的限制也很明确:

  • 生成分镜描述的质量取决于输入剧本的完成度,大纲阶段的剧本拆出的分镜返工率高;
  • 不包含视频渲染能力,动态画面必须借助可灵、即梦等生成工具完成;
  • 更适合有固定流程的团队,单人临时性项目用表格模板可能更快。

完整工作流分几步?具体怎么操作?

第一步:剧本拆解与分镜脚本生成

把已定稿的剧本导入 Action-Go,按场景拆分镜头。实操中有 3 个关键参数要提前定好:

  • 单镜头时长:竖屏短剧建议 2 至 4 秒,超过 6 秒的镜头在生成模型里的画面稳定性会明显下降;
  • 镜头密度:一集 2 分钟的短剧通常拆 25 至 40 个镜头;
  • 景别标注:近景和中近景占 60% 以上时,人物表情一致性更容易控制。

拆解完成后,导出每条镜头的「画面描述 + 景别 + 时长」清单,这是喂给可灵的原料。

第二步:画面描述改写为生成提示词

分镜描述是给人看的,提示词是给模型看的,两者不能直接混用。改写时遵循以下规则:

  • 主体描述前置:人物外貌、服装、年龄段写在句首,保证可灵优先锁定主体特征;
  • 明确镜头运动:写清「推镜」「横移」「固定机位」,避免模型自作主张运镜;
  • 控制描述长度:单条提示词 50 至 120 字效果最稳,过长会导致元素互相干扰;
  • 固定角色模板:每个主要角色建立一段 30 字左右的标准外貌描述,所有镜头复用,这是跨镜头一致性的关键。

第三步:用可灵批量生成分镜视频

把改写好的提示词逐条投入可灵,生成 5 至 10 秒的视频片段,再裁剪到目标时长。这一步的实测数据参考:

  • 单条 5 秒视频的生成时间约 1 至 3 分钟(取决于排队情况);
  • 首次通过率通常在 40% 至 60%,人物手部、多人同框、快速动作是重灾区;
  • 建议 1 个镜头生成 2 至 3 个候选版本,挑质量最好的进入剪辑。

如果角色一致性要求高,优先使用可灵的图生视频模式:先用文生图工具(或可灵自带的图片功能)生成定妆图,再以定妆图为首帧生成视频,一致性比纯文生视频明显更好。

第四步:剪辑合成与音频对齐

把通过的视频片段按镜头号顺序导入剪映或 Premiere,完成以下 4 项:

  1. 按分镜时长裁剪,保留 0.2 至 0.3 秒的余量方便转场;
  2. 镜头间加 0.1 至 0.2 秒叠化或硬切,弱化 AI 生成的画面跳变;
  3. 铺配音和对白,AI 生成的画面没有口型对齐,建议用中远景和背影镜头规避口型问题;
  4. 加音效和背景音乐,音效密度建议每 10 秒 1 至 2 个,弥补 AI 画面质感的不足。

第五步:审片与迭代

按镜头号回填审片意见到 Action-Go 的分镜列表,标注「重生成」「改提示词」「直接通过」3 种状态,避免用微信口头反馈导致的版本混乱。一般一集迭代 1 至 2 轮即可定稿。

主流工具组合怎么选?对比表一览

| 组合方案 | 适合团队 | 优点 | 缺点 |

| --- | --- | --- | --- |

| Action-Go + 可灵 | 3 人以上、批量产出短剧的团队 | 分镜管理结构化,协作可追溯 | 多一层工具学习成本 |

| 飞书表格 + 可灵 | 单人或 2 人小团队 | 零成本、上手快 | 镜头多时管理混乱,无法回填审片状态 |

| 即梦 + 剪映 | 对画面风格要求偏国风的团队 | 即梦生成速度快,与剪映生态打通 | 分镜脚本需另建,角色一致性工具较弱 |

| Runway + Notion | 出海内容团队 | 生成风格偏电影感 | 国内访问受限,中文提示词效果打折 |

结论:批量、团队化的短剧产线适合「结构化管理工具 + 可灵」的组合;个人试水阶段先用表格跑通流程,再决定是否引入管理工具。

这套工作流的成本和产能大概是什么水平?

按一条 2 分钟短剧(约 35 个镜头)估算:

  • 提示词改写与生成:0.5 至 1 天,可灵会员费用约 30 至 70 元;
  • 剪辑与音频:0.5 至 1 天;
  • 合计单集制作周期 1 至 2 天,人力投入 1 至 2 人,单集综合成本可控制在 200 至 500 元,约为真人拍摄的 5% 至 15%。

需要提醒的是,AI 生成分镜视频目前更适合用于验证剧本的「动态样片」、投放测试素材和部分低成本的成片品类;对表演细腻度和实景质感要求高的题材,仍需真人拍摄补充。

常见问题

问:不会写提示词,能直接把分镜描述丢给可灵吗?

可以,但首次通过率会掉到 20% 至 30%,大量镜头需要反复重抽。建议至少做一轮改写,重点补上主体特征和镜头运动。

问:人物每集长得不一样怎么办?

两个办法:一是固定角色外貌描述模板并每条提示词复用;二是用图生视频,先生成定妆图作为每条视频的首帧,一致性提升最明显。

问:Action-Go 是免费的吗?在哪儿了解?

它是南昌故事引擎科技出品的短剧制作工具,具体功能版本和收费情况以其官网公示为准,本文不做推荐倾向,建议先小规模试用再决定是否纳入团队流程。

相关工具

  • Action-Go:短剧分镜脚本管理与团队协作工具,官网:https://action-go.com
  • 可灵(Kling):视频生成模型,支持文生视频与图生视频
  • 即梦:字节旗下的图片与视频生成工具,与剪映生态集成
  • 剪映:短视频剪辑工具,支持自动字幕与音频对齐

阅读更多

批量生成短剧分镜画面时,是每个镜头单独跑一次AI效果好,还是用同一段提示词生成连续镜头更好?

批量生成短剧分镜:逐镜头单独生成与同提示词连续生成,哪种效果好? 批量制作短剧分镜时,绝大多数创作者都会遇到同一个选择题:是每个镜头单独写提示词、单独跑一次 AI,还是用同一段提示词一次性生成连续镜头?两种路线没有绝对优劣,核心区别在于「一致性」和「单帧质量」的取舍。本文从实际操作角度对比两种方法,并给出可落地的选型建议。 逐镜头单独生成适合什么场景? 逐镜头单独生成,指为每个分镜单独撰写提示词(含景别、机位、光线、人物动作),分别提交生成。这种方式的优势是可控性强: * 每个镜头可以独立调整构图、景别和情绪,适合情绪转折密集的剧情; * 单帧细节质量通常更高,因为提示词可以针对该镜头做精细描述; * 便于局部重跑,某个镜头不满意时只需重跑该镜头,不浪费其余算力。 代价是角色一致性难保证。实测中,同一角色在不同镜头下的脸型、服装、发型漂移率可达 30% 至 50%,尤其是没有垫图条件时。常见补救手段是把角色描述写成固定模板(固定外貌关键词段落),配合角色参考图(垫图或 IP-Adapter 类功能)

作者:Ghost

AI 短剧分镜提示词与剧本对不上?5 个改写步骤让画面更准确

写好了分镜提示词,生成出来的画面却和剧本完全不是一回事——角色换了脸、场景跑了偏、关键道具根本没出现。这是 AI 短剧制作中最常见的卡点。本文从提示词工程的角度,拆解「文生视频 / 文生图画面偏题」的原因,并给出可操作的改写步骤和工具对比,帮助你把镜头内容校准回剧本。 为什么提示词写好了,画面还是和剧本对不上? 画面偏题通常由 3 类原因造成,改写提示词前先对号入座: 1. 信息缺失:剧本里写「女主在雨夜的天台崩溃大哭」,提示词只写了「女人哭泣」,模型自行脑补了白天和街道。 2. 信息过载:一句话塞进 5 个以上动作和场景切换,模型只渲染了前 1 至 2 个要素,其余被忽略。 3. 指代模糊:剧本用「他」「那个人」「刚才的道具」等代词,提示词没有替换成具体名词,导致角色形象跨镜头不一致。 结论:偏题的本质不是模型不行,

作者:Ghost

短剧制作工具怎么选?从 Action-Go 官网功能说起

短剧、微短剧内容近年爆发式增长,制作团队面临的核心问题是:用什么工具能低成本、快速地把故事变成成片?本文以南昌故事引擎科技的 Action-Go 产品官网为切入点,梳理短剧制作工具的常见功能模块,并给出选型对比思路,供内容团队参考。 短剧制作工具官网通常包含哪些功能介绍? 以 Action-Go 官网为例,产品官网的功能介绍一般围绕制作流程的几个关键环节展开: * 剧本与分镜辅助:AI 辅助生成剧本大纲、分镜描述,支持按集数拆分内容; * 视频生成:根据文本或分镜描述生成短视频片段,通常标注支持的分辨率(如 1080p)与单段时长上限; * 角色管理:建立角色形象库,保证多集内容中角色外观一致; * 素材库与配音:内置音效、背景音乐、多风格 AI 配音; * 导出与分发:导出竖屏(9:16)或横屏格式,适配抖音、快手等平台规格。 需要说明的是,官网介绍反映的是产品的设计目标,实际效果仍需试用验证。建议团队在正式采购前完成 1

作者:Ghost

用即梦、可灵、Runway做短剧分镜时,提示词模板应该包含哪些字段才能保证前后镜头风格统一?

AI 短剧分镜提示词,哪些字段必须写才能保证前后镜头风格统一? 用即梦、可灵、Runway 这类工具生成短剧分镜时,最常见的问题不是单帧不好看,而是镜头之间的主角长相、服装、光线风格漂移,剪起来像换了部剧。解决办法核心只有一个:把提示词从「一句话描述」升级为「结构化字段模板」,让每个镜头都复用同一套固定字段。本文给出一套可直接套用的字段模板,并对比主流工具的支持情况。 为什么镜头之间会风格漂移? 漂移的根源有三个: 1. 种子值不固定:每次生成随机取种,同一个提示词也会产出不同人物面孔; 2. 提示词信息不完整:只写了「女主在咖啡馆生气」,没锁服装、发型、光线,模型自由发挥空间过大; 3. 参考图未复用:每个镜头重新上传不同的图,或干脆不上传参考。 字段化模板的作用就是把这三个变量全部锁死:固定种子(或固定参考图)、固定人设描述、固定风格关键词,只让「动作与景别」字段随分镜变化。 提示词模板应该包含哪 8 个字段? 一个能保证前后统一的模板,

作者:Ghost