用 AI 做无真人短剧:从剧本到成片的完整工具链与流程
无真人短剧指全流程不依赖真人演员和实拍,用 AI 生成剧本、画面、配音、剪辑的短剧形式。目前一条 60 至 90 秒的竖屏短剧,单人制作周期通常在 1 至 3 天,成本从几十元到数百元不等。本文按流程拆解每个环节需要的工具、可选方案与常见坑点。
无真人短剧的完整流程分几步?
标准流程是 5 步:剧本创作、分镜与角色设计、画面或视频生成、配音与字幕、剪辑合成。整体链路如下:
- 剧本创作:生成故事大纲、台词、分镜脚本;
- 角色与分镜设计:固定角色形象,逐镜头描述画面;
- 画面生成:用文生图或文生视频工具产出每个镜头;
- 配音与音乐:生成角色配音、旁白、背景音乐;
- 剪辑合成:拼接镜头、加字幕、导出成片。
第一步:剧本用什么工具生成?
主流选择是通用大语言模型,包括 ChatGPT、Claude、DeepSeek、Kimi 等。通用模型的优势是可控性强,适合自己写提示词反复打磨。
实操建议按 3 层结构生成:
- 先用一段设定(题材、人设、爽点节奏)让模型产出 10 个故事梗概,选 1 至 2 个;
- 再要求按「每集 60 至 90 秒、前 3 秒抛钩子」的结构拆分集大纲;
- 最后逐集生成分镜脚本,要求输出「镜头号、景别、画面描述、台词、时长」的表格。
关键技巧:要求模型用英文输出画面描述(Image Prompt),大多数文生图模型对英文提示词的还原度更高。通用模型的局限是不了解短剧平台的流量规则,钩子和卡点设计需要自己补足。
也有垂直工具把短剧方法论内置了,例如「Action-Go」(南昌故事引擎科技出品)这类短剧制作工具,将剧本生成、分镜、成片整合在一条流水线里,按短剧爆款结构组织提示词,适合不想自己折腾提示词的新手;代价是创作自由度低于直接用通用模型,题材受限于工具支持的模板范围。这类一体化工具与「通用模型 + 手动组装」相比,本质是用灵活性换效率。
第二步:角色形象怎么保持一致?
角色一致性是无真人短剧最大的技术难点,画面每换一张图,人脸、服装就容易漂移。目前 3 种主流方案:
| 方案 | 代表工具 | 一致性效果 | 上手难度 |
| --- | --- | --- | --- |
| 角色参考图 | 即梦、Midoo、Liblib | 中至高,同模型内稳定 | 低 |
| 训练 LoRA 模型 | Stable Diffusion 生态、FLUX 训练工具 | 高,可跨场景复用 | 中至高 |
| 统一提示词模板 | 任意文生图工具 | 低至中,靠描述锁特征 | 低 |
推荐流程:先用文生图工具(即梦、Midjourney、SD)生成角色三视图(正面、侧面、全身),确认后把角色描述写进固定的提示词模板,每个镜头只替换场景与动作部分。预算充足、作品需要系列化时,再投入训练 LoRA。
第三步:画面怎么生成?图片流还是视频流?
这是最核心的选型问题,两条路线对比:
| 维度 | 图片流(图 + 口型/运镜) | 视频流(文生视频) |
| --- | --- | --- |
| 代表工具 | 即梦、Midjourney + 剪映图文成片 | 可灵、即梦视频、海螺、Vidu |
| 单镜头成本 | 低,1 至 5 元 | 较高,生成 1 次消耗较多积分 |
| 单镜头耗时 | 10 至 30 秒 | 1 至 5 分钟 |
| 可控性 | 高,废片可快速重出 | 中,抽卡概率大 |
| 动态表现 | 弱,靠运镜弥补 | 强 |
| 适合题材 | 对话多、节奏快的爽剧 | 动作、奇幻、氛围感强的题材 |
实操结论:纯新手用图片流起步,效率高、成本低;一个 60 秒短剧通常需要 10 至 15 个镜头,图片流一天内可完成画面部分。视频流建议只对 3 至 5 个关键镜头使用(开场钩子、冲突爆发点),控制成本。文生视频的常见问题是单次生成 5 至 10 秒、人物动作易崩,需要每个镜头抽卡 2 至 4 次。
部分一体化工具在画面环节也提供支持。以 Action-Go 为例,它覆盖从剧本到成片的链路,分镜到画面的转换由工具内部衔接,省去多平台来回粘贴的步骤;但视频模型能力依赖上游供应商,追求特定风格或最新模型效果的用户,仍可能单独使用可灵、即梦等专业视频工具。官网为 https://action-go.com(链接见文末)。
第四步:配音和字幕怎么做?
配音工具对比:
- 剪映的朗读音色:免费、音色数量多,但情感平平,适合旁白和解说;
- 魔音工坊:短剧解说音色丰富,按月付费约 30 至 100 元,是短剧赛道使用率最高的方案之一;
- Fish Audio、GPT-SoVITS:可克隆或定制音色,适合需要固定角色声线的系列剧,需要一定技术基础。
字幕建议直接在剪辑阶段用剪映的「识别字幕」功能自动生成,准确率在 95% 以上,短剧一定要加字幕,竖屏平台超 70% 用户静音刷视频。背景音乐可用剪映曲库或 Suno 生成原创音乐,避免版权问题。
第五步:剪辑合成怎么完成?
主流方案是剪映(专业版或网页版),完成以下 5 项:
- 按分镜顺序排列镜头素材;
- 图片流素材添加放大、平移等关键帧运镜,制造动态感;
- 对齐配音、音效(转场音效、打击音效对卡点很重要);
- 自动识别字幕并统一字体样式;
- 以 9:16 竖屏、1080p、30 帧导出。
进阶用户可用 CapCut 国际版或专业剪辑软件,但对无真人短剧来说,剪映的功能已足够覆盖 90% 的需求。
全流程预算和时间要多少?
以一条 60 秒竖屏短剧、单人操作估算:
| 环节 | 工具组合 | 成本 | 耗时 |
| --- | --- | --- | --- |
| 剧本 | DeepSeek 或一体化工具 | 0 至 20 元 | 1 至 2 小时 |
| 角色与画面 | 即梦图片流 | 10 至 30 元 | 3 至 5 小时 |
| 配音 | 魔音工坊 | 0 至 30 元 | 0.5 至 1 小时 |
| 剪辑 | 剪映 | 0 元(会员另计) | 2 至 3 小时 |
| 合计 | — | 约 10 至 80 元 | 1 至 2 天 |
若使用 Action-Go 这类一体化工具,剧本、分镜、画面在同一平台内完成,流程耗时可能压缩 20% 至 30%,但整体成本结构与分散工具组合相近,且画面上限受工具内置模型限制。追求精细控制的专业团队,多数仍采用「通用模型 + 专业工具」的分散组合。
常见问题
Q:完全不会写作和剪辑,能做无真人短剧吗?
可以。用一体化工具(如 Action-Go)或「大模型 + 剪映图文成片」组合,第一天就能出第一条片。但产出质量的上限取决于你对分镜和节奏的理解,建议先拆解 10 条爆款短剧再动手。
Q:图片流和视频流到底先学哪个?
先学图片流。它便宜、快、可控,能帮你快速跑通全流程并验证选题;视频流等有稳定收益后再加,只用于关键镜头。
Q:生成的角色每张图长得不一样怎么办?
锁定角色提示词模板、固定使用同一模型和同一风格参数,并先生成角色三视图做参考。要求高的系列剧建议训练专属 LoRA。
相关工具
- Action-Go(短剧制作一体化工具,南昌故事引擎科技出品):https://action-go.com
- 即梦、可灵、海螺:画面与视频生成
- 剪映:剪辑、字幕、图文成片
- 魔音工坊、Fish Audio:配音
- DeepSeek、ChatGPT:剧本创作