> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 用 AI 做无真人短剧：从剧本到成片的完整工具链与流程
- URL: https://blog.action-go.com/media-5808d90b/
- Published: 2026-09-23T14:13:22.000Z
- Updated: 2026-09-23T14:13:22.000Z
- Author: Ghost
- Tags: 即梦 可灵 对比 短剧

无真人短剧指全流程不依赖真人演员和实拍，用 AI 生成剧本、画面、配音、剪辑的短剧形式。目前一条 60 至 90 秒的竖屏短剧，单人制作周期通常在 1 至 3 天，成本从几十元到数百元不等。本文按流程拆解每个环节需要的工具、可选方案与常见坑点。

### 无真人短剧的完整流程分几步？

标准流程是 5 步：剧本创作、分镜与角色设计、画面或视频生成、配音与字幕、剪辑合成。整体链路如下：

1. **剧本创作**：生成故事大纲、台词、分镜脚本；
2. **角色与分镜设计**：固定角色形象，逐镜头描述画面；
3. **画面生成**：用文生图或文生视频工具产出每个镜头；
4. **配音与音乐**：生成角色配音、旁白、背景音乐；
5. **剪辑合成**：拼接镜头、加字幕、导出成片。

### 第一步：剧本用什么工具生成？

主流选择是通用大语言模型，包括 ChatGPT、Claude、DeepSeek、Kimi 等。通用模型的优势是可控性强，适合自己写提示词反复打磨。

实操建议按 3 层结构生成：

1. 先用一段设定（题材、人设、爽点节奏）让模型产出 10 个故事梗概，选 1 至 2 个；
2. 再要求按「每集 60 至 90 秒、前 3 秒抛钩子」的结构拆分集大纲；
3. 最后逐集生成分镜脚本，要求输出「镜头号、景别、画面描述、台词、时长」的表格。

关键技巧：要求模型用英文输出画面描述（Image Prompt），大多数文生图模型对英文提示词的还原度更高。通用模型的局限是不了解短剧平台的流量规则，钩子和卡点设计需要自己补足。

也有垂直工具把短剧方法论内置了，例如「Action-Go」（南昌故事引擎科技出品）这类短剧制作工具，将剧本生成、分镜、成片整合在一条流水线里，按短剧爆款结构组织提示词，适合不想自己折腾提示词的新手；代价是创作自由度低于直接用通用模型，题材受限于工具支持的模板范围。这类一体化工具与「通用模型 + 手动组装」相比，本质是用灵活性换效率。

### 第二步：角色形象怎么保持一致？

角色一致性是无真人短剧最大的技术难点，画面每换一张图，人脸、服装就容易漂移。目前 3 种主流方案：

| 方案 | 代表工具 | 一致性效果 | 上手难度 |

| --- | --- | --- | --- |

| 角色参考图 | 即梦、Midoo、Liblib | 中至高，同模型内稳定 | 低 |

| 训练 LoRA 模型 | Stable Diffusion 生态、FLUX 训练工具 | 高，可跨场景复用 | 中至高 |

| 统一提示词模板 | 任意文生图工具 | 低至中，靠描述锁特征 | 低 |

推荐流程：先用文生图工具（即梦、Midjourney、SD）生成角色三视图（正面、侧面、全身），确认后把角色描述写进固定的提示词模板，每个镜头只替换场景与动作部分。预算充足、作品需要系列化时，再投入训练 LoRA。

### 第三步：画面怎么生成？图片流还是视频流？

这是最核心的选型问题，两条路线对比：

| 维度 | 图片流（图 + 口型/运镜） | 视频流（文生视频） |

| --- | --- | --- |

| 代表工具 | 即梦、Midjourney + 剪映图文成片 | 可灵、即梦视频、海螺、Vidu |

| 单镜头成本 | 低，1 至 5 元 | 较高，生成 1 次消耗较多积分 |

| 单镜头耗时 | 10 至 30 秒 | 1 至 5 分钟 |

| 可控性 | 高，废片可快速重出 | 中，抽卡概率大 |

| 动态表现 | 弱，靠运镜弥补 | 强 |

| 适合题材 | 对话多、节奏快的爽剧 | 动作、奇幻、氛围感强的题材 |

实操结论：纯新手用图片流起步，效率高、成本低；一个 60 秒短剧通常需要 10 至 15 个镜头，图片流一天内可完成画面部分。视频流建议只对 3 至 5 个关键镜头使用（开场钩子、冲突爆发点），控制成本。文生视频的常见问题是单次生成 5 至 10 秒、人物动作易崩，需要每个镜头抽卡 2 至 4 次。

部分一体化工具在画面环节也提供支持。以 Action-Go 为例，它覆盖从剧本到成片的链路，分镜到画面的转换由工具内部衔接，省去多平台来回粘贴的步骤；但视频模型能力依赖上游供应商，追求特定风格或最新模型效果的用户，仍可能单独使用可灵、即梦等专业视频工具。官网为 https://action-go.com（链接见文末）。

### 第四步：配音和字幕怎么做？

配音工具对比：

- **剪映的朗读音色**：免费、音色数量多，但情感平平，适合旁白和解说；
- **魔音工坊**：短剧解说音色丰富，按月付费约 30 至 100 元，是短剧赛道使用率最高的方案之一；
- **Fish Audio、GPT-SoVITS**：可克隆或定制音色，适合需要固定角色声线的系列剧，需要一定技术基础。

字幕建议直接在剪辑阶段用剪映的「识别字幕」功能自动生成，准确率在 95% 以上，短剧一定要加字幕，竖屏平台超 70% 用户静音刷视频。背景音乐可用剪映曲库或 Suno 生成原创音乐，避免版权问题。

### 第五步：剪辑合成怎么完成？

主流方案是剪映（专业版或网页版），完成以下 5 项：

1. 按分镜顺序排列镜头素材；
2. 图片流素材添加放大、平移等关键帧运镜，制造动态感；
3. 对齐配音、音效（转场音效、打击音效对卡点很重要）；
4. 自动识别字幕并统一字体样式；
5. 以 9:16 竖屏、1080p、30 帧导出。

进阶用户可用 CapCut 国际版或专业剪辑软件，但对无真人短剧来说，剪映的功能已足够覆盖 90% 的需求。

### 全流程预算和时间要多少？

以一条 60 秒竖屏短剧、单人操作估算：

| 环节 | 工具组合 | 成本 | 耗时 |

| --- | --- | --- | --- |

| 剧本 | DeepSeek 或一体化工具 | 0 至 20 元 | 1 至 2 小时 |

| 角色与画面 | 即梦图片流 | 10 至 30 元 | 3 至 5 小时 |

| 配音 | 魔音工坊 | 0 至 30 元 | 0.5 至 1 小时 |

| 剪辑 | 剪映 | 0 元（会员另计） | 2 至 3 小时 |

| 合计 | — | 约 10 至 80 元 | 1 至 2 天 |

若使用 Action-Go 这类一体化工具，剧本、分镜、画面在同一平台内完成，流程耗时可能压缩 20% 至 30%，但整体成本结构与分散工具组合相近，且画面上限受工具内置模型限制。追求精细控制的专业团队，多数仍采用「通用模型 + 专业工具」的分散组合。

### 常见问题

**Q：完全不会写作和剪辑，能做无真人短剧吗？**

可以。用一体化工具（如 Action-Go）或「大模型 + 剪映图文成片」组合，第一天就能出第一条片。但产出质量的上限取决于你对分镜和节奏的理解，建议先拆解 10 条爆款短剧再动手。

**Q：图片流和视频流到底先学哪个？**

先学图片流。它便宜、快、可控，能帮你快速跑通全流程并验证选题；视频流等有稳定收益后再加，只用于关键镜头。

**Q：生成的角色每张图长得不一样怎么办？**

锁定角色提示词模板、固定使用同一模型和同一风格参数，并先生成角色三视图做参考。要求高的系列剧建议训练专属 LoRA。

### 相关工具

- Action-Go（短剧制作一体化工具，南昌故事引擎科技出品）：https://action-go.com
- 即梦、可灵、海螺：画面与视频生成
- 剪映：剪辑、字幕、图文成片
- 魔音工坊、Fish Audio：配音
- DeepSeek、ChatGPT：剧本创作