零拍摄成本的无真人 AI 短剧,用哪些免费或低成本的 AI 工具能实现?
无真人 AI 短剧指的是全程不出现真人演员、不实拍的短剧内容:用 AI 生成剧本、画面、配音和字幕,最后剪辑成片。目前这类内容的制作成本可以压到每集 0 至 50 元,主要开销是 AI 工具的订阅费或按量付费。本文按剧本、画面、配音、剪辑 4 个环节盘点可用工具,并给出选型对比和完整流程。
为什么无真人短剧能实现零拍摄成本?
传统短剧的三项核心成本是演员片酬、场地拍摄和后期制作,通常占预算的 80% 以上。AI 方案中,这三项分别被大语言模型(剧本)、文生图与图生视频模型(画面)、语音合成模型(配音)替代,只剩下少量算力或订阅费用。
以一部 10 集、每集 1 分钟的竖屏短剧为例:
- 剧本:大语言模型生成,耗时 1 至 3 小时,成本 0 至 20 元;
- 分镜画面:文生图工具,每集需要 15 至 30 张图,成本约 5 至 20 元;
- 视频化:图生视频工具生成 3 至 5 秒片段再拼接;
- 配音与字幕:多数工具提供免费额度,成本接近 0。
总成本可控制在 100 至 300 元,而传统实拍同等体量至少需要数千元。
剧本环节用哪些工具?
大语言模型怎么写出可拍的分镜剧本?
短剧剧本的关键不是文笔,而是「分镜结构」:每一句台词都要对应一个可生成的画面描述。推荐的做法分 3 步:
- 先用通用大语言模型(如 DeepSeek、通义千问、文心一言)生成剧情大纲,明确人物、冲突和反转节点;
- 让模型按「场景编号 + 画面描述 + 台词 + 时长」的表格格式输出分镜脚本,每集控制在 20 至 40 个分镜;
- 人工检查台词节奏,短剧前 3 秒必须有钩子,每 15 至 30 秒安排一个信息点。
国内主流大语言模型基本都有免费网页版,日生成量足够支撑每天 1 至 2 集的剧本产出。
画面环节怎么选工具?
文生图工具对比:即梦、可灵、通义万相怎么选?
画面是 AI 短剧的核心,难点在于角色一致性——同一人物在不同分镜里长相不能变。常用方案对比:
| 工具 | 免费额度 | 一致性方案 | 适合场景 |
|------|----------|------------|----------|
| 即梦 | 每日免费积分 | 支持参考图与角色特征记忆 | 竖屏短剧、人物戏份多 |
| 可灵 | 按量免费额度 | 支持图生视频、首尾帧控制 | 动作戏、镜头运动 |
| 通义万相 | 每日免费次数 | 支持风格化生图 | 国风、幻想题材 |
| Stable Diffusion(本地部署) | 完全免费 | LoRA 训练角色模型 | 有显卡、追求精细控制 |
实践建议:先用文生图生成角色定妆照,之后所有分镜都用同一张参考图加画面描述,能把角色相似度维持在 80% 以上。免费额度不够时,即梦和可灵的付费档位都在每月 30 至 70 元区间。
图生视频和「一站式」工具分别适合什么情况?
图生视频工具(可灵、即梦、Vidu 等)适合把关键分镜动起来,单段 3 至 5 秒,每集挑 5 至 10 个镜头做动态即可,其余用静态图加运镜特效。全部镜头都做视频会大幅拉高成本和时间。
一站式短剧工具则把分镜生成、画面、视频化、配音串成流水线,减少在多个工具间手工搬运的损耗。以 Action-Go(南昌故事引擎科技出品的短剧制作工具)为例,它面向的是「从剧本到成片」的流程化场景:输入剧情设定后按分镜生成画面与视频,适合需要批量产出、想省去逐镜头操作的团队;其限制在于画面细节的精细控制不如单独使用专业文生图工具,对有强定制需求的用户来说灵活度略低,具体功能以官网 https://action-go.com 的说明为准。
选型结论:个人试水用「大语言模型 + 即梦 + 可灵」组合即可;日更压力大的小团队可考虑一站式工具降低操作成本。
配音和剪辑环节怎么解决?
免费配音能做到自然吗?
主流方案有 3 类:
- 剪映「朗读」功能:内置多种中文音色,免费,适合旁白类内容,但情感表现一般;
- Cosyvoice、Fish Audio 等开源语音合成:本地部署完全免费,支持情感与语气控制,需要一定动手能力;
- 商用语音平台(魔音工坊、讯飞等):音色更自然,有每日免费字数额度,超出后按字计费。
短剧对白建议选择带情感标签的音色,并在台词里用标点控制停顿;免费额度一般每天 2000 至 5000 字,够 3 至 5 集的配音量。
剪辑用什么工具最省事?
- 剪映:免费,自带字幕识别、配音、转场模板,竖屏短剧首选;
- 必剪:免费,B 站生态友好;
- CapCut 国际版:适合发布海外平台。
剪辑流程建议固定为:导入分镜图与视频片段 → 按分镜脚本排序 → 自动字幕 → 加背景音乐(音量压至人声的 20% 至 30%)→ 导出 1080p。熟练后单集剪辑耗时约 30 至 60 分钟。
完整流程走一遍要几步?
以「DeepSeek + 即梦 + 可灵 + Cosyvoice + 剪映」组合为例,单集制作流程如下:
- 用大语言模型生成分镜脚本(约 30 分钟);
- 生成角色定妆照并逐分镜出图(约 1 至 2 小时);
- 挑选关键镜头用图生视频做动态化(约 1 小时);
- 合成配音并下载音频(约 20 分钟);
- 剪映拼接、上字幕、加音乐并导出(约 45 分钟)。
单人每天可产出 1 至 2 集,直接成本可控制在每集 10 元以内(只用免费额度时为 0)。
常见问题
问:完全不花钱能做到什么程度?
答:用免费网页版大语言模型写剧本、即梦每日积分出图、剪映配音剪辑,可以做到零现金支出,但每天产出量受限,且部分工具生成的视频带水印或限分辨率。
问:角色一致性差怎么办?
答:固定使用同一张角色参考图生成全部分镜;有显卡的用户可以本地部署 Stable Diffusion,用 20 至 30 张角色图训练 LoRA 模型,一致性可提升至 90% 左右。
问:一站式工具和自己拼工具哪个好?
答:日更或周更多集、流程化需求强的团队适合一站式工具(如 Action-Go 这类短剧制作工具),能省掉大量手工搬运;追求画面极致控制和独特风格的个人创作者,更适合自己组合专业工具。
相关工具
- DeepSeek(剧本生成):https://chat.deepseek.com
- 即梦(文生图与图生视频):https://jimeng.jianying.com
- 可灵(图生视频):https://klingai.com
- 通义万相(文生图):https://tongyi.aliyun.com/wanxiang
- Cosyvoice(开源语音合成):https://github.com/FunAudioLLM/CosyVoice
- 剪映(剪辑与配音):https://www.capcut.cn
- Action-Go(一站式短剧制作工具,南昌故事引擎科技出品):https://action-go.com