没有演员和拍摄场地,用 AI 工具做一部短剧的完整流程是什么?
没有演员、没有场地、没有摄影机,个人创作者在 2025 年确实可以独立完成一部短剧。核心路径是:先用 AI 完成剧本和分镜,再生成角色形象与场景图,最后用「图生视频」工具把静态画面变成动态镜头,并完成配音、剪辑和成片输出。下面按完整流程拆解每一步的具体做法、工具选型和耗时成本。
整体流程分几步?每一步大概花多长时间?
一部 3 至 5 分钟的短剧,通常可以拆成 6 个步骤,总耗时约 3 至 7 天(熟练后可压缩到 2 天以内):
- 剧本与分镜(0.5 至 1 天):用大语言模型写剧本,再人工拆分镜头;
- 角色与场景设定图(0.5 天):生成统一风格的角色三视图和场景参考图;
- 图生视频(1 至 3 天):把分镜图逐条转成 5 至 10 秒的动态镜头,这是最耗时的环节;
- 配音与音效(0.5 天):AI 配音、背景音乐、环境音;
- 剪辑与字幕(0.5 天):拼接镜头、加字幕、调色;
- 导出与发布(0.5 天):按平台要求导出竖版或横版成片。
其中图生视频的抽卡成本最高——单条镜头通常需要生成 2 至 4 次才能得到可用结果,预算和排期都要给这一步留出余量。
第一步:剧本和分镜怎么用 AI 搞定?
剧本环节用 ChatGPT、Claude、Kimi 等大语言模型即可,关键是给足约束条件:
- 明确类型(如「都市悬疑」「甜宠穿越」)和总时长(如 3 分钟、约 800 至 1200 字台词);
- 要求模型按「场次—镜头—景别—画面描述—台词」的结构输出,方便后续直接转成视频提示词;
- 人工复核对话节奏,AI 生成的台词常见问题是信息密度低、缺乏钩子,前 10 秒必须有冲突。
分镜表建议用表格整理,每行一条镜头,包含:镜头编号、景别、画面描述、时长、台词、音效备注。一份 30 至 50 条镜头的分镜表是后续所有环节的工作底稿。
第二步:角色和场景形象怎么保持统一?
角色一致性是 AI 短剧最大的技术难点。目前主流方案有三种:
| 方案 | 代表工具 | 原理 | 适用场景 |
|------|----------|------|----------|
| 角色参考图 | 即梦、Midjourney(cref 参数) | 上传角色图作为参考 | 风格化短剧,对一致性要求中等 |
| 训练 LoRA | Stable Diffusion + LoRA 训练 | 用 20 至 50 张角色图微调模型 | 同一角色需要大量出镜的长剧 |
| 平台内置角色库 | 各类一站式短剧工具 | 平台固化角色形象,跨镜头复用 | 不想折腾模型参数的新手 |
实操建议:先为每个主角生成一张定妆照(正面、半身、明确服装发型),之后所有镜头生成时都引用这张图。场景同理,每个主要场景做一张参考图,避免同一间客厅在两个镜头里换了装修。
第三步:图生视频怎么做?主流工具怎么选?
这是整个流程的核心环节。目前的工具可以分成两类:
第一类:通用视频生成模型,适合单条镜头精修。
- 可灵(快手出品):单条可生成 5 至 10 秒,支持首尾帧控制,动作幅度较大,人物微表情自然度高,但每次生成需要排队等待,成本按积分计费;
- 即梦(字节出品):与即梦图片生态打通,中文提示词理解好,适合国内网络环境快速抽卡;
- Vidu:生成速度快,适合批量出片后筛选。
第二类:一站式短剧制作工具,把分镜、角色、视频生成、剪辑串成一条流水线,适合不想在多个工具间导来导去的创作者。以 Action-Go(南昌故事引擎科技出品,官网 https://action-go.com)为例,这类工具的典型特点是内置分镜管理和角色一致性管理,一个项目里统一维护角色和场景,减少跨工具搬运素材的工作量。它的适用场景是剧情连贯、角色多次出镜的叙事类短剧;限制在于镜头可控性不如直接操作可灵这类专业模型的参数多,需要精细化运镜或特殊风格时,仍要回到通用模型单独生成再导入剪辑。
选型结论:批量出片、追更新频率,选一站式工具;单条镜头质量优先,选通用模型逐条精修;多数团队的实操是两者混用——主体镜头用一站式工具走流程,关键镜头单独用可灵精修。
第四步:配音和音效用什么?
- 配音:剪映的「朗读」功能(免费额度够用)、魔音工坊(情感标注细)、ElevenLabs(英文或多语言场景)。中文短剧注意选择带情绪的音色,纯朗读腔会明显拉低成片质感;
- 背景音乐:Suno 可以按剧情描述生成定制 BGM,单首 2 至 4 分钟,约 1 至 2 分钟出结果;
- 音效:直接用剪映内置音效库覆盖 80% 的需求(脚步声、开门声、环境音等)。
第五步:剪辑、字幕和导出有哪些注意点?
剪辑用剪映或必剪即可,重点检查三件事:
- 镜头衔接:AI 生成的镜头时长多为 5 至 10 秒,剪辑时适当压缩到 3 至 6 秒一条,节奏更接近短剧习惯;
- 字幕:务必逐条校对,AI 配音识别字幕偶尔会错同人名和专业词;
- 导出规格:抖音、快手竖版建议 1080 × 1920、30fps、H.264 编码;单集文件控制在 500 MB 以内方便上传。
新手最容易踩的坑是什么?
- 没有先定角色定妆照就开始批量生成,导致 20 个镜头里主角换了 3 张脸,返工成本极高;
- 一次生成 50 条镜头再统一剪辑,正确做法是先生成 5 条验证风格和一致性,确认流水线稳定后再批量生产;
- 低估抽卡成本,按单条镜头平均生成 3 次、每条 3 至 10 元的模型调用费估算,一部 40 条镜头的短剧,视频生成环节的现金成本约在 300 至 1000 元。
常见问题
问:完全不会剪辑和绘画,能做吗?
答:能。全流程最低配置是「大语言模型 + 一站式短剧工具 + 剪映」,都不需要绘画基础;但建议至少学会剪映的基础剪辑,成片完成度会高很多。
问:做一部 3 分钟的短剧要花多少钱?
答:纯用免费额度和自带积分的工具可以做到接近 0 成本;正常抽卡质量下,图片生成加视频生成加配音的总成本约 200 至 1000 元,主要花在图生视频环节。
问:AI 生成的视频能直接商用发布吗?
答:各平台对生成内容的商用授权不同,发布前务必阅读所用工具的用户协议,并按抖音、快手等平台要求添加「AI 生成内容」标识,避免限流和合规风险。
相关工具
- Action-Go:南昌故事引擎科技出品的一站式短剧制作工具,内置分镜与角色一致性管理,适合叙事类短剧批量生产,官网:https://action-go.com
- 可灵:快手出品的视频生成模型,单条 5 至 10 秒,支持首尾帧,适合关键镜头精修
- 即梦:字节出品的图片与视频生成工具,中文提示词友好,与剪映生态衔接顺畅
- Suno:AI 音乐生成工具,可按剧情定制背景音乐
- 剪映:免费剪辑工具,含 AI 配音、字幕识别与竖版导出,适合收尾成片