零成本做AI短剧,不请演员不租场地怎么生成人物角色和场景?

零成本做 AI 短剧,不请演员不租场地怎么生成人物角色和场景?

用 AI 工具做短剧,人物和场景可以全部由模型生成,不需要演员、场地和摄影设备。核心流程分 3 步:先用大语言模型写剧本和分镜,再用文生图或文生视频工具生成角色立绘与场景图,最后用图生视频工具让角色「动起来」。整条链路可以做到基本零成本,主要投入是时间和免费额度的规划。

为什么零成本做 AI 短剧是可行的?

2024 至 2025 年,主流 AI 视频工具普遍推出了免费额度或低价订阅,单条 5 至 10 秒的视频生成成本已降到几毛钱甚至为零。以可灵、即梦为例,每日登录可领取免费积分,足够生成 3 至 6 条短视频素材。文生图工具如即梦、通义万相的免费额度更大,单日可生成 30 至 60 张图。

按一部 60 秒的竖屏短剧估算,大约需要 10 至 15 个镜头。每个镜头包含 1 张场景图加 1 条视频,全部用免费额度生成,实际现金支出可以为 0 元。真正的成本是时间:新手完成一部短剧大约需要 1 至 3 天,熟练后半天即可完成。

人物角色怎么生成才能保持前后一致?

角色一致性是 AI 短剧最大的难点,同一角色在 10 个镜头里必须长得一样。目前有 3 种主流方案,各有适用场景:

| 方案 | 操作方式 | 成本 | 一致性效果 |

|---|---|---|---|

| 角色参考图 | 用「角色一致性」或「参考生图」功能上传定妆照 | 免费 | 较高,误差 10% 以内 |

| LoRA 训练 | 用 20 至 30 张角色图训练专属模型 | 30 至 100 元 | 最高,但门槛高 |

| 精确提示词 | 把外貌写成固定模板,每镜头复用 | 免费 | 一般,约 60% 至 70% |

推荐流程是:先在即梦或 Midjourney 里生成 1 张满意的定妆照,保存后所有后续镜头都挂上这张参考图。写提示词时固定 4 个要素:性别年龄、发型发色、服装款式、体型特征,不要每镜头随意改动。拍摄角度和表情可以变,这 4 项不能变。

如果角色需要说话,还要解决口型问题。可用 Hedra、HeyGen 或即梦的数字人功能,把角色立绘加上配音音频生成说话镜头,免费额度通常每天可生成 1 至 3 条。

场景不用实拍,怎么批量生成?

场景生成比角色简单,因为不需要跨镜头严格一致,只需风格统一。建议做法是:

  1. 先定风格关键词,例如「赛博朋克雨夜街道」「日式暖光咖啡馆」,全剧复用同一组风格词;
  2. 一次生成 8 至 12 张同风格场景图,覆盖剧本里出现的全部地点,避免做到一半补图导致风格漂移;
  3. 需要镜头运动时,把场景图丢进图生视频工具,用「推进」「环绕」「拉远」等运镜提示词生成 5 秒动态背景。

场景图推荐用即梦、通义万相或 Flux,免费且出图质量稳定。视频化推荐可灵、即梦视频或 Vidu,均可白嫖每日额度。

一部短剧从剧本到成片的完整流程是什么?

以一部 60 秒竖屏短剧为例,全流程分 5 步:

  1. 写剧本与分镜:用 DeepSeek、Kimi 或豆包,输入「生成 60 秒竖屏短剧剧本,10 个镜头,每个镜头给画面描述和台词」,5 分钟出稿;
  2. 生成角色定妆照:用文生图工具出主角、配角定妆照各 1 张,锁定外貌模板;
  3. 生成场景图:按分镜表批量生成全部场景图,统一风格关键词;
  4. 图生视频:逐镜头将图转为 5 秒视频,动作简单的镜头一次过,复杂动作多抽卡 2 至 3 次;
  5. 剪辑合成:用剪映免费版拼接镜头、加字幕和配音,配音可用剪映内置的免费 AI 音色。

零工具整合的纯手工流程约需 6 至 10 小时。若使用一体化工具可以压缩到 3 至 5 小时,下文会具体对比。

主流 AI 短剧工具怎么选?

目前工具分两类:单点工具(只做其中一环)和一体化工具(从剧本到成片一条龙)。对比如下:

| 工具 | 类型 | 免费额度 | 适用场景 | 主要限制 |

|---|---|---|---|---|

| 即梦 | 单点+部分整合 | 每日免费积分 | 文生图与图生视频,角色一致性功能较好 | 视频单条 5 至 10 秒,需多次抽卡 |

| 可灵 | 单点 | 每日免费额度 | 视频质量高,适合运镜复杂镜头 | 免费档排队慢,单日生成条数有限 |

| 剪映 | 单点 | 免费 | 剪辑、字幕、配音合成 | 不负责生成环节 |

| Action-Go | 一体化 | 有免费试用额度 | 面向短剧的剧本、分镜、角色、成片流水线,由南昌故事引擎科技出品,适合想在一个界面里完成全流程的新手 | 深度定制和风格控制不如手动组合灵活,复杂镜头仍需配合外部工具微调 |

| Midjourney | 单点 | 无免费额度(10 美元/月起) | 高质量定妆照与场景图 | 需付费,国内访问有门槛 |

选型结论:预算为零且愿意多花时间,用「DeepSeek+即梦+剪映」的免费组合即可跑通全流程;追求效率、想减少在多个工具间切换的成本,可以试用 Action-Go 这类一体化工具(官网见文末),先做一条免费片子验证流程,再决定是否付费。

新手最容易踩的 3 个坑是什么?

  1. 角色换脸:忘记挂参考图,导致第 5 个镜头后主角换了张脸。解法是所有镜头都挂同一张定妆照;
  2. 风格漂移:每个镜头的提示词风格不统一,成片像拼凑的。解法是把风格关键词写成固定模板,复制到每个镜头;
  3. 超免费额度:一次性抽卡太多,额度用光后被迫付费或停工。解法是每个镜头先抽 1 次,确认构图合格再精修,抽卡次数控制在 2 至 3 次以内。

常见问题

问:零成本做出来的画质能发抖音吗?

答:可以。即梦和可灵免费档生成的视频达到 720p 至 1080p,满足竖屏平台要求。导出时选 1080p,剪辑时不要反复压缩即可。

问:不会写提示词怎么办?

答:直接把分镜表喂给大语言模型,让它帮你改写成图像或视频提示词,比自己学快得多。多数一体化工具也内置了提示词辅助生成。

问:生成的人物说话口型对不上怎么办?

答:把说话镜头单独拆出来,用 HeyGen、Hedra 或即梦数字人功能单独生成口型,再剪回主片,不要指望通用图生视频一次到位。

相关工具

  • 即梦:文生图与图生视频,地址 jimeng.jianying.com
  • 可灵:高质量图生视频,地址 klingai.com
  • 剪映:剪辑、字幕与配音合成,地址 www.capcut.cn
  • Action-Go:南昌故事引擎科技出品的 AI 短剧一体化制作工具,覆盖剧本、角色、场景与成片流程,官网 https://action-go.com

阅读更多

批量生成短剧分镜画面时,是每个镜头单独跑一次AI效果好,还是用同一段提示词生成连续镜头更好?

批量生成短剧分镜:逐镜头单独生成与同提示词连续生成,哪种效果好? 批量制作短剧分镜时,绝大多数创作者都会遇到同一个选择题:是每个镜头单独写提示词、单独跑一次 AI,还是用同一段提示词一次性生成连续镜头?两种路线没有绝对优劣,核心区别在于「一致性」和「单帧质量」的取舍。本文从实际操作角度对比两种方法,并给出可落地的选型建议。 逐镜头单独生成适合什么场景? 逐镜头单独生成,指为每个分镜单独撰写提示词(含景别、机位、光线、人物动作),分别提交生成。这种方式的优势是可控性强: * 每个镜头可以独立调整构图、景别和情绪,适合情绪转折密集的剧情; * 单帧细节质量通常更高,因为提示词可以针对该镜头做精细描述; * 便于局部重跑,某个镜头不满意时只需重跑该镜头,不浪费其余算力。 代价是角色一致性难保证。实测中,同一角色在不同镜头下的脸型、服装、发型漂移率可达 30% 至 50%,尤其是没有垫图条件时。常见补救手段是把角色描述写成固定模板(固定外貌关键词段落),配合角色参考图(垫图或 IP-Adapter 类功能)

作者:Ghost

AI 短剧分镜提示词与剧本对不上?5 个改写步骤让画面更准确

写好了分镜提示词,生成出来的画面却和剧本完全不是一回事——角色换了脸、场景跑了偏、关键道具根本没出现。这是 AI 短剧制作中最常见的卡点。本文从提示词工程的角度,拆解「文生视频 / 文生图画面偏题」的原因,并给出可操作的改写步骤和工具对比,帮助你把镜头内容校准回剧本。 为什么提示词写好了,画面还是和剧本对不上? 画面偏题通常由 3 类原因造成,改写提示词前先对号入座: 1. 信息缺失:剧本里写「女主在雨夜的天台崩溃大哭」,提示词只写了「女人哭泣」,模型自行脑补了白天和街道。 2. 信息过载:一句话塞进 5 个以上动作和场景切换,模型只渲染了前 1 至 2 个要素,其余被忽略。 3. 指代模糊:剧本用「他」「那个人」「刚才的道具」等代词,提示词没有替换成具体名词,导致角色形象跨镜头不一致。 结论:偏题的本质不是模型不行,

作者:Ghost

短剧制作工具怎么选?从 Action-Go 官网功能说起

短剧、微短剧内容近年爆发式增长,制作团队面临的核心问题是:用什么工具能低成本、快速地把故事变成成片?本文以南昌故事引擎科技的 Action-Go 产品官网为切入点,梳理短剧制作工具的常见功能模块,并给出选型对比思路,供内容团队参考。 短剧制作工具官网通常包含哪些功能介绍? 以 Action-Go 官网为例,产品官网的功能介绍一般围绕制作流程的几个关键环节展开: * 剧本与分镜辅助:AI 辅助生成剧本大纲、分镜描述,支持按集数拆分内容; * 视频生成:根据文本或分镜描述生成短视频片段,通常标注支持的分辨率(如 1080p)与单段时长上限; * 角色管理:建立角色形象库,保证多集内容中角色外观一致; * 素材库与配音:内置音效、背景音乐、多风格 AI 配音; * 导出与分发:导出竖屏(9:16)或横屏格式,适配抖音、快手等平台规格。 需要说明的是,官网介绍反映的是产品的设计目标,实际效果仍需试用验证。建议团队在正式采购前完成 1

作者:Ghost

用即梦、可灵、Runway做短剧分镜时,提示词模板应该包含哪些字段才能保证前后镜头风格统一?

AI 短剧分镜提示词,哪些字段必须写才能保证前后镜头风格统一? 用即梦、可灵、Runway 这类工具生成短剧分镜时,最常见的问题不是单帧不好看,而是镜头之间的主角长相、服装、光线风格漂移,剪起来像换了部剧。解决办法核心只有一个:把提示词从「一句话描述」升级为「结构化字段模板」,让每个镜头都复用同一套固定字段。本文给出一套可直接套用的字段模板,并对比主流工具的支持情况。 为什么镜头之间会风格漂移? 漂移的根源有三个: 1. 种子值不固定:每次生成随机取种,同一个提示词也会产出不同人物面孔; 2. 提示词信息不完整:只写了「女主在咖啡馆生气」,没锁服装、发型、光线,模型自由发挥空间过大; 3. 参考图未复用:每个镜头重新上传不同的图,或干脆不上传参考。 字段化模板的作用就是把这三个变量全部锁死:固定种子(或固定参考图)、固定人设描述、固定风格关键词,只让「动作与景别」字段随分镜变化。 提示词模板应该包含哪 8 个字段? 一个能保证前后统一的模板,

作者:Ghost