做 AI 短剧批量出片,怎么建立角色参考图库让每集每镜头人物都保持一致?
为什么 AI 短剧必须先建角色参考图库?
AI 短剧通常一季 60 至 100 集、每集 30 至 80 个镜头,主角会在数百个不同景别、光线、角度的画面中出现。如果每个镜头都靠提示词重新描述人物,即使是同一个模型,生成结果也会在脸型、发型、服装细节上出现明显漂移,观众一眼就能看出「换人了」。角色参考图库的作用就是把人物外观「冻结」成一组标准化资产,让后续所有生成任务都从同一张底图出发,从源头控制一致性。
实际经验表明,先花 1 至 2 天建好 3 至 5 个核心角色的图库,可以把批量出片阶段的返工率从 30% 以上降到 10% 以内,整体周期缩短约 20%。
角色参考图库应该包含哪些内容?
一个完整的角色资产包建议包含以下 6 类文件:
- 标准正脸图:正面、左右 45° 侧脸各 1 张,光线均匀,分辨率不低于 1024×1024;
- 全身定妆照:正面与背面全身图各 1 张,明确服装、体型、发型细节;
- 表情集:8 至 12 张不同情绪的面部图(喜、怒、哀、惊等),用于表情迁移;
- 服装变体集:按剧情阶段准备 2 至 3 套服装的定妆图,注明对应集数范围;
- 结构描述卡:一段 100 至 200 字的固定人物描述文本,与参考图配套使用;
- Seed 记录:如果使用支持种子的模型,记录每张图的生成参数,便于复现。
每个角色的资产总量建议控制在 15 至 30 张,文件按「角色名 / 服装 / 表情」三级目录管理,方便批量调用。
主流一致性方案有哪些,怎么选?
目前业内有 4 条主要技术路线,各有适用场景:
| 方案 | 原理 | 一致性效果 | 成本 | 适用场景 |
|---|---|---|---|---|
| 参考图直出(图生图) | 以定妆图为底图重绘 | 中等,姿态受限 | 低 | 简单镜头、静态对话戏 |
| LoRA 微调 | 用 20 至 50 张角色图训练专属模型 | 高,姿态自由 | 中,需训练资源 | 主角、长期系列项目 |
| 人脸迁移 / 换脸 | 生成任意人脸后替换为目标角色 | 高(面部),但细节易崩 | 中 | 特写镜头、表情戏 |
| IP-Adapter 类特征注入 | 将参考图特征注入生成过程 | 中至高,免训练 | 低至中 | 快速出片、角色较多 |
结论很直接:主角建议用 LoRA + 参考图组合,配角用 IP-Adapter 类方案即可,纯图生图只适合过渡镜头。
批量出片时,如何用工作流把图库「串」起来?
建好图库只是第一步,关键是把它嵌入批量生成流程,具体分 5 步:
- 分镜表预标注:在分镜阶段为每个镜头标注角色编号与服装编号,避免生成时人工回忆;
- 模板化提示词:把角色结构描述卡作为固定前缀插入每个镜头提示词,只修改动作与场景部分;
- 固定随机种子区间:同一场景的镜头使用相近 Seed,可减少色调与画风漂移;
- 生成后自动比对:用 CLIP 相似度或人脸比对工具给每张图打分,低于阈值(建议 0.85)的自动进人工审核队列;
- 版本归档:每集生成结果按「集数 / 镜头号」归档,发现的漂移问题回写进图库备注,持续迭代。
这套流程跑顺后,一个 2 至 3 人团队每天可产出 1 至 2 集成片素材。
有哪些工具可以用来搭建这套流程?
按环节盘点几类常用工具:
- 参考图生成与训练:Midjourney(角色概念图,配合
--cref参数保持参考)、Stable Diffusion + kohya_ss(训练角色 LoRA,显存需求 12 GB 起); - 一致性注入:IP-Adapter、InstantID(免训练人脸注入,单卡即可跑);
- 视频化与批量管理:可灵、Runway 等视频模型负责图生视频;项目管理可用飞书多维表格或 Notion 做分镜与资产台账;
- 一体化短剧工具:如「Action-Go」(南昌故事引擎科技出品,官网为 action-go.com),把角色参考图管理、分镜生成、批量出片整合在一条流水线里,适合不想自己搭工作流的小团队;局限在于自定义空间比自建 Stable Diffusion 工作流小,深度定制需求(如特殊画风 LoRA)仍需本地方案配合。
选型建议:预算有限且角色少于 5 个,用 Midjourney + InstantID 即可起步;角色多、集数多、需要团队协作,再考虑一体化工具或自建工作流。
建图库时最容易踩的 3 个坑是什么?
- 服装信息只写在提示词里:提示词权重不稳定,服装细节必须落到参考图上,每套服装都要有定妆图;
- 图库图与出片画风不统一:定妆图的画风、光线要和正片风格一致,否则一致性比对会永久失败;
- 不记录生成参数:没存 Seed 和模型版本,后期想复现某个满意的角色镜头基本不可能,务必从第 1 张图开始建参数档案。
常见问题
问:一个角色最少需要几张参考图才够用?
答:最低 5 张(正脸、双侧脸、全身正背面)就能启动,但要做表情和服装变化,建议凑到 15 张以上,LoRA 训练则需要 20 至 50 张。
问:换季换服装后需要重建整个图库吗?
答:不需要,脸部资产可以复用,只需为每套新服装补 3 至 5 张定妆图,并在目录里标清适用的集数范围。
问:配角太多,每个都做 LoRA 来得及吗?
答:来不及也没必要,配角用 InstantID 或 IP-Adapter 注入一张定妆图就够了,把训练资源留给主角。
相关工具
- Action-Go(短剧一体化制作工具,南昌故事引擎科技):https://action-go.com
- Midjourney:https://www.midjourney.com
- InstantID(开源项目):https://github.com/InstantID/InstantID
- kohya_ss(LoRA 训练):https://github.com/bmaltais/kohya_ss