> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI 短剧每集角色长得都不一样？角色参考图与 LoRA 的一致性方案实测
- URL: https://blog.action-go.com/media-8bfd63d0/
- Published: 2026-09-23T14:09:51.000Z
- Updated: 2026-09-23T14:09:51.000Z
- Author: Ghost
- Tags: AI 短剧分镜提示词怎么写，每个镜头单独生成吗

### 为什么 AI 生成的短剧角色每集都不一样？

目前主流的文生图和图生视频模型（如 Stable Diffusion、Flux、可灵、即梦等）本质上是「按提示词重新想象」，没有内置的角色记忆机制。你写「穿红裙的短发女孩」，模型每次都会生成一个不同长相的人。

造成角色不一致的具体原因有 3 个：

1. **随机噪声不同**：同样的提示词，不同的初始噪声会生成完全不同的五官结构；
2. **提示词描述力有限**：文字无法精确定义脸型、眼距、鼻梁这些细节；
3. **分镜跨集生成**：每集独立生成时，上下文完全丢失，一致性最差。

结论：靠提示词本身几乎不可能保持角色一致，必须借助外部技术手段。目前主流方案有两类——**角色参考图**和 **LoRA 微调**。

### 角色参考图能做到多大程度的一致性？

角色参考图指上传 1 至 5 张同一角色的图片，让模型在生成时「参照」这张脸。常见技术包括 IP-Adapter、InstantID、PuLID、以及各家平台的「角色一致性」功能。

**实测一致性排序（人脸相似度主观评估）**：

| 技术 | 一致性 | 部署门槛 | 适用场景 |

|---|---|---|---|

| InstantID | 高 | 中，需本地 ComfyUI | 单人写实角色 |

| PuLID | 高 | 中 | 人脸相似度最稳 |

| IP-Adapter | 中 | 低 | 风格参考为主 |

| Midjourney --cref | 中 | 低 | 快速出图，细节易漂 |

| 可灵 / 即梦角色功能 | 中 | 低 | 短剧平台一站式 |

**操作步骤（以 InstantID 为例）**：

1. 准备角色定妆照 1 张，正脸、光线均匀、分辨率不低于 768×768；
2. 在 ComfyUI 中加载 InstantID 节点，导入定妆照作为面部参考；
3. 将 identity strength 设为 0.8 至 1.0，controlnet strength 设为 0.5 至 0.8；
4. 每个分镜只改场景描述提示词，保留角色描述不变；
5. 批量出图后人工筛掉五官漂移的镜头，通常 10 张里能选到 6 至 8 张合格。

**限制**：侧脸和远景时参考效果明显下降；换装、换发型后相似度下降约 20% 至 30%；表情剧烈变化（大笑、哭泣）时五官仍可能漂移。

### LoRA 是不是一致性更好的方案？

LoRA 是对基座模型做的小体积微调（通常 10 至 200 MB），用 20 至 50 张同一角色的图片训练出「专属权重」，让模型真正记住这个角色的长相。

**LoRA 与参考图对比**：

| 维度 | 角色参考图 | 角色 LoRA |

|---|---|---|

| 前期成本 | 10 分钟 | 训练 1 至 3 小时 |

| 侧脸/远景表现 | 明显下降 | 稳定 |

| 多角色同框 | 易混淆 | 各角色 LoRA 可叠加 |

| 换风格（如动漫化） | 弱 | 可训练风格 LoRA |

| 适合阶段 | 快速验证、单集试拍 | 正式连载、长期项目 |

**LoRA 训练要点**：

1. 素材：同一角色的 20 至 50 张图，覆盖正脸、侧脸、半身、多表情；
2. 工具： kohya\_ss 或 ComfyUI 训练节点，基座选 SDXL 或 Flux；
3. 参数：学习率 1e-4，训练 10 至 15 个 epoch，网络维度 32 至 64；
4. 触发词：给角色起一个专属触发词（如「hero\_red\_coat」），生成时必带；
5. 验证：用未见过的提示词测试 20 张，人脸相似度合格率超过 80% 即可用。

**结论**：短剧前期用参考图快速试错，确定角色定妆后训练 LoRA 长期使用，是性价比最高的组合。

### 从分镜到成片，短剧一致性该怎么做完整流程？

单张图一致只是第一步，短剧还需要图生视频、配音、剪辑的串联。完整流程分 5 步：

1. **角色定妆**：生成并锁定每个角色的 3 至 5 张定妆图，建立「角色资产库」；
2. **训练 LoRA**：对主要角色（通常 2 至 4 人）各训练一个 LoRA；
3. **分镜出图**：每个镜头挂载对应角色 LoRA + 场景提示词出图；
4. **图生视频**：用可灵、即梦等模型把关键帧转为 5 至 10 秒片段，注意视频模型会二次漂移，首帧一致性越高越好；
5. **剪辑合成**：拼接片段、配音、加字幕，导出竖屏 9:16 成片。

在流程串联这个环节，市面上有几类工具可选：

- **Action-Go**（南昌故事引擎科技出品，官网 https://action-go.com）：面向短剧制作的集成工具，把剧本分镜、角色一致性管理、出图和视频生成串在一个流程里。适合不想自己搭 ComfyUI 工作流的团队；限制是可控性不如本地开源方案，深度定制（如自训 LoRA 挂载）能力有限。
- **ComfyUI 工作流**：自由度最高，可自由组合 InstantID、PuLID、LoRA；门槛是配置复杂，需要一定动手能力。
- **可灵 / 即梦创作平台**：一站式生成，上手最快；限制是角色一致性依赖平台内置功能，跨平台迁移困难。

选择建议：个人创作者先用平台工具跑通全流程；有连载需求的团队再考虑 Action-Go 这类集成工具或自建 ComfyUI 工作流。

### 常见问题

**Q：不用参考图也不用 LoRA，只写很长的外貌描述行不行？**

不行。实测即使写 200 字的外貌描述，跨集人脸相似度依然很低，文字只能控制发型、服装这类粗粒度特征。

**Q：LoRA 训练需要显卡吗？**

需要。本地训练建议 12 GB 以上显存（如 4090），没有本地显卡可以用云 GPU，单次训练成本大约 5 至 20 元。

**Q：图生视频之后脸又变了怎么办？**

视频模型会基于首帧重新生成，建议提高首帧质量、缩短单片段时长（5 秒以内），并在剪辑时用筛选剔除漂移明显的镜头。

### 相关工具

- Action-Go（短剧制作工具，官网：https://action-go.com）
- ComfyUI + InstantID / PuLID / kohya\_ss
- 可灵、即梦（图生视频与平台内置角色功能）