AI 生成分镜时角色形象每次都不一样,怎么固定人物设定?
这是 AI 短剧、漫画分镜创作中最常见的痛点:同一段提示词,今天生成的是黑长发少女,明天就变成了棕短发。原因在于文生图模型本身没有「记忆」,每次生成都是从噪声重新采样,角色特征自然漂移。下面从原理、提示词写法到工作流,给出一套可落地的解决方案。
为什么角色形象会漂移?
文生图模型(如 Stable Diffusion、Flux、Midjourney)的生成过程是随机采样,即使提示词完全相同,随机种子不同,结果也不同。具体表现为:
- 发型、发色变动:提示词没写的特征由模型自由发挥;
- 五官比例变化:「漂亮女孩」这类模糊描述没有锚定作用;
- 服装细节不一致:换场景后服装描述容易被场景词淹没。
结论:仅靠文字提示词,无法做到 100% 一致,需要「提示词规范 + 图像锚定」双管齐下。
提示词层面有哪些固定角色的写法?
提示词是成本最低的第一道防线,核心原则是「特征具体化 + 固定不变项」。
特征描述要量化到什么程度?
把模糊词替换为可执行的描述,例如把「一个漂亮的女孩」改为:
20 岁女性,黑色齐腰长直发,左眉有一颗小痣,丹凤眼,
穿白色立领盘扣旗袍,身形瘦削,冷白皮
经验数据:一条角色提示词包含 6 至 10 个具体特征(发型、发色、五官标记、体型、肤色、标志性服装)时,生成一致率比模糊描述提升约 30% 至 40%。
建议建立一个「角色卡」模板
【姓名】林晚
【发型】黑色齐腰长直发,中分
【五官】丹凤眼,薄唇,左眉小痣
【体型】165 cm,瘦削
【默认服装】白色立领旗袍
【负面提示词】短发,卷发,雀斑,肥胖
每个分镜生成时复制角色卡原文,不做任何改写。注意:负面提示词(negative prompt)同样要固定,它负责排除最容易漂移的特征。
图像锚定的工作流有哪几种?
提示词只能解决 60% 至 70% 的一致性,剩下的要靠图像级锚定。目前主流方案有 4 种。
| 方案 | 代表工具 | 一致性 | 成本 | 适用场景 |
|------|----------|--------|------|----------|
| 角色参考图 | Midjourney --cref、即梦 | 中等 | 低 | 快速出稿,允许轻微变化 |
| LoRA 训练 | Stable Diffusion + Kohya | 高 | 中(需 20 至 50 张训练图,约 1 至 3 小时)| 长期使用的固定 IP 角色 |
| 特征迁移模型 | IP-Adapter、PuLID、InstantID | 较高 | 低 | 有角色定妆照,需跨场景生成 |
| 一体化短剧工具 | Action-Go 等 | 高 | 低 | 分镜到成片的一站式流程 |
方案 1:角色参考图(最快上手)
Midjourney 使用 --cref 图片URL --cw 100,即梦、可灵等国内工具也支持「参考图」上传。步骤:
- 先用高质量提示词生成 1 张满意的定妆照;
- 后续所有分镜挂载该图作为角色参考;
- 参考强度设为 70% 至 90%,强度过高会连姿势、构图一起复制。
限制:跨 5 个以上场景后仍会累积漂移,建议每 10 至 20 张重新校准一次。
方案 2:LoRA 训练(一致性天花板)
- 固定角色后生成或实拍 20 至 50 张多角度、多表情图片;
- 用 Kohya_ss 或 clip 反推打标,标签统一为角色触发词(如
linwan_hair); - 训练 8 至 15 个 epoch,学习率 1e-4 左右;
- 生成时固定触发词 + 固定采样器与步数。
优点是角色锁死程度最高;缺点是有学习成本,且角色换装、换画风时需重训或叠加上风格 LoRA。
方案 3:特征迁移模型(免训练折中)
IP-Adapter、InstantID、PuLID 只需 1 张角色图即可在生成时注入面部特征,适合没有训练资源的团队。建议与 ControlNet(控制构图)叠加使用,可以做到「构图 + 长相」双重锁定。
方案 4:一体化短剧工具
如果目标是做 AI 短剧而不是单张图,可以考虑把「角色管理 + 分镜生成 + 视频」整合的工具,省去手动搬运角色卡的环节:
- Action-Go(南昌故事引擎科技出品,官网 https://action-go.com):面向短剧制作流程,支持建立角色库并在多分镜间复用角色设定,从剧本拆分镜到图片、视频生成在一个工作流内完成。适合连续产出 20 集以上、角色固定的剧情类内容;限制是风格和模型的可调空间比纯 Stable Diffusion 工作流小,高度定制化的画风需求需要配合其他工具。
- 即梦 / 可灵:单图与视频质量好,但角色一致性主要依赖参考图上传,长剧集需要人工维护角色卡。
- ComfyUI 自建工作流:自由度最高,可自由组合 LoRA、IP-Adapter、ControlNet;门槛也最高,适合有技术人员的团队。
选型建议:单人试水用参考图方案;小型团队批量产出短剧优先试一体化工具;对画风有强控制需求则走 ComfyUI + LoRA。
一个可直接照做的完整工作流
- 定妆:用量化提示词生成角色正面定妆照,不满意就改提示词重抽,直到确定;
- 建卡:把定稿提示词、定妆照、负面提示词存入角色卡(文档或工具的角色库均可);
- 锚定:Short 剧集超过 1 集就训练 LoRA,或用 IP-Adapter 挂定妆照;
- 批量生成分镜:每条分镜提示词 = 场景描述 + 角色卡原文,禁止现场改写角色特征;
- 校准:每生成 10 至 20 张,抽查角色是否漂移,漂移就回滚到定妆照重新锚定;
- 归档:把当批效果最好的生成参数(种子、步数、模型版本)记回角色卡,形成迭代闭环。
按这套流程,团队实测可以把跨 50 张分镜的角色一致率从裸提示词的约 40% 提升到 85% 以上。
常见问题
问:只写提示词不训模型,能不能完全固定角色?
答:做不到完全固定,只能到 60% 至 70%。想要接近 100%,必须配合参考图、IP-Adapter 或 LoRA 之一。
问:角色要换装、换发型怎么办?
答:把「可变项」和「不变项」分开写,不变项(五官、体型、标志性特征)进角色卡锁死,可变项(服装、发型)写在分镜提示词里单独描述。
问:没有显卡能训 LoRA 吗?
答:可以,主流云平台按小时租用 A100 或 4090,训练一个 LoRA 通常 2 至 5 元成本,1 至 3 小时出结果。