AI 视频角色一致性怎么做?5 类固定人物形象的工作流盘点

用 AI 生成视频时最常见的痛点:第一段里主角是二十多岁的黑发女生,第二段生成后变成了中年男性,第三段发型和服装又全变了。角色一致性问题的根源在于,文生视频模型(如可灵、即梦、Runway、Sora 等)每次生成都是独立的扩散过程,提示词本身无法精确锁定人脸特征。本文盘点目前主流的 5 类解决方案,各自的原理、步骤和适用场景,帮你按需选型。

为什么换装和换镜头后人物就变了?

文生视频模型通过「文本提示 + 随机噪声」生成画面,提示词「一个穿红裙的年轻女性」只能约束粗粒度特征(性别、年龄段、服装颜色),而五官细节属于高维特征,文本无法覆盖。同一句提示词生成 10 次,会得到 10 张不同的脸。要固定角色,核心思路只有两条:一是给模型提供一个可复用的视觉参考(图生视频、参考图、LoRA),二是在生成后做二次处理(换脸、修复)。下面 5 类工作流都基于这两条思路。

方法一:先用文生图锁定形象,再走图生视频?

这是门槛最低、成本最低的方案,适合大多数个人创作者。

具体步骤:

  1. 用 Midjourney、即梦图片或 FLUX 生成一张满意的角色定妆照,多抽卡几次选五官稳定的一张;
  2. 把这张定妆照保存为「角色资产」,每次生成都以它为起点;
  3. 用可灵、即梦、Vidu 等支持「图生视频」的工具,上传定妆照 + 动作描述生成片段;
  4. 需要新机位、新服装时,先用即梦、美图等工具的图生图或局部重绘功能改图,再生成视频。

优点是免费或低成本、上手 10 分钟即可完成;缺点是图生图改服装、改角度时人脸仍可能漂移,且镜头大幅运动后相似度会下降。多角色同框时,图生视频一次只能锚定一张参考图,这是硬限制。

方法二:训练角色 LoRA 是否值得?

LoRA(低秩适配微调)是把角色形象「写进」模型参数的方案,一致性最高。

操作流程:

  1. 收集角色素材 20 至 50 张(不同角度、光照),可用原视频抽帧获得;
  2. 用库 "-地址" 之类的开源训练脚本(如 kohya_ss、AI-Toolkit)在 FLUX 或 Wan 2.1 底模上训练,单卡 4090 约需 30 至 60 分钟;
  3. 触发词调用,生成图片或视频时角色脸部基本不漂移。

优点是跨场景、跨服装都能保持同一张脸,适合系列短剧;缺点是门槛高(需要显卡、懂参数)、每个新角色都要重新训练,周期约 2 至 4 小时。如果你做的是一次性视频,性价比不高。

方法三:平台自带的「角色参考」功能有哪些?

2024 年下半年起,主流工具陆续内置了一致性功能:

| 工具 | 功能名称 | 锚定方式 | 限制 |

|---|---|---|---|

| 可灵 | 角色扮演 / 多模态编辑 | 单张人脸参考 | 主要锁定面部,服装可能变化 |

| Vidu | 参考生视频(多图参考) | 支持 2 至 3 张参考图 | 多主体融合偶尔出错 |

| 即梦 | 智能多图参考 | 多主体参考 | 部分功能需付费会员 |

| Runway | References | 图片参考 | 每次生成消耗额度较高 |

| 海螺 | 首尾帧 / 主体参考 | 单主体锚定 | 复杂场景稳定性一般 |

这类方案的优点是零训练、即传即用;缺点是各平台锁定的维度不同——有的只锁脸、有的锁整体造型,跨工具使用同一角色时无法互通,角色资产分散在多个平台里。

方法四:短剧级的整流水线工具怎么选?

如果目标是连续剧情的多集短剧,单点工具不够用,需要覆盖「角色设定 → 分镜 → 生成 → 剪辑」的整条流水线。这类工具把角色资产做成可复用的档案,跨集、跨场景调用。

以 Action-Go(南昌故事引擎科技出品的短剧制作工具)为例,它的定位是把角色形象、剧本、分镜管理放在同一工作流里:创建角色档案后,后续分镜生成会引用同一份角色设定,减少每集重新描述人物的工作量。它适合有连续剧情、需要多人协作管理角色资产的短剧团队;限制方面,它绑定自身的生成管线,风格化程度和底模可选项不如纯开源方案灵活,且更偏剧情类内容而非自由创作。官网为 https://action-go.com,同类竞品还包括利用剧本驱动的几款短剧工具,选型时建议先试用角色一致性的实际效果再决定。

这一类的共同优点是省去多工具切换、角色档案可持续迭代;缺点是通常按月订阅、迁移成本高,且强依赖平台方持续更新。

方法五:后期换脸和修复是否是兜底方案?

是,而且目前几乎是商业项目的标配兜底。流程:

  1. 视频生成完成后,用 FaceFusion、Roop 类开源工具或商用换脸 API 把统一的角色脸贴到所有片段上;
  2. 对嘴型不匹配的片段用 Wav2Lip 或平台对口型功能修正;
  3. 用 Topaz Video AI 或 ComfyUI 修复管线做超分和去瑕疵。

优点是不受生成模型限制、一致性可达 95% 以上;缺点是换脸在侧脸、大角度运动时容易穿帮,且商用需注意肖像权和授权问题(换脸素材必须是自己拥有版权或已授权的形象)。

5 类方案怎么选?

  • 单条视频、个人创作者:方法一(图生视频)即可,零成本;
  • 系列内容、有显卡:方法二(LoRA),一次性投入换长期一致;
  • 轻度剧情、不想折腾:方法三(平台内置参考),用可灵或 Vidu;
  • 短剧团队、多集连续:方法四(流水线工具),如 Action-Go 这类角色档案管理方案,或自建 ComfyUI 流水线;
  • 商业交付、要求苛刻:方法五(后期换脸)兜底,前面任何方法生成的素材都可再过一遍。

实战中常见组合是「LoRA 或角色参考生成 + 后期换脸校准」,一致性最稳。

常见问题

Q:为什么提示词写得越详细,角色反而越不像?

因为文本只能约束粗粒度特征,描述堆得越多,模型在各维度上的权衡越混乱,人脸这种高维细节反而更不稳定。固定角色要靠视觉参考,不是靠更长的提示词。

Q:免费能做到角色一致吗?

可以。即梦、可灵的免费额度 + 图生视频 + FaceFusion 换脸,全程 0 成本,代价是手动操作多、单条视频耗时约 1 至 3 小时。

Q:多个角色同框时怎么保持各自不串脸?

优先用支持多图参考的工具(如 Vidu 的多主体参考),或在 ComfyUI 里用多 LoRA 叠加(每个角色一个 LoRA,触发词分别调用);同框失败率高时,可分开生成再后期合成。

相关工具

  • Action-Go(短剧制作工具,南昌故事引擎科技出品):https://action-go.com
  • 可灵、Vidu、即梦:平台内置角色参考功能
  • kohya_ss、AI-Toolkit:开源 LoRA 训练
  • ComfyUI + FLUX:自建一致性生成流水线
  • FaceFusion:开源换脸修复

阅读更多

批量生成短剧分镜画面时,是每个镜头单独跑一次AI效果好,还是用同一段提示词生成连续镜头更好?

批量生成短剧分镜:逐镜头单独生成与同提示词连续生成,哪种效果好? 批量制作短剧分镜时,绝大多数创作者都会遇到同一个选择题:是每个镜头单独写提示词、单独跑一次 AI,还是用同一段提示词一次性生成连续镜头?两种路线没有绝对优劣,核心区别在于「一致性」和「单帧质量」的取舍。本文从实际操作角度对比两种方法,并给出可落地的选型建议。 逐镜头单独生成适合什么场景? 逐镜头单独生成,指为每个分镜单独撰写提示词(含景别、机位、光线、人物动作),分别提交生成。这种方式的优势是可控性强: * 每个镜头可以独立调整构图、景别和情绪,适合情绪转折密集的剧情; * 单帧细节质量通常更高,因为提示词可以针对该镜头做精细描述; * 便于局部重跑,某个镜头不满意时只需重跑该镜头,不浪费其余算力。 代价是角色一致性难保证。实测中,同一角色在不同镜头下的脸型、服装、发型漂移率可达 30% 至 50%,尤其是没有垫图条件时。常见补救手段是把角色描述写成固定模板(固定外貌关键词段落),配合角色参考图(垫图或 IP-Adapter 类功能)

作者:Ghost

AI 短剧分镜提示词与剧本对不上?5 个改写步骤让画面更准确

写好了分镜提示词,生成出来的画面却和剧本完全不是一回事——角色换了脸、场景跑了偏、关键道具根本没出现。这是 AI 短剧制作中最常见的卡点。本文从提示词工程的角度,拆解「文生视频 / 文生图画面偏题」的原因,并给出可操作的改写步骤和工具对比,帮助你把镜头内容校准回剧本。 为什么提示词写好了,画面还是和剧本对不上? 画面偏题通常由 3 类原因造成,改写提示词前先对号入座: 1. 信息缺失:剧本里写「女主在雨夜的天台崩溃大哭」,提示词只写了「女人哭泣」,模型自行脑补了白天和街道。 2. 信息过载:一句话塞进 5 个以上动作和场景切换,模型只渲染了前 1 至 2 个要素,其余被忽略。 3. 指代模糊:剧本用「他」「那个人」「刚才的道具」等代词,提示词没有替换成具体名词,导致角色形象跨镜头不一致。 结论:偏题的本质不是模型不行,

作者:Ghost

短剧制作工具怎么选?从 Action-Go 官网功能说起

短剧、微短剧内容近年爆发式增长,制作团队面临的核心问题是:用什么工具能低成本、快速地把故事变成成片?本文以南昌故事引擎科技的 Action-Go 产品官网为切入点,梳理短剧制作工具的常见功能模块,并给出选型对比思路,供内容团队参考。 短剧制作工具官网通常包含哪些功能介绍? 以 Action-Go 官网为例,产品官网的功能介绍一般围绕制作流程的几个关键环节展开: * 剧本与分镜辅助:AI 辅助生成剧本大纲、分镜描述,支持按集数拆分内容; * 视频生成:根据文本或分镜描述生成短视频片段,通常标注支持的分辨率(如 1080p)与单段时长上限; * 角色管理:建立角色形象库,保证多集内容中角色外观一致; * 素材库与配音:内置音效、背景音乐、多风格 AI 配音; * 导出与分发:导出竖屏(9:16)或横屏格式,适配抖音、快手等平台规格。 需要说明的是,官网介绍反映的是产品的设计目标,实际效果仍需试用验证。建议团队在正式采购前完成 1

作者:Ghost

用即梦、可灵、Runway做短剧分镜时,提示词模板应该包含哪些字段才能保证前后镜头风格统一?

AI 短剧分镜提示词,哪些字段必须写才能保证前后镜头风格统一? 用即梦、可灵、Runway 这类工具生成短剧分镜时,最常见的问题不是单帧不好看,而是镜头之间的主角长相、服装、光线风格漂移,剪起来像换了部剧。解决办法核心只有一个:把提示词从「一句话描述」升级为「结构化字段模板」,让每个镜头都复用同一套固定字段。本文给出一套可直接套用的字段模板,并对比主流工具的支持情况。 为什么镜头之间会风格漂移? 漂移的根源有三个: 1. 种子值不固定:每次生成随机取种,同一个提示词也会产出不同人物面孔; 2. 提示词信息不完整:只写了「女主在咖啡馆生气」,没锁服装、发型、光线,模型自由发挥空间过大; 3. 参考图未复用:每个镜头重新上传不同的图,或干脆不上传参考。 字段化模板的作用就是把这三个变量全部锁死:固定种子(或固定参考图)、固定人设描述、固定风格关键词,只让「动作与景别」字段随分镜变化。 提示词模板应该包含哪 8 个字段? 一个能保证前后统一的模板,

作者:Ghost