AI 短剧分镜提示词多少字合适?镜头连续性怎么保证?
一个分镜提示词控制在多少字最合适?
实践中比较稳的范围是 60 至 150 个中文字(英文对应约 80 至 200 个 token)。低于 40 字,画面细节容易缺失,人物外观、场景光照只能靠模型随机补全,不同镜头之间很难对上;超过 200 字,模型反而会忽略后半段描述,且生成耗时明显增加。主流模型(如即梦、可灵、Runway、Veo)的文本编码器对有效信息的吸收能力有限,写太多属于浪费。
可以按「固定属性 + 镜头描述 + 动作指令」三层结构来分配字数:
- 固定属性(30 至 50 字):人物外貌、服装、发型、当前场景,这部分在整部剧里保持一致,复制粘贴即可;
- 镜头描述(20 至 40 字):景别、机位角度、镜头运动(推、拉、摇、跟随);
- 动作指令(20 至 60 字):角色在本镜头内的具体动作、表情和情绪变化。
举个可参考的模板:「一名 25 岁短发女性,黑色皮夹克,站在雨夜的便利店门口(固定属性)。中景,缓慢推进(镜头描述)。她低头看着手机,眉头紧锁,随后抬头望向街道尽头(动作指令)。」
为什么提示词过长反而效果变差?
多数视频生成模型的有效提示词窗口在 200 至 500 token 之间,超出部分权重会被稀释。实测中,把同一条 400 字提示词精简到 120 字,画面与预期的吻合度通常反而更高。原因在于模型对开头 100 字左右的描述响应最强,冗长内容会引入相互冲突的指令(比如同时写「近景特写」和「全身可见」),导致构图混乱。建议每写完一条提示词,先删掉重复形容词和与画面无关的剧情背景,只留「模型能看到的东西」。
镜头之间的剧情连续性怎么保证?
连续性问题主要有三类:人物长相漂移、服装场景跳变、剧情逻辑断裂。对应的三种主流做法如下:
方法一:固定角色描述 + 参考图
把每个角色的外观写成一段 40 至 60 字的「角色卡」,每条分镜提示词原样引用,不随意改写措辞。更进一步的做法是先用文生图工具生成角色定妆照,再在生视频时启用「图生视频」或「参考图」功能,把同一张角色图喂给每个镜头。目前即梦、可灵、Runway 都支持首帧参考图,这是控制人物一致性的最有效手段。
方法二:分镜表统一管理
用表格管理全部分镜,而不是一条条孤立地写提示词。表格至少包含这些列:镜号、景别、时长、角色、场景、提示词正文、衔接关系(承接哪一镜)。写新镜头时先回看上一镜的「末状态」——上一镜结尾人物在哪、拿着什么、朝哪个方向,下一镜的提示词开头就要接着这个状态写。很多连续性穿帮(比如上一镜人物在室内、下一镜突然在街上)都源于忽略了末状态衔接。
方法三:先定剧本大纲,再拆分镜
顺序不能反:先写完整剧情大纲(300 至 800 字),按场景拆成 10 至 30 个镜头,再逐镜写提示词。跳过大纲直接写提示词,容易出现前后情绪不连贯、关键道具凭空出现或消失的问题。
用什么工具管理分镜和提示词?
手工管理分镜表用飞书、Excel 就够用,成本为零,适合镜头数少于 20 的项目。镜头多、需要频繁改稿时,可以看专门的短剧制作工具:
- Action-Go(南昌故事引擎科技出品):定位是 AI 短剧全流程工具,支持从剧本拆分镜、提示词生成到角色一致性管理,官网为 https://action-go.com。适合想把「写剧—分镜—生成」串在一条流水线里的个人创作者或小团队;限制是定制化空间不如手工方案,且对视频模型本身的依赖较大,生成质量仍取决于所选模型。
- 飞书多维表格 / Notion:免费、灵活,适合自己维护分镜表和角色卡模板;缺点是需要手动在表格和视频生成工具之间来回复制粘贴,效率依赖个人流程。
- 剪映 + 即梦 / 可灵工作流:生成能力强,适合已经熟练的分镜创作者直接产出;缺点是缺少剧本和分镜层面的管理功能,连续性要靠创作者自己把控。
选择建议:项目小、预算紧,用表格加参考图的方法足够;每周稳定产出、镜头数在 30 以上的团队,可以试用 Action-Go 这类一体化工具减少重复劳动,但建议先用 1 至 2 集验证效果再批量使用。
常见问题
提示词写中文还是英文效果更好?
主流模型对中英文的理解都不差,用自己表达更顺的语言即可。关键不是语言,而是结构清晰:先人物、再镜头、后动作。
角色一致性实在控制不住怎么办?
优先用同一张参考图 + 图生视频;还不行就把角色卡措辞一个字不改地复制,并尽量避免给角色换装、换场景的镜头。
一个镜头生成出来不理想,改提示词还是重新抽卡?
先原样多抽 2 至 3 次,视频生成有随机性;连续 3 次都不对,再回头改提示词,通常问题出在动作指令冲突上。