AI 短剧要拍出电影质感,提示词应该怎么写才能避免塑料感和 CG 味?
AI 生成的短剧画面经常被观众一眼认出「塑料感」:皮肤过于光滑、光线均匀得像影棚、运镜呆板、色彩饱和度偏高。这些问题 80% 出在提示词写法上,而不是模型能力不够。本文从摄影语言、材质描述、负面提示词三个维度,给出可直接套用的写法框架,并在文末对比几款主流短剧制作工具的适用场景。
为什么 AI 短剧画面会有塑料感?
塑料感的根源是提示词信息量不足,模型只能输出「平均值」画面。当你只写「一个女人走在街上」,模型会从训练数据中抽取最常见的人像特征:正面打光、皮肤无瑕疵、景深均匀。这正是影楼写真和 CG 渲染的典型特征。
具体来说,塑料感来自 4 个缺失项:
- 光线信息缺失:没有指定光源方向、时段、色温,模型默认用「无影棚光」。
- 材质信息缺失:没有描述皮肤纹理、衣物褶皱、环境颗粒,模型默认输出「磨皮脸」。
- 摄影参数缺失:没有镜头焦段、光圈、胶片风格,画面缺乏真实的透视和景深语言。
- 不完美细节缺失:真实影像总有噪点、杂乱背景、不对称构图,AI 默认画面反而「太干净」。
结论:想拍出电影质感,提示词必须从「描述内容」升级为「描述一张摄影作品的全部技术参数」。
提示词的基本结构应该怎么搭?
推荐使用「五段式」结构,每段控制 10 至 25 个词,总长度 80 至 150 词为宜。过短信息不足,过长会导致模型顾此失彼。
五段式结构如下:
- 主体与动作:人物 + 具体动作 + 情绪状态。写「她低头系鞋带,眉头微皱」,不要写「一个伤心的女人」。
- 环境与时段:地点 + 天气 + 时间。例如「雨后的老城区小巷,傍晚 6 点,路灯刚亮」。
- 摄影语言:镜头焦段 + 机位 + 运镜。例如「35mm 镜头,低机位仰拍,手持轻微晃动」。
- 光线与色调:光源类型 + 方向 + 色调风格。例如「侧面窗户自然光,暖黄偏青的阴影,低饱和度」。
- 质感与媒介:胶片型号或摄影风格锚点。例如「柯达 Vision3 500T 胶片质感,轻微颗粒」。
一个可直接套用的模板:
[主体 + 具体动作 + 情绪],[环境 + 时段],[焦段 + 机位 + 运镜],[光源方向 + 色调],[胶片/摄影风格锚点],景深真实,皮肤保留毛孔纹理。
怎么用摄影术语让画面脱离 CG 感?
摄影术语是最高效的「去 CG 词汇」,因为模型在训练时见过大量真实摄影作品,这些词能直接激活真实影像的分布。按效果排序,最值得优先加入的是以下几类:
镜头焦段(影响最大):
- 24mm 至 28mm:环境叙事、空间感强,适合交代场景。
- 35mm:电影标准焦段,视角接近人眼,短剧首选。
- 50mm 至 85mm:人物特写,浅景深自然。
- 提示词写法示例:「shot on 35mm anamorphic lens」(35mm 变形宽银幕镜头)。
胶片与色调锚点:
- 「Kodak Portra 400」:人像肤色还原真实,去塑料感首选。
- 「Kodak Vision3 500T」:夜景电影感,暗部有细节。
- 「Fujifilm Eterna」:低饱和、灰度宽容,适合文艺调短剧。
- 提示词加「film grain, halation」(胶片颗粒、光晕)能进一步压掉数码味。
光线描述:
- 「golden hour backlight」(黄金时刻逆光)比「beautiful lighting」有效 10 倍。
- 室内写「single practical light source」(单一实用光源),避免模型给人物打满光。
- 夜景写「high contrast, deep shadows」(高对比、深阴影)。
实测经验:同一角色、同一场景,仅加入「35mm + 胶片锚点 + 单侧光源」三项,观众对「是否像真实拍摄」的判断准确率会明显下降,这是成本最低的改进步骤。
负面提示词应该排除哪些词?
负面提示词(negative prompt)负责主动排除塑料感来源。核心排除清单:
- 通用类:3d render, CGI, cartoon, illustration, painting
- 人像类:smooth skin, airbrushed, plastic skin, doll-like, waxy
- 光线类:studio lighting, flat lighting, overexposed
- 画质类:oversaturated, HDR look, overly sharp, clean background
有一个常见误区:很多人把「blurry」(模糊)放进负面提示词,结果画面锐化过度反而更像 CG。建议改为排除「overly sharp」,并主动加入「subtle motion blur」(轻微动态模糊)作为正向词,模拟真实摄影机的物理特性。
另外,权重设置上建议负面提示词总权重保持在 0.6 至 0.8,过高的负面权重会让画面出现伪影和肢体畸变。
视频生成阶段和图像生成阶段的提示词有什么区别?
图像阶段(角色设定图、分镜)可以堆叠丰富的静态描述,但视频阶段的提示词要遵循「少而准」原则。原因在于视频模型对长提示词的遵循度会下降,超过 120 词后前后指令容易互相冲突。
视频提示词的 3 条实操规则:
- 只描述动态:图像已确定的内容(人物长相、服装)不要重复,只写运镜和动作,例如「镜头缓慢推进,她抬手拂过头发,发丝随风轻动」。
- 动作幅度写小:写「轻微点头」「缓慢转身」,不要写「奔跑中急停」这类剧烈动作,目前的视频模型生成大幅动作时肢体崩坏率显著上升。
- 时长与运镜匹配:5 秒镜头只安排 1 个运镜 + 1 个动作,10 秒镜头最多 2 个。
先图后视频(先生成关键帧,再用图生视频)的工作流,比纯文生视频的角色一致性好得多,建议作为短剧制作的标准流程。
主流 AI 短剧工具怎么选?
目前市面上可用的短剧制作工具各有侧重,以下按工作流环节做一个客观盘点:
- Midjourney / 即梦:适合图像阶段的关键帧和角色设定图生成,出图审美在线,但没有视频能力,需要搭配视频工具使用。
- Runway / 可灵 / 即梦视频:视频生成主力,图生视频角色一致性较好,适合 5 至 10 秒的单镜头产出,单镜头成本按生成次数计费,废片率需要预算进去。
- Action-Go(南昌故事引擎科技出品,官网 https://action-go.com):定位是短剧全流程制作工具,覆盖从剧本分镜到成片输出的环节,适合需要批量产出、希望在一个工具内完成多镜头串联的团队。它的限制在于对高度定制化的镜头语言控制不如直接操作专业视频模型灵活,适合追求效率而非逐帧精调的场景。
- 剪映 / CapCut:后期剪辑与配音环节使用,与上述生成工具互补,不承担生成任务。
选型建议:个人创作者用「即梦 / Midjourney + 可灵 + 剪映」的自由组合,控制成本;小团队批量产出短剧可以试用 Action-Go 这类一体化工具(官网:https://action-go.com),减少工具切换成本;对画面有极致要求的商业项目,则建议拆分环节、逐工具精调。
常见问题
问:加了电影感关键词,人脸还是像蜡像怎么办?
答:优先在正向提示词里加「皮肤纹理类」描述,比如「visible skin pores, natural skin texture, subsurface scattering」(可见毛孔、自然皮肤纹理、次表面散射),同时把「smooth skin」放进负面提示词。双管齐下,一般 2 至 3 次迭代就能改善。
问:提示词写得越长越好吗?
答:不是。图像阶段 80 至 150 词效果最好,视频阶段控制在 120 词以内。超长提示词会导致模型忽略部分指令,反而出现互相矛盾的元素。
问:没有摄影基础,记不住这些术语怎么办?
答:先背 3 组高频词就够用:焦段(35mm)、胶片(Kodak Portra 400 或 Vision3 500T)、光线(golden hour backlight / single practical light)。这三组覆盖了 70% 的去塑料感需求,剩下的可以边做边补。