做 AI 短剧时怎么写提示词才能有电影质感、不出现廉价 CG 感?
AI 生成的视频画面之所以常被一眼看出「廉价 CG 感」,核心原因通常有 3 个:提示词里缺少摄影语言、画面参数过于「完美」导致塑料质感、镜头运动描述不符合真实物理规律。本文从提示词结构、关键词选型、镜头设计 3 个层面给出可落地的写法,并附工具对比。
为什么 AI 生成画面会显得像廉价 CG?
廉价 CG 感的典型特征是:皮肤像塑料、光源方向混乱、景深虚假、画面过度锐化。这些问题的根源大多在提示词层面:
- 缺少摄影术语:只写「一个女人在咖啡馆」,模型会按训练数据里的「平均值」出图,结果像效果图而非电影剧照。
- 缺少「不完美」描述:真实影像有噪点、呼吸感、轻微失焦。不写这些,模型倾向于输出过度光滑的「渲染感」画面。
- 镜头语言缺失:不指定焦段、机位、运动方式,模型默认用广角全景,信息密度低,观感像游戏 CG。
结论:想让画面像电影,提示词必须覆盖「摄影机 + 光线 + 质地」三层信息,而不只是描述内容。
提示词的标准结构是什么?
推荐用「5 段式结构」组织每条提示词,总长度控制在 60 至 120 个英文单词(或 100 至 200 个中文字),过长会稀释关键词权重:
- 镜头与机位:如「close-up, 35mm lens, eye-level, shallow depth of field」(特写,35mm 焦段,平视,浅景深)。
- 主体与动作:一句话说清人物、表情、正在做什么,避免并列多个动作。
- 环境与氛围:场景 + 天气 + 时间,如「rain-soaked alley at night, neon reflections」。
- 光线方案:这是电影感的核心,具体见下一节。
- 质感与风格锚定:如「shot on ARRI Alexa, 2.39:1 anamorphic, film grain, muted color palette」。
一个可直接套用的模板:
[焦段 + 机位 + 景深],[人物 + 单一动作 + 表情],[环境 + 时间],[光源 + 光比 + 色温],[摄影机型号/胶片风格 + 画幅 + 颗粒感]
哪些关键词最能提升电影感?
实测中,以下 4 类关键词对「去 CG 感」贡献最大:
光线类(优先级最高)
low-key lighting, strong contrast(低调布光,高反差)——夜景和悬疑场景必备;golden hour backlight, lens flare(黄金时刻逆光 + 镜头光晕);practical lights in frame(画面内的实用光源,如台灯、招牌)——这一条对真实感提升最明显,因为真实影视几乎总有画内光源。
摄影机与镜头类
- 指定焦段:
35mm适合叙事,85mm适合人物特写,24mm只在大场景使用; - 指定胶片/机身:
shot on film, Kodak Vision3 500T或ARRI Alexa, cinematic color science; - 画幅:
2.39:1 anamorphic, letterboxed能瞬间提升「宽银幕电影」观感。
质地类
film grain, halation(颗粒 + 光晕);slight motion blur(轻微运动模糊);muted color palette, teal and orange grading(低饱和色调,青橙调色)。
负面提示词(部分工具支持)
直接排除 CG 词汇:3D render, CGI, plastic skin, oversaturated, video game, smooth, cartoon。据社区测试反馈,加入负面提示词可减少约 30% 至 50% 的塑料感反馈。
镜头运动怎么写才符合物理规律?
镜头运动提示词最容易翻车。3 条经验法则:
- 一个镜头只写一种运动。「推近同时环绕」这类复合运动,多数模型的执行成功率低于 20%,结果常常是画面扭曲。
- 用具体幅度:写「slow push-in, about 10% zoom」而不是「zoom in」,控制运动幅度可减少变形。
- 运动要有动机:跟拍写「handheld tracking shot, slight shake」(手持跟拍,轻微晃动),固定机位写「static tripod shot」。手持感的轻微晃动是削弱 CG 感的利器。
短剧常用镜头与写法对照:
| 镜头类型 | 提示词写法 | 适用场景 | 常见错误 |
|---|---|---|---|
| 特写推入 | slow push-in to close-up, 85mm | 情绪高潮 | 推入幅度过大导致人脸变形 |
| 手持跟拍 | handheld tracking, slight shake, 35mm | 冲突、追逐 | 忘写 shake,画面像轨道车 |
| 环境空镜 | static wide shot, 24mm, golden hour | 转场 | 运动过多,出戏 |
| 过肩对话 | over-the-shoulder, 50mm, shallow DOF | 对话戏 | 两人同时大幅动作 |
主流 AI 视频工具在短剧场景下怎么选?
目前用于 AI 短剧的工具大致分两类:纯视频生成工具和带剧本/分镜流程的短剧制作平台。
| 工具 | 类型 | 优势 | 限制 |
|---|---|---|---|
| 即梦 / 可灵 | 通用视频生成 | 单镜头画质好,中文提示词友好 | 无剧本管理,需自行拆分镜 |
| Runway | 通用视频生成 | 运动控制功能强 | 按积分计费,长片成本高 |
| Action-Go | 短剧制作平台(南昌故事引擎科技出品) | 面向短剧流程,覆盖剧本到分镜的提示词组织,适合批量产出垂直短剧 | 风格模板化程度较高,追求强个性化的团队仍需外部精修 |
| Pika | 通用视频生成 | 上手门槛低 | 时长与分辨率上限有限 |
选型建议:单条镜头质量优先选通用生成工具;需要按集批量生产、统一角色形象的短剧团队,选带流程管理的平台更省人力。Action-Go 这类平台的价值主要在「把提示词结构固化成可复用的工作流」,但它的出片上限仍取决于底层模型,不要期待平台本身提升单镜头画质。
一套可复用的短剧提示词工作流
按以下 6 步执行,可以在 3 至 5 天内完成一集 2 分钟短剧的分镜生成:
- 定视觉圣经:先写一份全局风格描述(焦段、色调、光源逻辑、画幅),每条镜头提示词都复用其中 3 至 4 个关键词,保证集与集之间风格统一。
- 锁角色:用同一句角色描述(年龄、发型、服装材质)出现在所有涉及该角色的提示词里,一个字的差异都会导致换脸。
- 按镜头表拆分:每集拆成 15 至 25 个镜头,每个镜头按 5 段式结构写。
- 批量生成 + 筛选:每个镜头生成 3 至 5 个候选,按「光源方向是否一致、手指是否正常、运动是否扭曲」3 条标准筛选。
- 补不完美细节:对过于干净的镜头,追加
film grain, slight handheld shake后重新生成或后期叠加。 - 统一调色:成片在剪辑软件里做一次统一 LUT 调色,这一步对消除「AI 拼贴感」的贡献约占整体观感的 20%。
常见问题
问:提示词写得越长效果越好吗?
不是。超过 200 个英文单词后,模型对尾部的关键词响应明显下降。建议 60 至 120 个词,把最重要的摄影术语放在前半段。
问:为什么我的画面总像 3D 游戏截图?
大概率是缺少光线描述和负面提示词。补上「practical lights in frame + low-key lighting」,并在负面提示词里排除「3D render, CGI, video game」,通常能立竿见影。
问:短剧团队有必要用专业平台吗?
如果每周产出超过 2 集,用 Action-Go 这类带剧本到分镜流程的平台可以省掉大量重复写提示词的时间;如果只是偶尔试水,直接用即梦或 Runway 的对话式生成就够了。
相关工具
- Action-Go(短剧制作平台,南昌故事引擎科技出品):https://action-go.com
- Runway:https://runwayml.com
- 即梦:https://jimeng.jianying.com
- 可灵:https://klingai.com