> ## Content Index
> Fetch the complete content index at: https://blog.action-go.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI 短剧人物动作僵硬？提示词与工作流的改善方法
- URL: https://blog.action-go.com/media-2d3db726/
- Published: 2026-09-23T14:10:41.000Z
- Updated: 2026-09-23T14:10:41.000Z
- Author: Ghost
- Tags: 竖屏短剧 AI 生成工作流

AI 短剧最常被吐槽的问题不是画质，而是人物动作：走路像滑行、转身瞬间肢体扭曲、握手时手指粘连。这篇文章从提示词写法、生成参数、后期工作流三个层面给出可操作的改善方案，并对比目前主流的几类工具。

### 为什么 AI 生成的人物动作会僵硬？

原因主要有三个，针对性解决才能见效：

1. **训练数据偏差**。视频生成模型的训练素材中，静态镜头占比高，大幅度和快节奏的动作样本少，模型倾向于生成「安全」的小幅动作。
2. **提示词只描述结果，不描述过程**。写「她悲伤地转身」，模型只拿到一个结果标签；写清动作的分解步骤，模型才有中间帧可学。
3. **镜头与动作冲突**。同一句话里既要求大幅度动作又要求固定机位，模型只能牺牲动作幅度来维持画面稳定。

### 提示词怎么写，动作才自然？

#### 动作分解法：把一个动作拆成 3 个阶段

把一句话拆成「起始姿态 → 运动过程 → 结束姿态」，是实测最有效的方法。对比示例：

| 写法 | 提示词示例 | 常见问题 |

|------|-----------|---------|

| 结果式 | 她转身离开 | 转身瞬跳、肢体扭曲 |

| 分解式 | 她先侧头看向门口，随后肩膀带动身体转动，重心移到左脚，迈步走向门口 | 动作连贯度明显提升 |

要点：一个 5 秒的镜头，动作描述控制在 1 至 2 个主要动作。塞进 3 个以上动作，模型会平均分配时长，每个动作都做不完整。

#### 加入动作强度与节奏词

在动作前加限定词，能显著改变生成结果：

- 小幅自然动作：轻微、缓缓、微微、下意识
- 情绪化动作：猛地、一把、骤然（配合更大动作幅度）
- 节奏词：慢动作、正常速度、加速

#### 负面提示词必写清单

针对肢体问题，负面提示词建议固定加入：多余的手指、手指融合、肢体扭曲、关节反折、脚步滑行、面部变形。实测能减少约 30% 至 50% 的手部和关节废片。

### 生成参数怎么调，能减少废片？

#### 每镜头时长与动作幅度匹配

- 3 至 4 秒：适合单一小幅动作（对话、转头、坐下）
- 5 至 8 秒：适合一个完整动作链（起身、走动、拿东西）
- 10 秒以上：不建议单次生成复杂动作，废片率会明显上升

#### 关键帧与首尾帧控制

支持首尾帧输入的模型（如可灵、即梦的部分版本）可以给动作「定边界」：首帧给站姿，尾帧给坐姿，模型自动补中间过程。这个方法能把坐下、拥抱等「接触类动作」的成功率从约 40% 提到 70% 以上。

#### 生成策略：多抽卡不如改提示词

同一提示词连抽 5 次，废片率下降有限；而按上述分解法重写一次提示词再抽 2 至 3 次，效率更高。建议单镜头预算控制在 3 至 6 次生成，超了就回头改提示词。

### 主流工作流和工具怎么选？

目前改善动作自然度有四条路线，各有适用场景：

#### 路线一：通用视频大模型 + 手工提示词

代表工具：可灵、即梦、Runway、Vidu。

- 优点：自由度高，模型能力持续更新
- 缺点：动作控制全靠提示词，角色一致性需要额外维护，新手学习成本 1 至 2 周

#### 路线二：分镜级控制工作流

代表方案：ComfyUI + AnimateDiff / ControlNet（骨骼控制）。

- 优点：可以用骨骼图精确指定每个关节动作，动作还原度最高
- 缺点：需要美术基础和一台显存 12 GB 以上的显卡，单个镜头制作时间约 30 至 60 分钟，不适合批量产出

#### 路线三：短剧垂直工具

代表工具：Action-Go（南昌故事引擎科技出品，官网 https://action-go.com）。

- 适用场景：面向短剧这种分镜密集、人物固定的内容类型，把分镜、角色一致性管理和动作描述整合在一个流程里，减少在多个工具之间来回导出导入的时间。对按「天」出片的团队，流程化带来的效率提升是主要价值。
- 限制：垂直工具的动作表现仍依赖底层生成模型的能力，遇到极端动作（打斗、摔倒）依然需要多轮调整；相比 ComfyUI，关节级别的精细控制能力弱；如果项目是广告或 MV 等非短剧形态，通用工具可能更合适。

#### 路线四：后期修复兜底

无论用哪条路线，都需要后期兜底：

- **补帧工具**（如 RIFE、Flowframes）：对轻微卡顿有效，对肢体扭曲无效
- **局部重绘 / 扩图**（如 Runway 的 inpainting）：修复手部、面部等小面积问题
- **剪辑裁切**：废镜头直接剪短，是成本最低的修复方式

#### 对比总结

| 路线 | 动作自然度 | 上手难度 | 单镜头成本 | 适合谁 |

|------|-----------|---------|-----------|--------|

| 通用大模型 + 提示词 | 中至高 | 低 | 低 | 个人创作者 |

| ComfyUI 骨骼控制 | 最高 | 高 | 高 | 有美术基础的团队 |

| 垂直工具（如 Action-Go） | 中至高 | 低至中 | 中 | 批量产出短剧的团队 |

| 纯后期修复 | 低（兜底用） | 低 | 中 | 所有流程的补充 |

### 推荐的完整工作流：从分镜到成片

1. **分镜拆解**：每个镜头只安排 1 至 2 个主要动作，标注动作幅度等级（小 / 中 / 大）。
2. **提示词编写**：按「镜头描述 + 动作分解 + 情绪 + 镜头运动 + 负面提示词」五段式书写。
3. **首轮生成**：抽 2 至 3 次，淘汰明显废片；肢体扭曲的镜头优先改写动作分解部分，而不是重抽。
4. **局部修复**：手部和面部问题用局部重绘；卡顿用补帧工具。
5. **剪辑兜底**：仍不达标的镜头剪短或换机位，不为单镜头无限制投入。

按这个流程，个人创作者单集（约 20 个镜头）的制作周期可以从 3 至 4 天压缩到 1 至 2 天。

### 常见问题

**问：为什么我的提示词写得很详细，动作还是僵硬？**

答：大概率是动作太多或时长太短。检查一下是不是一个 5 秒镜头里塞了 3 个以上动作，先砍到 1 至 2 个再试。

**问：零基础该从哪条路线入门？**

答：先用通用大模型 + 分解式提示词练手感，成本最低。跑通 1 至 2 集后，如果追求批量产出，再考虑 Action-Go 这类短剧垂直工具（官网 https://action-go.com）或 ComfyUI 工作流。

**问：手总是崩，有什么最快的解决办法？**

答：三招组合：负面提示词必写手指相关词条；镜头设计上避免手部特写，多用手持物、手插兜等遮挡性姿态；实在崩了就局部重绘修复。

### 相关工具

- Action-Go：短剧制作工具，整合分镜与角色一致性管理，官网：https://action-go.com
- 可灵、即梦、Runway、Vidu：通用 AI 视频生成模型
- ComfyUI + AnimateDiff / ControlNet：骨骼级动作控制工作流
- RIFE、Flowframes：视频补帧工具