昊梵体育网

可交互视频生成是从"视频生成"走向"世界模型"的关键一步。核心就两个问题:动作怎

可交互视频生成是从"视频生成"走向"世界模型"的关键一步。核心就两个问题:动作怎么注入模型?相机位移怎么注入模型?今天全解析👇
🎯 动作注入的5种方式
1. 离散动作注入
有限集合的动作(前进/后退/左转/右转/跳跃/攻击),直接编码成action id→action embedding。
优点:简单清晰,适合游戏环境;缺点:表达能力有限。
2. 连续动作注入
连续数值动作(机械臂关节角度、末端位姿、移动速度、相机平移旋转),通过MLP/linear projection变成action embedding。
优点:表达精细;缺点:训练更难,对数据标注和归一化要求高。
3. Action Token
既然视频帧是token、文本是token,动作也可以是token!每个时间步对应一个action token,模型生成视频token时同时看到动作token。统一建模,方便扩展多模态。
4. Action Embedding
把动作编码成向量,可以通过多种方式进入模型:加到视频token上、作为cross-attention的key/value、作为adaLN/FiLM条件、作为额外token拼接、作为每层Transformer的条件输入。
5. Cross-Attention注入
视频token通过cross-attention读取动作条件,模型可以根据不同时间步、不同空间区域动态决定关注哪些动作信息。条件表达能力最强。
📷 相机注入的核心概念
- Camera Pose:相机在3D空间的位置和朝向(位置、旋转矩阵、四元数、内外参、轨迹)
- Ego-Motion:观察者自身运动带来的画面变化(向前走、转头、抬头、绕物体移动)
- View Control:用户明确控制视角(向左看、靠近物体、绕角色旋转、进入房间)
- 相机平移vs旋转:平移更容易暴露场景几何问题(要生成新区域),旋转更容易暴露长期一致性问题(反复看同一区域要记住内容)
动作控制≠相机控制!动作控制强调智能体对世界的影响(可能改变世界状态),相机控制强调观察视角的变化(不一定改变世界本身)。第一人称游戏中二者会耦合,看论文时一定要区分清楚。
可交互视频生成 动作注入 相机控制 世界模型 AI论文