Agility Robotics 的 AI 创新负责人 Chris Paxton,刚把 Fast-WAM 称作「可能是今年的 paper of the year」。
他的理由很直接:这篇论文正在被越来越多后续研究当作出发点,一些机器人创业公司从公开评论看似乎也在使用;更特别的是,Fast-WAM 没做具身预训练,开箱表现已经到了 Physical Intelligence 这一档。
这个评价要连着 Paxton 的身份一起看。
他现在负责 Agility Robotics 的 AI 创新,做的是把智能能力放进 Digit 这样的商用人形机器人。此前在 NVIDIA 机器人实验室、Meta FAIR 和 Hello Robot 做过机器人学习、规划以及家庭移动操作。对他来说,模型能不能进入真实机器人的控制回路,比生成的视频看起来像不像未来更重要。
Fast-WAM 是清华大学交叉信息院与银河通用今年 3 月发布的工作。它问了世界动作模型一个很直接的问题:机器人执行任务前,真的需要先把未来画面生成出来吗?
现有不少 WAM 采用「先想象、再执行」的路线:根据当前画面生成未来视频,再从想象出的结果里预测动作。道理很顺,但生成视频需要反复去噪,机器人每做一个决定都要等。
Fast-WAM 训练时仍然同时学习视频预测和机器人动作,让模型理解物体会怎么运动、接触和变化;到了真机推理,它不再把未来视频完整生成出来,而是直接使用学到的隐式世界表征输出动作。
模型以 Wan2.2-5B 视频 DiT 为底座,接入一个 1B 参数的动作专家。在单张 RTX 5090D V2 上,推理延迟为 190 毫秒,比论文中「先想象、再执行」的对照方案快 4 倍以上。
没有具身数据预训练的情况下,Fast-WAM 在 RoboTwin 2.0 和 LIBERO 上分别取得 91.8% 和 97.6% 的平均成功率。团队还在银河通用 R1 Lite 上采集了 60 小时遥操作数据,测试真实世界的长流程毛巾折叠。
消融实验更能说明问题:去掉训练阶段的视频协同学习后,模型在真实毛巾折叠任务中的成功率只剩 10%。显式生成未来视频可以删,学习世界如何变化这件事不能删。
论文也没有说自己全面超过了 Physical Intelligence。真实机器人测试里,做过预训练的 π0.5 仍然表现最好。Fast-WAM 有意思的地方,是没有具身预训练也能做到接近这一档的任务表现,同时把推理延迟降了下来。
Paxton 所说的「研究风向」,大概就在这里:世界模型的价值可能主要发生在训练阶段。机器人需要学会预测世界,但真正执行任务时,未必每走一步都要先生成一段未来视频。
训练时把世界学进去,真机上少绕一步。
Fast-WAM星海图世界模型
