EGOWAM
📌 论文速读|EGOWAM:让机器人从人类第一视角视频中学会“世界怎么变化”
今天分享一篇很有意思的机器人学习论文:EGOWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data。它关注一个非常核心的问题:大量人类第一视角视频能不能真正帮助机器人学习操作任务?过去很多方法直接做 Behavior Cloning,把人类动作重定向到机器人动作空间,但问题是人手、机器人夹爪、头部相机运动、行为习惯都不一样,动作对齐很容易把“人类能做但机器人做不了”的动作也学进去,反而伤害性能。
🧠 核心思路:不只学动作,而是学世界如何演化
EGOWAM 引入 World Action Model(WAM)协同训练框架。它不再只让模型预测下一步动作,还额外预测未来场景状态。也就是说,人类数据即使动作标签不能直接迁移,也可以通过“物体怎么动、场景怎么变”来监督机器人策略的共享表示。作者认为,跨具身迁移真正应该学习的不是人类动作本身,而是动作背后的任务相关动态。
🔍 方法重点:比较三种世界表示
论文最重要的研究问题是:什么样的世界表示最适合人类到机器人的迁移?作者固定策略骨干、动作头和数据混合,只替换世界模型目标,比较了三类表示:
1️⃣ Pixel VAE:预测未来像素潜变量,作为重建基线。但像素会强烈绑定外观、背景和相机运动,迁移效果较弱。
2️⃣ DINO Features:预测语义特征,更关注物体和场景语义,因此在 OOD 物体和新场景泛化上表现最好。
3️⃣ 3D Flow:预测相机稳定化后的 3D motion flow,能够分离头部自运动和真实物体运动,在空间泛化和精确操作上优势明显。
🤖 实验:三个真实双臂任务
作者在真实双臂机器人上验证,包括 cup-on-saucer、fold-clothes、bag-grocery 三个任务,覆盖刚体操作、可变形物体操作和长时序任务。结果显示,传统 BC 在人类动作未对齐时容易退化,而 WAM 能更稳定地利用大规模野外第一视角人类数据。DINO 最高可带来约 4× 的 OOD 泛化提升,3D Flow 在域内任务上提升约 20–30%。

