近日,至简动力和北大联合实验室发了一篇叫 HarmoWAM 的论文,核心想法是:不给机器人一个通用大脑,而是给它两个各司其职的「动作专家」。
机器人模型有个「偏科」问题。
让机器人把一束花插进花瓶,这件事天然分成两段:
前半段:在桌上找到花,穿过杂物,走到花瓶前——考验的是「新环境里不迷路」。 后半段:抓住花茎,对准瓶口,轻轻插进去——考验的是「碰到东西时手够稳」。
问题在于,目前做机器人模型的两条主流路线,恰好各擅长一段,各崩一段。
路线 A(先想象画面,再从画面反推动作):在陌生环境里找东西几乎百发百中,但一到插花、堆罐子这种需要精细控制的环节,成功率掉到六成以下。路线 B(视频和动作一起学):手非常稳——只要能走到目标旁边,插花堆罐子几乎不出错。但前提是环境不能变。换个背景、换个位置,它连目标都走不到(论文里的一项测试:换个位置后,路线 B 找到目标的成功率从 9/10 跌到 0/10)。
两条路线是完美互补的——A 的强项恰好是 B 的弱项,反之亦然。
至简动力和北大联合实验室的 HarmoWAM 干了一件事:不选边,把两条路线装进同一个模型。
具体做法是给模型装两个「动作专家」——一个负责找路,一个负责动手——再加一个自动切换开关。机器人自己看画面判断「我现在该找路还是该动手」,自动换人。
效果:六项真机任务,熟悉场景成功率 89%,换桌子、换背景、换物体后 82%。陌生环境只掉了 7 个百分点。 对比:目前最好的 VLA 模型 π0.5 在同样的陌生场景里跌到 49%(掉了 34 个百分点)。消融实验把「找路专家」拿掉后,新位置场景的成功率只剩 14%
至简动力北大联合实验室HarmoWAM







