昊梵体育网

[RO]《Towards Predictive, Aligned, and Sc

[RO]《Towards Predictive, Aligned, and Scalable Robot Learning》P Tang, S Xie, B Huang, B Sun… [Astribot Team] (2026)

在通用机器人学习领域,VLA模型常受困于低级信号重建与高级语义控制间的断层。过去的方法依赖显式推理导致高延迟,或因动作标记化缺乏物理常识,本质原因是未能将动作逻辑锚定在环境演化的预测空间中。

本文的核心洞见是:将动作生成重新看作在潜空间内对世界动力学的“隐式推理”。通过三阶段对齐协议,模型在生成动作前先投影物理世界的潜状态演变,使动作标记从纯运动学参数升华为具备语义深度与预测能力的认知单元。

这项工作留下的遗产是确立了“潜世界-动作模型”作为具身智能缩放的新范式。它为利用海量人类视频实现跨模态迁移打开了新门,但尚未跨过的门槛是潜空间预测在极端精细操作中对毫米级误差的闭环容忍度。

arxiv.org/abs/2607.11270 机器学习 人工智能 论文 AI创造营