[RO]《See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models》B Lee, D Hwang, D Kim, H Lee… [KAIST AI] (2026)
在机器人操控领域,视觉观测的相机坐标系与动作输出的机器人坐标系之间的“空间错位”是一个悬而未决的难题。过去的方法受困于视角变化导致的泛化失效,本质原因是模型在被迫学习一种随相机位置改变而不断变化的观测-动作映射,而非物理空间的恒定几何关系。
本文的核心洞见是:把深度信息重新看作以机器人末端执行器为中心的像素级三维坐标图。由此,将三维几何坐标直接注入预训练模型的二维像素网格这一关键操作,使模型能够以统一的机器人视角感知环境。这消除了相机位置的干扰,让模型在不同视角下都能捕捉到一致的物理空间坐标。
这项工作真正留下的遗产是证明了“坐标系对齐”在具身智能感知中的基础性地位。它为利用异构相机数据实现大规模机器人学习打开了新门,通过极简的架构改动实现了跨视角的鲁棒性。但尚未跨过的门槛是该方法仍高度依赖精确的相机外参标定,在无标定或相机动态移动的复杂场景下仍面临挑战。
arxiv.org/abs/2607.11498 机器学习 人工智能 论文 AI创造营








