[RO]《Patch Policy: Efficient Embodied Control via Dense Visual Representations》G Zhou, Z J Cui, A Langford, B Tan… [New York University] (2026)
在机器人学习领域,高精度操作受困于视觉信息的极端压缩。传统方法将图像简化为全局向量,丢失了操作所需的空间细节;而新兴的视觉-语言-动作模型(VLA)虽保留了细节,却因参数量庞大导致推理迟缓,难以满足高频闭环控制的实时性需求。
本文的核心洞见是:机器人控制所需的几何感知已蕴含在预训练 ViT 的密集特征块中,无需庞大的语言模型外壳。通过引入块因果注意力掩码(Block-causal Mask),该方法直接在策略层消耗原始 Patch 标记,在维持时间因果律的同时,以极小的计算开销还原了被压缩掉的关键空间维度。
这项工作证明了空间密度而非模型规模才是精准操纵的瓶颈,为利用视觉大模型成果提供了轻量化范式。它以 0.7% 的参数量超越了主流 VLA 的性能,实现了毫秒级响应。但密集标记带来的序列长度增长仍是潜在的算力负担,且如何在完全冻结的特征空间下适应极端异质的视觉环境仍待探索。
arxiv.org/abs/2607.18236 机器学习 人工智能 论文 AI创造营








