[RO]《RoboTTT: Context Scaling for Robot Policies》Y Jiang, Y Chebotar, R Zheng, F Hu… [NVIDIA] (2026)
在机器人基础模型领域,长程任务的闭环控制是一个悬而未决的难题。过去的方法受困于单步或短时视觉运动上下文(通常仅限于 2-8 帧),本质原因是传统架构(如 Transformer)在处理长序列时推理延迟随长度激增,且难以从冗余的机器人流数据中有效提取关键状态。
本文的核心洞见是:把机器人的动作序列建模重新看作一个带“快速权重”的循环过程。由此,集成测试时训练(Test-Time Training, TTT)这一关键操作使问题得以解开:它通过在推理过程中利用梯度下降动态更新模型参数,将长达 8000 步的历史压缩进权重空间,实现了推理成本恒定且容量巨大的长程记忆。
这项工作真正留下的遗产是证明了上下文长度可以作为机器人基础模型的一个全新缩放轴(Scaling Axis)。它为后来者打开的新门是实现了从人类视频一键学习(One-shot)以及在线策略自我改进,但尚未跨过的门槛是训练长序列带来的计算开销巨大,且目前仍需依赖高质量的演示数据来引导测试时的权重演化。
arxiv.org/abs/2607.15275 机器学习 人工智能 论文 AI创造营








