[RO]《RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination》H Liang, M Chen, Y Huang, Y Guo… [Tencent Robotics X Team] (2026)
在具身智能领域,将抽象任务逻辑与具体物理状态对齐是一个悬而未决的难题。过去的方法受困于视觉理解与视频预测的脱节,本质原因是系统无法在生成指令的同时,实时“想象”出动作完成后应达到的物理图景。
本文的核心洞见是:把具身规划重新看作语言与视觉交织的单一序列。由此,混合 Transformer 架构下的“联合想象”操作使问题得以解开:语言负责拆解逻辑与约束,而视觉生成则在同一序列中同步合成每一规划步骤对应的物理状态转换。
这项工作真正留下的遗产是实现了具身认知中推理与感知的闭环融合。它为后来者打开的新门是无需大规模动作数据预训练即可实现复杂的机器人操控,但尚未跨过的门槛是长程规划中多步迭代带来的误差累积风险。
arxiv.org/abs/2607.14187 机器学习 人工智能 论文 AI创造营








