腾讯 Robotics X 和混元团队 7 月 15 日发了两个具身智能基座模型,都已开源。
VLM 基座 Hy-Embodied-VLM-1.0 比较好理解:3B 参数在 37 个评测任务上跑出和上一代 32B 旗舰差不多的分数,计算量只有十分之一。适合往端侧放。
更值得拆的是 RxBrain。
做具身智能现在大致两条路:VLM/VLA 擅长用语言推理「下一步做什么」,但目标状态长什么样是模糊的,做完没有往往得靠额外模块判断;视频生成世界模型能预测未来画面,但讲不清任务逻辑和约束。两条路各有盲区。
RxBrain 让文本推理和视觉想象在同一个认知序列里交替进行——语言负责分解任务、说约束,目标图像负责描述每一步做完后世界应该变成什么样。不是两个模块各做各的再拼起来,而是在同一上下文里来回生成,上一轮输出重新进到下一轮规划里。
按团队数据,6.2B 参数,5 万小时具身数据训练。真机测了三个操作任务——摆餐具、折眼镜、丢垃圾,平均成功率 87%。对比之下 π0 是 68%,π0.5 是 82%。不过这是团队自己的评测,任务也只有三个。
主要瓶颈在目标图像质量(0.52 分),规划步数一长,综合得分从两步的 0.69 掉到八步的 0.55。视觉想象走远了会漂,这个问题还没解决。
目前这两个模型在GitHub和HuggingFace都能下载到。
具身智能腾讯混元腾讯Robotics X








