WAIC 上具身智能展馆的共识已经很清楚了——机器人要真干活,端侧大脑是绕不过去的坎。但「端侧大脑」具体怎么做、做到什么水平才算及格,之前没人给过一套完整的参照系。
面壁智能这次一口气端出来了三件东西,恰好把这件事的轮廓画出来了。先说两个模型。
MiniCPM-RobotManip,1.5B 参数的通用 VLA 模型。小,但有两点值得说。
一是记忆力。很多 VLA 模型只看当前帧做决策——让机器人按按钮 5 次,它要么按一下停、要么停不下来,因为没有前序记忆。RobotManip 把历史观测和已执行动作完整纳入判断,在专门考察上下文记忆的 RMBench 上拿了 53 分,而 π0.5 只有 10 分,接近随机水平。
二是视觉 Token 压缩。机器人做三明治这种长序列任务,三个摄像头画面持续涌入,历史信息越堆越多,计算量一路暴涨。RobotManip 把 MiniCPM-V 4.6 积累的视觉 Token 压缩能力迁移过来,计算量减半,同时靠流式计算让长记忆的推理成本和单帧反应式一样。效果是单次决策延迟约 120ms,π0.5 是 234ms,接近对方的一半。
这两个能力不是独立的——记得住 + 算得快,才能让长程操作不「断片」。
MiniCPM-RobotTrack,0.9B,负责跟踪导航。它的核心卖点就一个字:断网也能跑。现场演示拔掉了宇树 Go2 的网卡,机器狗照样能跟住指定的人,从室外到电梯到地下停车场不掉链子。单目标跟踪 89.8%、多人干扰 73.4%、模糊指令 80.4%,三项都是开源最优。关键在于一套「自进化数据管线」——模型在仿真和真机中持续暴露弱点,快速转向、短时遮挡、多人交叉这些长尾场景被不断收回训练,相当于一本会自动更新的错题本。
然后是 PhyAI 推理框架。这是三件东西里最容易忽略但最工程化的一个。它在 RTX 5090 上把 π0、π0.5、GR00T 分别加速 2.85x、1.82x、2.28x;适配 MiniCPM-Robot 后,帧率从 10.12Hz 拉到 36.77Hz。一个行业级的痛点:每发一个新模型就要从头适配一次硬件,PhyAI 在解决的就是这个问题。
场景端,面壁和乐聚做了展厅导览和园区巡检(端侧离线讲解、本地处理敏感画面),和吉利进了生产仓储(VLA + RoboHarness Agent 框架做长程任务)。不新鲜,但和模型一起看,意义不一样——1.5B 的模型跑在端侧做真实任务,这件事在工程上走通了。
一个值得注意的数字:面壁把机器人操作体验的临界线划在约 200ms。再慢,机械臂和机器狗的卡顿感就会明显增加。当前多数 VLA 基础模型都控制在 4B 以内——不是做不大,而是做大了延迟兜不住,落地就悬了。
这个逻辑和之前写 Kimi K3 和 DeepSeek V4 是通的:当能力拉到前沿之后,工程指标(延迟、成本、部署)开始重新定义竞争维度。只不过这次不是在云端,是在机器人身上。
WAIC2026面壁智能具身智能





