因为现在不少发布会都把某个 VLA 模型直接称为“大脑”,好像有了这个“大脑”,机器人就什么都能做了,人形机器人马上一飞冲天。
但逐际动力这次更新的 COSA 0.5,给出的答案挺明确。模型更像机器人掌握的一项能力,真正的大脑,应该是能把理解、记忆、规划、行动和身体控制组织起来的系统。
这次发布主要看两件事。一个是逐际首次完整介绍 COSA 的三层系统技术架构,另一个是人形 VLA 能力全面提升。前者是在解释人形大脑系统到底由什么组成,后者则通过 Demo 证明,这套系统能不能把一件事完整做完。
机器人抓起一瓶水,如今已经不算稀奇。真正难的是在“拿一瓶水”这种模糊的指令下,自己找到目标、规划路线、走过去、稳定抓取、绕开障碍,再把水送到指定的人面前。
像这次 COSA 0.5 的 VLA 提升,重点是机器人对长程移动操作任务的连续执行能力再往前走了一步。逐际把移动、避障、抓取和全身平衡放进同一条任务链里,机器人不只会完成一个动作,接下来该调用什么能力。
这背后还考验一个容易被忽视的部分,运控。
S0负责让机器人够稳。逐际的WBT 全身运动基础模型,约千万参数,以 1000 Hz 的频率在机器人本机运行,负责维持平衡并把上层目标转化为稳定的全身动作。最直观的对比就是Flexion,同样是拿取物体的移动操作,两者的稳定和丝滑程度不在一个量级。
中间的 S1 是技能层,里面装着一组可以复用的能力,VLA 只是其中一种技能。顶层 S2 负责场景理解、记忆、交互、推理和任务调度,决定机器人接下来该做什么、调用哪项技能。
COSA 再把三层串起来,让机器人既知道该做什么,也有能力把它做出来。
Figure 的家务 Demo 在精细操作和连续任务上依然是行业标杆,逐际更有辨识度的地方,是本体、运控、VLA 和上层系统全部自己做。
近期逐际完成近2亿美元 Pre-IPO 轮融资,投后估值达到150亿元。这也说明市场开始关注这类不只会做模型,还能把身体、运控和大脑系统一起推向产品的公司。
人形机器人下一阶段的竞争,可能争的就是谁能真的做出“能动、能想,能边想边动”的大脑系统,能在牌桌上的,就有这样的全栈能力的公司。




