昊梵体育网

昨天刷到一条消息,愣了好几秒。 宇树科技直接开源了一个60亿参数的VLA多模态

昨天刷到一条消息,愣了好几秒。

宇树科技直接开源了一个60亿参数的VLA多模态基座模型——不是那种论文挂个链接的"伪开源",是模型权重、推理代码、真机数据集全打包放出来的那种。

VLA跟之前炒得火热的VLM不是一回事。VLM是"看懂图、理解文字",VLA多走了一大步:把视觉、语言、动作三件事塞进同一个模型,自然语言下指令,摄像头看环境,模型直接输出机器人关节该怎么动。

说白了,以前的机器人模型只能"看",现在这个能"看+想+做"。

60亿参数听起来吓人,但更关键的数字是:2500小时真机采集数据,500万条具身推理样本,单模型覆盖64类任务——倒垃圾、叠毛巾、拧瓶盖、铺床、厨房收纳,从全身移动到桌面精细操作,一套模型全搞定。

连灵巧手和平行夹爪都兼容,不用给每种机械手单独训练。

我为什么关注这个?

因为我每天靠AI跑工作流,太清楚"基座开源"四个字的分量了。

两年前做大模型应用,你要自己训模型或者花大价钱调API。DeepSeek用500万美元训出媲美GPT-4的模型之后,整个成本结构被掀翻了。现在宇树把同样的打法搬到了具身智能——最贵的那层基座,直接免费。

过去做机器人创业,三个坑得同时填:硬件、AI算法、数据采集。光训练数据这一项,采集一小时高质量机器人遥操作数据,设备加人力加调试就是一笔不小的开支,小团队根本扛不住。

现在基座模型+配套数据+开发框架一起放出来了。个人开发者和小型创业团队不用再从零训模型,在这个基座上针对自己的场景做微调就行。

我的判断:具身智能的竞争正在从"谁的模型强"转向"谁更懂场景"。

模型免费了,但场景数据没有捷径。工厂里焊接工人手势的微小差异,家庭环境里非标物品的抓取角度——这些东西大厂通用数据集里根本没有。

谁能在自己的细分场景里积累到高质量操作数据,谁就拿到了护城河。这跟大模型生态一模一样:开源模型人人能用,但真正把模型用好的人,赢在对垂直场景的理解深度。

说实话,这是我今年看到的对个体开发者最友好的信号。

具身智能现在就像2023年初的大模型——基座开始开放,应用层一片空白。当年有人专门给医院做CT影像微调模型,有人专门给工地做安全检测,靠细分场景活得很滋润。

机器人的"细分场景红利期",可能比我们想象的来得更快。

你觉得,机器人领域最先被个人开发者拿下的场景会是什么?工业巡检还是家庭服务?