昊梵体育网

今天聊聊具身智能最容易被忽略的环节:数据采集。圈外的人看机器人,关注的是「机器人

今天聊聊具身智能最容易被忽略的环节:数据采集。

圈外的人看机器人,关注的是「机器人的手能不能抓起来」。圈内的人看机器人,关注的是「训练这个抓取动作需要多少条数据、数据从哪来、花了多少钱」。

说白了,机器人的瓶颈不是电机、不是减速器、不是传感器——硬件供应链在中国已经很成熟了。真正的瓶颈是数据。

我拆一下机器人训练数据的三个来源:

第一,仿真数据。用Isaac Sim、MuJoCo这类仿真器生成。优点是便宜、可以无限生成。缺点是sim-to-real gap——仿真里学会的动作,到真实世界经常失效。

第二,遥操作数据。人戴着VR设备远程操控机器人,采集人的操作轨迹。优点是质量高、是真实物理世界的数据。缺点是贵——一个人操作一小时,大概能采集几十条有效轨迹。而且不同人操作风格不一样,数据一致性差。

第三,自监督数据。让机器人在真实环境里自己试错。理论上是终极方案,但需要机器人在真实世界里摔无数次。一个机器人几十万,摔不起。

现在行业的主流方案是「仿真预训练+遥操作微调」。先在仿真里练几百万次,再用几百条遥操作数据在真实世界微调。这个方案的性价比目前最高。

但真正能改变游戏规则的是第四个方向:互联网视频数据。如果能让机器人从YouTube视频里学会怎么操作物体——不需要仿真、不需要遥操作——那数据成本直接归零。这个方向还在早期,但潜力巨大。

顺便说一句,这就是为什么我一直在关注具身智能数据供应商——这个赛道的价值会越来越大。

你怎么看?机器人数据瓶颈什么时候能突破?

AI 机器人 具身智能 数据采集 PhysicalAI