今天聊聊具身智能最容易被忽略的环节:数据采集。
圈外的人看机器人,关注的是「机器人的手能不能抓起来」。圈内的人看机器人,关注的是「训练这个抓取动作需要多少条数据、数据从哪来、花了多少钱」。
说白了,机器人的瓶颈不是电机、不是减速器、不是传感器——硬件供应链在中国已经很成熟了。真正的瓶颈是数据。
机器人训练数据三个来源:
第一,仿真数据。便宜可以无限生成,但sim-to-real gap是硬伤。
第二,遥操作数据。质量高但是贵,一个人操作一小时只能采集几十条有效轨迹。
第三,自监督数据。理论上是终极方案,但机器人摔不起。
现在主流方案是「仿真预训练+遥操作微调」,性价比最高。
但真正能改变游戏规则的是第四个方向:互联网视频数据。让机器人从YouTube视频里学会操作物体——不需要仿真、不需要遥操作——数据成本直接归零。这个方向还在早期,但潜力巨大。
你怎么看?机器人数据瓶颈什么时候能突破?
AI 机器人 具身智能 数据采集 PhysicalAI