昊梵体育网

小米三天三连炸:10万小时数据验证机器人Scaling Law,U0+...

小米三天三连炸:10万小时数据验证机器人Scaling Law,U0+Robotics-1造了一个自己喂自己的飞轮

7月16日,小米发布第二代具身基座模型Xiaomi-Robotics-1,基于10万小时真实世界操作数据预训练,搭配约1.1万小时跨本体数据后训练,单张4090推理延迟仅80ms。这是小米具身智能三天三连发的压轴之作——14日机器人本体进厂实习,15日38B世界基础模型U0开源,16日Robotics-1收官。分开看是三个点,连起来是一套能自己转的系统。
先说核弹级的数据。10万小时不是仿真数据,是自研UMI便携设备在1700多个家庭、商业、工业场景里手把手采集的人类真实操作轨迹——人怎么拿东西、怎么整理空间、怎么通过连续动作改变环境状态。面对这种量级的数据人工标注完全不可行,小米搭了一条基于VLM的自动标注流水线,两周完成全量标注。
更关键的是,团队用这套数据完整跑通了机器人版的Scaling Law验证:数据从2500小时扩到2万小时,模型从2B扩到10B,动作预测损失持续下降,真实任务成功率同步提升。这是国内首次在机器人策略模型上系统证明"堆数据、堆参数,能力可预测增长"——此前这条规律只在语言模型上被反复验证过。
双阶段训练范式设计得也干净。预训练阶段从10万小时中学通用动作表征,不绑具体机器人型号;后训练阶段做两件事——本体对齐(把通用能力映射到真实机器人控制空间)和指令对齐(让模型听懂自然语言)。效果很直接:在完全未见过的真实家庭环境中,模型能直接根据自然语言完成鞋柜收纳、桌面整理、沙发收拾。四个新任务对打行业标杆Pi-0.5——手机打包、打印机加墨、衣物装载、箱子打包——平均不到10小时微调数据,Xiaomi-Robotics-1总体成功率75%,Pi-0.5只有40%。数据加到40小时,拉大到85%对53%。
榜单同样不讲情面:RoboDojo以13.93%成功率登顶(前最优8.80%),RoboCasa365以57.4%碾压前纪录46.6%,VLABench和RoboCasa全部SOTA。
但13.93%这个数字本身就说明问题——当前全球最好的机器人策略模型,八次任务里有七次搞不定。Scaling Law被证实了,但Scaling到哪才算够,没人有答案。
真正有意思的是闭环设计。U0不是控制机器人的模型,是给Robotics-1造训练数据的引擎——38B参数,统一覆盖场景生成、轨迹迁移、交互视频、图像编辑四大任务,WorldArena 126款模型中总分第一。
实测效果一针见血:用U0生成增强数据后,Pi-0.5在分布外场景的成功率从36.9%跳到63.2%,近乎翻倍。一个专门做机器人场景的模型,在跨视角几何一致性和动作保真度上甚至胜过了闭源的GPT-Image 2.0。
三天的逻辑串起来就是:机器人进厂跑出真实问题→U0把有限数据扩展到更多环境、光照和本体→Robotics-1从更大更复杂的数据里重新训练变强→进更多工站、产生新一轮问题。自己喂自己,飞轮转起来了。
从2021年的铁蛋到2022年的铁大,再到如今第一代Robotics-0和第二代Robotics-1,小米用五年时间完整打通了"本体—数据—模型"的全栈闭环。
具身智能的终局如果真是软硬件数据一体化的系统战,小米这次亮的是整套牌。项目已开源,GitHub和HuggingFace可下载。