昊梵体育网

机器人基础模型的训练数据该怎么配,X 上刚发生了一场很具体的辩论。Joe Don

机器人基础模型的训练数据该怎么配,X 上刚发生了一场很具体的辩论。

Joe Dong 提了一个直接的问题:ego(第一人称/自我中心数据)和 UMI(灵巧手操作数据),为什么不混着用?预训练跑 ego,mid-training 接 UMI,尤其是灵巧手的 UMI 数据。

Danfei Xu 的回复简练:混合数据源会引入复杂性和任意的设计选择,可能不具备可扩展性。要触碰最优渐近线,简单性非常重要。

到这里看起来是两种路线之争:要规模还是要简单。

但 Joe Dong 追了一句关键的话:EgoScale 自己的论文里,mid-training 也用了 glove 数据和 teleOp 数据。很难想象能跳过这类高动作保真度数据,只用 ego 就把机器人基础模型训出来。

这里的信息量比前半段大得多。Danfei Xu 正是 EgoScale 的核心作者之一。他在讨论里坚持「简单性」,但 EgoScale 论文的工程实现里,已经在 mid-training 阶段接入了高保真动作数据。

这不叫自相矛盾。EgoScale 论文的工程选择至少说明一件事:即便是最推崇 ego 数据路线的团队,在实验层面也没打算只用 ego。公开表达上先守住原则,工程上该用的还是会用。

这场讨论真正揭示的不是 ego 好还是 UMI 好,而是机器人数据争论正在从「要不要混」进入「什么阶段混什么、混多少」的配方阶段。配方之所以是配方,就是你得调,调的过程里很难保持纯粹。

机器人模型EgoScaleUMI