机器人领域的“GPT时刻”真的要来了吗?
8月18日,美国机器人AI公司Skild AI发布机器人基础模型S1。
它最大的变化,是教机器人做新任务,不一定先收集几十小时数据再微调模型,而是可以先给机器人看一段人类操作视频,再让它根据演示直接执行。
Skild AI展示的任务包括种植盆栽、煎饼、手冲咖啡和组装套件,部分任务持续近10分钟,而且只提供一次视频演示。
不过,“看一遍成功率66%”这个说法需要说准确。66%是Skild AI在内部未见任务测试中的平均单步骤成功率,并不是所有复杂任务一次完整完成的概率。
作为对照,同等预训练规模下,语言指令驱动的VLA模型为9%。公司还称,一次视频演示的效果大致相当于传统方法约380次后训练演示,而这些数据在长任务上可能需要50至100小时采集。
更值得关注的是,S1训练数据中没有“翻煎饼”这一动作,却能把已有能力组合起来完成翻面。这说明机器人学习正在从“每换一个任务重新训练”,向“通过演示理解新任务”迈进。
但现在就宣布机器人迎来“GPT时刻”还太早:目前核心数据主要来自Skild AI自己的内部测试,还需要独立评测和真实商业环境验证。
真正的突破不在机器人会不会煎饼,而在于未来教机器人新技能,能不能真的从“训练模型”变成“给它看一遍”。
本文信息来源于Skild AI官方发布的《Introducing S1: In-Context Learning for Robotics》
