昊梵体育网

穆尧SeeAct AI具身RSI连接模型物理世界对谈

「In the LOOP」栏目是 Research AI+社区推出,面向Frontier 领域青年研究者的专访栏目,带领大家亲临 100 位 Researcher 的思想现场。Keep everyone In the LOOP!

👀 AlphaGo 能靠自己下棋超越人类,具身 RSI 能不能让机器人靠自己“干活”越练越聪明?
🤔 给它接上更强的大模型,可能还只是开始。
👂 听说有一部2008 年的国产科幻电视也许影响了穆尧老师的具身理想?

Research AI+ 跟 SeeAct AI 创始人,也是深受大家喜爱的穆尧老师@穆尧_YaoMarkMu 进行了深度对谈:GPT-6 Astra 之后, SeeAct AI 将如何让机器人🤖 不只学人类的“标准答案”,而是从自己的探索、失败和纠错中持续进化,然后成为连接模型和物理世界的 Super Intelligence 💪💪💪

如果机器人叠衣服时,衣角突然从夹爪里滑了出来,它接下来该怎么办?

对人来说,这可能只是一个下意识的补救动作:重新抓住,再继续。但对机器人来说,这种“不按剧本发生”的瞬间,往往才是真正困难的部分。

今天具身智能的大量数据,仍然来自人类示范、遥操作和人工采集。它们告诉机器人,人是怎么把一件事情做对的。但如果抓偏了、物体滑落了,或者执行到一半,现实世界已经偏离了训练数据里的“标准答案”呢?

穆尧关心的,是机器人能不能开始积累属于自己的 experience:不只是失败和纠错,而是它真正进入环境之后探索过哪些状态、做过哪些尝试、什么有效、什么无效,以及偏离之后如何把任务继续做下去。

在他看来,未来真正需要被 scale up 的,不能永远只是人类提供的 demonstration,还应该包括机器人自身与物理世界交互产生的经验。

这也是他现在反复谈到的一个概念:具身 RSI(Recursive Self-Improvement,递归自我改进)。它的关键在于:机器人从上一轮探索中获得新的能力之后,就能进入过去到不了的状态、完成过去完成不了的任务,从而产生下一轮新的经验。

前一轮能力的提升,会改变下一轮它能够探索什么、又能够从中学到什么。
#具身智能 #顶会 #强化学习 #大模型 #Astra #cvpr #世界模型 #RSI