世界模型不是会生成视频就行,得能看懂、推演,还得动手改世界。
现在圈子里啥都叫世界模型。其实分三派:李飞飞按功能分渲染、模拟和规划;LeCun主张在抽象空间里预测;清华朱军则给出了五级进化路线。
核心闭环就三步:先理解眼下啥情况,再想象“我这么干会怎样”,最后真去干,拿新结果修正自己。
五级路线怎么爬:
L1看连贯:能生成杯子掉地上碎了的画面。
L2看互动:你换个视角或推力,它还能接着演。
L3看行动:模型得真输出抓取动作,把杯子接住。
L4看自主:没人催也能主动发现风险、补信息。
L5看协作:安排谁去抓、谁去避障,调配资源。
目前生数的Vidu系列到了L2,Motus系列刚摸到L3。往上走还缺因果推理、持久记忆和安全控制。
数据得从屏幕接到现实:底层用海量视频学常识,越往上越得用带动作的人类示范和真实机器人数据。生数搞的Motus2,就是让机器人在脑子里预演几套方案,挑最好的动手,做完再复盘。
说白了,光画面逼真没用,能在真实环境里不断试错、持续学习的系统,才算通向通用智能。世界模型榜 模型进化 模型简史 进化建模 世界模型2 视觉世界模型 交互世界模型 预测式世界模型
世界模型不是会生成视频就行,得能看懂、推演,还得动手改世界。 现在圈子里啥都叫世界模型。其实分三派:李飞飞按功能分渲染、模拟和规划;LeCun主张在抽象空间里预测;清华朱军则给出了五级进化路线。 核心闭环就三步:先理解眼下啥情况,再想象“我这么干会怎样”,最后真去干,拿新结果修正自己。 五级路
阅读:0
点赞:0