昊梵体育网

# ChatGPT之后,世界模型为何成为AI的新方向 **信源:**Bloomberg《The Circuit》对李飞飞的专访《What's Beyond ChatGPT? The “Godmother of AI” Has a Plan》。 2006年,李飞飞开始建设ImageNet。当时AI缺少的不是更复杂的规则,而是足够多、足够系统的数据。2012年,AlexNet借助ImageNet、神经 ​

# ChatGPT之后,世界模型为何成为AI的新方向

**信源:**Bloomberg《The Circuit》对李飞飞的专访《What's Beyond ChatGPT? The “Godmother of AI” Has a Plan》。
2006年,李飞飞开始建设ImageNet。当时AI缺少的不是更复杂的规则,而是足够多、足够系统的数据。2012年,AlexNet借助ImageNet、神经网络和GPU取得突破,机器视觉由此进入深度学习时代。二十年后,李飞飞再次把问题指向数据,只是这次AI需要学习的不再是图片里的物体,而是物体所处的空间、运动方式,以及行动可能带来的结果。
这也是她创办World Labs的出发点。语言模型通过预测下一个词学习人类知识,世界模型则试图预测环境的下一个状态。如果杯子被推到桌边,它会不会掉落;机器人伸手抓取时,应该选择什么角度;相机转到物体背后,场景能否保持一致。这些能力很难单靠语言获得。
李飞飞在访谈中问:“文字能灭火吗?文字能煎蛋吗?”这句话划出了当前AI的边界。大语言模型可以解释动作、拆解任务,甚至生成一套看似完整的操作方案,但物理世界不会按照文字概率运行。机器若要进入家庭、工厂和医院,还要理解深度、遮挡、重量、摩擦、碰撞,以及动作与后果之间的联系。
李飞飞把世界模型分为渲染、模拟和规划。渲染负责生成供人观看的图像与视频;模拟需要保存世界的几何结构和物理状态,主要服务机器训练;规划则要判断下一步采取什么动作,与机器人控制紧密相连。
这个区分也说明,World Labs推出的Marble只是起点。它可以根据文字或图片生成可探索、可编辑的三维环境,并被用于影视制作、游戏开发和机器人训练。不过,可自由移动的三维场景不等于模型已经理解物理规律。一个房间可以看起来逼真,却未必知道玻璃会摔碎、液体会流动,或者抽屉拉开后内部物体会如何变化。
Marble现阶段最明确的价值,是降低数字环境的生产成本。过去,影视场景、游戏地图和机器人仿真环境需要大量建模与资产制作。生成式世界模型如果能把一张图片转换成可使用的三维空间,模拟环境就可能由手工资产变成按需生成的数据。
这对机器人训练尤其重要。现实数据昂贵、缓慢,还伴随安全风险。机器人不能为了学习跌倒而在真实工厂中摔上万次。可生成的仿真环境能够扩大训练规模,覆盖更多场景和意外情况。但它也带来新的问题:如果虚拟世界的物理规律不准确,机器人可能学会一套只在模拟器中有效的策略。世界模型最终要接受现实任务成功率的检验,而不是只看演示视频是否惊艳。
世界模型与大语言模型也不会是二选一。更可能出现的结构是,语言模型负责理解任务和高层推理,世界模型预测动作后果,控制模型把计划转换为机器动作。一个家庭机器人接到“收拾餐桌”的指令后,需要同时理解人的意图、识别餐具、估计空间位置,并根据每次抓取的反馈调整计划。任何单一模型都很难独立完成这条链路。
这条路线还会改变AI基础设施的负载。文本是一维Token序列,世界模型需要同时处理视频、三维空间、时间变化和动作状态。训练数据更大,模型工作集更复杂,推理过程也可能由一次性回答变成持续更新环境。这会推高计算、显存、存储和分布式通信需求,AI系统的瓶颈将继续向数据搬运、内存带宽和网络互连迁移。
访谈称World Labs已经融资10亿美元,团队约50人,但其护城河尚未得到充分证明。李飞飞提到专门准备的数据、模型架构和人才,这些都是必要条件,却不足以判断公司已经领先。更可靠的观察指标,是生成环境能否保持长期空间一致性,能否准确预测动作结果,以及仿真训练能否稳定改善机器人的现实表现。
世界模型仍处于类似早期语言模型的阶段,概念很多,统一架构和评价标准尚未出现。近期收入可能首先来自影视、游戏、设计和机器人仿真,通用物理智能则需要更长时间。值得关注的变化是,AI的学习对象正在扩大。互联网提供了语言、图片和视频,下一阶段的数据还将包括空间、行动与反馈。只有这些数据形成闭环,机器才可能由一个擅长回答问题的系统,变成能够在现实环境中持续行动的参与者。