昊梵体育网

小鹏给自动驾驶AI装上了&34;记忆&34;:记住30秒,预判6秒 小鹏汽车 你开车时会记住旁边那辆车30秒前在干嘛吗? 你会。你不仅会记住,你还会根据它的动作猜它接下来想干什么——那辆一直在右边车道磨蹭的车,八成要变道了;那个反复横跳的行人,随时可能冲出来。 这就是&

小鹏给自动驾驶AI装上了"记忆":记住30秒,预判6秒
小鹏汽车
你开车时会记住旁边那辆车30秒前在干嘛吗?

你会。你不仅会记住,你还会根据它的动作猜它接下来想干什么——那辆一直在右边车道磨蹭的车,八成要变道了;那个反复横跳的行人,随时可能冲出来。

这就是"老司机直觉"。现在,小鹏的自动驾驶AI也学会了。

一、为什么"只看眼前"不够

过去几年,自动驾驶的技术比拼可以用一句话概括:谁看得更清楚、反应更快。

不管是纯视觉方案还是激光雷达,系统的标准流程都是:识别前方车辆、行人、信号灯 → 判断道路情况 → 输出下一个动作。听起来很合理,但问题出在这里——真实道路不是一张张静止图片,而是一连串"正在进行时"的状况。

一辆进进退退的车,单帧画面上它可能并没有在动,但对驾驶决策来说意义完全不同。一个站在路边的人,和一个正在往车道方向挪步的人,在某一帧画面上看起来几乎一样,但一个需要刹车、一个可以继续走。

只看眼前的AI就像一个只盯着后视镜开车的司机——技术上没问题,但实际上很危险。
二、Infini-VLA:记住30秒,把连续事件串起来

小鹏8月27日在广州举办物理AI分享活动,宣布第二代VLA(Vision-Language-Action)大模型迎来首次重大升级。核心变化用一个词概括:从3D到4D——从对物理世界的"空间理解"升级为"时空理解"。

具体怎么做的?第二代VLA引入了Infini-VLA长时序架构。这个架构能让系统保留过去30秒内的有效信息,把此前发生的动作、位置和场景变化串联起来。

这意味着系统不再只处理"当前这一帧",而是拥有了一个"短期记忆"。它能知道:30秒前那辆车在左车道,15秒前它打了一下左转向灯,5秒前它开始往左偏——所以现在它很可能要变道过来。这不是"看到",而是"理解"。

三、X-Foresight:预判未来6秒

光记住过去还不够,小鹏还引入了X-Foresight预测世界模型。它的工作是:根据过去30秒的信息,推理并预判未来6秒内观察对象的动作。

举个例子:路口红灯,一个行人站在路边。普通系统看到的是"有人站在路边"。但VLA看到的是:这个行人30秒前小跑过来,15秒前停下了,5秒前身体微微前倾——X-Foresight预判他可能在接下来3秒内闯红灯过马路。系统提前减速,而不是等行人迈出第一步才急刹。

这就是从"看清眼前发生了什么"到"记住刚才发生了什么+猜接下来会发生什么"的跨越。小鹏把它叫做"记住过去,理解现在,推演未来"。

四、参数量扩大3.5倍:主流VLA的15倍

实现这些能力是有代价的。第二代VLA的参数量扩大了3.5倍,达到主流VLA模型的15倍。这意味着更强的理解能力,但也对算力提出了更高要求。

小鹏在AI Infra方面也做了配套升级,包括更高效的推理框架和token优化策略,确保大参数量不会拖慢实时响应速度。用小鹏通用智能中心负责人刘先明的话说,这场发布会"像高数课一样晦涩",但讲的事情并不复杂:让车载AI拥有时间和记忆的概念。

五、对消费者的实际影响:G9L全系标配

技术最终要落到产品上。全新XOS 6.3.0系统将在小鹏刚发布的新车G9L上首发,全系标配第二代VLA。

对消费者来说,最直接的变化体现在以下几个场景:

复杂路口:系统能记住30秒前路口的状态变化,不会因为某一帧的误判做出错误决策
行人密集区:提前预判行人的运动意图,减少急刹车频率,乘坐更舒适
变道博弈:理解旁车的"磨蹭"行为模式,更自然地完成变道,不再像机器人一样生硬
施工路段:记住前方路段的临时变化,不会在同一位置反复犹豫
从"看得清"到"想得远"

自动驾驶这几年的技术进化路线很清晰:第一代比的是"感知能力"——谁的车能更准确地识别路上的东西;第二代比的是"认知能力"——谁的车能理解路上正在发生什么事。

小鹏第二代VLA做的就是把AI从"逐帧处理"升级为"时序理解"。30秒记忆+6秒预判听起来参数不大,但它解决的是自动驾驶最根本的问题之一:道路是动态的,AI不能只活在当下。

当然,实验室数据和实际路况之间永远有差距。VLA能不能在暴雨、逆光、复杂施工路段中稳定发挥,还需要大量实测验证。但至少方向对了——让AI学会像人一样开车,而不是像机器一样开车。