小鹏第二代 VLA 去年 11 月发布,今年 3 月推上量产车,这次发布会是上车后的第一次大升级。
VLA 是 Vision、Language、Action——视觉、语言、动作。过去的思路是,摄像头看到画面,先翻译成一句话,比如"右前方有车准备变道",模型理解这句话,再决定转向还是刹车。
问题出在翻译上。画面里的距离、速度、角度、车身姿态,一句话装不下;转译一次丢一些,从语言再翻回动作,又丢一些。第二代 VLA 做的事,就是减少这层转译,让视觉信息更直接地参与动作生成。
这是去年拆掉的VLA的"L"。而这一次,小鹏往里加入的是连续的时间信息。
人开车,不会每秒都把世界重新认一遍。前车打着双闪、连续几次减速,哪怕还没真正停下,你也会猜它在找地方靠边——脚提前离开油门,跟车距离放大一点。这个反应不来自眼前这一帧,来自你还记得它前几秒在干什么。
很多智驾缺的,恰恰是这个记忆能力。
它们更像一个记性不太好的新手。每一秒都看得挺清楚,但每秒都是重新开始看。新版第二代 VLA 引入了 Infini-VLA 长时序架构。
按小鹏的说法,模型可以利用最长 30 秒的历史信息。30 秒不是把路况录下来,模型不需要记住每一片树叶和每一根车道线,它要留下的是那些会影响下一步动作的信息。
前车明明正在掉头,它等了两秒,如果把前因忘了,就可能又往前蹭,发现过不去,再刹住。人坐在车里,感受到的就是点头和犹豫。能记住"这辆车还没掉完头",它才能安心等,等对方走完再起步。
小鹏第二代VLA蒸馏版9月开启首批推送小鹏第二代VLA全新版本9月开启推送


