最近忙于项目,差点错过小鹏第二代 VLA 的首次重大升级,广快逐字复习一下
这次更新的关键词很有意思:TIME
简单说,就是在小鹏这里,AI 开始从理解“空间”,进一步走向理解“时间”——逐渐接近人的思维模式。
我们都知道,真实世界并不是一张张静止画面的集合。
老司机之所以能提前判断前车要不要变道、路边行人会不会突然横穿,本质上依靠的都是对“过去—现在—未来”的连续理解。
这次第二代 VLA 的升级,就是基于此。
划几个重点:
1️⃣ 记住过去:拥有前 30 秒的“记忆”
全新的 Infini-VLA 长时序架构,可以记住前 30 秒发生的事情。
这意味着模型看到的不再只是“这一帧有什么”,而是能把车辆、行人此前的动作和位置变化串联起来,形成连续的上下文。
对于驾驶来说,这一点其实非常重要——轨迹本身就是信息。
2️⃣ 预判未来:开始预测未来 6 秒
X-Foresight 预测世界模型首次上车,可以结合目标物的位置、速度、运动趋势和道路环境,对未来 6 秒进行预测。
人开车也是一样。
真正好的驾驶,很少是在危险已经发生之后才反应,而是通过一些微小迹象,提前判断“接下来可能发生什么”。
所以相比单纯“识别得更准”,我反而更关注 AI 有没有开始形成这种预判能力。
3️⃣ 边看边想:响应速度提升 300%
第二代 VLA 引入 Streaming Inference 流式自回归推理。
以前更像:看 → 算 → 输出 → 再看。
现在则希望做到:边看、边想、边行动。
官方数据是端到端响应速度提升 300%。
遇到前车突然刹停、行人折返、旁车加塞这些瞬时变化,模型的决策链路会更连续。
4️⃣ 模型继续变大:参数量提升 3.5 倍
新版第二代 VLA 端侧模型参数量提升 3.5 倍,同时加入 MoT 混合架构,根据城区、园区、泊车等不同任务动态分配模型能力。
小鹏给出的数据是:结合更长时序、更快响应和轨迹预判之后,多维综合安全能力提升 20 倍。
除了智驾,这次还有一个容易被忽略的变化:
Master Agent 开始把 VLA 和 VLM 打通,让车不只是“听懂一句话”,而是理解你真正想完成什么,再调度智驾、底盘、座舱、车身控制等不同 Agent 去执行。
比如一句“靠边停车”,车辆可以自己寻找合适的位置并完成停车。
所以看完这次升级,我觉得“TIME”这个主题其实挺准确。AI 对真实世界的理解,终于开始从一张“照片”,变成一段连续的“电影”。
这将是“具身智能”概念落地的关键一步。 北京



