塔斯娱乐资讯网

最近忙于项目,差点错过小鹏第二代 VLA 的首次重大升级,广快逐字复习一下[doge] 这次更新的关键词很有意思:TIME 简单说,就是在小鹏这里,AI 开始从理解“空间”,进一步走向理解“时间”——逐渐接近人的思维模式。 我们都知道,真实世界并不是一张张静止画面的集合。 老司机之所以能提前判断前 ​

最近忙于项目,差点错过小鹏第二代 VLA 的首次重大升级,广快逐字复习一下

这次更新的关键词很有意思:TIME

简单说,就是在小鹏这里,AI 开始从理解“空间”,进一步走向理解“时间”——逐渐接近人的思维模式。

我们都知道,真实世界并不是一张张静止画面的集合。

老司机之所以能提前判断前车要不要变道、路边行人会不会突然横穿,本质上依靠的都是对“过去—现在—未来”的连续理解。

这次第二代 VLA 的升级,就是基于此。

划几个重点:

1️⃣ 记住过去:拥有前 30 秒的“记忆”

全新的 Infini-VLA 长时序架构,可以记住前 30 秒发生的事情。

这意味着模型看到的不再只是“这一帧有什么”,而是能把车辆、行人此前的动作和位置变化串联起来,形成连续的上下文。

对于驾驶来说,这一点其实非常重要——轨迹本身就是信息。

2️⃣ 预判未来:开始预测未来 6 秒

X-Foresight 预测世界模型首次上车,可以结合目标物的位置、速度、运动趋势和道路环境,对未来 6 秒进行预测。

人开车也是一样。

真正好的驾驶,很少是在危险已经发生之后才反应,而是通过一些微小迹象,提前判断“接下来可能发生什么”。

所以相比单纯“识别得更准”,我反而更关注 AI 有没有开始形成这种预判能力。

3️⃣ 边看边想:响应速度提升 300%

第二代 VLA 引入 Streaming Inference 流式自回归推理。

以前更像:看 → 算 → 输出 → 再看。

现在则希望做到:边看、边想、边行动。

官方数据是端到端响应速度提升 300%。

遇到前车突然刹停、行人折返、旁车加塞这些瞬时变化,模型的决策链路会更连续。

4️⃣ 模型继续变大:参数量提升 3.5 倍

新版第二代 VLA 端侧模型参数量提升 3.5 倍,同时加入 MoT 混合架构,根据城区、园区、泊车等不同任务动态分配模型能力。

小鹏给出的数据是:结合更长时序、更快响应和轨迹预判之后,多维综合安全能力提升 20 倍。

除了智驾,这次还有一个容易被忽略的变化:

Master Agent 开始把 VLA 和 VLM 打通,让车不只是“听懂一句话”,而是理解你真正想完成什么,再调度智驾、底盘、座舱、车身控制等不同 Agent 去执行。

比如一句“靠边停车”,车辆可以自己寻找合适的位置并完成停车。

所以看完这次升级,我觉得“TIME”这个主题其实挺准确。AI 对真实世界的理解,终于开始从一张“照片”,变成一段连续的“电影”。

这将是“具身智能”概念落地的关键一步。 北京