小鹏X-Foresight上车:智驾能预判未来6秒,多维安全提升20倍
今天这事儿有点意思,小鹏直接把X-Foresight预测世界模型搬上了车。这玩意儿能干啥?它能提前算出未来六秒钟会发生啥,周边那些车和人接下来会怎么动,它心里都有数。说白了,就是给智驾加了个“算命”功能。

与此同时,第二代VLA全新版本的底子也厚了不少。多维综合安全能力一口气提升了二十倍。这次升级,核心就四个大招。头一个是端侧模型参数量翻了三点五倍,比主流VLA模型高出十五倍不止。参数越大,脑子越活泛,泛化能力强了,想快速铺向全球市场,这基础算是打牢了。
再看第二个大招,端到端响应速度提了三倍。啥概念?毫秒级的反应,遇到危险能快速避让。第三个是支持最长三十秒的有效时序。这可是头一回把长时序记忆引进智驾决策里来。最后那个,就是刚才说的,推演未来六秒的场景,让车子有了预测的能力。

在实际路面上开车,情况那叫一个复杂。前车可能突然一脚急刹车,行人可能临时改道,旁边的车还可能突然加塞。面对这些突发状况,小鹏靠X-Foresight来应对。它用Flow Matching技术,预测出更多的未来可能性,然后从中挑出最靠谱的行动方案。

这模型不光得看懂过去的画面和当下的路况,还得琢磨目标物的位置、速度、运动趋势,外加道路环境。这些信息汇总起来,才能做出准确的预测。 具体咋实现的?模型先通过长时序的驾驶表征,生成多种可能的行驶意图。
这就从单一的确定性,变成了多解的问题。接着,再通过强化学习,把这些轨迹调得更自然、更像真人开车。 第二代VLA还引入了Infini-VLA长时序架构。这玩意儿能让车子记住前三十秒的世界。驾驶判断时,更多有效的历史信息就能喂进模型里,辅助决策。

小鹏方面强调,这几项技术不是各干各的。Infini负责把过去拉进来,流式自回归推理处理正在发生的当下,X-Foresight和Flow Matching则盯着未来。过去、现在、未来,这三个时间维度彻底打通,形成了一个完整的时空决策闭环。

从技术演进的时间线看,第二代VLA是在2025年11月5日的小鹏科技日上头回发布的。到了2026年3月2日,才正式开启推送。 这个模型是个原生多模态物理世界大模型。“看、听、读”全包了。它创新性地砍掉了传统VLA里的“语言转译”环节,直接从视觉信号生成动作指令,全程端到端,中间不绕弯子。
训练数据量有多大?接近一亿个clips。换算一下,这相当于人类司机开几万年的经验。而且,这些数据不需要任何人工标注。