科技日报记者 杨雪
8月27日,小鹏汽车宣布,其第二代VLA(视觉语言动作)大模型迎来首次重大升级,全新XOS 6.3.0版本将于小鹏G9L全球首发。此次模型升级的核心是让AI开始真正理解时间——从过去对物理世界的静态3D空间理解,进一步走向动态4D时空理解。
传统模型可以识别车辆、行人、道路和交通信号,但要真正完成复杂的物理世界决策,仅仅“看见”还远远不够,车辆需要知道过去、现在、未来可能发生什么。此次第二代VLA的升级让模型第一次建立起对时间维度的理解,小鹏物理世界基座模型,首次把“时间”纳入模型,AI理解世界的维度,从“3D空间”跃迁至“4D时空”。
以前模型看到的更多是当下的信息,第二代VLA全新引入Infini-VLA长时序架构,记得前30秒的世界,驾驶判断开始拥有更长的上下文,更多有效信息进入模型。连续发生的道路事件不再被割裂成一个个独立画面,模型可以将此前发生的动作、位置和场景串联起来,形成更加完整的时序理解。
道路情况是时刻在变化的,模型也需要边看边想,如果决策速度跟不上现实变化,也无法形成真正可靠的物理世界智能。所以,第二代VLA同步提升了模型推理效率,采用Streaming Inference(流式自回归推理),从离散推理走向连续推理,端到端响应速度提升300%。面对不断变化的道路状况,传统的模型是“看→算→输出→再看”的模式,而第二代VLA能够做到“边看、边想、边行动”的并行处理。
在真实道路上,前车可能突然刹停,行人可能临时改变方向,旁车可能突然加塞,预测更多种未来,才能选择更好的行动。模型不仅要识别过往画面和当前画面信息,还需要根据目标物的位置、速度、运动趋势、道路环境等进行预测。小鹏X-Foresight预测世界模型首次上车,可预判6秒内发生什么,推演周边交通参与者未来的可能行为。
据介绍,第二代VLA全新版本端侧模型参数量提升3.5倍,是主流VLA的15倍以上,结合超前轨迹预判、超长有效时序、更快决策响应,使得多维综合安全能力提升20倍。
与此同时,小鹏选择用做机器人的方式重构车机大脑,首次推出Master Agent(整车大脑),实现VLA与VLM(视觉语言模型)的驾舱融合。Master Agent建立在小鹏自研Omni全模态模型之上,不仅能够理解自然语言和模糊语义,还能将用户意图自动拆解为任务,并调度智驾、底盘、座舱、车身控制等垂直Agent协同执行,实现从“理解”到“行动”的闭环。这意味着,Master Agent让整车第一次拥有一个统一大脑,也让车辆智能从响应单一指令,进一步迈向自主理解意图、规划任务和协同执行。

网友评论