世界模型在自动驾驶中的作用居然不止一种?

点击展示全部

[首发于智驾最前沿微信公众号]进入2026年的自动驾驶,最火热的概念莫过于世界模型了,Waymo、特斯拉小鹏、理想、华为,几乎所有头部玩家都在押注这条路线。

但如果你仔细看各家发布的技术方案,会发现他们说的世界模型其实不是同一个东西。

同样是世界模型,有人在做物理仿真,有人在搞视频生成,有人在推演因果关系,这些路线有什么差异?哪些可以用在自动驾驶中?

01

三类世界模型,各自解决什么问题

先看物理仿真这条路线。

这类模型的核心任务是从传感器数据中重建三维物理结构,让系统理解物体在空间中的位置、形状和运动规律。

它不直接输出驾驶指令,而是为决策系统提供一个关于外部世界的内部表示。

斯坦福李飞飞团队的空间智能、英伟达的Cosmos平台以及Waymo基于Genie 3构建的世界模型都属于这一类。

英伟达在2026年7月推出的Cosmos Edge 3专门面向边缘设备,参数规模压缩到40亿,说明这条路线正在从云端向车端延伸。

物理仿真路线的优点是和真实物理世界贴合紧密,能为模型提供密集的几何和物理约束。

缺点是计算量仍然偏大,高保真推演在车端实时运行仍有压力。

图片源自:网络

视频生成路线则是让模型在海量视频中学习场景的演化规律,然后根据输入生成新的视频内容。

OpenAI的Sora、Runway等产品属于这一类。

从技术角度看,它确实隐式地学到了物体下落、光影变化等物理规律,但它学的只是看起来像物理,并不真正理解物理规则。

用在影视制作上没问题,但要用它来做驾驶决策,风险很大。

再看因果推演这条路线,这条路不建模像素,也不模拟物理动力学。

而是搞清楚场景里各个因素之间有怎样的因果关系,这样系统就能理解如果我做了某个动作,周围的人和车会怎么反应。

自动驾驶里很多决策都依赖这类判断。

如打灯准备变道,旁边车道的车是会减速让你,还是加速顶上来,不同的场景答案不一样,系统得自己判断。

这套思路的源头可以追溯到图灵奖得主朱迪亚·珀尔的理论体系。

过去很长一段时间,这类方法主要停留在学术论文里,因为实际驾驶场景中变量太多,很难建立起可靠的因果图。

到了2026年,情况开始有了变化,已经有公司尝试将这一技术落地。

从前面的梳理中其实可以发现,同样是世界模型,物理仿真可以帮系统弄明白路长什么样、东西在哪儿。

视频生成可以变出各种没见过的路况画面,用来练系统。

因果推演则可以告诉系统做了某个动作之后会发生什么。

这三件事完全不一样,那自动驾驶是不是三样都得要?

从目前行业的情况看,答案是都得要,但每样东西用在哪儿得搞清楚。

物理仿真负责构建环境模型,视频生成负责制造训练素材,因果推演负责做决策判断。

它们各管一摊,缺谁都不行。

在学术圈,其实还有一种分类方式。

CVPR 2026上有一篇论文将自动驾驶世界模型分为时空神经仿真、生成式数据合成与增强,以及基于认知推理的隐空间决策三个范式。

它们对应的功能分别是模拟世界、生成数据、做出决策。

这三个层次对应着不同的技术难度和商业价值。

02

世界模型在自动驾驶中起到什么作用?

世界模型到底能解决自动驾驶什么问题?

简单理解世界模型的作用,就是可以让自动驾驶系统在行动之前,先在脑子里把结果跑一遍。

传统自动驾驶系统是反应式的,传感器看到什么,系统就输出什么控制指令。

这种架构的问题在于,系统只处理现在发生了什么,对接下来会发生什么缺乏预判能力,若是遇到训练数据里没见过的场景,系统就容易失效。

世界模型则通过在海量驾驶视频中学习场景的动态演化规律,并在模型内部建立起对物理世界运行方式的结构化理解。

有了这个理解,系统就可以推演未来。

在自动驾驶的实际落地中,世界模型目前承担着几个关键功能。

一个功能是预测动态元素的未来轨迹和意图。

想实现自动驾驶,不仅要知道周围那辆车接下来几秒钟会往哪走,还要推断出它为什么会这么走。

其实对于自动驾驶系统来说,若只是预测轨迹的话,只需要盯着周围车辆的位置变化看就行了,但如果能判断出对方的意图,决策的依据就会充分很多。

所以判断意图比判断轨迹要难得多,但对决策来说也更关键。

图片源自:网络

另一个功能是做反事实推演。

自动驾驶系统在执行某个操作之前,世界模型可以先在内部模拟出多种可能的未来路径,然后评估每条路径的风险大小。

如在决定变道之前,系统会先推演如果现在变道会怎样、如果等两秒再变道又会怎样,然后选出风险最低的那个方案。

世界模型还能生成极端场景数据来弥补真实路测的不足。

像是暴雨天突然窜出的行人、前车爆胎后飞来的碎片,这类场景在真实道路上很难遇到,一年也碰不上几次。

但世界模型可以在虚拟环境里把这些情况成批地生成出来,让系统反复练习。

还有一个功能是结合大语言模型做常识推理。

纯视觉模型能识别出路边有辆车在冒烟,但难以理解这意味着什么。

融合了大语言模型的世界模型可以调用常识知识,就可以推断出冒烟的车随时可能起火或者爆炸,系统应该提前远离。

世界模型也提升了自动驾驶的研发效率,过去自动驾驶的研发方式是遇到什么问题再修什么Bug。

现在变成了想要什么场景就生成什么场景。

小鹏宣称其世界模型支撑的仿真测试每天等效跑3000万公里,这意味着迭代速度可以提升几个数量级。

03

世界模型被用到什么程度了?

智驾最前沿以为,世界模型在自动驾驶中的作用被严重高估了。

不是说它没用,而是行业对它的期待太高,超出了技术目前能做到的程度。

世界模型本质上是一个脑内沙盘,系统在虚拟环境里推演各种可能性,然后根据推演结果做决策,但沙盘再真实也只是沙盘,和真实世界之间永远存在差距。

虚拟环境里的物理规律、车辆动力学、路面附着系数都是预设的,真实路况却充满了不确定性。

想将在虚拟环境里训练出来的策略直接用到真实道路上,目前还是比较难做到的。

还有就是计算成本问题,VLA模型的推理延迟普遍在100到300毫秒,世界模型的高保真推演比这个还要慢。

对于自动驾驶来说,从感知到决策再到执行的端到端延迟需要控制在50毫秒以内。

过去相当长一段时间里,世界模型只能部署在云端,用来做离线训练和仿真测试,没办法放到车端实时运行。

不过2026年以来,这个情况也正在发生变化。

英伟达在2026年7月推出了Cosmos 3 Edge,这是一款40亿参数的开源世界模型。

其专门针对边缘设备做了优化,可以在Jetson Thor这类车规级硬件上实时运行。

小鹏在CVPR 2026上发布的X-Mind技术框架,用深度压缩自编码器把未来12帧的世界推演压缩到96个Token。

其推理延迟极低,具备在车规级芯片上量产落地的可行性。

魔芯科技联合浙江大学发布的MoWorld则更进一步,首次在全栈国产NPU上实现了超过每秒50帧的实时推理,推理成本比同规模的GPU方案降低了70%。

蔚来的世界模型也已经覆盖了从2022年最早的ET7到乐道L60等多个平台和超过70万用户。

云端模型上车的门槛正在被一步步拆掉。

图片源自:网络

除此之外,世界模型过去很长时间里主要解决的是预测,而不是决策。

它能告诉你如果我往左打方向,接下来三秒周围的车可能会怎么动,但它没办法直接告诉你那我到底该不该往左打。

真正的自动驾驶需要把预测和决策串在一起,系统既要知道未来可能发生什么,也要知道面对这些可能性自己应该怎么做。

2026年行业也在这方面努。

Waymo在CVPR 2026上首次曝光了其世界模型的完整训练框架,明确表示不满足于让模型只做预测,还希望模型能够直接参与规划。

北京交通大学和小米联合提出的DriveWorld-VLA,构建了表征共享、推理联动、决策闭环的一体化框架,打破了VLA与世界模型之间的结构边界。

小鹏X-Mind的核心思路是在输出动作之前先进行显式的时空推演,将预测和决策放进同一个框架里处理。

预测和决策正在从两个独立模块走向统一。

当然,架构上虽然打通了,实际效果怎么样、能不能在各种复杂场景里都稳定工作,还需要更多的路测数据来验证。

图片源自:网络

长期来看,世界模型是非常有价值的。

自动驾驶发展到现在,最大的瓶颈从来不是算法写得不够好,而是数据太贵、太稀、太慢。

你可以让测试车队在真实道路上跑一亿公里,但大部分里程都是没什么变化的高速巡航。

而真正值钱的场景是那些极端场景。

暴雨天突然窜出来的行人、前车掉下来的货物、路面突然出现的障碍物等,这些情况真实路测一年都碰不到几次。

世界模型则可以在虚拟环境里把这些场景成批地生成出来,让系统反复练习怎么应对。

从这个角度看,未来车企之间的竞争,会从谁的传感器更多变成谁的世界模型更会造场景。

当然,会造场景和能安全开车之间,还有很长的路要走。

声明:本文由太平洋号作者撰写,观点仅代表个人,不代表太平洋汽车。文中部分图片来源网络,感谢原作者。
1902
08-16
分享
发表您的看法…
半价购
分享