BEV的纠结分叉:是桥梁也是枷锁
零跑在前不久的技术日上宣布砍掉BEV,引发了不小的讨论,但砍掉BEV这件事本身并不新鲜。
华为ADS 3.0早在两年前就去掉了BEV网络,理想则在今年转向了3D ViT,用原生模型理解3D世界。

特斯拉仍在BEV基础上叠加Occupancy,小鹏也还以BEV作为空间认知的抽象底板。
但真正值得关注的,不是谁砍了BEV、谁留了BEV,而是为了辅助驾驶的体验深度进化,空间感知正在经历一轮系统性的重构。
零跑只不过是把这层窗户纸捅得最彻底。
但重构的方向是什么?拆掉BEV之后,谁的理解方式更接近物理世界的真相?砍掉BEV零跑世界模型节省了算力,但会不会也省掉了安全?
都是为了“说母语”
BEV即Bird's Eye View,鸟瞰图。
车身上的摄像头位置、高低各不相同,并且会产生不同程度的视野畸变,BEV系统就是负责把这些视角统合在一起,翻译成一张上帝视角的鸟瞰图,决策系统再在这张图上做判断。
但问题是,这张图是平面的,现实世界却是三维立体的。
为了解决空间认知,特斯拉早在2021年就引入了BEV+Transformer架构,实现了从2D图像到3D空间的跨越。

但BEV+Transformer对遮挡物和异形障碍物识别不足,于是在2022年,特斯拉又引入Occupancy Network—占用网络。
2021年前后辅助驾驶还处在规则时代,障碍物仍需要一个个训练识别具体是什么,但Occupancy Network不去识别这是什么物体,而是判断这个空间有没有被占据。
就像人开车看到前面有东西,你不用看清楚它是黑塑料袋还是石头或者其他,你只是看到有,然后判断障碍边界就绕过去了。
2024年发布的华为ADS 3.0则一口气砍掉了BEV,取而代之以GOD(通用障碍物检测)网络。
GOD有些像华为版的Occupancy Network,但特斯拉是在BEV的基础上认知空间,可ADS 3.0不再单独输出BEV鸟瞰图(特斯拉如今也不输出了),而是借助以激光雷达为核心的多传感器融合方案来直接完成更精准的感知。

来到今年,面向汽车向具身智能机器人的变革,理想也优化了空间认知的方案——原生3D ViT。
李想对BEV有过具体的评价,他说BEV把世界从俯视角拍扁,丢失了高度信息;OCC是3D的,但缺失了语义信息。
于是理想在2026年GTC上发布的MindVLA-o1,在底层实现了原生3D ViT,物理环境不再从2D还原3D,而是让模型一开始就工作在真实的三维世界里。

在6月份Livis Day上,理想就现场演示了3D ViT看到的观众台画面,大到整个空间,小到挥手动作,3D ViT都能捕捉到。
特斯拉、华为、理想对BEV的优化或者放弃,本质上都是在做同一件事,没有中间层的直接看懂三维物理世界。
或者用零跑智驾负责人冯铭月的话来形容应该更贴切,让智驾“说母语”。
对此,零跑的解决思路也是砍掉BEV,让模型从图像直接输出驾驶轨迹,而激光雷达和少量规则代码基本只做安全兜底。
但需要注意的是,BEV存在的原因是要处理摄像头视野畸变的问题,可零跑砍掉BEV,并不意味着摄像头畸变随之消失。
畸变仍然存在,只是零跑世界模型的应对方式变了。它不让模型先去修正畸变、再输出BEV,而是让模型直接在畸变视角下理解世界。

换句话说,系统没有先矫正画面再理解,而是在畸变本身的基础上完成理解。
世界还是那个世界,只是理解路径不同。别家方案是在“正常视角”下重建世界,零跑是在“畸变视角”下直接理解世界,最终处理方式殊途同归。
而零跑世界模型中间少了修正畸变、输出BEV的环节,算力自然省下来了。这也是零跑能在10万级、200TOPS算力车型上跑世界模型的基础。
如果说特斯拉、华为、理想是在尽可能说母语,那我觉得零跑更像是在说带点方言的母语。
至于这种带“方言”的理解方式能不能沟通,我们之前在杭州已经体验过了,大家可以参考下面这个视频。
两个问题
有两个问题到了这里必须摊开来讲。
第一,BEV的去留,到底谁更正确?
特斯拉仍然坚持BEV作为空间基底,小鹏其实也在以BEV作为空间认知抽象底板。
而华为ADS 3.0早就去掉BEV网络,理想则用原生3D ViT替代BEV,让模型一开始就工作在真实的三维世界里。零跑更激进,直接从图像输出轨迹。
谁更正确?目前当然没有答案。

但有一点是清楚的:BEV并不是不可动摇的认知底座。
过去五六年它撑起了辅助驾驶从高速到城区的一轮轮扩张,但现在,行业正在探索用不同的方式解决同一个问题:
如何让系统更接近理解世界,而不是翻译世界。
第二:零跑给智驾其实来了次减法,但辅助驾驶事关安全,能用、有功能就够了吗?
零跑的算力弹性确实诱人:200TOPS就能部署世界模型,10万元以内车型也有机会用上城区领航。
但便宜不等于够用,有功能不等于足够安全。
减法可以是技术上的聪明选择,但安全上没有捷径。

零跑赌的是模型能力可以弥补硬件和算力的削减,但这个赌注的输赢,还需要看更多车主的真实反馈。
写在最后
BEV的去留,其实是辅助驾驶空间认知方式的探索。
在最开始的时候,BEV让机器拥有上帝视角,进而拥有了认知世界的基础,但也把世界压扁成了二维。
而来到现在,某种程度上,BEV既是系统认知世界的桥梁,也是系统认知世界的障碍。
各家定位不同、取向不同,对BEV采取的做法自然也不同,但无论BEV是砍是留,核心都是尽可能还原这个世界原本的样貌,带来更好的辅助驾驶体验。
不过说到底,技术路线之争再热闹,大家最关心的肯定还是实际体验。
BEV要不要砍、世界模型怎么跑、200TOPS够不够用,这些问题的答案,最终都得在真实路况里找。
欢迎持续关注《超级开箱》,后续我们会带来更多相关测试,用实测带给大家答案。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”



