占据网络
1. 定义与核心范式跃迁
Occupancy Network,即占用网络,是自动驾驶感知技术演进中的一次根本性范式跃迁。其核心思想在于,将真实、连续的三维物理世界,以一种极其细密的数学网格进行离散化表示,这个网格中的最小立方体单元被称为“体素”(Voxel)。占用网络实时地为每一个体素分配状态:它被占据了吗?如果被占据,它属于哪一类物体?这种机制从本源上解决了一个困扰行业已久的根本缺陷——传统“目标级”感知(Object-level Perception)对万物进行“白名单”式识别的局限性。在目标检测范式下,感知系统只能辨认其训练列表中预设的物体(如轿车、卡车、行人),而对列表之外的长尾异形障碍物,例如侧翻在地的路锥、扭曲变形的施工护栏、或散落在路面的石块,则直接视而不见,造成灾难性漏检。
占用网络的诞生,标志着智能驾驶感知从“目标级”向“环境级”(Environment-level)的跨越。它不再试图仅回答“前面有什么”,而是持续回答“我周围的每一寸空间,其状态为何”。这个“兜底”能力,是高阶智能驾驶(尤其是城市导航辅助驾驶,City NOA)得以在复杂、开放性环境中安全运行的技术基石。从2022年特斯拉在AI Day上首次系统阐述其Occupancy Network技术方案开始,这一概念迅速凝聚为全行业共识,并分化出纯视觉占用网络与多模态融合占用网络两条主干技术路径,引发了感知架构的深刻重构。进一步地,占用网络还将感知的表达能力从几何空间拓展到时序与语义空间,成为后续预测、规划模块可以直接消费的通用世界表征,推动自动驾驶软件架构从模块化走向“感知-预测-规划”一体化。
2. 产业背景与量产概况
占用网络技术的产业化进程,在2023年至2024年间经历了从技术验证到“早期量产爬坡”的爆发式增长。根据Yole Intelligence于2024年8月发布的《自动驾驶感知技术年度报告》,全球Occupancy网络技术已正式从预研阶段跨入部署期,在公共道路上实装该方案的量产乘用车估算已超过120万辆,市场覆盖中国与北美两大核心市场。这一数据的口径,特指搭载了包含占用网络感知方案的车辆,不再是实验室Demo或测试车队。
行业的主要推动力来自头部造车新势力与科技公司。蔚来、小鹏、理想、华为等国内方案商,均已在其城市NOA系统中实装了占用网络技术。这项技术的引入,大幅降低了对高精度地图的刚性依赖,使得车辆在没有预先测绘、厘米级地图的道路上,依然能够理解复杂的道路结构和障碍物分布。例如,系统不再需要依赖地图告知“这里是一个复杂的十字路口”,而是通过实时体素重建,“看”到了路缘石、安全岛、隔离带和其他交通参与者的分布,自行构建出可行驶区域的几何边界。这从根本上解决了高精地图固有的鲜度不足、成本高昂与覆盖率有限等商业化瓶颈,为城市智能驾驶的大规模普及铺平了道路。与此同时,在海外市场,特斯拉基于其自研FSD芯片和纯视觉方案已将占用网络推送至数百万辆存量车,Mobileye、Waymo、Cruise等厂商也在积极推进占用网络在其感知栈中的集成,全球竞争格局已进入白热化阶段。
3. 体素化的数学基础与工程权衡
占用网络的第一性原理根植于对连续空间的离散化,即体素化。在典型的感知范围内——通常定义为车辆前向120米、车道方向左右各30米、高度方向8米的空间——连续的物理流形被切割成一个规整的三维网格。每个体素的分辨率通常在0.1米至0.5米立方体之间浮动,这个参数直接决定了感知系统的粒度和对算力的消耗量级。
我们以一个典型配置(分辨率为0.2米)进行估算:在120m × 60m × 8m的空间内,将产生 (120/0.2) × (60/0.2) × (8/0.2) = 600 × 300 × 40 = 7,200,000,即720万个初始体素。这是一个巨大的数字。然而,物理世界的一个关键特性被用来进行大幅压缩:空间是稀疏的。绝大多数体素处于“自由”状态(即空气),真正的信息量集中在物体表面和内部。因此,工程实现中,绝不会为所有体素密集分配算力,而是采用稀疏数据结构(如三维稀疏卷积或哈希表),只为那些在传感器观测中可能存在的表面及其附近区域维护活跃体素状态,从而将有效计算量降低一到两个数量级。此外,为了平衡近处高精度感知和远处低分辨率感知的算力分配,不少方案引入了多分辨率体素或可变分辨率架构,比如在车体周围10米内采用0.1米分辨率,而在50米外降至0.4米,从而实现感知性能与实时性的最优折衷。
每个活跃体素内部,承载着一个高维状态向量,它不仅是简单的二值占用标志,更是一个综合描述符。这个向量通常包含:占用概率 p∈[0,1],表征该空间被物质占据的置信度;一个语义类别logits向量,用于区分车辆、行人、骑车人、道路表面、护栏、植被、建筑物、通用障碍物等;以及可能的运动状态标志,用于区分静态背景与动态前景。这个设计,让每个微小的立方体都从一个纯粹的几何实体,升维为一个信息丰富的语义实体,奠定了“环境级”感知的数学基础。
4. 纯视觉特征编码管线
纯视觉是占用网络最关键且最具挑战性的输入模态,特斯拉是该路线的标杆推动者。其核心任务是将多个2D相机(通常为6至8路,覆盖车身360度)捕获的RGB图像,通过深度神经网络升维至3D体素空间,并为每一个体素生成占用状态和语义信息。这一过程通常遵循“2D特征提取→视角变换(View Transformation)→3D特征融合”的范式。
在2D特征提取阶段,采用成熟的图像骨干网络(如RegNet、EfficientNet或ViT)从每路相机的输入图像中提取多尺度特征图。关键的挑战出现在视角变换阶段:如何将2D图像特征“提升”到3D空间。早期方法依赖显式的深度估计(Depth Estimation),为每个像素点预测一个深度分布,然后通过外积操作将2D特征沿深度维度“喷”入体素空间,形成相机视锥体素特征(Frustum Voxel Features)。随后,将多路相机的视锥体素特征通过BEV(Bird’s Eye View)池化或三维体素编码器进行融合,跨越不同相机之间的重叠与遮挡区域,最终输出一个统一的车体坐标系下的3D占用场。特斯拉在其Occupancy Network中对此进行了精巧改进:他们不再依赖一个独立的深度估计分支,而是通过对齐体素查询(Voxel Query)与图像特征之间的注意力机制,隐式地学习深度和体素占用,此即基于Transformer的交叉注意力方案。该方案使梯度可以从占用损失直接流回图像特征提取器,实现了真正的端到端训练,并显著提升了对远距离小障碍物的召回能力。纯视觉方案的核心优势在于硬件成本低、部署便捷,但其对夜间、雨雾、逆光等恶劣条件的鲁棒性仍是产业化关键攻关点。业界正通过引入时序特征、图像增强网络以及合成数据训练等手段,逐步补齐纯视觉在极端光照与天气下的性能短板。
5. 多模态融合占用网络:雷达与激光雷达的协同
为解决纯视觉方案在几何精度和恶劣环境下的感知退化问题,多模态融合占用网络成为另一条主流技术路线。其核心理念是融合不同物理原理的传感器信息——相机提供丰富的语义纹理,毫米波雷达(Radar)提供径向速度与距离,激光雷达(LiDAR)提供精确的稀疏三维点云——从而在体素层面获得更稳健、更精确的占用描述。
毫米波雷达的特殊价值在于其速度测量能力。4D成像雷达(如Arbe、Mobileye、华为等方案)能够直接输出点云级的速度信息,这对占用网络的动态属性预测至关重要。传统视觉方案需要多帧时序推断运动状态,而雷达可以在单帧内直接给出每个反射点的径向速度,这使得占用网络能够实时区分静态背景与移动前景,甚至在拥堵红绿灯场景下精准感知周围车辆的起步与停止意图。融合方法多采用“特征级融合”:先为每种模态设计独立的特征编码器(点云体素化、雷达点柱体化等),然后在统一的3D空间内将多模态特征拼接或投影到同一体素特征图上,再通过一个轻量级融合网络输出最终占用。这种异构融合架构可以屏蔽单一传感器故障,实现冗余感知。但多模态方案也带来硬件成本增加、标定复杂度提升与数据对齐等新挑战。如何在有限算力预算下最大化多传感器的互补增益,是当前量产工程的核心难题。
6. 时序信息融合与4D占用网络
从静止的3D占用扩展到包含时间维度的4D占用,是占用网络向预测能力演进的关键一步。4D占用网络不仅回答“当前时刻空间被什么占据”,还能推断“这些占据将如何随时间演化”。这本质上是在体素层面进行稠密的运动估计与占用流预测。
工程实现中,时序融合通常依托于循环神经网络(RNN/LSTM)或Transformer的时序交叉注意力。一种典型架构是:将当前帧和历史帧的体素特征按时间顺序排列,通过时空3D卷积或可变形注意力模块,在空间邻域和时间邻域内聚合信息。模型会学习隐式地对运动体素进行“推拉”操作,从而预测未来0.5秒至3秒内的占用变化。部分方案更进一步,在4D占用的基础上显式生成体素级的速度场或占用流,这使得下游的规划器可以直接避开未来可能进入自车路径的动目标。基于4D占用,车辆能够对“鬼探头”、突然变道、行人横穿等危险场景做出提前反应,大幅提升预判安全性。4D占用网络的瓶颈在于时序对齐与历史帧压缩:必须精确补偿自车运动(ego-motion)带来的坐标偏移,且需要设计高效的历史帧缓存机制,避免显存和算力的线性增长。目前主流方案通常缓存3至10帧历史(约0.3-1秒),未来将向更长时序和自适应缓存方向演进。
7. 占用预测与运动规划耦合
占用网络不仅服务于感知,它正成为连接感知与规划的桥梁。传统架构中,感知输出目标物列表,规划器再基于这些列表进行决策,二者之间存在语义鸿沟和信息损失。而占用网络输出的稠密占用场,可以直接作为规划的约束空间,使得规划器能够在统一的自由空间/占用空间中进行优化,避免了“先检测、后决策”流水线中的级联误差。
在具体实现上,规划器将占用场转换为一个3D代价图(Cost Map),每个体素根据占用概率和语义类别加权得到一个“穿行代价”。自车在未来一定时间内的若干条候选轨迹,通过将轨迹穿越的体素代价进行时间积分,得到每条轨迹的安全成本与舒适度成本,再结合行进效率等目标,选择最优轨迹。这种“占用→代价→轨迹选择”的方案,天然可以处理不规则障碍物和复杂道路边界,因为它不依赖障碍物的具体外形类别,只问“该空间是否不可通过”。部分前沿研究甚至已经将占用预测与规划合并在同一个神经网络中,实现从传感器输入直接到轨迹输出的端到端联合优化。特斯拉在其2023年公布的技术细节中,便展示了基于占用网络的“交互搜索”规划器,能够在非结构化停车场、施工区域等场景中以类人的方式灵活穿行。这种紧密耦合对占用的准确性和时延提出了极高要求:任何误报的占用都将导致不必要的刹停,任何漏报都可能导致碰撞,因此占用预测的置信度校准和不确定性估计成为必须攻克的工程难题。
8. 监督信号与真值生成:从LiDAR标注到自动标注
训练占用网络需要海量的真值监督数据,如何高效生成准确的3D占用标签成为产业化的第一道坎。最直接的方法是将高线束激光雷达点云作为几何真值:将每一帧LiDAR点云投影到体素网格,有点落入的体素标记为“占据”,其余通过射线投射(Ray Tracing)判断为“自由”或“未知”。然而,这种稠密化过程对传感器的物理局限敏感:例如,黑色车辆吸光导致点云缺失,镜面反射造成伪点,雨雾产生噪点等,都会污染真值质量。
为弥合这一差距,业界发展出“多传感器融合+多帧聚合”自动标注流水线。首先,通过高精定位和高精地图将多趟采集、多辆车的数据进行离线对齐,形成一个庞大的聚合点云。然后,在聚合点云的基础上,结合目标级检测模型和人工标注修正,生成稠密、准确的占用和语义标签。对于动态物体,利用离线4D跟踪算法将每个物体实例的运动轨迹恢复出来,从而生成4D占用序列真值。最后,针对视觉方案的模型训练,还需要将聚合点云通过传感器模型反向投影到每一帧相机的成像平面,进行一致性检查。这套自动标注系统通常运行在云端数千张GPU的集群上,其成本与技术壁垒极高,已成为头部厂商的核心护城河。即便在自动标注技术高度成熟的今天,关键安全场景的真值仍需人工校验,人机协同的标注体系将长期存在。
9. 损失函数设计与优化策略
占用网络的损失函数设计直接决定了模型学到何种占用表征。基础的占用损失由“占用分类损失”和“语义分割损失”加权构成。对于每个体素,占用分类通常采用二值交叉熵(BCE)或Focal Loss来缓解正负样本极度不均衡(绝大多数体素为自由)。语义损失则对占据体素施加多分类交叉熵,以区分不同物体类别。
在实际优化中,这种逐体素的监督存在两大问题:一是体素间的独立性假设忽略了空间拓扑结构;二是在物体边界处因离散化造成的不确定性惩罚过重。为此,现代占用网络引入了结构感知损失,如结合占用边界和真实点云分布的Chamfer Distance Loss,或采用占用流(Occupancy Flow)一致性约束,即要求相邻帧的占用场在补偿自车运动后具有高度一致性。此外,一些自监督辅助任务也被引入,例如要求网络同时预测深度图或表面法向量,并与LiDAR投影或光流估计进行对齐,从而注入几何先验。对于多类别不平衡,即道路上某些类别(如自行车、行人)出现频率远低于路面和建筑,可采用类别重加权或重采样策略。在4D占用的训练中,往往采用课程学习策略:先训练静态3D占用至收敛,再逐步引入时序任务和运动预测头,帮助模型平滑收敛。整体而言,损失函数和训练策略的精细化调优是决定占用网络可量产性的关键,需要专业的算法团队与大规模工程试验共同完成。
10. 基准数据集与评测体系
占用网络评测体系的标准化是推动行业技术进步的重要支撑。2023年以来,学术界和产业界推出了一系列专用基准数据集。最具代表性的是OpenOccupancy-NuScenes和Occ3D-NuScenes,它们基于nuScenes数据集构建,提供360度全景的稠密占用和语义标签,体素分辨率0.2米,覆盖超过1000个场景、20个语义类别。另一基准SemanticKITTI则侧重于激光雷达视角的语义占用评测。此外,面向长尾障碍物和极端天气,Waymo Open Dataset、Lyft L5等也提供了部分可用数据,但在占用真值标注的完善度上仍有欠缺。
评测指标方面,行业正在从单一的交并比(IoU)向多维度综合评价体系演进。核心指标包括:几何交并比(Geometry IoU,即体素占用的空间重叠度)、语义交并比(Semantic IoU,即同时考虑类别正确的体素重叠度)、近距离召回率(Close-range Recall,体素距离自车5米内的平均召回,关乎碰撞安全)、远距离密度保持率(Far-range Density Preservation)、以及实时性指标(帧率和时延)。面向4D占用,新增了时序交并比和运动预测终点误差等指标。值得注意的是,现有指标多从几何一致性出发,尚无法完全反映占用网络对下游规划的实际价值。行业正致力于建立“感知-规划联合评测”框架,即直接将占用网络接入规划器,通过闭环仿真统计碰撞率、接管率和舒适度,从而为占用的优化提供真正面向任务的技术指引。
11. 算力挑战与硬件加速:从GPU到专用芯片
占用网络对算力的消耗极为可观,这是其量产路上最突出的瓶颈之一。以720万体素的初始空间为例,若使用一个中等规模的3D encoder网络,浮点运算量常在数百GFLOPS至数TOPS量级,而量产域控制器的算力预算通常仅为几十到几百TOPS,感知仅是其中的子系统之一。因此,模型压缩与硬件加速成为必须进行的技术工程。
在算法层面,神经架构搜索(NAS)被广泛用于搜索高效3D基础结构,如将常规3D卷积替换为分组可分离卷积或空间时序分解卷积。剪枝技术可去除对下游规划贡献度低的体素区域(如高空或远距离边界)。量化方面,主流方案已从FP32推进至混合精度FP16甚至INT8,在精度损失可控的前提下将推理速度提升2-4倍。在硬件层面,英伟达Orin、高通Snapdragon Ride、地平线J5/J6以及特斯拉自研FSD等芯片,均对稀疏卷积和注意力机制的硬件加速进行了专门优化,例如支持稀疏张量Core、加速体素查询等。更进一步,一些初创公司正在探索基于事件相机和神经形态计算的超低功耗占用感知,一旦成熟将颠覆现有算力架构。目前行业共识是,占用网络的高效推理需要算法-软件-硬件的垂直协同设计,拥有全栈能力的厂商将在功耗和成本上获得决定性的竞争优势。
12. 安全性验证与可解释性
占用网络作为安全关键系统的一部分,其安全性验证与可解释性已成为从研发走向合规认证的核心命题。与传统目标检测不同,占用网络输出的是连续概率场,其置信度校准和误报/漏报的系统性分析更加复杂。功能安全标准ISO 21448(SOTIF)要求系统对未知场景和未知物体具有可控的失效机制,占用网络恰好是被寄予厚望的“未知障碍物兜底”方案,但这反过来要求它自身的安全性边界必须被清晰界定。
业界正从多个维度构建验证体系。一是基于真实事故数据的场景重放测试,将数百例典型碰撞场景注入仿真平台,评估占用网络在碰撞前关键时段内的输出稳定性。二是对抗性体素攻击测试,即人为在体素空间中生成微小扰动或物理世界可实现的对抗图案,检验网络的鲁棒性。三是可解释性分析,通过将占用输出反向投影到各相机视角,人工观察高风险和误判区域对应的原始图像模式,帮助算法人员快速定位模型弱点。部分研究还利用占用网络内部的注意力图,可视化3D空间中对预测贡献最大的图像区域,为模型的“透明化”提供线索。面向法规,中国和欧洲的待出台标准均关注感知系统的可论证安全,占用网络的Safety Case构建将成为下一阶段企业技术能力的分水岭。
13. 与高精地图的协同与替代路径
占用网络被冠以“轻地图重感知”路线的核心支撑技术,它不仅可作为高精地图的替代者,也能与其形成互补。在无图或弱图场景下,占用网络实时构建起一个半径为百米的局部世界模型,这个模型包含道路标线、路缘、护栏、障碍物等静态元素,足以支持即时路径规划。当多车共享占用场时,还可以云端融合形成轻量级的众包地图,持续动态更新,这正是特斯拉、蔚来等企业正在探索的“群体感知”闭环。
在有高精地图的区域,占用网络则充当了地图验证与偏差修正器。它可以将实时占用的几何边界与地图矢量层进行对齐,检测道路施工改道、临时障碍物等地图鲜度问题,确保规划模块不会盲目信赖过时地图。在技术架构上,部分方案直接在地图先验上叠加占用信息,将地图提供的墙、路缘等硬边界注入占用初始值,加速推理并提升精度;另一些方案则“脱图”运行,仅在背景层考虑地图线索。未来,随着感知精度的进一步提升,局部占用场将逐步承载越来越多原属于地图的静态语义功能(如道路等级、交叉口结构),地图将退化为全球导航骨架,而占用网络成为环境的实时数字孪生载体。
14. 产业链与竞争格局分析
占用网络技术已然形成了一个从芯片、传感器、数据工具到算法方案和整车集成的新兴产业链。在芯片与计算平台环节,英伟达凭借Orin和Thor的强势算力与软件生态,目前占据主导地位;高通通过Ride平台的集成ISP-AI-通信优势切入;国内地平线、黑芝麻、华为昇腾三足鼎立,正在通过提供专用占用网络参考设计来拉动芯片导入。
在数据与标注环节,海天瑞声、澳鹏、Scale AI等企业竞相推出占用网络专用标注工具,同时,以整数智能、龙猫数据为代表的新生力量正努力以更低成本抢占长尾场景标注市场。在算法方案层,Mobileye、Waymo、理想、小鹏等车厂与Tier 1均自研占用网络感知,但中小车企更多寻求外购方案,催生了Momenta、毫末智行、元戎启行等算法供应商的打包交付模式。在传感器侧,4D毫米波雷达企业(赛恩领动、楚航科技等)与激光雷达企业(禾赛科技、速腾聚创、图达通等)正围绕“融合占用网络”展开传感器选型之争。
竞争格局呈现“全栈自研”与“开放合作”两条路线分歧。头部新势力坚定自研,通过数据闭环构筑护城河;传统车企则倾向与算法Tier 1和芯片厂商组建联盟,以缩短研发周期并分摊成本。预计到2026年,整个占用网络相关市场规模(芯片、传感器增量、软件授权与数据服务)将达到80亿美元,成为智能驾驶产业中增长最快的细分领域之一。
15. 未来展望:全息占用、世界模型与端到端自动驾驶
占用网络的终极演进方向,是从一个感知模块成长为通用的世界模型(World Model)。未来的“全息占用”(Holographic Occupancy)将不仅仅描述几何占据与语义,还将融合辐射亮度、表面反射率、声音、温度等多种物理属性,形成一个多模态统一的数字孪生体。在这个数字孪生体中,仿真测试可以实时注入障碍物和传感器噪声,生成高保真训练数据,解决大规模安全场景采集的瓶颈。
更深远地,占用网络将作为视频生成模型和端到端自动驾驶系统的内部世界表征。借鉴Sora等扩散模型的思想,研究人员正在探索利用占用场作为中间潜变量,从稀疏传感器输入生成未来的三维场景演变,再渲染为多视角视频,实现闭环的规划-模拟-修正循环。当端到端模型直接输出控制信号时,占用场则作为隐式或显式的学习目标,是模型理解物理世界的最核心表达。尽管当下4D占用还在早期工程化阶段,但技术迭代的速度暗示我们:5至10年内,一个全分辨率、实时更新的4D世界模型很可能成为高阶自动驾驶的标准化基础模块,届时,人类设计的规则将逐渐被数据驱动的大模型取代,车辆将真正具备在任意开放环境中安全、智能地行动的能力。这一进程,既需要算法突破,也需要整个产业链的协同,更需要在法律法规、保险和伦理领域做好前瞻性布局,迎接一个由占用网络重新定义的智能出行时代。