Occupancy(占据网络)
定位:自动驾驶 3D 感知核心范式 · 端云协同链路
标签:感知算法 BEV/3D 端到端 链-云
更新:2025 年 Q2
⚡ 3 秒速览
| 关键词 | 说明 |
|---|
| 一句话定义 | 将车辆周围 3D 空间离散化为体素(Voxel),逐体素预测”是否被占据+语义类别”的感知表征方法 |
| 核心价值 | 用统一网格统一建模车辆、行人、异形障碍物(落石/施工锥/动物),告别”先检测再建图”的两阶段范式 |
| 产业位置 | 感知算法层 → 为下游规划/控制提供稠密 3D 占据栅格输入 |
📖 3 分钟理解
是什么?
Occupancy Network(占据网络)是一种 稠密 3D 语义占据预测 方法:
- 体素化:以自车为中心,将周围空间(典型范围:前 60–100 m、左右 40 m、高 8 m)划分为 0.2–0.4 m 边长的立方体网格。
- 预测任务:对每个体素输出两维信息——
- 占据概率:该格是否被实体占据(二值/概率)
- 语义标签:车辆/行人/建筑/道路/植被/空(可选多类别)
- 输出:一张高分辨率 3D 占据栅格,供规划模块做碰撞检测与路径搜索。
为什么火?
| 驱动因素 | 说明 |
|---|
| 特斯拉效应 | 2022 AI Day 公布 Occupancy Network,将其作为 FSD v11 核心感知模块 |
| 长尾难题 | 传统 3D 检测器只能识别训练集内类别;Occupancy 用”占据”替代”类别”兜底所有未知物体 |
| 端到端趋势 | Occupancy 输出的体素栅格天然适配端到端架构(占据 → 代价体 → 规划轨迹) |
典型技术链路
多相机图像 ──→ Backbone(ResNet/ViT) ──→ BEV 特征 ──→ 3D 升维 ──→ Occupancy Head
│
摄像头 + LiDAR(可选)──────────────────────────────────────────────┘
▼
3D 占据栅格
│
▼
规划/控制模块
关键性能指标(公开基准参考)
| 指标 | 说明 | 典型值(2024 公开论文/开源) |
|---|
| mIoU(运动物体) | 运动体素交并比 | 30–45(纯视觉) |
| mIoU(全场景) | 含静止结构 | 40–55(视觉+LiDAR) |
| 推理延迟 | 端侧单帧耗时 | 30–80 ms(Orin 级别) |
🔬 15 分钟专家深入
一、技术原理
1.1 从 BEV 到 Occupancy 的演进
| 阶段 | 代表工作 | 核心思想 |
|---|
| 2D 检测 | YOLO/CenterNet | 在图像平面检测 2D 框 |
| 3D 检测 | DETR3D/PETR | 从图像预测 3D 框(长宽高+朝向) |
| BEV 语义 | BEVFormer/LSS | 将图像特征投影到鸟瞰图,做语义分割 |
| Occupancy | Tesla OccNet/FlashOcc | 在 BEV 基础上增加高度维,逐体素预测占据+语义 |
关键跃迁:BEV 仅是”俯视投影”(丢失高度信息),Occupancy 是真正的 3D 体素网格,能表达立交桥、隧道、车辆底盘等多层结构。
1.2 核心技术模块
① 2D→3D 特征提升(Lift)
- LSS 系(Lift-Splat-Shoot):预测每个像素深度分布,将 2D 特征”沿射线撒回”3D 空间。
- Transformer 系(BEVFormer):用 3D 参考点查询 BEV 特征,通过交叉注意力聚合多视角图像信息。
- 显式深度监督:引入 LiDAR 点云或深度真值做深度估计辅助损失。
② 3D 编码器
- 将稀疏 3D 特征体素化后送入 3D 卷积(如 SparseConv)或 3D Transformer。
- 稀疏化是关键:整幅场景体素数量可达 200³≈800 万,必须用哈希表/稀疏卷积只计算被占据区域。
③ Occupancy Head
- 分类头:逐体素做多分类(空/车/人/建筑…),常用 Focal Loss 或 Dice Loss。
- 回归头(可选):预测体素内 TSDF(截断符号距离场),用于更精细的表面重建。
④ 时序融合
- 融合历史帧的 BEV/占据特征(循环结构或帧间注意力),提升遮挡区域的推理能力。
- 可进一步做 占据流(Occupancy Flow) 预测,估计每个体素的速度矢量。
1.3 代表开源方案对比
| 方案 | 机构 | 年份 | 特点 |
|---|
| SurroundOcc | 北大/商汤 | 2023 | 首个大规模 Occupancy 数据集 + 基线 |
| FB-OCC | 人大/图森 | 2023 | 前后向特征对齐,mIoU 提升 |
| OccNet (Tesla) | Tesla | 2022 | 工程化标杆,细节未开源 |
| FlashOcc | 华中科技大学 | 2024 | 轻量化设计,延迟低至 30 ms@Orin |
| OpenOccupancy | 地平线 | 2024 | 面向量产,配合地平线芯片优化 |
注:上表 mIoU 数值因数据集划分不同不可直接横向比较,此处仅列方案定位。
二、产业链全景
2.1 产业链图谱(链-云视角)
┌─────────────────────────────────────────────────────────────────┐
│ 云 端 (Cloud) │
│ ┌──────────┐ ┌──────────────┐ ┌─────────────────────────┐ │
│ │ 数据闭环 │ │ 仿真测试平台 │ │ 模型训练/蒸馏/压缩 │ │
│ │ (采集→标注│ │ (CARLA/LGSVL │ │ (GPU集群 A100/H100) │ │
│ │ →回流) │ │ →自研) │ │ │ │
│ └──────────┘ └──────────────┘ └─────────────────────────┘ │
└──────────────────────────┬──────────────────────────────────────┘
│ 模型下发 OTA
┌──────────────────────────▼──────────────────────────────────────┐
│ 车 端 (Chain) │
│ ┌─────────┐ ┌───────────┐ ┌────────────┐ ┌──────────────┐ │
│ │ 传感器 │→│ 域控芯片 │→│ Occ 算法栈 │→│ 规划/控制 │ │
│ │摄像头×N │ │Orin/征程6 │ │ (前处理→ │ │ 占据栅格→ │ │
│ │LiDAR(可)│ │TDA4/自研 │ │ 骨干→Head)│ │ 代价体→轨迹 │ │
│ └─────────┘ └───────────┘ └────────────┘ └──────────────┘ │
└─────────────────────────────────────────────────────────────────┘
2.2 上游:传感器与芯片
| 环节 | 代表公司/产品 | 备注 |
|---|
| 摄像头模组 | 舜宇光学、欧菲光、联创电子、Sunny Optical | 车规级 800 万像素前视+环视 |
| LiDAR | 禾赛 AT128、速腾 M1/M2、图达通 Falcon | 部分 Occ 方案融合 LiDAR 做深度真值/点云监督 |
| 域控芯片 | 英伟达 Orin-X、地平线征程 6、黑芝麻 C1236、TI TDA4VH | Occ 算法对算力需求高(30–100 TOPS 起步) |
| 内存 | 三星/LPDDR5、SK 海力士 | 体素特征占用显存大,高带宽存储是瓶颈之一 |
2.3 中游:算法/软件
| 类型 | 代表公司/团队 | 说明 |
|---|
| 全栈自研 | 特斯拉、华为 ADS、小鹏 XNGP、理想 AD Max | 端到端+Occ 一体设计 |
| Tier-1 方案 | Momenta、地平线 SuperDrive、商汤绝影 | 提供感知算法+中间件,卖给主机厂 |
| 开源/学术 | OpenMMLab (MMDet3D)、SurroundOcc、nuScenes-Occ | 推动行业基线与评测标准 |
2.4 下游:整车与 Robotaxi
| 场景 | 应用方式 | 代表 |
|---|
| L2+ 量产车 | Occ 输出直接喂给规控模块 | 特斯拉 FSD v12、华为 ADS 3.0、小鹏 XNGP |
| L4 Robotaxi | Occ 与高精地图融合,做更精细的碰撞检测 | Waymo、百度 Apollo、小马智行 |
| 低速场景 | 泊车/园区,Occ 处理异形障碍物 | 纵目科技、酷黑科技 |
三、代表公司深度
3.1 特斯拉(Tesla)
| 维度 | 详情 |
|---|
| 发布节点 | 2022 AI Day 首次展示 OccNet;2024.8 发布端到端 FSD v12.5,Occ 融入端到端网络 |
| 技术特点 | 纯视觉(8 摄像头);自回归式多帧时序融合;DOJO 超算训练 |
| 数据优势 | 截至 2024 年,全球车队累计行驶里程超 300 亿英里(公司披露),持续回传 Corner Case |
| 争议 | 纯视觉方案在恶劣天气/夜间是否可靠仍有行业争论 |
3.2 华为 ADS
| 维度 | 详情 |
|---|
| 发布时间 | 2023 年 Q3 随问界 M9 发布 ADS 2.0,引入 GOD 网络(通用障碍物检测,Occ 思路) |
| 2024 进展 | ADS 3.0(2024.9 发布),端到端+GOD 网络一体化;支持激光雷达+视觉融合 |
| 搭载车型 | 问界 M9、M7,智界 S7,享界 S9 等 |
| 算力平台 | MDC 810(400+ TOPS) |
3.3 小鹏汽车
| 维度 | 详情 |
|---|
| 发布时间 | 2023 年 1024 科技日公布 XNet 2.0(引入 Occ) |
| 2024 进展 | 2024 年 5 月发布端到端架构,Occ 作为感知-规控衔接层 |
| 搭载车型 | G6、G9、X9、P7+ |
| 算力平台 | Orin-X × 2 |
3.4 理想汽车
| 维度 | 详情 |
|---|
| 发布时间 | 2024 年发布端到端+VLM 双系统架构,Occ 为核心表征 |
| 技术路线 | 视觉为主 + 激光雷达辅助真值监督 |
| 搭载车型 | MEGA、L9/L8/L7 Max 版 |
| 2025 规划 | 公开资料称计划将模型参数从约 30 亿扩展至超 50 亿(口径待官方确认) |
3.5 Momenta
| 维度 | 详情 |
|---|
| 定位 | Tier-1 算法供应商,向主机厂输出”飞轮”数据闭环方案 |
| Occ 方案 | 提供 Occ 感知栈+仿真工具链,支持客户适配不同芯片 |
| 合作车企 | 上汽智己、丰田(战略合作) |
3.6 地平线
| 维度 | 详情 |
|---|
| 芯片 | 征程 5(128 TOPS)、征程 6(560 TOPS) |
| Occ 生态 | 发布 OpenOccupancy 开源工具,联合学术界建立评测基线 |
| SuperDrive | 2024 年发布城区 NOA 全栈方案,Occ 为核心感知模块 |
四、中国产业进展
4.1 时间线
| 时间 | 事件 |
|---|
| 2022.10 | 特斯拉 AI Day 公布 OccNet,国内技术社区开始跟进研究 |
| 2023.04 | SurroundOcc 数据集开源(北大/商汤),推动学术复现 |
| 2023.10 | 小鹏 1024 日公布 XNet 2.0(含 Occ),国内首个公开量产 Occ 方案之一 |
| 2023.Q4 | 华为 ADS 2.0 随问界 M9 上市,GOD 网络(Occ 思路)落地 |
| 2024.Q1 | 地平线 OpenOccupancy 开源,联合 10+ 高校建立评测 |
| 2024.05 | 小鹏发布端到端架构,Occ 融入端到端管线 |
| 2024.09 | 华为 ADS 3.0 发布,端到端+GOD 一体化 |
| 2024.Q4 | 理想汽车公布端到端+VLM 双系统,Occ 为感知核心 |
| 2025.Q1 | 多家主机厂(比亚迪、长城、长安)披露 Occ 相关专利或技术预研 |
4.2 产学研格局
| 层面 | 代表 | 说明 |
|---|
| 学术 | 北大、清华、上海交大、华中科大、中科院 | 在 CVPR/ECCV/ICCV 发表多篇 Occ 相关论文 |
| 开源 | OpenMMLab (MMDet3D)、SurroundOcc、OpenOccupancy | 提供工具链和基线模型 |
| 产业 | 华为、小鹏、理想、Momenta、地平线、商汤绝影 | 量产或接近量产 |
| 标准 | 公开资料未见统一的 Occ 评测国家标准;行业多沿用 nuScenes / SurroundOcc 基准 | |
4.3 中国市场特殊性
| 特点 | 说明 |
|---|
| LiDAR 普及率高 | 与特斯拉纯视觉路线不同,国内主流方案多采用”视觉+激光雷达”融合,Occ 可利用 LiDAR 点云做深度真值监督 |
| 城区 NOA 竞赛 | 2024–2025 年国内城区 NOA 快速落地,Occ 作为统一障碍物表征成为标配 |
| 芯片自主化 | 地平线征程 6、黑芝麻 C1236 等国产芯片推动 Occ 在国产平台的优化部署 |
五、风险与争议
5.1 技术风险
| 风险 | 说明 |
|---|
| 计算开销 | 体素分辨率越高(0.1 m vs 0.4 m),体素数量呈立方增长;高分辨率 Occ 在端侧部署仍面临算力与内存瓶颈 |
| 真值标注成本 | 3D 体素级标注极其昂贵;主流方案依赖 LiDAR 点云投影生成伪真值,可能引入系统性偏差 |
| 时序一致性 | 多帧融合的 Occ 在高速/急转弯场景可能出现时序抖动或”幽灵体素” |
| 边界模糊 | 占据概率阈值的选取(0.3? 0.5?)直接影响规划模块的保守性/激进性,尚无行业统一标准 |
5.2 产业争议
| 争议 | 正方 | 反方 |
|---|
| 纯视觉 vs 融合 | 特斯拉:纯视觉足够,数据规模弥补硬件短板 | 华为/小鹏等:LiDAR 提供可靠深度真值,安全冗余不可少 |
| Occ vs 传统 3D 检测 | Occ 能兜底长尾障碍物 | 传统检测在已知类别上精度更高,Occ 精度仍落后 5–10 mIoU |
| 端到端黑箱 | Occ 是端到端的中间表征,最终可解释性下降 | 规划模块仍需显式占据栅格做安全校验 |
| 数据安全 | Occ 训练依赖海量回传数据,涉及地理信息/隐私 | 需平衡数据利用与合规(《汽车数据安全管理若干规定》等) |
5.3 监管与合规
| 维度 | 现状 |
|---|
| 功能安全 | Occ 属于感知模块,需满足 ISO 26262 ASIL-B 或以上要求;但”占据栅格”作为新表征,FMEA(失效模式分析)尚无成熟范式 |
| 数据合规 | 中国《汽车数据安全管理若干规定(试行)》要求车外人脸/车牌等信息脱敏;Occ 涉及的点云/图像数据需合规处理 |
| 测试标准 | 公开资料未见针对 Occ 的国家级测试标准;行业多参照 C-NCAP / i-VISTA 智能驾驶评测 |
六、关键数据汇总
| 数据项 | 数值 | 口径/来源 |
|---|
| 特斯拉全球车队累计里程 | >300 亿英里 | 2024 年公司披露 |
| 英伟达 Orin-X 单芯片算力 | 254 TOPS | 英伟达官网 |
| 地平线征程 6 算力 | 560 TOPS | 2024 年发布会,地平线官方 |
| 华为 MDC 810 算力 | 400+ TOPS | 华为智能汽车解决方案官网 |
| Occ 典型体素分辨率(量产) | 0.2–0.4 m | 行业通用配置(2024 公开论文) |
| Occ 端侧推理延迟(Orin 级) | 30–80 ms | FlashOcc 等论文(2024) |
| 华为 ADS 3.0 发布时间 | 2024 年 9 月 | 华为发布会 |
| SurroundOcc 数据集场景数 | 107,000+ 帧 | 论文公开(2023) |
说明:部分数值为公开论文/发布会数据,实际量产参数可能因软硬件版本不同存在差异。
七、未来展望
| 方向 | 趋势 |
|---|
| 端到端融合 | Occ 从独立模块逐渐融入端到端网络(感知→规控一体),减少模块间信息损失 |
| 4D 占据(+时序) | 从 3D 占据扩展到 4D(含速度/加速度场),为规划提供动态预测 |
| Occ + 世界模型 | 占据栅格作为世界模型的”状态空间”,支撑仿真/预测/决策闭环 |
| 轻量化部署 | 知识蒸馏+稀疏卷积+INT8 量化,目标:10 ms 级延迟@中端芯片 |
| 标准化 | 推动行业统一 Occ 评测基准与安全规范 |
免责声明:本文仅供技术科普与产业链研究参考,不构成任何投资建议或产品推荐。数据截至 2025 年 Q2,如有更新请以官方最新披露为准。