概念庫 開放閱讀

佔據網路

概念庫 · 開放閱讀

概念 ID
occupancy-3
更新時間
2026-06-03
來源數量
1

佔據網路

1. 定義與核心範式躍遷

Occupancy Network,即佔用網路,是自動駕駛感知技術演進中的一次根本性範式躍遷。其核心思想在於,將真實、連續的三維物理世界,以一種極其細密的數學網格進行離散化表示,這個網格中的最小立方體單元被稱為“體素”(Voxel)。佔用網路即時地為每一個體素分配狀態:它被佔據了嗎?如果被佔據,它屬於哪一類物體?這種機制從本源上解決了一個困擾行業已久的根本缺陷——傳統“目標級”感知(Object-level Perception)對萬物進行“白名單”式識別的侷限性。在目標檢測範式下,感知系統只能辨認其訓練列表中預設的物體(如轎車、卡車、行人),而對列表之外的長尾異形障礙物,例如側翻在地的路錐、扭曲變形的施工護欄、或散落在路面的石塊,則直接視而不見,造成災難性漏檢。

佔用網路的誕生,標誌著智慧駕駛感知從“目標級”向“環境級”(Environment-level)的跨越。它不再試圖僅回答“前面有什麼”,而是持續回答“我周圍的每一寸空間,其狀態為何”。這個“兜底”能力,是高階智慧駕駛(尤其是城市導航輔助駕駛,City NOA)得以在複雜、開放性環境中安全執行的技術基石。從2022年特斯拉在AI Day上首次系統闡述其Occupancy Network技術方案開始,這一概念迅速凝聚為全行業共識,並分化出純視覺佔用網路與多模態融合佔用網路兩條主幹技術路徑,引發了感知架構的深刻重構。進一步地,佔用網路還將感知的表達能力從幾何空間拓展到時序與語義空間,成為後續預測、規劃模組可以直接消費的通用世界表徵,推動自動駕駛軟體架構從模組化走向“感知-預測-規劃”一體化。

2. 產業背景與量產概況

佔用網路技術的產業化程序,在2023年至2024年間經歷了從技術驗證到“早期量產爬坡”的爆發式增長。根據Yole Intelligence於2024年8月釋出的《自動駕駛感知技術年度報告》,全球Occupancy網路技術已正式從預研階段跨入部署期,在公共道路上實裝該方案的量產乘用車估算已超過120萬輛,市場覆蓋中國與北美兩大核心市場。這一資料的口徑,特指搭載了包含佔用網路感知方案的車輛,不再是實驗室Demo或測試車隊。

行業的主要推動力來自頭部造車新勢力與科技公司。蔚來、小鵬、理想、華為等國內方案商,均已在其城市NOA系統中實裝了佔用網路技術。這項技術的引入,大幅降低了對高精度地圖的剛性依賴,使得車輛在沒有預先測繪、釐米級地圖的道路上,依然能夠理解複雜的道路結構和障礙物分佈。例如,系統不再需要依賴地圖告知“這裡是一個複雜的十字路口”,而是通過即時體素重建,“看”到了路緣石、安全島、隔離帶和其他交通參與者的分佈,自行建置出可行駛區域的幾何邊界。這從根本上解決了高精地圖固有的鮮度不足、成本高昂與覆蓋率有限等商業化瓶頸,為城市智慧駕駛的大規模普及鋪平了道路。與此同時,在海外市場,特斯拉基於其自研FSD晶片和純視覺方案已將佔用網路推送至數百萬輛存量車,Mobileye、Waymo、Cruise等廠商也在積極推進佔用網路在其感知棧中的整合,全球競爭格局已進入白熱化階段。

3. 體素化的數學基礎與工程權衡

佔用網路的第一性原理根植於對連續空間的離散化,即體素化。在典型的感知範圍內——通常定義為車輛前向120米、車道方向左右各30米、高度方向8米的空間——連續的物理流形被切割成一個規整的三維網格。每個體素的解析度通常在0.1米至0.5米立方體之間浮動,這個引數直接決定了感知系統的粒度和對算力的消耗量級。

我們以一個典型配置(解析度為0.2米)進行估算:在120m × 60m × 8m的空間內,將產生 (120/0.2) × (60/0.2) × (8/0.2) = 600 × 300 × 40 = 7,200,000,即720萬個初始體素。這是一個巨大的數字。然而,物理世界的一個關鍵特性被用來進行大幅壓縮:空間是稀疏的。絕大多數體素處於“自由”狀態(即空氣),真正的資訊量集中在物體表面和內部。因此,工程實現中,絕不會為所有體素密集分配算力,而是採用稀疏資料結構(如三維稀疏卷積或雜湊表),只為那些在感測器觀測中可能存在的表面及其附近區域維護活躍體素狀態,從而將有效計算量降低一到兩個數量級。此外,為了平衡近處高精度感知和遠處低解析度感知的算力分配,不少方案引入了多解析度體素或可變解析度架構,比如在車體周圍10米內採用0.1米解析度,而在50米外降至0.4米,從而實現感知效能與即時性的最優折衷。

每個活躍體素內部,承載著一個高維狀態向量,它不僅是簡單的二值佔用標誌,更是一個綜合描述符。這個向量通常包含:佔用機率 p∈[0,1],表徵該空間被物質佔據的置信度;一個語義類別logits向量,用於區分車輛、行人、騎車人、道路表面、護欄、植被、建築物、通用障礙物等;以及可能的運動狀態標誌,用於區分靜態背景與動態前景。這個設計,讓每個微小的立方體都從一個純粹的幾何實體,升維為一個資訊豐富的語義實體,奠定了“環境級”感知的數學基礎。

4. 純視覺特徵編碼管線

純視覺是佔用網路最關鍵且最具挑戰性的輸入模態,特斯拉是該路線的標杆推動者。其核心任務是將多個2D相機(通常為6至8路,覆蓋車身360度)捕獲的RGB影像,通過深度神經網路升維至3D體素空間,併為每一個體素生成佔用狀態和語義資訊。這一過程通常遵循“2D特徵提取→視角變換(View Transformation)→3D特徵融合”的範式。

在2D特徵提取階段,採用成熟的影像骨幹網路(如RegNet、EfficientNet或ViT)從每路相機的輸入影像中提取多尺度特徵圖。關鍵的挑戰出現在視角變換階段:如何將2D影像特徵“提升”到3D空間。早期方法依賴顯式的深度估計(Depth Estimation),為每個畫素點預測一個深度分佈,然後通過外積操作將2D特徵沿深度維度“噴”入體素空間,形成相機視錐體素特徵(Frustum Voxel Features)。隨後,將多路相機的視錐體素特徵通過BEV(Bird’s Eye View)池化或三維體素編碼器進行融合,跨越不同相機之間的重疊與遮擋區域,最終輸出一個統一的車體座標系下的3D佔用場。特斯拉在其Occupancy Network中對此進行了精巧改進:他們不再依賴一個獨立的深度估計分支,而是通過對齊體素查詢(Voxel Query)與影像特徵之間的注意力機制,隱式地學習深度和體素佔用,此即基於Transformer的交叉注意力方案。該方案使梯度可以從佔用損失直接流回影像特徵提取器,實現了真正的端到端訓練,並顯著提升了對遠距離小障礙物的召回能力。純視覺方案的核心優勢在於硬體成本低、部署便捷,但其對夜間、雨霧、逆光等惡劣條件的魯棒性仍是產業化關鍵攻關點。業界正通過引入時序特徵、影像增強網路以及合成數據訓練等手段,逐步補齊純視覺在極端光照與天氣下的效能短板。

5. 多模態融合佔用網路:雷達與雷射雷達的協同

為解決純視覺方案在幾何精度和惡劣環境下的感知退化問題,多模態融合佔用網路成為另一條主流技術路線。其核心理念是融合不同物理原理的感測器資訊——相機提供豐富的語義紋理,毫米波雷達(Radar)提供徑向速度與距離,雷射雷達(LiDAR)提供精確的稀疏三維點雲端——從而在體素層面獲得更穩健、更精確的佔用描述。

毫米波雷達的特殊價值在於其速度測量能力。4D成像雷達(如Arbe、Mobileye、華為等方案)能夠直接輸出點雲端級的速度資訊,這對佔用網路的動態屬性預測至關重要。傳統視覺方案需要多幀時序推斷運動狀態,而雷達可以在單幀內直接給出每個反射點的徑向速度,這使得佔用網路能夠即時區分靜態背景與移動前景,甚至在擁堵紅綠燈場景下精準感知周圍車輛的起步與停止意圖。融合方法多采用“特徵級融合”:先為每種模態設計獨立的特徵編碼器(點雲端體素化、雷達點柱體化等),然後在統一的3D空間內將多模態特徵拼接或投影到同一體素特徵圖上,再通過一個輕量級融合網路輸出最終佔用。這種異構融合架構可以遮蔽單一感測器故障,實現冗餘感知。但多模態方案也帶來硬體成本增加、標定複雜度提升與資料對齊等新挑戰。如何在有限算力預算下最大化多感測器的互補增益,是當前量產工程的核心難題。

6. 時序資訊融合與4D佔用網路

從靜止的3D佔用擴充套件到包含時間維度的4D佔用,是佔用網路向預測能力演進的關鍵一步。4D佔用網路不僅回答“當前時刻空間被什麼佔據”,還能推斷“這些佔據將如何隨時間演化”。這本質上是在體素層面進行稠密的運動估計與佔用流預測。

工程實現中,時序融合通常依託於迴圈神經網路(RNN/LSTM)或Transformer的時序交叉注意力。一種典型架構是:將當前幀和歷史幀的體素特徵按時間順序排列,通過時空3D卷積或可變形注意力模組,在空間鄰域和時間鄰域內聚合資訊。模型會學習隱式地對運動體素進行“推拉”操作,從而預測未來0.5秒至3秒內的佔用變化。部分方案更進一步,在4D佔用的基礎上顯式生成體素級的速度場或佔用流,這使得下游的規劃器可以直接避開未來可能進入自車路徑的動目標。基於4D佔用,車輛能夠對“鬼探頭”、突然變道、行人橫穿等危險場景做出提前反應,大幅提升預判安全性。4D佔用網路的瓶頸在於時序對齊與歷史幀壓縮:必須精確補償自車運動(ego-motion)帶來的座標偏移,且需要設計高效的歷史幀快取機制,避免視訊記憶體和算力的線性增長。目前主流方案通常快取3至10幀歷史(約0.3-1秒),未來將向更長時序和自適應快取方向演進。

7. 佔用預測與運動規劃耦合

佔用網路不僅服務於感知,它正成為連線感知與規劃的橋樑。傳統架構中,感知輸出目標物列表,規劃器再基於這些列表進行決策,二者之間存在語義鴻溝和資訊損失。而佔用網路輸出的稠密佔用場,可以直接作為規劃的約束空間,使得規劃器能夠在統一的自由空間/佔用空間中進行最佳化,避免了“先檢測、後決策”流水線中的級聯誤差。

在具體實現上,規劃器將佔用場轉換為一個3D代價圖(Cost Map),每個體素根據佔用機率和語義類別加權得到一個“穿行代價”。自車在未來一定時間內的若干條候選軌跡,通過將軌跡穿越的體素代價進行時間積分,得到每條軌跡的安全成本與舒適度成本,再結合行進效率等目標,選擇最優軌跡。這種“佔用→代價→軌跡選擇”的方案,天然可以處理不規則障礙物和複雜道路邊界,因為它不依賴障礙物的具體外形類別,只問“該空間是否不可通過”。部分前沿研究甚至已經將佔用預測與規劃合併在同一個神經網路中,實現從感測器輸入直接到軌跡輸出的端到端聯合最佳化。特斯拉在其2023年公佈的技術細節中,便展示了基於佔用網路的“互動搜尋”規劃器,能夠在非結構化停車場、施工區域等場景中以類人的方式靈活穿行。這種緊密耦合對佔用的準確性和時延提出了極高要求:任何誤報的佔用都將導致不必要的剎停,任何漏報都可能導致碰撞,因此佔用預測的置信度校準和不確定性估計成為必須攻克的工程難題。

8. 監督訊號與真值生成:從LiDAR標註到自動標註

訓練佔用網路需要海量的真值監督資料,如何高效生成準確的3D佔用標籤成為產業化的第一道坎。最直接的方法是將高線束雷射雷達點雲端作為幾何真值:將每一幀LiDAR點雲端投影到體素網格,有點落入的體素標記為“佔據”,其餘通過射線投射(Ray Tracing)判斷為“自由”或“未知”。然而,這種稠密化過程對感測器的物理侷限敏感:例如,黑色車輛吸光導致點雲端缺失,鏡面反射造成偽點,雨霧產生噪點等,都會汙染真值質量。

為彌合這一差距,業界發展出“多感測器融合+多幀聚合”自動標註流水線。首先,通過高精定位和高精地圖將多趟採集、多輛車的資料進行離線對齊,形成一個龐大的聚合點雲端。然後,在聚合點雲端的基礎上,結合目標級檢測模型和人工標註修正,生成稠密、準確的佔用和語義標籤。對於動態物體,利用離線4D追蹤演算法將每個物體例項的運動軌跡恢復出來,從而生成4D佔用序列真值。最後,針對視覺方案的模型訓練,還需要將聚合點雲端通過感測器模型反向投影到每一幀相機的成像平面,進行一致性檢查。這套自動標註系統通常執行在雲端端數千張GPU的叢集上,其成本與技術壁壘極高,已成為頭部廠商的核心護城河。即便在自動標註技術高度成熟的今天,關鍵安全場景的真值仍需人工校驗,人機協同的標註體系將長期存在。

9. 損失函式設計與最佳化策略

佔用網路的損失函式設計直接決定了模型學到何種佔用表徵。基礎的佔用損失由“佔用分類損失”和“語義分割損失”加權構成。對於每個體素,佔用分類通常採用二值交叉熵(BCE)或Focal Loss來緩解正負樣本極度不均衡(絕大多數體素為自由)。語義損失則對佔據體素施加多分類交叉熵,以區分不同物體類別。

在實際最佳化中,這種逐體素的監督存在兩大問題:一是體素間的獨立性假設忽略了空間拓撲結構;二是在物體邊界處因離散化造成的不確定性懲罰過重。為此,現代佔用網路引入了結構感知損失,如結合佔用邊界和真實點雲端分佈的Chamfer Distance Loss,或採用佔用流(Occupancy Flow)一致性約束,即要求相鄰幀的佔用場在補償自車運動後具有高度一致性。此外,一些自監督輔助任務也被引入,例如要求網路同時預測深度圖或表面法向量,並與LiDAR投影或光流估計進行對齊,從而注入幾何先驗。對於多類別不平衡,即道路上某些類別(如腳踏車、行人)出現頻率遠低於路面和建築,可採用類別重加權或重取樣策略。在4D佔用的訓練中,往往採用課程學習策略:先訓練靜態3D佔用至收斂,再逐步引入時序任務和運動預測頭,幫助模型平滑收斂。整體而言,損失函式和訓練策略的精細化調優是決定佔用網路可量產性的關鍵,需要專業的演算法團隊與大規模工程試驗共同完成。

10. 基準資料集與評測體系

佔用網路評測體系的標準化是推動行業技術進步的重要支撐。2023年以來,學術界和產業界推出了一系列專用基準資料集。最具代表性的是OpenOccupancy-NuScenes和Occ3D-NuScenes,它們基於nuScenes資料集建置,提供360度全景的稠密佔用和語義標籤,體素解析度0.2米,覆蓋超過1000個場景、20個語義類別。另一基準SemanticKITTI則側重於雷射雷達視角的語義佔用評測。此外,面向長尾障礙物和極端天氣,Waymo Open Dataset、Lyft L5等也提供了部分可用資料,但在佔用真值標註的完善度上仍有欠缺。

評測指標方面,行業正在從單一的交併比(IoU)向多維度綜合評價體系演進。核心指標包括:幾何交併比(Geometry IoU,即體素佔用的空間重疊度)、語義交併比(Semantic IoU,即同時考慮類別正確的體素重疊度)、近距離召回率(Close-range Recall,體素距離自車5米內的平均召回,關乎碰撞安全)、遠距離密度保持率(Far-range Density Preservation)、以及即時性指標(幀率和時延)。面向4D佔用,新增了時序交併比和運動預測終點誤差等指標。值得注意的是,現有指標多從幾何一致性出發,尚無法完全反映佔用網路對下游規劃的實際價值。行業正致力於建立“感知-規劃聯合評測”架構,即直接將佔用網路接入規劃器,通過閉環模擬統計碰撞率、接管率和舒適度,從而為佔用的最佳化提供真正面向任務的技術展望。

11. 算力挑戰與硬體加速:從GPU到專用晶片

佔用網路對算力的消耗極為可觀,這是其量產路上最突出的瓶頸之一。以720萬體素的初始空間為例,若使用一箇中等規模的3D encoder網路,浮點運算量常在數百GFLOPS至數TOPS量級,而量產域控制器的算力預算通常僅為幾十到幾百TOPS,感知僅是其中的子系統之一。因此,模型壓縮與硬體加速成為必須進行的技術工程。

在演算法層面,神經架構搜尋(NAS)被廣泛用於搜尋高效3D基礎結構,如將常規3D卷積替換為分組可分離卷積或空間時序分解卷積。剪枝技術可去除對下游規劃貢獻度低的體素區域(如高空或遠距離邊界)。量化方面,主流方案已從FP32推進至混合精度FP16甚至INT8,在精度損失可控的前提下將推論速度提升2-4倍。在硬體層面,輝達Orin、高通Snapdragon Ride、地平線J5/J6以及特斯拉自研FSD等晶片,均對稀疏卷積和注意力機制的硬體加速進行了專門最佳化,例如支援稀疏張量Core、加速體素查詢等。更進一步,一些初創公司正在探索基於事件相機和神經形態計算的超低功耗佔用感知,一旦成熟將顛覆現有算力架構。目前行業共識是,佔用網路的高效推論需要演算法-軟體-硬體的垂直協同設計,擁有全棧能力的廠商將在功耗和成本上獲得決定性的競爭優勢。

12. 安全性驗證與可解釋性

佔用網路作為安全關鍵系統的一部分,其安全性驗證與可解釋性已成為從研發走向合規認證的核心命題。與傳統目標檢測不同,佔用網路輸出的是連續機率場,其置信度校準和誤報/漏報的系統性分析更加複雜。功能安全標準ISO 21448(SOTIF)要求系統對未知場景和未知物體具有可控的失效機制,佔用網路恰好是被寄予厚望的“未知障礙物兜底”方案,但這反過來要求它自身的安全性邊界必須被清晰界定。

業界正從多個維度建置驗證體系。一是基於真實事故資料的場景重放測試,將數百例典型碰撞場景注入模擬平台,評估佔用網路在碰撞前關鍵時段內的輸出穩定性。二是對抗性體素攻擊測試,即人為在體素空間中生成微小擾動或物理世界可實現的對抗圖案,檢驗網路的魯棒性。三是可解釋性分析,通過將佔用輸出反向投影到各相機視角,人工觀察高風險和誤判區域對應的原始影像模式,幫助演算法人員快速定位模型弱點。部分研究還利用佔用網路內部的注意力圖,視覺化3D空間中對預測貢獻最大的影像區域,為模型的“透明化”提供線索。面向法規,中國和歐洲的待出臺標準均關注感知系統的可論證安全,佔用網路的Safety Case建置將成為下一階段企業技術能力的分水嶺。

13. 與高精地圖的協同與替代路徑

佔用網路被冠以“輕地圖重感知”路線的核心支撐技術,它不僅可作為高精地圖的替代者,也能與其形成互補。在無圖或弱圖場景下,佔用網路即時建置起一個半徑為百米的區域性世界模型,這個模型包含道路標線、路緣、護欄、障礙物等靜態元素,足以支援即時路徑規劃。當多車共享佔用場時,還可以雲端端融合形成輕量級的眾包地圖,持續動態更新,這正是特斯拉、蔚來等企業正在探索的“群體感知”閉環。

在有高精地圖的區域,佔用網路則充當了地圖驗證與偏差修正器。它可以將即時佔用的幾何邊界與地圖向量層進行對齊,檢測道路施工改道、臨時障礙物等地圖鮮度問題,確保規劃模組不會盲目信賴過時地圖。在技術架構上,部分方案直接在地圖先驗上疊加佔用資訊,將地圖提供的牆、路緣等硬邊界注入佔用初始值,加速推論並提升精度;另一些方案則“脫圖”執行,僅在背景層考慮地圖線索。未來,隨著感知精度的進一步提升,區域性佔用場將逐步承載越來越多原屬於地圖的靜態語義功能(如道路等級、交叉口結構),地圖將退化為全球導航骨架,而佔用網路成為環境的即時數字孿生載體。

14. 產業鏈與競爭格局分析

佔用網路技術已然形成了一個從晶片、感測器、資料工具到演算法方案和整車整合的新興產業鏈。在晶片與計算平台環節,輝達憑藉Orin和Thor的強勢算力與軟體生態,目前佔據主導地位;高通通過Ride平台的整合ISP-AI-通訊優勢切入;國內地平線、黑芝麻、華為昇騰三足鼎立,正在通過提供專用佔用網路參考設計來拉動晶片匯入。

在資料與標註環節,海天瑞聲、澳鵬、Scale AI等企業競相推出佔用網路專用標註工具,同時,以整數智慧、龍貓資料為代表的新生力量正努力以更低成本搶佔長尾場景標註市場。在演算法方案層,Mobileye、Waymo、理想、小鵬等車廠與Tier 1均自研佔用網路感知,但中小車企更多尋求外購方案,催生了Momenta、毫末智行、元戎啟行等演算法供應商的打包交付模式。在感測器側,4D毫米波雷達企業(賽恩領動、楚航科技等)與雷射雷達企業(禾賽科技、速騰聚創、圖達通等)正圍繞“融合佔用網路”展開感測器選型之爭。

競爭格局呈現“全棧自研”與“開放合作”兩條路線分歧。頭部新勢力堅定自研,通過資料閉環構築護城河;傳統車企則傾向與演算法Tier 1和晶片廠商組建聯盟,以縮短研發週期並分攤成本。預計到2026年,整個佔用網路相關市場規模(晶片、感測器增量、軟體授權與資料服務)將達到80億美元,成為智慧駕駛產業中增長最快的細分領域之一。

15. 未來展望:全息佔用、世界模型與端到端自動駕駛

佔用網路的終極演進方向,是從一個感知模組成長為通用的世界模型(World Model)。未來的“全息佔用”(Holographic Occupancy)將不僅僅描述幾何佔據與語義,還將融合輻射亮度、表面反射率、聲音、溫度等多種物理屬性,形成一個多模態統一的數字孿生體。在這個數字孿生體中,模擬測試可以即時注入障礙物和感測器噪聲,生成高保真訓練資料,解決大規模安全場景採集的瓶頸。

更深遠地,佔用網路將作為影片生成模型和端到端自動駕駛系統的內部世界表徵。借鑑Sora等擴散模型的思想,研究人員正在探索利用佔用場作為中間潛變數,從稀疏感測器輸入生成未來的三維場景演變,再渲染為多視角影片,實現閉環的規劃-模擬-修正迴圈。當端到端模型直接輸出控制訊號時,佔用場則作為隱式或顯式的學習目標,是模型理解物理世界的最核心表達。儘管當下4D佔用還在早期工程化階段,但技術迭代的速度暗示我們:5至10年內,一個全解析度、即時更新的4D世界模型很可能成為高階自動駕駛的標準化基礎模組,屆時,人類設計的規則將逐漸被資料驅動的大型模型取代,車輛將真正具備在任意開放環境中安全、智慧地行動的能力。這一程序,既需要演算法突破,也需要整個產業鏈的協同,更需要在法律法規、保險和倫理領域做好前瞻性版面配置,迎接一個由佔用網路重新定義的智慧出行時代。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型