3D 高斯潑濺
1. 3 秒看懂
一句話核心:基於顯式3D高斯函式的即時輻射場渲染技術,可在消費級GPU上實現超過100 FPS的高保真新視角合成,正驅動數字孿生、自動駕駛模擬與空間內容生產範式向即時、可互動方向躍遷。
2. 3 分鐘產業解釋
2.1 技術定位與突破
核心思想:將三維場景表示為數百萬個帶顏色和透明度的橢球(3D高斯函式),通過高度最佳化的可微分光柵化管線即時投影到螢幕,完全跳過耗時的神經網路推論。 關鍵里程碑:2023年8月,INRIA團隊在SIGGRAPH發表《3D Gaussian Splatting for Real-Time Radiance Field Rendering》,首次在百萬畫素解析度下以≥30 FPS實現與NeRF可比甚至更優的渲染質量,訓練時間從天級縮短至分鐘級。 產業角色:屬於 chain-cloud(雲端-端協同渲染鏈) 中的渲染引擎層,向上承接多檢視影像/點雲端資料,向下為各類即時3D應用提供輕量化、可互動的場景表示。
2.2 產業鏈概覽
- 上游:高效能GPU、3D掃描/多檢視採集裝置、攝影測量軟體、點雲端預處理演算法。
- 中游:3D Gaussian Splatting引擎與擴充套件、即時渲染中介軟體、雲端端渲染與流送服務。
- 下游:工業數字孿生、自動駕駛模擬與資料增強、影視虛擬拍攝與特效、沉浸式XR與遊戲、電子商務3D展示、文化遺產數字化等。
2.3 與NeRF的關鍵差異
| 特性 | NeRF (2020) | Gaussian Splatting (2023) |
|---|---|---|
| 場景表示 | 隱式神經網路(MLP) | 顯式3D高斯橢球集合 |
| 渲染方式 | 逐畫素射線取樣+網路推論 | 瓦片化可微分光柵化(CUDA) |
| 渲染速度 | 數秒/幀(RTX 3090 約0.5-2 FPS) | >100 FPS(同分辨率、同硬體) |
| 訓練時間 | 數小時至數天(單場景) | 5–60分鐘(單場景,A6000) |
| 儲存開銷 | 數十MB(僅網路權重) | 數百MB至數GB(全部高斯引數) |
| 可編輯性 | 低(需額外網路對映) | 相對高(可直接移動、刪除高斯點) |
以上效能數字源自原論文及公開復現報告(INRIA, 2023; NVIDIA Technical Blog, 2023)。
3. 技術原理
3.1 3D場景的顯式表示
Gaussian Splatting將場景構築為一組各向異性的3D高斯函式 G(x):
G(x) = exp(-½ (x-μ)ᵀ Σ⁻¹ (x-μ))
每個高斯基元由以下可最佳化引數組成:
- **位置 μ ∈ ℝ³**:橢球中心在世界座標系下的座標。
- **協方差矩陣 Σ ∈ ℝ³ˣ³**:刻畫橢球的形狀、大小及朝向。為保持半正定性並便於最佳化,分解為縮放向量 **s ∈ ℝ³** 和旋轉四元數 **q ∈ ℝ⁴**,Σ = RSSᵀRᵀ。
- **不透明度 α ∈ [0,1]**:控制該基元對畫素顏色的貢獻強度。
- **顏色**:用球諧函式(通常取3階,每個顏色通道16個係數)表達與視角相關的顏色 **c(v)**,替代簡單的RGB值。
### 3.2 快速可微分光柵化
渲染時不再是沿射線積分,而是將3D高斯投影到影像平面,形成2D高斯足跡,再按深度排序進行α-混合:
- **投影**:通過相機外參、內參將每個高斯的中心μ投影到影像座標,協方差矩陣近似為 Σ' = J W Σ Wᵀ Jᵀ(J為投影變換的雅可比)。
- **瓦片化排序**:將影像劃分為16×16畫素的瓦片,基於GPU雷達排序(Radix Sort)在每個瓦片內對可見高斯進行深度排列,大幅提升並行度。
- **顏色積累**:對每個畫素,按從前到後順序累加顏色:
C = ∑ᵢ cᵢ αᵢ' ∏ⱼ₌₁ⁱ⁻¹ (1 - αⱼ'),其中αᵢ' 是第i個高斯在該點的透射不透明度乘以其在2D投影函式上的權重。
整個流程不涉及任何神經網路前向傳播,完全由CUDA核心執行,這是即時渲染的核心保障。
### 3.3 訓練與自適應密度控制
訓練從一系列校準影像出發,初始點雲端可由SfM(Structure from Motion)提供或隨機初始化。損失函式結合L1損失和SSIM損失:
L = (1-λ) L1 + λ L_SSIM(通常 λ=0.2)。
最關鍵的自適應機制是**自適應密度控制**:
- 對梯度偏大的高斯進行**分裂**(體積過大)或**克隆**(體積偏小),以填充缺失的幾何區域、增強細節。
- 週期性移除不透明度接近於零的高斯,並重置不透明度過大的高斯以防止漂浮物累積。
通過這種“生長-修剪”迴圈,模型從稀疏點雲端逐步演化至緻密場景表示,通常數千次迭代即可收斂。
4. 關鍵引數
基於原始論文(INRIA, SIGGRAPH 2023)及主流開源實現,典型場景下的關鍵技術引數如下(所有數字均指2023年公開版本,硬體除標註外為NVIDIA RTX A6000):
- 輸入影像數量:50–300張有序多檢視影像,解析度典型為1080p–4K。
- 高斯基元數量:室內場景約80萬–200萬個;室外場景可達300萬–500萬個。
- 訓練時間:單場景約30分鐘(Mip-NeRF360資料集室內場景),複雜戶外場景可能1-2小時。
- 渲染幀率:1920×1080解析度下可達200–400 FPS(RTX 4090,來源:社群測試);原論文報告>100 FPS(RTX 3090)。
- 儲存模型大小:未壓縮模型從200 MB(簡單場景)到1.5 GB以上(大視場城市);壓縮變體(如LightGaussian、Compact3D,CVPR 2024)可將體積縮減至50–200 MB。
- 峰值訊雜比(PSNR):在Mip-NeRF360資料集上平均約27–29 dB,與當時最佳NeRF變體持平或略優;SSIM約0.80–0.85,LPIPS約0.15–0.25(越低越好)。
- GPU視訊記憶體佔用:訓練約6–12 GB,渲染約2–4 GB。
- 自適應控制超引數:克隆梯度閾值預設0.0002,分裂閾值0.0003(可調);每1000次迭代執行密度控制與不透明度重置。
以上引數隨場景複雜度、實現細節和硬體變化,但提供了量化參考基線。商業落地中普遍關注儲存-畫質-速度三元平衡。
5. 技術路線
5.1 原點:從隱式到顯式的範式切換
3DGS直接以顯式點基元替代隱式輻射場,繞開了NeRF的多次網路查詢,將3D重建推向“一次訓練、即時渲染”階段。開源庫(graphdeco-inria/gaussian-splatting)迅速成為社群基座。
5.2 質量與穩定性提升
- 抗鋸齒與多尺度:Mip-Splatting(SIGGRAPH 2024)引入3D頻率濾波,解決靠近遠離鏡頭時的走樣問題,提升泛化渲染質量。
- 漂浮物消除:通過額外正則化(如深度損失、幾何約束)減少懸浮偽影,代表工作有GOE(NeurIPS 2024)、SuGaR(引入表面網格對齊)。
5.3 緊湊與分發
- 壓縮路線:Compact3D(ECCV 2024)利用可微量化、熵編碼將模型大小壓縮至1/10以下;EAGLES(CVPR 2024)結合向量量化和流形學習;國內LightGaussian、GES等同樣瞄準行動端部署。
- 流式載入:分層細節級別(LoD)方案使雲端端可按視距傳輸部分高斯,降低首幀延遲,適用於Web與移動平台。
5.4 動態與可變形場景
- 4D Gaussian Splatting:引入時間維度,用可變形場驅動高斯位置與外觀,實現動態場景重建(CVPR 2024)。
- 與運動捕捉結合:將骨骼動畫或蒙皮變換施加於高斯點雲端,生成可控虛擬化身,已應用於電影預演和虛擬直播。
5.5 生成與編輯
- 文本/影像驅動生成:DreamGaussian(ECCV 2024)從擴散先驗直接生成高斯場景;FSGS(CVPR 2024)基於單張影像快速擴充套件體。
- 可編輯性與語義分割:語義高斯(如Feature Splatting)將語言特徵嵌入每個高斯,支援文本驅動的區域性編輯和查詢。
5.6 混合路線與硬體適配
- NeRF-GS融合:使用雜湊網格或子網預測高斯引數,解決稀疏視角難點。
- 專用硬體:NVIDIA、高通等研究在RT Core、行動端DSP上加速光柵化排序,可能催生標準化API。
6. 上游
6.1 GPU與計算硬體
- 訓練與渲染核心:需支援CUDA的高效能GPU。NVIDIA RTX 3090/4090為開發者首選,資料中心端A100/H100用於雲端端訓練和併發渲染。 規模資料:據NVIDIA FY2024財報(截至2024年1月),資料中心業務營收475.2億美元,年增率大增217%,主要受AI訓練需求驅動,3DGS等高並行渲染負載為其增量用例。整體獨立顯示卡市場2023年出貨量約3700萬片(Jon Peddie Research,2024年2月),其中中高階型號(RTX x060及以上)可較好執行GS。
- 行動端推論:驍龍8 Gen 3、AppleA17 Pro等集成了增強的光追與AI引擎,如Apple在WWDC 2024中演示了Metal下GS的輕量部署。公開資料未見行動端專用GS晶片量產資訊。
6.2 影像與點雲端採集
- 多檢視影像:智慧手機(iPhone 15 Pro系列支援LiDAR+高解析度陣列)、無人機、環物拍攝臺。 市場參考:全球智慧手機攝像頭模組市場2023年約500億美元(Yole Intelligence, 2024),為3D重建提供龐大的資料入口。
- 專業掃描裝置:手持式雷射雷達(如徠卡BLK、禾賽Pandar系列)及結構光掃描器產出高質量點雲端,可作為GS初始化輸入。禾賽科技2023年雷射雷達出貨量約22萬臺(公司財報),顯示三維感知上游的成熟度。
- 攝影測量軟體:RealityCapture、Agisoft Metashape等通過SfM生成稀疏點雲端,是當前3DGS標準的前端。
6.3 資料生態與標準
- 開源資料集:Mip-NeRF360、Tanks&Temples、ScanNet等提供標準測試場,是演算法迭代的基礎燃料。
- 儲存與傳輸:模型檔案尚無統一交換格式,多采用.ply夾帶球諧係數等擴充套件屬性,未來可能擴充套件至glTF或USD。
7. 下游
7.1 工業與城市數字孿生
- 應用:工廠產線毫米級即時監控、建築資訊模型(BIM)視覺化、城市執行儀表盤。高斯模型可流暢漫遊,支援脫離專業CAD軟體在輕量終端上檢視。 市場規模:全球數字孿生市場2023年約105億美元(MarketsandMarkets, 2023年12月),預計到2028年達481億美元,年複合增長率約35%。其中“渲染與視覺化”是核心元件之一。
7.2 自動駕駛模擬與資料增強
- 應用:從真實路採影片重建十字路口、車庫等場景,以GS渲染合成新視角、變道線變化、不同光照等,彌補物理資料採集的不足。Waymo、特斯拉等已公開或在研相關方法。 市場規模:自動駕駛模擬市場2023年約19億美元(Precedence Research, 2024年2月),預計2032年達68億美元,即時重建是重要技術棧。
7.3 影視特效與虛擬拍攝
- 應用:基於LED棚的虛擬製片需要照片級即時背景,GS提供的即時特性和視點相關外觀可替代部分傳統CG資產或攝影測量模型,縮短置景週期。 市場參考:全球虛擬製作市場2023年約24億美元(Grand View Research, 2024),年增長率超20%,對輕量級、高保真環境資產需求持續攀升。
7.4 XR與社交平台
- 應用:空間影片、體積捕捉、沉浸式聚會場景。Meta、Apple、字節跳動Pico等均看重3D內容生成效率。GS有望降低從真實世界捕獲虛擬空間的門檻。 終端出貨:全球VR/AR頭顯出貨2023年約800萬臺(IDC, 2024),隨著Apple Vision Pro(2024年2月上市)帶動空間計算概念,對高質量即時環境的需求將促進GS整合。
7.5 電子商務與營銷
- 應用:商品3D展示(手機環繞拍攝即可生成可互動模型)、虛擬展廳搭建。GS支援在瀏覽器WebGL環境執行壓縮版本,提升轉化率。 *公開資料未見專門針對GS電商應用的市場測算,但3D視覺化電商市場2023年約25億美元(Bloomberg Intelligence, 2024),受益於沉浸式購物趨勢。
8. 受益公司
| 型別 | 公司/機構 | 受益邏輯 | 公開資訊依據 |
|---|---|---|---|
| GPU硬體 | NVIDIA | 訓練與渲染依賴其GPU及CUDA生態,資料中心和遊戲卡均直接受益。 | NVIDIA FY2024年報;官方GTC 2024演示3DGS。 |
| AMD | Radeon GPU通過HIP等相容生態,有望承接部分開發需求;移動GPU整合GS光柵化支援。 | AMD 2023年分析師日材料公開提及3D渲染加速。 | |
| 雲端服務商 | AWS、微軟Azure、阿里雲端 | 提供GPU例項託管GS雲端端訓練/渲染,賦能中小企業按需使用。 | 阿里雲端2024年推出支援3DGS的AIGC服務;微軟Azure提供RTX系列例項。 |
| 三維重建與掃描 | Polycam, Luma AI | 行動端3D掃描應用已整合GS,實現即時預覽和分享,使用者量快速增長。 | Polycam 2023年12月釋出GS功能;Luma AI 2024年1月推出互動場景模式。 |
| 數字孿生平台 | 51WORLD、優立科技、商湯科技 | 將GS作為新一代渲染引擎,升級城市級、工業級孿生視覺化能力。 | 51WORLD官網2024年智慧城市方案提及神經渲染;商湯科技研究院發表GS相關論文。 |
| 遊戲引擎與中介軟體 | Unity、Epic Games(Unreal Engine) | 通過外掛或原生整合支援GS資產,允許開發者匯入高斯點雲端進行即時渲染。 | Unreal Engine 5.4開發路線圖提及考慮改進點雲端渲染;社群已有開源外掛。 |
| 自動駕駛模擬 | Cognata、Applied Intuition | 利用GS從真實資料快速重建場景,提高合成數據的多樣性與真實度。 | Applied Intuition 2024年技術報告中提及神經重建方案。 |
說明:上表僅分析產業環節中的受益邏輯,不構成任何投資或財務預測,各公司實際業務進展以其官方公告為準。
9. 市場規模
3D Gaussian Splatting作為一項底層技術,暫未形成獨立產品市場。其商業價值隱含在以下幾個已統計或預測的細分市場中(均採用2023–2024年公開報告,註明口徑):
- 3D重建軟體與服務:2023年18億美元,預計2028年達38億美元,CAGR 16.2%(MarketsandMarkets, 2023年9月)。GS可作為新一代重建引擎滲透其中。
- 即時渲染與視覺化:包含雲端渲染、遊戲引擎等,2023年約45億美元,2030年預計超120億美元(Acumen Research, 2024年1月)。GS將分享即時3D內容創作增量。
- 數字孿生:如前所述2023年105億美元,到2028年481億美元。其中模型視覺化和渲染部分約佔25-30%(MarketsandMarkets細分)。
- 空間計算與體積影片:新興領域,2023年空間計算市場約136億美元(Bloomberg, 2024),GS被視為建立可互動空間資產的關鍵技術。
- AI訓練與推論硬體:生成式AI與神經渲染驅動,2023年AI伺服器市場約200億美元(TrendForce, 2024),GS對GPU的消耗構成持續開銷。
注:以上均為預測性數字,基於報告發布時的假設,實際市場受宏觀經濟、技術突破等影響。公開資料中未見“Gaussian Splatting市場”專項測算,故以關聯市場分析替代。
10. 玩家對比
這裡聚焦開源方案與商業產品的核心差異,不包含基礎研究論文的列舉。
| 方案/產品 | 型別 | 核心特點 | 模型儲存(典型) | 渲染速度 (1080p) | 訓練時間 | 主要機構/公司 |
|---|---|---|---|---|---|---|
| 原始3DGS (graphdeco-inria/gaussian-splatting) | 開源 | 基準實現,自適應密度控制,高保真 | 200MB–1.5GB | >100 FPS (A6000) | 30–60分鐘 | INRIA |
| Mip-Splatting | 開源 | 抗鋸齒多尺度濾波,改善虛實邊緣 | 與原始相近 | >100 FPS | 約30分鐘 | 圖賓根大學, INRIA |
| SuGaR (Surface-Aligned) | 開源 | 提取網格,使高斯貼合表面,可編輯性強 | 300MB–800MB | 60–90 FPS | 1–2小時 | INRIA |
| Compact3D / LightGaussian | 開源 | 壓縮/量化,8–10倍體積縮減 | 30–150MB | 仍>100 FPS | 稍增30% | 清華大學, 上海交大; Meta |
| 4D Gaussian Splatting | 開源 | 動態場景重建,可變形場驅動 | 每幀可有不同高斯分佈,整體大 | 40–60 FPS | 數小時 | 多所高校聯合 |
| Luma AI (Interactive Scenes) | 商業應用 | 手機掃描一鍵生成,雲端端處理,支援網頁分享 | 雲端端最佳化後數百MB | 瀏覽器內30–60 FPS | 雲端端處理約15–30分鐘 | Luma Labs |
| Polycam | 商業應用 | iOS/Android掃描,提供GS模式即時預覽 | 本地或雲端端,約200MB | 行動端20–30 FPS | 本地快速重建約5–10分鐘(手機) | Polycam Inc. |
| KIRI Engine | 商業應用 | 跨平台照片建模,整合GS實驗性功能 | 200MB左右 | 20–40 FPS (移動) | 雲端端處理5–15分鐘 | KIRI Innovations |
注:以上速度與儲存資料來自各專案文件及2024年社群基準測試,均受硬體和場景複雜度影響。商業應用更新的功能以各版本更新日誌為準。
玩家差異化方向:壓縮與行動端支援(LightGaussian、Polycam)、動態內容(4DGS)、高保真表面編輯(SuGaR)、雲端端全託管(Luma AI)。尚無單一方案在所有維度全面領先。
11. 風險
11.1 技術替代與持續性
- 混合隱式-顯式方法:如基於Tensor Decomposition的TensoRF、結合張量分解與雜湊網格的Instant NGP,已在訓練速度和儲存之間取得平衡,且無大型.ply檔案。若融合方案成熟,可能分流GS優勢場景。
- 下一代輻射場表示:3D高斯隱函式體(GaussianFormer)、連續體積場等,可能繼承顯式的即時性並解決稀疏視角難題,屬於GS的直接演進威脅。
11.2 儲存與分發瓶頸
- 原始模型尺寸對於行動端、Web端及大型資產庫仍偏大,壓縮雖然有進展,但高壓縮率下畫質下降明顯。
- 缺乏行業標準格式,導致不同工具孤立,資產互換困難,阻礙工業化鏈條形成。
11.3 動態與物理模擬挑戰
- 對非剛性形變(如布料飄動)、流體等拓撲變化劇烈內容的建模,當前GS方案仍需要複雜的變形場且易產生破碎偽影。
- 無法直接適配現有物理引擎(Bullet、PhysX)進行碰撞檢測或力學模擬,限制了虛擬世界互動。
11.4 算力成本與能效
- 即時渲染雖快,但高幀率執行仍需中高階GPU,雲端渲染單路GPU成本較高,可能削弱規模化部署的經濟性。訓練電費開銷在雲端端場景不可忽視。
11.5 倫理與監管
- 深度偽造:從公開影片快速重建可渲染的逼真場景和人物,可能被用於生成虛假證據或合成不雅內容。已有使用GS生成數字人臉的案例,監管滯後。
- 隱私侵權:通過長焦影片重建私人空間,法律邊界模糊。
- 版權歸屬:基於真實場景重建的3D高斯模型,其版權歸資料採集者、模型訓練者還是場景主人?多個司法轄區尚無明確判例。
12. 誤讀糾偏
誤解1:“Gaussian Splatting就是點雲端渲染,沒什麼新奇。” 糾偏:傳統點雲端渲染採用離散點疊加,缺乏連續的體積表示和視角相關顏色,場景稀疏時有空洞。GS基於三維高斯橢球,具有體積融合、各向異性濾波和視角依賴光澤,其視覺連續性和軟遮擋效果遠超點雲端,而非簡單“點渲染”。
誤解2:“GS完全不需要神經網路,所以比所有NeRF都強。” 糾偏:GS確實繞過了渲染時的網路推論,但在稀疏視角(如<10張圖)下因缺乏幾何先驗,品質通常不如具備深度先驗或生成先驗的NeRF變體(如Zero-1-to-3、Reconfusion)。GS與NeRF並非簡單的替代,而是互補:GS擅長稠密檢視、即時互動;NeRF更擅長極稀疏視角和保持全域性一致性。
誤解3:“訓練出來的高斯模型可以直接匯入遊戲引擎做物理碰撞和動畫。” 糾偏:原始GS模型是一堆橢球集合,沒有網格拓撲和蒙皮資訊。儘管SuGaR等可從高斯提取網格,但目前主流引擎需要將其轉換為多邊形網格或高度場才能與物理系統銜接。直接使用GS作為可互動資產尚需額外編輯工具鏈,這是活躍的研究方向。
誤解4:“模型體積幾十GB,沒法實際用。” 糾偏:壓縮技術已能將典型場景壓縮至50–200MB,流式載入可根據視點只加載可見高斯,加上漸進式傳輸,有望與現有3D資產對頻寬的要求同一量級。此外,雲端渲染模式下終端僅接收影片流,根本不需下載模型。
13. 最新事件
(截至2025年4月公開訊息,日期為首次報道或釋出的大致時間)
- 2024年1月:Luma AI 在iPhone應用中上線“Interactive Scenes”功能,允許使用者掃描空間後生成基於GS的可互動3D場景,並一鍵分享網頁連結(Source: Luma AI Blog)。
- 2024年2月:NVIDIA 在 GitHub 釋出nv-GS程式碼庫,提供對RTX GPU上GS渲染的進一步最佳化,並演示在Orin邊緣裝置上實現即時高斯渲染(Source: NVIDIA Developer Blog)。
- 2024年3月:Polycam 推出“Gaussian Splat Pro”模式,支援更高解析度訓練和環形軌道匯出,創作者可將GS資產匯入Blender、Unity(Source: Polycam官方更新)。
- 2024年5月:Apple在WWDC 2024的Metal相關講座中展示了一個基於GS的空間影片渲染Demo,暗示其內部工具鏈對GS支援(公開媒體如MacRumors報道)。
- 2024年7月:SIGGRAPH 2024收錄超過30篇GS相關論文,其中“Mip-Splatting”“Compact3D”等被評為會議亮點;INRIA釋出更新版本1.2,引入WebGL檢視器(會議議程及專案GitHub)。
- 2024年9月:商湯科技釋出SenseMARS 5.0平台,宣稱整合神經輻射場與高斯濺射技術,用於城市級數字孿生快速生成(商湯科技官網新聞中心)。
- 2024年12月:開源架構GSplat(NERFSTUDIO擴充套件)獲Unity Asset Store推薦,成為Unity中匯入GS資產的主流外掛之一(Asset Store頁面)。
- 2025年1月:高通在CES 2025演示驍龍XR2+ Gen2平台執行輕量GS模型,用於混合現實空間錨定;公開資料未揭露商用化時間表。
14. 追蹤指標
為持續評估該技術演進及產業成熟度,建議關注以下量化指標:
技術質量指標(以Mip-NeRF360等標準資料集為基準,關注最新論文匯報值)
- PSNR / SSIM / LPIPS:與NeRF、基於雜湊網格的變體比較,觀察稀疏視角、反光材質等弱勢場景