Grounding
3 秒看懂
- 本質:Grounding 是將抽象的符號(詞語、概念、指令)錨定到物理世界、感知資料或結構化知識上的過程。在多模態 AI 中,最常見的形態是“視覺 Grounding”——讓模型把語言描述與影像中的具體區域(物體、屬性、空間關係)精確對應起來。
- 核心價值:解決了“符號與實物脫節”的問題,使 AI 不再僅僅是文本的集合體,而是能夠理解並作用於真實環境的智慧代理。它被視為實現通用人工智慧(AGI)的關鍵能力之一。
- 典型表現:當你對 AI 說“把桌子上的紅色杯子遞給我”,模型需要先理解“桌子”、“紅色”、“杯子”這些詞,然後在攝像頭畫面中找到對應物體、定位其位置,並規劃機械臂去互動——這個過程就是 Grounding 在工作。
3 分鐘產業解釋
Grounding 並非單一技術,而是一大類使 AI 模型“落地”的能力的統稱。產業界主要關注兩個方向:
- 視覺-語言 Grounding:驅動了視覺問答(VQA)、影像描述、指代表達理解(Referring Expression Comprehension)、開放詞彙目標檢測(OVD)等任務。商業化落地包括:智慧安防中的“查詢黑衣背包男性”、自動駕駛中對罕見障礙物的理解、電商的“拍圖搜同款”精準匹配。
- 具身智慧與互動 Grounding:在機器人領域尤為重要。模型需要將“開啟抽屜”的指令對映為連續的動作序列,並理解當前環境的物理約束(重力、遮擋、物體剛性)。這是從數字世界走向物理世界的關鍵橋樑。
產業鏈核心矛盾在於模態的對齊精度和開放場景的泛化能力。當前技術路線從早期的“先檢測後匹配”轉向基於大型模型的端到端統一架構,如 GPT-4o、Gemini 等原生多模態模型,直接用文本 token 定位視覺座標,試圖無縫融合對物理世界的感知與推論。
15 分鐘專家深入
Grounding 的發展折射出 AI 從“模式識別”到“環境理解”的範式遷移。其技術深度體現在對跨模態表徵空間的建置、細粒度對齊機制的設計以及任務統一性的追求上。目前的競爭焦點集中在:
- 空間與邏輯交疊:不僅要找到物體,還要理解“從左邊數第三個”、“在陰影下的那個”等涉及空間計數、物理條件推論的表達。
- 指代消解與對話歷史:在多輪互動中,使用者說“它”、“那個大的”,模型需要基於歷史上下文正確 Grounding 到此前討論過的物體上。
- 開放集 Grounding:傳統目標檢測受限於預定義類別,而視覺-語言 Grounding 模型理論上可以定位任何被描述的物件(甚至抽象概念如“能用來寫字的物體”),這是邁向通用感知的關鍵。
衡量 Grounding 能力的核心不再是簡單的 mAP(平均精度),而是向指代理解準確率(如 RefCOCO 上的 精度)、定位偏差容忍度以及對細粒度屬性(材質、顏色、狀態)的分辨能力演進。同時,在具身智慧中,任務成功率、泛化到新物體/新環境的成功率成為硬指標。
技術原理(最深部分,剖析機制與關鍵引數)
視覺 Grounding 的技術核心可以抽象為:建置一個聯合嵌入空間,使得在該空間中,語言查詢的表示向量與影像對應區域的視覺表示向量距離最小化。依據解耦粒度不同,主要有以下範式:
1. 兩階段範式(先檢測,後匹配)
早期佔主導地位。流程為:
- 階段一:使用預訓練目標檢測器(如 Faster R-CNN)從影像中提取大量候選區域(Region Proposals),每個區域得到一個視覺特徵向量
v_i和空間座標b_i = (x, y, w, h)。 - 階段二:將語言查詢通過語言模型(如 LSTM、BERT)編碼為文本特徵向量
q。對每個候選區域計算匹配分數s_i = f(v_i, q),常用內積、拼接後經全連線層或 Transformer 交叉注意力。 - 訓練目標:最大化正樣本區域(與查詢語義一致)的分數,最小化負樣本區域分數(通常使用交叉熵或對比損失)。
侷限性:效能天花板受限於檢測器的召回率;無法處理“檢測器不認識”的類別(如“耳機盒上的劃痕”),開放域能力差。
2. 單階段範式(直接回歸/分割)
省去預先提取候選區步驟,直接從畫素/特徵圖中端到端預測目標位置。
- 基於 Transformer 的方案:將影像柵格化為 Patch 序列(類似 ViT),與語言 token 序列拼接送入多模態 Transformer。模型輸出時,為每個語言 token 預測其在影像中的對應區域,或直接解碼出一組
<查詢,邊界框>對。代表方法包括 MDETR 等。 - 特徵圖對齊:計算語言查詢特徵與影像特徵圖中每個空間位置的相似度,生成熱力圖(Heatmap),然後通過可微操作(如 Soft-Argmax + 寬高迴歸)直接輸出邊界框。代表方法有基於 CLIP 的 Grad-CAM 擴充套件等。
關鍵引數(定性):
- 影像 Patch 尺寸(如 16×16、14×14),直接決定空間粒度;
- 跨模態 Transformer 的層數、隱藏維度,影響細粒度對齊能力;
- 定位頭的設計:是僅迴歸中心點+寬高(4 引數)還是採用旋轉框、分割掩碼(Mask)輸出,決定幾何精度。
3. 生成式/大語言模型驅動的 Grounding
最新趨勢是將定位能力融入自迴歸語言模型。模型被訓練為在文本序列中插入特殊的 定位 Token,例如 <bbox> x1 y1 x2 y2 </bbox> 或離散化的座標 bin。在處理影像-語言多模態輸入時,模型的輸出不僅能回答問題,還能“說出”物體在哪裡。這統一了視覺理解與定位表達,使模型可以完成圖生定位、定位生圖、基於定位的推論等一切任務。
【輸入】影像 Patch Token ... 文本:找到照片裡的貓 <|grounding|>
【模型輸出】貓的邊界框:<|coor_start|> 120 34 256 198 <|coor_end|>
此範式不再依賴專用的檢測頭,完全依靠 Transformer 的解碼能力,具備極強的任務泛化性和組合推論能力。大型模型極低的零樣本誤差證明了其 Scaling Laws 的有效性,但推論成本高、座標精度受 tokenization 影響是現實瓶頸。
技術演進史
- 2013-2017 奠基期:深度學習驅動的視覺定位任務萌芽,基於 CNN-RNN 結構處理影像描述與簡單指代(如 Show, Attend and Tell 的注意力視覺化可視為一種弱 Grounding)。目標檢測架構(Faster R-CNN)成熟,成為標準候選區域提取器。
- 2018-2020 深度融合期:BERT 引發 NLP 革命後,ViLBERT、LXMERT、UNITER 等視覺-語言預訓練模型湧現,採用多模態 Transformer 在大規模圖文對資料上學習,Grounding 成為模型內生的注意力模式,但仍依賴預訓練的檢測器。
- 2021-2023 端到端與開放詞彙突破:MDETR 將檢測與指代理解統一為集合預測問題;CLIP 展現出驚人的開放詞彙視覺語義對齊能力,驅動了 OV-Det、Grounding DINO 等基於語言引導的開放世界檢測器誕生。Grounding 從封閉集走向開放集。
- 2024-至今 原生多模態大型模型統一:GPT-4o、Gemini、Qwen-VL 等大型模型原生支援視覺定位,將語言、視覺、座標統一為離散 token 序列進行處理。Grounding 不再是下游任務,而成為基礎模型的通識能力。具身智慧中的 3D Grounding、任務級 Grounding 成為研究前沿。
技術路線對比(量化表)
| 維度 | 兩階段檢測匹配 | 單階段直接回歸 | 大語言模型生成式 |
|---|---|---|---|
| 開放集能力 | 弱(限於檢測器詞彙) | 較強(語言特徵引導) | 極強(理論上無約束) |
| 定位精度 | 較高(候選框精細) | 中等(取決於特徵圖解析度) | 中高(座標離散化或迴歸頭配合) |
| 推論速度 | 慢(檢測器獨立執行) | 快(單次前向) | 很慢(大型模型自迴歸解碼) |
| 多工統一性 | 差(需單獨系統) | 中 | 優(視覺問答、定位、描述一體化) |
| 典型模型/方案 | MAttNet | MDETR, Grounding DINO, GLIP | GPT-4o, Gemini, CogVLM |
| 適用場景 | 算力有限、類別固定的工業部署 | 即時開放詞彙定位 | 通用人機互動、複雜推論 |
上下游
- 上游:
- 基礎視覺編碼器(ViT、CNN 骨幹網)與語言模型(LLaMA、Gemma 系列)提供特徵提取和語義理解能力;
- 高質量標註資料:人工精確標註的視覺指代資料集(RefCOCO 系列)、圖文對資料(LAION)、視覺指令微調資料。合成數據工具鏈(利用模擬器渲染生成孿生資料)成為新供給。
- 算力基礎設施:多模態大型模型訓練和推論需要大規模 GPU 叢集,跨模態注意力計算視訊記憶體消耗極大。
- 下游:
- 具身智慧與機器人:室內服務機器人、工業協作機器人,要求對操作目標、路徑空間(如“桌面左上角的零件”)進行亞釐米級 Grounding。
- 自動駕駛:對異形障礙物、交警手勢、臨時路障等語言+感測器輸入的 Grounding,作為感知系統的安全冗餘。
- 增強現實(AR):眼鏡端需即時理解“把說明書疊加在這個按鈕位置”,實現幾何與語義的雙重 Grounding。
- 內容安全與稽核:理解影像中的社交關係、違規物體並進行定位與解釋。
- 多模態 AI 助手:手機/PC 端的截圖理解、應用操作引導等。
關鍵指標
- 指代表達理解準確率( Precision@0.5/0.75):預測框與真值框 IoU > 0.5(或 0.75)的樣本佔比,是 REFCOCO/RefCOCO+ 等基準的核心指標。目前最先進模型(如強語言引導的生成式大型模型)在 RefCOCO val 上能達到 92%+ 的 ,但不同難度 Split(如對空間描述較長的 UNC 分割)仍有較大差異。
- 開放詞彙零樣本定位召回率:在未見過類別上的定位成功率,反映泛化能力。通常以 LVIS 或自定義資料集測試,尚未有統一行業標準。
- 多模態大型模型幻覺中的 Grounding 一致性:生成的定位座標是否“張冠李戴”(將紅色車定位到白色車上)或“無中生有”。以人工評測或輔助的自動校驗為主。
- 具身任務成功率:在模擬或真實環境中,完成“抓起所述物體”步驟的端到端成功率,是目前產業落地的終極指標,相比定位 IoU 更嚴苛,因為包含抓取姿態等物理約束。
供需與市場資料
- 需求側:隨著多模態大型模型成為 AI 領域確定性趨勢,企業對模型“世界理解力”的付費意願在急劇攀升。尤其是在以視覺推論為核心的工業 AI 質檢、倉儲機器人分揀等垂直場景,從 2024 年起需求呈指數級增長。據行業估算(引用調研機構定性判斷,具體數字未公開揭露),全球具身智慧+視覺 Grounding 的潛在市場到 2028 年將構成數百億人民幣規模的市場。
- 供給側:技術供給高度集中,主要由前沿 AI 實驗室(OpenAI、Google DeepMind、Meta、百川、智譜等)和機器人平台公司(Tesla、波士頓動力等)提供基礎能力,再由系統整合商封裝為行業解決方案。一個顯著趨勢是:基礎模型廠商正將 Grounding 作為一種平台服務提供,API 呼叫的形式極大降低了開發者的進入門檻。
- 核心矛盾:供給側的高昂推論成本(生成式 Grounding 模型每次定位需數秒、成本數美分)與需求側對即時性、低成本的要求間存在鴻溝。壓縮加速技術(Int8/Int4 量化、投機解碼、小模型精調)成為破局關鍵。
代表公司與資本對映
- OpenAI / Google(前沿路線):將 Grounding 作為多模態大型模型旗艦能力的核心組成部分展示,通過 GPT-4o 與 Gemini 樹立行業標杆,拉動雲端服務消耗,建立生態護城河。其投入規模巨大,資本對映為鉅額 AI 算力 CapEx。
- Meta(開源生態):通過釋出開源多模態模型(如 Chameleon、ImageBind 等)推動社群建設,策略為底層模型不收費,寄望於驅動 AR 眼鏡等硬體生態。對應資本關注其 Reality Labs 的長期投入。
- Tesla(垂直整合):在 Optimus 機器人及 FSD 中深度應用 Grounding 技術,將語言指令對映為車輛/機器人的物理行動,形成從資料採集、模型訓練到場景部署的閉環,被視為具身智慧 Grounding 最大潛在商業兌現實體,直接影響其車企之外的估值想像力。
- 國內廠商(如位元組、阿里、華為):均在大型模型體系下推出強視覺定位版本(如“豆包·視覺理解”的UI定位能力),並與自己的雲端服務、終端手機/汽車業務深度繫結,以 Grounding 能力作為差異化賣點吸引企業客戶。一級市場,具身智慧初創公司(如智元、宇樹、銀河通用等)因掌握高精度的真實環境 3D Grounding 技術而獲得極高估值溢價。
投資邏輯
- 能力原子化溢價:Grounding 被視為多模態理解的“臨門一腳”能力。能提供高精度、高泛化 Grounding 的平台公司將掌握進入物理世界 AI 應用的門票,估值將不僅基於軟體營收,還包括對整個機器人、AR 生態的控制權預期。
- 替代傳統感知鏈:開放詞彙 Grounding 模型正逐步替代封閉集目標檢測器,在安防、自動駕駛後備感知、工業缺陷檢測領域存在明確的存量替代邏輯。追蹤模型迭代速度與部署成本曲線(特別是端側晶片適配)是關鍵。
- 資料飛輪壁壘:出色的 Grounding 能力需要海量、精細的圖文空間對齊資料,而這些資料採集成本極高。先發廠商通過使用者互動可以建置資料閉環(如特斯拉自車資料),後發者難以逾越。公司在定位資料、3D 環境互動資料上的稟賦構成核心護城河。
- 風險關注:① 大型模型速率與成本,若效率提升遇阻,應用落地將嚴重推遲;② 純視覺/弱視覺方案在安全關鍵場景(如自動駕駛)中的可靠性,可能導致重大召回或事故,引發監管收緊;③ 開源社群的快速追趕可能將能力商品化,侵蝕閉源廠商的定價權。
常見誤讀糾偏(≥2)
- 誤讀 1:“能看圖回答問題的模型就一定具備好的 Grounding 能力”
很多多模態模型可以正確描述影像內容(例如“一個男孩在放風箏”),甚至回答需要推論的問題,但這說明其具備了影像的全域性理解,並不必然擁有精確的空間定位能力。全域性理解好比知道“畫面裡有風箏”,而 Grounding 要求精準框出風箏所佔的所有畫素。許多視覺語言模型在回答“風箏的尾巴在哪裡?”時可能會描述顏色,卻無法給出精準座標,甚至產生座標幻覺(將位置指到錯誤物體上)。兩者是相關但獨立演化的能力維度。 - 誤讀 2:“Grounding 就是一個升級版的目標檢測”
儘管兩者輸出形式可能都包含邊界框,但本質不同。目標檢測是“在預定義類別中找物體”,是封閉世界裡的模式匹配。Grounding 解決的是“將任意語言概念(包括組合概念、屬性、關係、抽象需求)與視覺區域對應”,它的核心是語義理解和對齊。一個典型的檢測器可以識別“杯子”,但 Grounding 模型需要理解並定位“裝了一半牛奶的、離你近的那個杯子”。因此,單純的高 mAP 檢測器無法替代 Grounding,後者是通向真正語義感知的必經之路。
學習路徑
- 奠基:掌握計算機視覺基礎(CNN/ViT,目標檢測經典架構 Faster/Mask R-CNN,瞭解 IoU、mAP)和自然語言處理基礎(Attention 機制,BERT/Transformer,詞嵌入)。
- 切入跨模態:深入研讀開創性視覺語言預訓練論文——CLIP(學習對比對齊)、ViLBERT/UNITER(瞭解多模態 Transformer 流)、MDETR(端到端定位)。在 RefCOCO 資料集上動手訓練一個小型定位模型,概念才會具體化。
- 前沿統一架構:閱讀 Grounding DINO、GPT-4V/RoPE 定位原理、KOSMOS-2、Qwen-VL 等原生支援定位的大型模型技術報告,理解座標 tokenization 和自迴歸 Grounding。關注新興的 3D Grounding 與具身操作論文(如 RT-2 系列),將 Grounding 從 2D 框拓展到 6-DoF 姿態與動作。
- 系統實踐:在實際機器人平台或 AR 裝置中部署一個開放詞彙定位模組,從功耗、延遲、對抗噪聲(光影變化)中體會工業級應用的真實約束,完成從“刷榜”到“可用”的認知躍遷。
一句話總結
Grounding 是 AI 睜開看懂世界的眼睛後,伸出手去觸碰世界的那個關鍵動作,它決定了智慧代理是否只會在數字世界裡做“文字遊戲”,還是能真正走進物理現實改造世界。
延伸閱讀與來源
- 核心論文:Radford et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP) [ICML 2021]; Liu et al. Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection [ECCV 2024]; Driess et al. PaLM-E: An Embodied Multimodal Language Model [ICML 2023].
- 技術報告與部落格:OpenAI GPT-4V(ision) System Card; Google DeepMind Gemini: A Family of Highly Capable Multimodal Models; Meta Chameleon: Mixed-Modal Early-Fusion Foundation Models.
- 權威基準與資料集:RefCOCO / RefCOCO+ / RefCOCOg (UNC) 系列用於指代表達理解;Omni3D 用於開放詞彙 3D Grounding;Google Scanned Objects 用於具身場景基準。
- 前瞻觀點:鐵梅(李飛飛)團隊及斯坦福 HAIs 有關空間智慧的論述;WAIC 2024 具身智慧專題論壇上國內外頭部實驗室的公開分享(可網路查詢實錄)。
注:本文涉及具體準確率數字、廠商指標均為公開論文/文件資料總結,未標示處來源於行業基準的一般範圍,非特定模型版本實測;市場估算為定性綜合自多家券商及諮詢機構分析觀點,未採用單一精確數值。