Grounding
3 秒看懂
- 本质:Grounding 是将抽象的符号(词语、概念、指令)锚定到物理世界、感知数据或结构化知识上的过程。在多模态 AI 中,最常见的形态是“视觉 Grounding”——让模型把语言描述与图像中的具体区域(物体、属性、空间关系)精确对应起来。
- 核心价值:解决了“符号与实物脱节”的问题,使 AI 不再仅仅是文本的集合体,而是能够理解并作用于真实环境的智能体。它被视为实现通用人工智能(AGI)的关键能力之一。
- 典型表现:当你对 AI 说“把桌子上的红色杯子递给我”,模型需要先理解“桌子”、“红色”、“杯子”这些词,然后在摄像头画面中找到对应物体、定位其位置,并规划机械臂去交互——这个过程就是 Grounding 在工作。
3 分钟产业解释
Grounding 并非单一技术,而是一大类使 AI 模型“落地”的能力的统称。产业界主要关注两个方向:
- 视觉-语言 Grounding:驱动了视觉问答(VQA)、图像描述、指代表达理解(Referring Expression Comprehension)、开放词汇目标检测(OVD)等任务。商业化落地包括:智能安防中的“查找黑衣背包男性”、自动驾驶中对罕见障碍物的理解、电商的“拍图搜同款”精准匹配。
- 具身智能与交互 Grounding:在机器人领域尤为重要。模型需要将“打开抽屉”的指令映射为连续的动作序列,并理解当前环境的物理约束(重力、遮挡、物体刚性)。这是从数字世界走向物理世界的关键桥梁。
产业链核心矛盾在于模态的对齐精度和开放场景的泛化能力。当前技术路线从早期的“先检测后匹配”转向基于大模型的端到端统一架构,如 GPT-4o、Gemini 等原生多模态模型,直接用文本 token 定位视觉坐标,试图无缝融合对物理世界的感知与推理。
15 分钟专家深入
Grounding 的发展折射出 AI 从“模式识别”到“环境理解”的范式迁移。其技术深度体现在对跨模态表征空间的构建、细粒度对齐机制的设计以及任务统一性的追求上。目前的竞争焦点集中在:
- 空间与逻辑交叠:不仅要找到物体,还要理解“从左边数第三个”、“在阴影下的那个”等涉及空间计数、物理条件推理的表达。
- 指代消解与对话历史:在多轮交互中,用户说“它”、“那个大的”,模型需要基于历史上下文正确 Grounding 到此前讨论过的物体上。
- 开放集 Grounding:传统目标检测受限于预定义类别,而视觉-语言 Grounding 模型理论上可以定位任何被描述的对象(甚至抽象概念如“能用来写字的物体”),这是迈向通用感知的关键。
衡量 Grounding 能力的核心不再是简单的 mAP(平均精度),而是向指代理解准确率(如 RefCOCO 上的 精度)、定位偏差容忍度以及对细粒度属性(材质、颜色、状态)的分辨能力演进。同时,在具身智能中,任务成功率、泛化到新物体/新环境的成功率成为硬指标。
技术原理(最深部分,剖析机制与关键参数)
视觉 Grounding 的技术核心可以抽象为:构建一个联合嵌入空间,使得在该空间中,语言查询的表示向量与图像对应区域的视觉表示向量距离最小化。依据解耦粒度不同,主要有以下范式:
1. 两阶段范式(先检测,后匹配)
早期占主导地位。流程为:
- 阶段一:使用预训练目标检测器(如 Faster R-CNN)从图像中提取大量候选区域(Region Proposals),每个区域得到一个视觉特征向量
v_i和空间坐标b_i = (x, y, w, h)。 - 阶段二:将语言查询通过语言模型(如 LSTM、BERT)编码为文本特征向量
q。对每个候选区域计算匹配分数s_i = f(v_i, q),常用内积、拼接后经全连接层或 Transformer 交叉注意力。 - 训练目标:最大化正样本区域(与查询语义一致)的分数,最小化负样本区域分数(通常使用交叉熵或对比损失)。
局限性:性能天花板受限于检测器的召回率;无法处理“检测器不认识”的类别(如“耳机盒上的划痕”),开放域能力差。
2. 单阶段范式(直接回归/分割)
省去预先提取候选区步骤,直接从像素/特征图中端到端预测目标位置。
- 基于 Transformer 的方案:将图像栅格化为 Patch 序列(类似 ViT),与语言 token 序列拼接送入多模态 Transformer。模型输出时,为每个语言 token 预测其在图像中的对应区域,或直接解码出一组
<查询,边界框>对。代表方法包括 MDETR 等。 - 特征图对齐:计算语言查询特征与图像特征图中每个空间位置的相似度,生成热力图(Heatmap),然后通过可微操作(如 Soft-Argmax + 宽高回归)直接输出边界框。代表方法有基于 CLIP 的 Grad-CAM 扩展等。
关键参数(定性):
- 图像 Patch 尺寸(如 16×16、14×14),直接决定空间粒度;
- 跨模态 Transformer 的层数、隐藏维度,影响细粒度对齐能力;
- 定位头的设计:是仅回归中心点+宽高(4 参数)还是采用旋转框、分割掩码(Mask)输出,决定几何精度。
3. 生成式/大语言模型驱动的 Grounding
最新趋势是将定位能力融入自回归语言模型。模型被训练为在文本序列中插入特殊的 定位 Token,例如 <bbox> x1 y1 x2 y2 </bbox> 或离散化的坐标 bin。在处理图像-语言多模态输入时,模型的输出不仅能回答问题,还能“说出”物体在哪里。这统一了视觉理解与定位表达,使模型可以完成图生定位、定位生图、基于定位的推理等一切任务。
【输入】图像 Patch Token ... 文本:找到照片里的猫 <|grounding|>
【模型输出】猫的边界框:<|coor_start|> 120 34 256 198 <|coor_end|>
此范式不再依赖专用的检测头,完全依靠 Transformer 的解码能力,具备极强的任务泛化性和组合推理能力。大模型极低的零样本误差证明了其 Scaling Laws 的有效性,但推理成本高、坐标精度受 tokenization 影响是现实瓶颈。
技术演进史
- 2013-2017 奠基期:深度学习驱动的视觉定位任务萌芽,基于 CNN-RNN 结构处理图像描述与简单指代(如 Show, Attend and Tell 的注意力可视化可视为一种弱 Grounding)。目标检测框架(Faster R-CNN)成熟,成为标准候选区域提取器。
- 2018-2020 深度融合期:BERT 引发 NLP 革命后,ViLBERT、LXMERT、UNITER 等视觉-语言预训练模型涌现,采用多模态 Transformer 在大规模图文对数据上学习,Grounding 成为模型内生的注意力模式,但仍依赖预训练的检测器。
- 2021-2023 端到端与开放词汇突破:MDETR 将检测与指代理解统一为集合预测问题;CLIP 展现出惊人的开放词汇视觉语义对齐能力,驱动了 OV-Det、Grounding DINO 等基于语言引导的开放世界检测器诞生。Grounding 从封闭集走向开放集。
- 2024-至今 原生多模态大模型统一:GPT-4o、Gemini、Qwen-VL 等大模型原生支持视觉定位,将语言、视觉、坐标统一为离散 token 序列进行处理。Grounding 不再是下游任务,而成为基础模型的通识能力。具身智能中的 3D Grounding、任务级 Grounding 成为研究前沿。
技术路线对比(量化表)
| 维度 | 两阶段检测匹配 | 单阶段直接回归 | 大语言模型生成式 |
|---|---|---|---|
| 开放集能力 | 弱(限于检测器词汇) | 较强(语言特征引导) | 极强(理论上无约束) |
| 定位精度 | 较高(候选框精细) | 中等(取决于特征图分辨率) | 中高(坐标离散化或回归头配合) |
| 推理速度 | 慢(检测器独立运行) | 快(单次前向) | 很慢(大模型自回归解码) |
| 多任务统一性 | 差(需单独系统) | 中 | 优(视觉问答、定位、描述一体化) |
| 典型模型/方案 | MAttNet | MDETR, Grounding DINO, GLIP | GPT-4o, Gemini, CogVLM |
| 适用场景 | 算力有限、类别固定的工业部署 | 实时开放词汇定位 | 通用人机交互、复杂推理 |
上下游
- 上游:
- 基础视觉编码器(ViT、CNN 骨干网)与语言模型(LLaMA、Gemma 系列)提供特征提取和语义理解能力;
- 高质量标注数据:人工精确标注的视觉指代数据集(RefCOCO 系列)、图文对数据(LAION)、视觉指令微调数据。合成数据工具链(利用模拟器渲染生成孪生数据)成为新供给。
- 算力基础设施:多模态大模型训练和推理需要大规模 GPU 集群,跨模态注意力计算显存消耗极大。
- 下游:
- 具身智能与机器人:室内服务机器人、工业协作机器人,要求对操作目标、路径空间(如“桌面左上角的零件”)进行亚厘米级 Grounding。
- 自动驾驶:对异形障碍物、交警手势、临时路障等语言+传感器输入的 Grounding,作为感知系统的安全冗余。
- 增强现实(AR):眼镜端需实时理解“把说明书叠加在这个按钮位置”,实现几何与语义的双重 Grounding。
- 内容安全与审核:理解图像中的社交关系、违规物体并进行定位与解释。
- 多模态 AI 助手:手机/PC 端的截屏理解、应用操作引导等。
关键指标
- 指代表达理解准确率( Precision@0.5/0.75):预测框与真值框 IoU > 0.5(或 0.75)的样本占比,是 REFCOCO/RefCOCO+ 等基准的核心指标。目前最先进模型(如强语言引导的生成式大模型)在 RefCOCO val 上能达到 92%+ 的 ,但不同难度 Split(如对空间描述较长的 UNC 分割)仍有较大差异。
- 开放词汇零样本定位召回率:在未见过类别上的定位成功率,反映泛化能力。通常以 LVIS 或自定义数据集测试,尚未有统一行业标准。
- 多模态大模型幻觉中的 Grounding 一致性:生成的定位坐标是否“张冠李戴”(将红色车定位到白色车上)或“无中生有”。以人工评测或辅助的自动校验为主。
- 具身任务成功率:在仿真或真实环境中,完成“抓起所述物体”步骤的端到端成功率,是目前产业落地的终极指标,相比定位 IoU 更严苛,因为包含抓取姿态等物理约束。
供需与市场数据
- 需求侧:随着多模态大模型成为 AI 领域确定性趋势,企业对模型“世界理解力”的付费意愿在急剧攀升。尤其是在以视觉推理为核心的工业 AI 质检、仓储机器人分拣等垂直场景,从 2024 年起需求呈指数级增长。据行业估算(引用调研机构定性判断,具体数字未公开披露),全球具身智能+视觉 Grounding 的潜在市场到 2028 年将构成数百亿人民币规模的市场。
- 供给侧:技术供给高度集中,主要由前沿 AI 实验室(OpenAI、Google DeepMind、Meta、百川、智谱等)和机器人平台公司(Tesla、波士顿动力等)提供基础能力,再由系统集成商封装为行业解决方案。一个显著趋势是:基础模型厂商正将 Grounding 作为一种平台服务提供,API 调用的形式极大降低了开发者的进入门槛。
- 核心矛盾:供给侧的高昂推理成本(生成式 Grounding 模型每次定位需数秒、成本数美分)与需求侧对实时性、低成本的要求间存在鸿沟。压缩加速技术(Int8/Int4 量化、投机解码、小模型精调)成为破局关键。
代表公司与资本映射
- OpenAI / Google(前沿路线):将 Grounding 作为多模态大模型旗舰能力的核心组成部分展示,通过 GPT-4o 与 Gemini 树立行业标杆,拉动云服务消耗,建立生态护城河。其投入规模巨大,资本映射为巨额 AI 算力 CapEx。
- Meta(开源生态):通过发布开源多模态模型(如 Chameleon、ImageBind 等)推动社区建设,策略为底层模型不收费,寄望于驱动 AR 眼镜等硬件生态。对应资本关注其 Reality Labs 的长期投入。
- Tesla(垂直整合):在 Optimus 机器人及 FSD 中深度应用 Grounding 技术,将语言指令映射为车辆/机器人的物理行动,形成从数据采集、模型训练到场景部署的闭环,被视为具身智能 Grounding 最大潜在商业兑现实体,直接影响其车企之外的估值想象力。
- 国内厂商(如字节、阿里、华为):均在大模型体系下推出强视觉定位版本(如“豆包·视觉理解”的UI定位能力),并与自己的云服务、终端手机/汽车业务深度绑定,以 Grounding 能力作为差异化卖点吸引企业客户。一级市场,具身智能初创公司(如智元、宇树、银河通用等)因掌握高精度的真实环境 3D Grounding 技术而获得极高估值溢价。
投资逻辑
- 能力原子化溢价:Grounding 被视为多模态理解的“临门一脚”能力。能提供高精度、高泛化 Grounding 的平台公司将掌握进入物理世界 AI 应用的门票,估值将不仅基于软件收入,还包括对整个机器人、AR 生态的控制权预期。
- 替代传统感知链:开放词汇 Grounding 模型正逐步替代封闭集目标检测器,在安防、自动驾驶后备感知、工业缺陷检测领域存在明确的存量替代逻辑。跟踪模型迭代速度与部署成本曲线(特别是端侧芯片适配)是关键。
- 数据飞轮壁垒:出色的 Grounding 能力需要海量、精细的图文空间对齐数据,而这些数据采集成本极高。先发厂商通过用户交互可以构建数据闭环(如特斯拉自车数据),后发者难以逾越。公司在定位数据、3D 环境交互数据上的禀赋构成核心护城河。
- 风险关注:① 大模型速率与成本,若效率提升遇阻,应用落地将严重推迟;② 纯视觉/弱视觉方案在安全关键场景(如自动驾驶)中的可靠性,可能导致重大召回或事故,引发监管收紧;③ 开源社区的快速追赶可能将能力商品化,侵蚀闭源厂商的定价权。
常见误读纠偏(≥2)
- 误读 1:“能看图回答问题的模型就一定具备好的 Grounding 能力”
很多多模态模型可以正确描述图像内容(例如“一个男孩在放风筝”),甚至回答需要推理的问题,但这说明其具备了图像的全局理解,并不必然拥有精确的空间定位能力。全局理解好比知道“画面里有风筝”,而 Grounding 要求精准框出风筝所占的所有像素。许多视觉语言模型在回答“风筝的尾巴在哪里?”时可能会描述颜色,却无法给出精准坐标,甚至产生坐标幻觉(将位置指到错误物体上)。两者是相关但独立演化的能力维度。 - 误读 2:“Grounding 就是一个升级版的目标检测”
尽管两者输出形式可能都包含边界框,但本质不同。目标检测是“在预定义类别中找物体”,是封闭世界里的模式匹配。Grounding 解决的是“将任意语言概念(包括组合概念、属性、关系、抽象需求)与视觉区域对应”,它的核心是语义理解和对齐。一个典型的检测器可以识别“杯子”,但 Grounding 模型需要理解并定位“装了一半牛奶的、离你近的那个杯子”。因此,单纯的高 mAP 检测器无法替代 Grounding,后者是通向真正语义感知的必经之路。
学习路径
- 奠基:掌握计算机视觉基础(CNN/ViT,目标检测经典架构 Faster/Mask R-CNN,了解 IoU、mAP)和自然语言处理基础(Attention 机制,BERT/Transformer,词嵌入)。
- 切入跨模态:深入研读开创性视觉语言预训练论文——CLIP(学习对比对齐)、ViLBERT/UNITER(了解多模态 Transformer 流)、MDETR(端到端定位)。在 RefCOCO 数据集上动手训练一个小型定位模型,概念才会具体化。
- 前沿统一架构:阅读 Grounding DINO、GPT-4V/RoPE 定位原理、KOSMOS-2、Qwen-VL 等原生支持定位的大模型技术报告,理解坐标 tokenization 和自回归 Grounding。关注新兴的 3D Grounding 与具身操作论文(如 RT-2 系列),将 Grounding 从 2D 框拓展到 6-DoF 姿态与动作。
- 系统实践:在实际机器人平台或 AR 设备中部署一个开放词汇定位模块,从功耗、延迟、对抗噪声(光影变化)中体会工业级应用的真实约束,完成从“刷榜”到“可用”的认知跃迁。
一句话总结
Grounding 是 AI 睁开看懂世界的眼睛后,伸出手去触碰世界的那个关键动作,它决定了智能体是否只会在数字世界里做“文字游戏”,还是能真正走进物理现实改造世界。
延伸阅读与来源
- 核心论文:Radford et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP) [ICML 2021]; Liu et al. Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection [ECCV 2024]; Driess et al. PaLM-E: An Embodied Multimodal Language Model [ICML 2023].
- 技术报告与博客:OpenAI GPT-4V(ision) System Card; Google DeepMind Gemini: A Family of Highly Capable Multimodal Models; Meta Chameleon: Mixed-Modal Early-Fusion Foundation Models.
- 权威基准与数据集:RefCOCO / RefCOCO+ / RefCOCOg (UNC) 系列用于指代表达理解;Omni3D 用于开放词汇 3D Grounding;Google Scanned Objects 用于具身场景基准。
- 前瞻观点:铁梅(李飞飞)团队及斯坦福 HAIs 有关空间智能的论述;WAIC 2024 具身智能专题论坛上国内外头部实验室的公开分享(可网络查询实录)。
注:本文涉及具体准确率数字、厂商指标均为公开论文/文档数据总结,未标示处来源于行业基准的一般范围,非特定模型版本实测;市场估算为定性综合自多家券商及咨询机构分析观点,未采用单一精确数值。