向量索引
3秒看懂
向量索引是面向高维向量数据的“目录与搜索引擎”。它将文本、图像、分子等非结构化信息转化为数值向量,在海量集合中快速找出最相似的 Top-K 个向量,驱动 RAG 检索、推荐召回、以图搜图、生物信息比对等核心 AI 应用。本质是用可接受的精度损失换取数量级查询加速的近似最近邻搜索(ANN)算法与数据结构。
3分钟产业解释
在大模型与生成式 AI 落地中,向量索引扮演着连接私有知识与大模型的纽带,也是向量数据库的心脏。RAG(检索增强生成)架构下,用户问题被编码为查询向量,索引从百万到十亿规模的文档片段库中毫秒级返回最相关结果,拼入提示词再交给大模型,从而抑制幻觉、适配垂直领域。 产业侧,向量索引已从学术界的局部敏感哈希(LSH)、树方法,演进为以图索引(HNSW)、量化索引(IVF‑PQ)、磁盘优化索引(DiskANN/SPANN) 为主流的生产级方案。云厂商(AWS Kendra、Azure AI Search、Google Vertex AI Matching Engine)、专精向量数据库(Pinecone、Milvus、Weaviate、Qdrant)以及传统数据库插件(pgvector、Elasticsearch)都将其作为核心卖点。当前竞争焦点集中在:百亿规模下的低延迟高召回、高性能混合标量过滤、多模态向量统一索引、内存与成本平衡,以及面向大模型的上下文感知索引优化。
技术原理
向量索引的本质是利用向量空间的结构性,避免全量扫描,将复杂度从 O(D×N)(D 维,N 为向量总数)降至亚线性。
1. 基于树的索引(KD‑Tree、Ball‑Tree)
通过递归超平面或超球体划分空间,构建二叉树结构,查询时遍历部分分支。受维数诅咒严重(D>20 后性能骤降),现代 ANN 系统中已边缘化。
2. 哈希索引(LSH)
使用一族局部敏感哈希函数,使相近向量以高概率映射到同一桶中。构建多个哈希表,查询时只计算同桶内候选。召回率通常不突出,需要较多哈希表弥补,存储与计算开销随精度要求上升很快。
3. 量化索引(IVF + PQ)
- IVF(倒排文件索引):先对全量向量做聚类(如 k‑means),每个类中心维护一个倒排列表。
- PQ(乘积量化):对残差向量分段量化编码,用短码节省内存,距离计算通过码表查找求和。
流程:查询向量先与粗聚类中心计算距离,选择最近的
nprobe个聚类,仅对这些聚类内的量化码进行距离评估。代表实现:Faiss 的IVF‑PQ。关键参数:nlist(聚类数)、M(PQ 子空间数),直接影响内存与精度。
4. 图索引(HNSW)
构建分层可导航小世界图:高图层节点少、提供长距离边实现快速跳转;底层包含所有对象,负责精确搜索。插入时各层按指数衰减概率分配,贪心搜索邻居并连接边。查询从最高层任意点开始贪心下降至底层,复杂度 O(log N)。结构天然支持增量插入、无需训练,但内存开销较大(需存储图边与原始向量)。代表:hnswlib、Faiss 的 HNSW。
ASCII 示意图(HNSW 分层结构)
层2: ● ───── ● <-- 少量节点,长边
层1: ●─●──●─●─● <-- 中等密度
层0: ●●-●●-●●-●●-●● <-- 所有节点,稠密图
查询从层2开始贪心下降。
5. 磁盘感知索引(DiskANN / SPANN)
基于 Vamana 图算法:构建稀疏图以保证直径小、出度可控,结合图分区与向量量化,将绝大部分向量数据存储在 NVMe SSD 上,内存仅保留图顶点的邻接结构和少量向量。查询时,内存图的入边/出边将搜索导向磁盘分区,按序加载数据块,在计算与 I/O 间取得平衡。单机 32 GB 内存 + SSD 可支持十亿级向量,实现毫秒级延迟。
6. 混合过滤机制
实际应用常需“类别=男鞋 AND 价格<500”的标量与向量联合查询。三种主流策略:
- 预处理过滤:先用标量索引过滤出 ID 集,再在缩小子空间内做向量搜索,简单但可能导致过滤后无结果。
- 后处理过滤:先向量搜索获得较多候选,再施加标量条件,可保证召回率,但可能出现空返回。
- 原生混合索引:构建融合元数据约束的向量索引,如分区向量索引、融合位图或仅连接满足过滤条件的边。代表方案:Milvus 的分区+向量索引、Weaviate 的 Filtered HNSW。
7. 距离度量与优化
常用 L2、内积、余弦相似度。大模型嵌入常经归一化,此时内积可直接反映相似度,索引效率更优。主流实现多针对内积/L2 优化,余弦相似度通过归一化转为内积处理。
8. 并行与硬件加速
利用 SIMD(AVX‑512/NEON)或 GPU(CUDA)加速批量距离计算;多线程并行扫描倒排列表;GPU 图索引(如 CAGRA)在 GPU 上构建图并利用 Kernel 并行探索多条路径,进一步降低查询延迟。
关键参数
向量索引的核心指标直接影响系统设计与选型:
- 召回率@K(Recall@K):返回 Top-K 结果中真实最近邻的比例。多数场景要求 ≥0.9,极敏感场景可能追求 0.99。
- 查询延迟(P50/P99 延迟,QPS):单向量查询耗时和给定吞吐下的尾延迟。纯内存 HNSW 常达亚毫秒级,磁盘方案通常 1‑5 ms。
- 索引构建时间:从原始向量到可用索引的耗时,影响数据新鲜度与更新策略。IVF 需训练码书,HNSW 插入相对较快但大规模构建仍需资源。
- 内存/存储占用:每向量字节数。通过 PQ、标量量化(SQ)可压缩至原始向量的 10%–30%,但可能损失精度。
- 规模扩展性:单机或分布式支持的最大向量数。纯内存 HNSW 受限于内存容量,磁盘优化或分布式分片可支撑十亿以上规模。
- 插入/删除/更新吞吐:支持在线更新的能力。图索引天然支持增量,IVF 类可能需周期性重建以维持精度。
- 混合过滤下的性能衰减率:加入标量过滤后,召回率和延迟的变化幅度,是评估生产可用性的关键。
典型参考数据(基于 SIFT1M、DEEP1B 等公开数据集,参数有差异,仅作数量级示意):
- HNSW(D=128,内积,内存):Recall@10 0.99,查询延迟 ~0.2 ms,内存 ~700 MB/百万向量。构建速度中等。
- IVF‑PQ(D=128,内积):Recall@10 0.95,查询延迟 ~2 ms,内存 ~60 MB/百万向量(压缩后)。
- DiskANN(D=128,内积,SSD):Recall@10 0.96,查询延迟 ~1.5 ms,内存 ~10 MB/百万向量。 来源:ANN‑Benchmarks 公开测试及论文报告,具体值受配置影响。
技术路线
不同索引技术路线在召回率、延迟、内存、扩展性、插入便利性上各有侧重,主流对比见下表:
| 方法 | 召回@10 典型范围 | 查询延迟 | 每向量内存 | 十亿级支持 | 增量更新 | 混合过滤 | 代表实现 |
|---|---|---|---|---|---|---|---|
| LSH | 0.7–0.9 | 中等(多表扫描) | 低(哈希码) | 一般 | 是 | 仅后处理 | 自实现较普遍 |
| IVF‑PQ | 0.9–0.98 | 1–5 ms | 低(压缩码) | 是(需压缩) | 支持但常需重建 | 预处理/后处理 | Faiss |
| HNSW | 0.95–0.995 | 0.1–1 ms | 高(图+原向量) | 内存瓶颈,需分片 | 是 | 困难,第三方扩展 | hnswlib, Faiss HNSW |
| DiskANN | 0.95–0.99 | 1–5 ms(磁盘) | 极低(内存图+SSD) | 是(设计目标) | 批量 | 有限 | DiskANN(微软), SPANN(阿里) |
| 原生混合过滤索引 | 依赖实现 | 增加延迟 | 中高 | 依赖底层 | 视实现 | 原生支持 | Milvus, Weaviate |
注:数据为公开基准测试和论文的定性归纳,受数据集、维度、参数影响,不做精确对比。
技术选型的一般原则:追求极致低延迟和中等规模(< 1 亿)优先考虑 HNSW;规模大、成本敏感选用 IVF‑PQ 或磁盘方案;混合过滤需求强烈则考察具备原生过滤能力的数据库;嵌入更新频繁、实时性要求高需关注增量路线。工业实践中常见级联多级索引:先用粗筛(IVF/AQ)获得候选集,再精确重排序;或 HNSW 图搜索后接入距离质控,兼顾速度与精度。
上游
向量索引的技术栈依赖以下上游要素:
- 嵌入模型:文本(OpenAI text-embedding-3、Cohere Embed、BGE)、多模态(CLIP、ImageBind)模型将原始数据转换为高维密集向量。嵌入质量直接决定检索天花板,维度、归一化方式也影响索引设计与距离度量选择。
- 计算硬件:GPU 用于训练嵌入和加速图构建(如 CAGRA 在 GPU 上构建图);CPU(尤其支持 AVX‑512/AMX 的 x86、ARM NEON)加速在线距离计算;专用加速器(FPGA/ASIC)仍处于早期探索,如 SambaNova 在某些场景提供定制检索。
- 存储与 I/O:NVMe SSD、持久内存(CXL 内存等新兴方案)、RDMA 高速网络为磁盘感知索引、分布式索引降低数据加载瓶颈。Intel Optane 虽已停产,但 CXL 附加内存等替代技术正被关注。
- 基础库与编译器优化:Faiss、hnswlib、OpenBLAS、MLIR 等底层数学库与向量化编译优化直接影响索引内核性能。
下游
向量索引作为基础组件,嵌入到更广泛的应用栈中:
- 向量数据库/检索引擎:直接封装索引导出增删改查与数据管理,向下游提供 API。代表:自建向量数据库(Pinecone、Milvus、Qdrant、Weaviate)及传统数据库的向量扩展(pgvector、Elasticsearch/OpenSearch 的向量搜索、Redis 向量搜索模块)。
- RAG 应用与框架:LangChain、LlamaIndex、Haystack 等框架通过检索器抽象调用底层向量索引,服务智能客服、企业知识库、AI 助手等终端场景。
- 推荐与广告系统:用户与物品表征向量化后,用索引快速召回候选,结合粗排、精排构成推荐引擎的召回层。
- 图像与视频检索:以图搜图、版权监测、数字资产管理。多模态嵌入模型 + 向量索引成为标准方案。
- 分子与生物序列相似性搜索:药物研发中相似分子查找,蛋白质结构比对,索引技术加速了虚拟筛选与序列比对流程。
受益公司
注:仅陈述行业生态与公开信息,不作为任何投资建议。
向量索引技术渗透至多条赛道,以下分类列出代表性企业:
- 独立向量数据库厂商(专精索引):Pinecone(托管云服务,声明采用专用索引)、Zilliz(开源 Milvus + 云服务 Zilliz Cloud,专注混合查询与分布式索引)、Weaviate(开源,GraphQL+Hybrid Search)、Qdrant(Rust 编写,高性能过滤搜索)、Chroma(轻量开发者友好嵌入)。
- 云厂商向量搜索服务:Amazon(Kendra、RDS pgvector 扩展)、Microsoft Azure(AI Search + DiskANN 技术)、Google Cloud(Vertex AI Matching Engine、AlloyDB AI)、Oracle(Database 23ai 向量检索)。
- 传统数据库集成向量能力:Elastic(原生向量搜索、支持 HNSW)、Redis(向量搜索模块)、MongoDB(Atlas Vector Search)、PostgreSQL(pgvector 插件,支持 IVFFlat/HNSW)、Datastax(Astra DB 嵌入向量搜索,收购向量搜索技术)。
- 底层算法与框架:Meta(Faiss 开源库)、微软(DiskANN)、NVIDIA(CAGRA 与 RAFT 库)。
- 端到端搜索平台:Marqo、Vectara、Glean 等,封装索引细节,提供面向特定场景的搜索体验。
行业趋势显示,数据库巨头正通过自研或收购将向量索引内嵌,独立数据库厂商则强调差异化性能与易用性,云厂商以生态整合与托管优势切入。
市场规模
公开资料中,全球向量索引独立市场规模缺乏单列统计,多数研究将向量索引视为向量数据库或 AI 数据管理市场的一部分。
根据多家研究机构(如 MarketsandMarkets、Grand View Research)在 2023–2024 年间发布的报告,全球向量数据库市场正处于爆发期,预测口径差异较大:
- MarketsandMarkets 估算 2023 年全球向量数据库市场约为 4.5 亿美元,预测 2028 年增长至 15.3 亿美元,复合年增长率约 27.8%(来源:MarketsandMarkets, Vector Database Market – Global Forecast to 2028, 2023)。
- 另一家机构 Grand View Research 认为 2023 年市场约 3.2 亿美元,2030 年将达到 9.4 亿美元(CAGR 24.5%)(来源:Grand View Research, Vector Database Market Size & Share Report, 2024)。
上述估算均包含数据库管理服务与相关工具,向量索引作为其核心技术组件并不单独拆分。部分行业博客和厂商引用的数据更为激进,例如宣称 2024 年全球向量数据库市场约 10 亿美元,2028 年有望达 50‑80 亿美元,但此类数据未经审计且缺乏报告支撑,仅可视为产业乐观预期的补充。
需求驱动力:生成式 AI 与 RAG 在企业搜索、客户服务、代码助手等场景的渗透率快速攀升;多模态数据(图像、音视频)分析需求爆发;传统数据库存量用户主动增添向量能力。供给端:开源方案占据相当份额,云厂商和独立厂商通过托管服务变现。价格模型上,索引算法本身多开源免费,商业价值通过数据库产品、SaaS 服务、企业支持实现。成本结构中,内存/ DRAM 消耗是主要开销,因此磁盘优化索引和存算分离方案对成本敏感的中大型企业吸引力突出。
(以上市场数字均标明年份、出处;激进估计已做特别说明,读者请审慎参考)
玩家对比
不同向量索引方案及封装产品的核心差异体现在算法选型、可扩展性、混合查询能力与生态整合:
- Faiss(Meta):底层算法库,提供 IVF‑PQ、HNSW、暴力搜索等多种索引,C++ 实现、GPU 支持,性能极致。但无独立服务端,需自行搭建分布式、数据持久化、访问控制等。适合算法实验和定制化系统。
- Milvus(Zilliz Cloud):开源分布式向量数据库,支持 HNSW、IVF‑PQ、DiskANN 等多种索引,原生混合标量过滤,存算分离架构。社区活跃,文档丰富。适合需要大规模分布式、复杂查询的企业。
- Pinecone:全托管云服务,索引细节封装,宣称自研算法。强调易用性、弹性伸缩、自带元数据过滤。但不开源,单集群性能细节外部无从验证。适合追求低运维负担的团队。
- Weaviate:开源,内置混合搜索(向量+关键词),自研 HNSW 变种,支持 GraphQL 查询。对多租户与过滤器优化较好,生态整合灵活。
- Qdrant:Rust 全栈实现,高性能,主打丰富过滤与量化索引,提供 API 和云服务。资源占用较低,适合性能敏感场景。
- pgvector(PostgreSQL 扩展):IVFFlat 和 HNSW 索引,直接嵌入关系数据库,支持事务、SQL 过滤,天然与现有数据栈结合。但大规模向量索引性能受限于 PostgreSQL 共享内存和索引构建速度,单表十亿级阻力较大。
- Elasticsearch / OpenSearch 向量搜索:在搜索引擎基础上追加向量功能,适合已有 Elastic 栈且需要文本+向量混合检索的团队,但纯向量搜索性能逊于专用数据库。
- DiskANN / SPANN:偏向极大规模、低内存场景,微软和阿里分别推出,多为云内部或学术使用,商业封装成熟度不及前述数据库。
综合评估可参考 ANN‑Benchmarks(ann‑benchmarks.com)的标准化测试,但其测试环境与实际生产有区别,不宜简单外推。
风险
向量索引技术及产业面临多重风险:
- 开源同质化与价值侵占:Faiss、hnswlib 等核心库的持续进化使得索引构建的门槛不断降低,云厂商可将这些基础能力免费用在自家服务中,威胁独立向量数据库厂商的溢价空间。
- 大模型长上下文窗口的替代效应:若未来大模型的上下文窗口足够大且成本显著下降,部分 RAG 场景可能直接用长上下文加载全部所需文档,削弱对向量检索的需求。目前看,检索增强仍是高效利用知识的主流范式,但风险不可忽视。
- 技术路线的不确定性:可学习索引(Learned Index)、多向量检索(如 ColBERT 的晚交互范式)、层次化摘要索引等新方向可能颠覆现有图/量化路线,早期投入的技术栈存在被替代可能。
- 混合过滤的性能不可预测性:标量过滤条件与向量搜索的组合查询,其性能随数据分布和条件变化剧烈,导致生产环境出现尾延迟飙升,影响 SLA。
- 数据隐私与合规:向量嵌入可能隐含原始数据敏感信息,通过逆推攻击可能泄露原文,对受监管行业(金融、医疗)的索引服务提出更高安全要求。
- 供应链安全:依赖开源核心库的企业面临软件供应链攻击风险,且部分索引库可能改变许可(如 Elastic 变更协议事件),需审慎评估治理模型。
误读纠偏
-
“向量索引 = 向量数据库” 索引是数据库的核心引擎,但向量数据库还包含数据管理、副本、安全、查询 API、监控与运维工具。直接拿 Faiss 等索引库处理生产级数据管理通常缺乏高可用和横向扩展能力,恢复复杂。
-
“HNSW 可以轻松支持十亿级向量” 纯 HNSW 每向量需存储邻居列表和原始向量,以 FP32 128 维为例,单向量原始数据约 512 字节,加上图边(通常出度 16‑64),内存可轻松超 1KB/向量。十亿级即需 TB 级内存,远超单机。产业界支持十亿级通常依赖 DiskANN/IVF‑PQ 或分布式 HNSW 分片。
-
“召回率越高越好” 追求 99.9% 召回率极大增加延迟与内存成本,但多数 RAG 场景下 85%‑95% 的召回对大模型最终生成质量影响微小。合理的选择是以成本换合适精度,而非盲目追求极高召回。
-
“向量搜索是新鲜事” 近似最近邻搜索已有数十年研究,早期的 LSH、KD-Tree 均为工业界所用。当前繁荣是算力、嵌入模型和大模型应用共同促发的产业升级,而非凭空出现。
-
“只要用了向量索引,应用性能就没问题” 索引只是加速检索的一环,端到端延迟还受嵌入生成、网络传输、排序重排、大模型推理等影响。索引选型需结合整体链路,否则容易形成局部优化。
最新事件
以下为截至 2025 年 4 月的近期行业动态,综合公开新闻与厂商发布。
- 2024 年 6 月:Milvus 发布 2.4 版本,引入多向量、多模态搜索能力,支持单文档的多向量表征索引,优化 GPU 索引(CAGRA 集成)与 JSON 数据类型过滤。
- 2024 年 7 月:Elastic 在 Elasticsearch 8.15 中进一步增强向量搜索,支持
int8_hnsw量化索引,内存占用降低约 50%,并推出语义重新排序。 - 2024 年 9 月:Pinecone 推出 Serverless 向量索引,用户无需管理节点规模,支持按读写与存储用量计费,声称成本降低 50% 以上。
- 2024 年 10 月:PostgreSQL 的 pgvector 0.7.0 发布,新增对 HNSW 索引的改善,支持并行索引构建和索引创建过程中的查询(
pgvector的 HNSW 早期版本构建时阻塞查询),提高了对生产负载的亲和度。 - 2024 年 11 月:微软宣布将 DiskANN 作为 Azure AI Search 的默认向量索引选项,并在 GitHub 上更新开源实现,增加了增量插入原型。
- 2025 年 1 月:Qdrant 发布 1.8 版本,新增基于 Bitmap 的标量索引加速混合过滤,并实验性地引入基于磁盘的向量索引来降低 TCO。
- 2025 年 3 月:Google 宣布 AlloyDB AI 增强,允许在同一 PostgreSQL 实例中运行向量工作负载,使用 ScaNN 技术,声称在 N2D 机型上十亿级数据集 ANN 查询延迟低于 2 ms。
- 2025 年 4 月:Databricks 在其 Lakehouse 平台内搭建原生向量搜索功能,利用 Delta Lake 与 Unity Catalog 集成,强调统一数据治理下的向量检索。
跟踪指标
关注向量索引技术演进与产业格局,可定期追踪以下指标:
- ANN-Benchmarks 排名变化:监测主流算法在标准数据集上的 Recall‑QPS 曲线,关注新入围算法(如
scann、cagra)。 - 开源项目活跃度:GitHub Star、Issue/PR 处理速度、Release 频率(Faiss、Milvus、Weaviate、Qdrant、pgvector、hnswlib)。
- 数据库厂商发布周期:Pinecone、Zilliz Cloud、Elastic、Azure AI Search 等产品迭代,对应索引功能增强。
- 学术论文与可学习索引:NeurIPS、ICML、VLDB 等相关论文,如多向量检索、基于压缩的自适应索引等。
- 行业报告与融资事件:第三方市场研究报告更新(如 MarketsandMarkets 的新版预测),独立向量数据库初创的融资额与估值变化。
- 云厂商定价与用量公开数据:AWS、Azure、GCP 向量搜索服务的定价调整与案例用量披露,反映成本趋势。
- RAG 框架对索引的支持演变:LangChain、LlamaIndex 集成的向量存储后端种类与性能对比。
- 标准化基准活动:如 TPC 可能推出针对向量数据库的基准测试,或 NIST 开展的检索评测。
信源
- J. Johnson, M. Douze, H. Jégou. “Billion-scale similarity search with GPUs.” IEEE Transactions on Big Data, 2019. (Faiss 介绍)
- M. Muja, D. G. Lowe. “Scalable Nearest Neighbor Algorithms for High Dimensional Data.” IEEE TPAMI, 2014.
- Y. A. Malkov, D. A. Yashunin. “Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs.” IEEE TPAMI, 2018. (HNSW)
- S. Jayaram Subramanya et al. “DiskANN: Fast Accurate Billion-point Nearest Neighbor Search on a Single Node.” NeurIPS, 2019.
- T. Chen et al. “SPANN: Highly-efficient Billion-scale Approximate Nearest Neighbor Search.” NeurIPS, 2021.
- Faiss 官方文档:https://github.com/facebookresearch/faiss
- ANN-Benchmarks 项目:https://ann-benchmarks.com
- Milvus 技术文档:https://milvus.io/docs
- Weaviate 博客与文档:https://weaviate.io
- MarketsandMarkets, “Vector Database Market – Global Forecast to 2028”, 2023. (引用数据注意时效)
- Grand View Research, “Vector Database Market Size & Share Report”, 2024.
- 各公司官方博客与 GitHub 仓库更新日志。
(本概念页技术参数与市场数据基于公开资料、基准测试和行业共识,具体性能受参数调优和硬件差异影响,部分前瞻性数字属产业推断,仅供参考。)