向量索引
3秒看懂
向量索引是面向高維向量資料的“目錄與搜尋引擎”。它將文本、影像、分子等非結構化資訊轉化為數值向量,在海量集合中快速找出最相似的 Top-K 個向量,驅動 RAG 檢索、推薦召回、以圖搜圖、生物資訊比對等核心 AI 應用。本質是用可接受的精度損失換取數量級查詢加速的近似最近鄰搜尋(ANN)演算法與資料結構。
3分鐘產業解釋
在大型模型與生成式 AI 落地中,向量索引扮演著連線私有知識與大型模型的紐帶,也是向量資料庫的心臟。RAG(檢索增強生成)架構下,使用者問題被編碼為查詢向量,索引從百萬到十億規模的文件片段庫中毫秒級返回最相關結果,拼入提示詞再交給大型模型,從而抑制幻覺、適配垂直領域。 產業側,向量索引已從學術界的區域性敏感雜湊(LSH)、樹方法,演進為以圖索引(HNSW)、量化索引(IVF‑PQ)、磁碟最佳化索引(DiskANN/SPANN) 為主流的生產級方案。雲端廠商(AWS Kendra、Azure AI Search、Google Vertex AI Matching Engine)、專精向量資料庫(Pinecone、Milvus、Weaviate、Qdrant)以及傳統資料庫外掛(pgvector、Elasticsearch)都將其作為核心賣點。當前競爭焦點集中在:百億規模下的低延遲高召回、高效能混合標量過濾、多模態向量統一索引、記憶體與成本平衡,以及面向大型模型的上下文感知索引最佳化。
技術原理
向量索引的本質是利用向量空間的結構性,避免全量掃描,將複雜度從 O(D×N)(D 維,N 為向量總數)降至亞線性。
1. 基於樹的索引(KD‑Tree、Ball‑Tree)
通過遞迴超平面或超球體劃分空間,建置二叉樹結構,查詢時遍歷部分分支。受維數詛咒嚴重(D>20 後效能驟降),現代 ANN 系統中已邊緣化。
2. 雜湊索引(LSH)
使用一族區域性敏感雜湊函式,使相近向量以高機率對映到同一桶中。建置多個雜湊表,查詢時只計算同桶內候選。召回率通常不突出,需要較多雜湊表彌補,儲存與計算開銷隨精度要求上升很快。
3. 量化索引(IVF + PQ)
- IVF(倒排檔案索引):先對全量向量做聚類(如 k‑means),每個類中心維護一個倒排列表。
- PQ(乘積量化):對殘差向量分段量化編碼,用短碼節省記憶體,距離計算通過碼錶查詢求和。
流程:查詢向量先與粗聚類中心計算距離,選擇最近的
nprobe個聚類,僅對這些聚類內的量化碼進行距離評估。代表實現:Faiss 的IVF‑PQ。關鍵引數:nlist(聚類數)、M(PQ 子空間數),直接影響記憶體與精度。
4. 圖索引(HNSW)
建置分層可導航小世界圖:高圖層節點少、提供長距離邊實現快速跳轉;底層包含所有物件,負責精確搜尋。插入時各層按指數衰減機率分配,貪心搜尋鄰居並連線邊。查詢從最高層任意點開始貪心下降至底層,複雜度 O(log N)。結構天然支援增量插入、無需訓練,但記憶體開銷較大(需儲存圖邊與原始向量)。代表:hnswlib、Faiss 的 HNSW。
ASCII 示意圖(HNSW 分層結構)
層2: ● ───── ● <-- 少量節點,長邊
層1: ●─●──●─●─● <-- 中等密度
層0: ●●-●●-●●-●●-●● <-- 所有節點,稠密圖
查詢從層2開始貪心下降。
5. 磁碟感知索引(DiskANN / SPANN)
基於 Vamana 圖演算法:建置稀疏圖以保證直徑小、出度可控,結合圖分割槽與向量量化,將絕大部分向量資料儲存在 NVMe SSD 上,記憶體僅保留圖頂點的鄰接結構和少量向量。查詢時,記憶體圖的入邊/出邊將搜尋導向磁碟分割槽,按序載入資料塊,在計算與 I/O 間取得平衡。單機 32 GB 記憶體 + SSD 可支援十億級向量,實現毫秒級延遲。
6. 混合過濾機制
實際應用常需“類別=男鞋 AND 價格<500”的標量與向量聯合查詢。三種主流策略:
- 預處理過濾:先用標量索引過濾出 ID 集,再在縮小子空間內做向量搜尋,簡單但可能導致過濾後無結果。
- 後處理過濾:先向量搜尋獲得較多候選,再施加標量條件,可保證召回率,但可能出現空返回。
- 原生混合索引:建置融合後設資料約束的向量索引,如分割槽向量索引、融合點陣圖或僅連線滿足過濾條件的邊。代表方案:Milvus 的分割槽+向量索引、Weaviate 的 Filtered HNSW。
7. 距離度量與最佳化
常用 L2、內積、餘弦相似度。大型模型嵌入常經歸一化,此時內積可直接反映相似度,索引效率更優。主流實現多針對內積/L2 最佳化,餘弦相似度通過歸一化轉為內積處理。
8. 並行與硬體加速
利用 SIMD(AVX‑512/NEON)或 GPU(CUDA)加速批次距離計算;多執行緒並行掃描倒排列表;GPU 圖索引(如 CAGRA)在 GPU 上建置圖並利用 Kernel 並行探索多條路徑,進一步降低查詢延遲。
關鍵引數
向量索引的核心指標直接影響系統設計與選型:
- 召回率@K(Recall@K):返回 Top-K 結果中真實最近鄰的比例。多數場景要求 ≥0.9,極敏感場景可能追求 0.99。
- 查詢延遲(P50/P99 延遲,QPS):單向量查詢耗時和給定吞吐下的尾延遲。純記憶體 HNSW 常達亞毫秒級,磁碟方案通常 1‑5 ms。
- 索引建置時間:從原始向量到可用索引的耗時,影響資料新鮮度與更新策略。IVF 需訓練碼書,HNSW 插入相對較快但大規模建置仍需資源。
- 記憶體/儲存佔用:每向量位元組數。通過 PQ、標量量化(SQ)可壓縮至原始向量的 10%–30%,但可能損失精度。
- 規模擴充套件性:單機或分散式支援的最大向量數。純記憶體 HNSW 受限於記憶體容量,磁碟最佳化或分散式分片可支撐十億以上規模。
- 插入/刪除/更新吞吐:支援線上更新的能力。圖索引天然支援增量,IVF 類可能需週期性重建以維持精度。
- 混合過濾下的效能衰減率:加入標量過濾後,召回率和延遲的變化幅度,是評估生產可用性的關鍵。
典型參考資料(基於 SIFT1M、DEEP1B 等公開資料集,引數有差異,僅作數量級示意):
- HNSW(D=128,內積,記憶體):Recall@10 0.99,查詢延遲 ~0.2 ms,記憶體 ~700 MB/百萬向量。建置速度中等。
- IVF‑PQ(D=128,內積):Recall@10 0.95,查詢延遲 ~2 ms,記憶體 ~60 MB/百萬向量(壓縮後)。
- DiskANN(D=128,內積,SSD):Recall@10 0.96,查詢延遲 ~1.5 ms,記憶體 ~10 MB/百萬向量。 來源:ANN‑Benchmarks 公開測試及論文報告,具體值受配置影響。
技術路線
不同索引技術路線在召回率、延遲、記憶體、擴充套件性、插入便利性上各有側重,主流對比見下表:
| 方法 | 召回@10 典型範圍 | 查詢延遲 | 每向量記憶體 | 十億級支援 | 增量更新 | 混合過濾 | 代表實現 |
|---|---|---|---|---|---|---|---|
| LSH | 0.7–0.9 | 中等(多表掃描) | 低(雜湊碼) | 一般 | 是 | 僅後處理 | 自實現較普遍 |
| IVF‑PQ | 0.9–0.98 | 1–5 ms | 低(壓縮碼) | 是(需壓縮) | 支援但常需重建 | 預處理/後處理 | Faiss |
| HNSW | 0.95–0.995 | 0.1–1 ms | 高(圖+原向量) | 記憶體瓶頸,需分片 | 是 | 困難,第三方擴充套件 | hnswlib, Faiss HNSW |
| DiskANN | 0.95–0.99 | 1–5 ms(磁碟) | 極低(記憶體圖+SSD) | 是(設計目標) | 批次 | 有限 | DiskANN(微軟), SPANN(阿里) |
| 原生混合過濾索引 | 依賴實現 | 增加延遲 | 中高 | 依賴底層 | 視實現 | 原生支援 | Milvus, Weaviate |
注:資料為公開基準測試和論文的定性歸納,受資料集、維度、引數影響,不做精確對比。
技術選型的一般原則:追求極致低延遲和中等規模(< 1 億)優先考慮 HNSW;規模大、成本敏感選用 IVF‑PQ 或磁碟方案;混合過濾需求強烈則考察具備原生過濾能力的資料庫;嵌入更新頻繁、即時性要求高需關注增量路線。工業實踐中常見級聯多級索引:先用粗篩(IVF/AQ)獲得候選集,再精確重排序;或 HNSW 圖搜尋後接入距離質控,兼顧速度與精度。
上游
向量索引的技術棧依賴以下上游要素:
- 嵌入模型:文本(OpenAI text-embedding-3、Cohere Embed、BGE)、多模態(CLIP、ImageBind)模型將原始資料轉換為高維密集向量。嵌入質量直接決定檢索天花板,維度、歸一化方式也影響索引設計與距離度量選擇。
- 計算硬體:GPU 用於訓練嵌入和加速圖建置(如 CAGRA 在 GPU 上建置圖);CPU(尤其支援 AVX‑512/AMX 的 x86、ARM NEON)加速線上距離計算;專用加速器(FPGA/ASIC)仍處於早期探索,如 SambaNova 在某些場景提供定製檢索。
- 儲存與 I/O:NVMe SSD、持久記憶體(CXL 記憶體等新興方案)、RDMA 高速網路為磁碟感知索引、分散式索引降低資料載入瓶頸。Intel Optane 雖已停產,但 CXL 附加記憶體等替代技術正被關注。
- 基礎庫與編譯器最佳化:Faiss、hnswlib、OpenBLAS、MLIR 等底層數學庫與向量化編譯最佳化直接影響索引核心效能。
下游
向量索引作為基礎元件,嵌入到更廣泛的應用棧中:
- 向量資料庫/檢索引擎:直接封裝索引匯出增刪改查與資料管理,向下遊提供 API。代表:自建向量資料庫(Pinecone、Milvus、Qdrant、Weaviate)及傳統資料庫的向量擴充套件(pgvector、Elasticsearch/OpenSearch 的向量搜尋、Redis 向量搜尋模組)。
- RAG 應用與架構:LangChain、LlamaIndex、Haystack 等架構通過檢索器抽象呼叫底層向量索引,服務智慧客服、企業知識庫、AI 助手等終端場景。
- 推薦與廣告系統:使用者與物品表徵向量化後,用索引快速召回候選,結合粗排、精排構成推薦引擎的召回層。
- 影像與影片檢索:以圖搜圖、版權監測、數字資產管理。多模態嵌入模型 + 向量索引成為標準方案。
- 分子與生物序列相似性搜尋:藥物研發中相似分子查詢,蛋白質結構比對,索引技術加速了虛擬篩選與序列比對流程。
受益公司
注:僅陳述行業生態與公開資訊,不作為任何投資建議。
向量索引技術滲透至多條賽道,以下分類列出代表性企業:
- 獨立向量資料庫廠商(專精索引):Pinecone(託管雲端服務,宣告採用專用索引)、Zilliz(開源 Milvus + 雲端服務 Zilliz Cloud,專注混合查詢與分散式索引)、Weaviate(開源,GraphQL+Hybrid Search)、Qdrant(Rust 編寫,高效能過濾搜尋)、Chroma(輕量開發者友好嵌入)。
- 雲端廠商向量搜尋服務:Amazon(Kendra、RDS pgvector 擴充套件)、Microsoft Azure(AI Search + DiskANN 技術)、Google Cloud(Vertex AI Matching Engine、AlloyDB AI)、Oracle(Database 23ai 向量檢索)。
- 傳統資料庫整合向量能力:Elastic(原生向量搜尋、支援 HNSW)、Redis(向量搜尋模組)、MongoDB(Atlas Vector Search)、PostgreSQL(pgvector 外掛,支援 IVFFlat/HNSW)、Datastax(Astra DB 嵌入向量搜尋,收購向量搜尋技術)。
- 底層演算法與架構:Meta(Faiss 開源庫)、微軟(DiskANN)、NVIDIA(CAGRA 與 RAFT 庫)。
- 端到端搜尋平台:Marqo、Vectara、Glean 等,封裝索引細節,提供面向特定場景的搜尋體驗。
行業趨勢顯示,資料庫巨頭正通過自研或收購將向量索引內嵌,獨立資料庫廠商則強調差異化效能與易用性,雲端廠商以生態整合與託管優勢切入。
市場規模
公開資料中,全球向量索引獨立市場規模缺乏單列統計,多數研究將向量索引視為向量資料庫或 AI 資料管理市場的一部分。
根據多家研究機構(如 MarketsandMarkets、Grand View Research)在 2023–2024 年間釋出的報告,全球向量資料庫市場正處於爆發期,預測口徑差異較大:
- MarketsandMarkets 估算 2023 年全球向量資料庫市場約為 4.5 億美元,預測 2028 年增長至 15.3 億美元,複合年增長率約 27.8%(來源:MarketsandMarkets, Vector Database Market – Global Forecast to 2028, 2023)。
- 另一家機構 Grand View Research 認為 2023 年市場約 3.2 億美元,2030 年將達到 9.4 億美元(CAGR 24.5%)(來源:Grand View Research, Vector Database Market Size & Share Report, 2024)。
上述估算均包含資料庫管理服務與相關工具,向量索引作為其核心技術元件並不單獨拆分。部分行業部落格和廠商引用的資料更為激進,例如宣稱 2024 年全球向量資料庫市場約 10 億美元,2028 年有望達 50‑80 億美元,但此類資料未經審計且缺乏報告支撐,僅可視為產業樂觀預期的補充。
需求驅動力:生成式 AI 與 RAG 在企業搜尋、客戶服務、程式碼助手等場景的滲透率快速攀升;多模態資料(影像、音影片)分析需求爆發;傳統資料庫存量使用者主動增添向量能力。供給端:開源方案佔據相當份額,雲端廠商和獨立廠商通過託管服務變現。價格模型上,索引演算法本身多開源免費,商業價值通過資料庫產品、SaaS 服務、企業支援實現。成本結構中,記憶體/ DRAM 消耗是主要開銷,因此磁碟最佳化索引和存算分離方案對成本敏感的中大型企業吸引力突出。
(以上市場數字均標明年份、出處;激進估計已做特別說明,讀者請審慎參考)
玩家對比
不同向量索引方案及封裝產品的核心差異體現在演算法選型、可擴充套件性、混合查詢能力與生態整合:
- Faiss(Meta):底層演算法庫,提供 IVF‑PQ、HNSW、暴力搜尋等多種索引,C++ 實現、GPU 支援,效能極致。但無獨立服務端,需自行搭建分散式、資料持久化、訪問控制等。適合演算法實驗和定製化系統。
- Milvus(Zilliz Cloud):開源分散式向量資料庫,支援 HNSW、IVF‑PQ、DiskANN 等多種索引,原生混合標量過濾,存算分離架構。社群活躍,文件豐富。適合需要大規模分散式、複雜查詢的企業。
- Pinecone:全託管雲端服務,索引細節封裝,宣稱自研演算法。強調易用性、彈性伸縮、自帶後設資料過濾。但不開源,單叢集效能細節外部無從驗證。適合追求低運維負擔的團隊。
- Weaviate:開源,內建混合搜尋(向量+關鍵詞),自研 HNSW 變種,支援 GraphQL 查詢。對多租戶與過濾器最佳化較好,生態整合靈活。
- Qdrant:Rust 全棧實現,高效能,主打豐富過濾與量化索引,提供 API 和雲端服務。資源佔用較低,適合效能敏感場景。
- pgvector(PostgreSQL 擴充套件):IVFFlat 和 HNSW 索引,直接嵌入關聯式資料庫,支援事務、SQL 過濾,天然與現有資料棧結合。但大規模向量索引效能受限於 PostgreSQL 共享記憶體和索引建置速度,單表十億級阻力較大。
- Elasticsearch / OpenSearch 向量搜尋:在搜尋引擎基礎上追加向量功能,適合已有 Elastic 棧且需要文本+向量混合檢索的團隊,但純向量搜尋效能遜於專用資料庫。
- DiskANN / SPANN:偏向極大規模、低記憶體場景,微軟和阿里分別推出,多為雲端內部或學術使用,商業封裝成熟度不及前述資料庫。
綜合評估可參考 ANN‑Benchmarks(ann‑benchmarks.com)的標準化測試,但其測試環境與實際生產有區別,不宜簡單外推。
風險
向量索引技術及產業面臨多重風險:
- 開源同質化與價值侵佔:Faiss、hnswlib 等核心庫的持續進化使得索引建置的門檻不斷降低,雲端廠商可將這些基礎能力免費用在自家服務中,威脅獨立向量資料庫廠商的溢價空間。
- 大型模型長上下文視窗的替代效應:若未來大型模型的上下文視窗足夠大且成本顯著下降,部分 RAG 場景可能直接用長上下文載入全部所需文件,削弱對向量檢索的需求。目前看,檢索增強仍是高效利用知識的主流範式,但風險不可忽視。
- 技術路線的不確定性:可學習索引(Learned Index)、多向量檢索(如 ColBERT 的晚互動範式)、層次化摘要索引等新方向可能顛覆現有圖/量化路線,早期投入的技術棧存在被替代可能。
- 混合過濾的效能不可預測性:標量過濾條件與向量搜尋的組合查詢,其效能隨資料分佈和條件變化劇烈,導致生產環境出現尾延遲飆升,影響 SLA。
- 資料隱私與合規:向量嵌入可能隱含原始資料敏感資訊,通過逆推攻擊可能洩露原文,對受監管行業(金融、醫療)的索引服務提出更高安全要求。
- 供應鏈安全:依賴開源核心庫的企業面臨軟體供應鏈攻擊風險,且部分索引庫可能改變許可(如 Elastic 變更協議事件),需審慎評估治理模型。
誤讀糾偏
-
“向量索引 = 向量資料庫” 索引是資料庫的核心引擎,但向量資料庫還包含資料管理、副本、安全、查詢 API、監控與運維工具。直接拿 Faiss 等索引庫處理生產級資料管理通常缺乏高可用和橫向擴充套件能力,恢復複雜。
-
“HNSW 可以輕鬆支援十億級向量” 純 HNSW 每向量需儲存鄰居列表和原始向量,以 FP32 128 維為例,單向量原始資料約 512 位元組,加上圖邊(通常出度 16‑64),記憶體可輕鬆超 1KB/向量。十億級即需 TB 級記憶體,遠超單機。產業界支援十億級通常依賴 DiskANN/IVF‑PQ 或分散式 HNSW 分片。
-
“召回率越高越好” 追求 99.9% 召回率極大增加延遲與記憶體成本,但多數 RAG 場景下 85%‑95% 的召回對大型模型最終生成質量影響微小。合理的選擇是以成本換合適精度,而非盲目追求極高召回。
-
“向量搜尋是新鮮事” 近似最近鄰搜尋已有數十年研究,早期的 LSH、KD-Tree 均為工業界所用。當前繁榮是算力、嵌入模型和大型模型應用共同促發的產業升級,而非憑空出現。
-
“只要用了向量索引,應用效能就沒問題” 索引只是加速檢索的一環,端到端延遲還受嵌入生成、網路傳輸、排序重排、大型模型推論等影響。索引選型需結合整體鏈路,否則容易形成區域性最佳化。
最新事件
以下為截至 2025 年 4 月的近期行業動態,綜合公開新聞與廠商釋出。
- 2024 年 6 月:Milvus 釋出 2.4 版本,引入多向量、多模態搜尋能力,支援單文件的多向量表徵索引,最佳化 GPU 索引(CAGRA 整合)與 JSON 資料型別過濾。
- 2024 年 7 月:Elastic 在 Elasticsearch 8.15 中進一步增強向量搜尋,支援
int8_hnsw量化索引,記憶體佔用降低約 50%,並推出語義重新排序。 - 2024 年 9 月:Pinecone 推出 Serverless 向量索引,使用者無需管理節點規模,支援按讀寫與儲存用量計費,聲稱成本降低 50% 以上。
- 2024 年 10 月:PostgreSQL 的 pgvector 0.7.0 釋出,新增對 HNSW 索引的改善,支援並行索引建置和索引建立過程中的查詢(
pgvector的 HNSW 早期版本建置時阻塞查詢),提高了對生產負載的親和度。 - 2024 年 11 月:微軟宣佈將 DiskANN 作為 Azure AI Search 的預設向量索引選項,並在 GitHub 上更新開源實現,增加了增量插入原型。
- 2025 年 1 月:Qdrant 釋出 1.8 版本,新增基於 Bitmap 的標量索引加速混合過濾,並實驗性地引入基於磁碟的向量索引來降低 TCO。
- 2025 年 3 月:Google 宣佈 AlloyDB AI 增強,允許在同一 PostgreSQL 例項中執行向量工作負載,使用 ScaNN 技術,聲稱在 N2D 機型上十億級資料集 ANN 查詢延遲低於 2 ms。
- 2025 年 4 月:Databricks 在其 Lakehouse 平台內搭建原生向量搜尋功能,利用 Delta Lake 與 Unity Catalog 整合,強調統一資料治理下的向量檢索。
追蹤指標
關注向量索引技術演進與產業格局,可定期追蹤以下指標:
- ANN-Benchmarks 排名變化:監測主流演算法在標準資料集上的 Recall‑QPS 曲線,關注新入圍演算法(如
scann、cagra)。 - 開源專案活躍度:GitHub Star、Issue/PR 處理速度、Release 頻率(Faiss、Milvus、Weaviate、Qdrant、pgvector、hnswlib)。
- 資料庫廠商釋出週期:Pinecone、Zilliz Cloud、Elastic、Azure AI Search 等產品迭代,對應索引功能增強。
- 學術論文與可學習索引:NeurIPS、ICML、VLDB 等相關論文,如多向量檢索、基於壓縮的自適應索引等。
- 行業報告與融資事件:第三方市場研究報告更新(如 MarketsandMarkets 的新版預測),獨立向量資料庫初創的融資額與估值變化。
- 雲端廠商定價與用量公開資料:AWS、Azure、GCP 向量搜尋服務的定價調整與案例用量揭露,反映成本趨勢。
- RAG 架構對索引的支援演變:LangChain、LlamaIndex 整合的向量儲存後端種類與效能對比。
- 標準化基準活動:如 TPC 可能推出針對向量資料庫的基準測試,或 NIST 開展的檢索評測。
信源
- J. Johnson, M. Douze, H. Jégou. “Billion-scale similarity search with GPUs.” IEEE Transactions on Big Data, 2019. (Faiss 介紹)
- M. Muja, D. G. Lowe. “Scalable Nearest Neighbor Algorithms for High Dimensional Data.” IEEE TPAMI, 2014.
- Y. A. Malkov, D. A. Yashunin. “Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs.” IEEE TPAMI, 2018. (HNSW)
- S. Jayaram Subramanya et al. “DiskANN: Fast Accurate Billion-point Nearest Neighbor Search on a Single Node.” NeurIPS, 2019.
- T. Chen et al. “SPANN: Highly-efficient Billion-scale Approximate Nearest Neighbor Search.” NeurIPS, 2021.
- Faiss 官方文件:https://github.com/facebookresearch/faiss
- ANN-Benchmarks 專案:https://ann-benchmarks.com
- Milvus 技術文件:https://milvus.io/docs
- Weaviate 部落格與文件:https://weaviate.io
- MarketsandMarkets, “Vector Database Market – Global Forecast to 2028”, 2023. (引用資料注意時效)
- Grand View Research, “Vector Database Market Size & Share Report”, 2024.
- 各公司官方部落格與 GitHub 倉庫更新日誌。
(本概念頁技術引數與市場資料基於公開資料、基準測試和行業共識,具體效能受引數調優和硬體差異影響,部分前瞻性數字屬產業推斷,僅供參考。)