向量資料庫
3 秒看懂
向量資料庫是面向高維向量(embedding)設計的新型資料基礎設施,專用於儲存、索引和快速檢索“語義上最相似”的內容。它不依賴關鍵詞匹配,而是通過向量間的數學距離(如餘弦相似度、歐氏距離)衡量相似性。在大型模型(LLM)檢索增強生成(RAG)、推薦系統、影像/音訊搜尋、多模態理解等場景中,向量資料庫充當外部非結構化知識的語義索引,直接決定檢索延遲與召回質量,是 AI 應用從“模型智慧”邁向“資料智慧”的關鍵橋樑。
3 分鐘產業解釋
當文本、影像等非結構化資料被深度神經網路編碼為一組高維浮點數(向量,通常數百至數千維)之後,傳統關係型資料庫的 B‑Tree、倒排索引等結構便無法表達“意思相近”這類模糊匹配。向量資料庫將“語義相似”轉化為“空間鄰近”,藉助**近似最近鄰(ANN)**演算法,在毫秒級完成海量向量檢索。
從產業定位看,向量資料庫處於 AI 基礎設施的中間層:向上承載大型模型應用(尤其 RAG),向下依賴記憶體、NVMe SSD、GPU 等異構硬體。其產品形態通常具備以下能力:
- 全託管/雲端原生:自動擴縮容、多租戶隔離、跨可用區容災。
- 混合搜尋:結合標量過濾(時間、標籤、使用者 ID)與向量相似度,支援複雜查詢。
- 即時更新:支援流式向量寫入、動態索引增刪,而非僅靜態批次建庫。
- 生態對接:LangChain、LlamaIndex、Dify 等 LLM 應用架構已內建主流向量資料庫驅動,開發者一鍵接入。
2023 年後,向量資料庫從利基技術躍升為 AI 棧核心元件,市場規模快速擴大。其產業角色正從“可選外掛”演變為 LLM 的“預設外部記憶體”。
技術原理
底層模型
非結構化資料(文本、圖片、音訊)經嵌入模型(如 OpenAI text-embedding-3-small、BGE、CLIP)對映為固定維度浮點向量 v ∈ ℝ^d。嵌入模型的訓練基於分佈假設(Distributional Hypothesis):語義相近的輸入在高維空間中距離更近,表現為餘弦相似度高或歐氏距離小。該性質構成了向量資料庫一切後續操作的前提。
相似度度量
常用距離/相似度函式包括:
- 歐氏距離(L2):d(v1, v2) = ||v1 − v2||,越小越相似。
- 內積(IP):v1 ⋅ v2,越大越相似。
- 餘弦相似度:(v1 ⋅ v2) / (||v1|| × ||v2||),歸一化後等價於內積。
工程實踐中,多數系統預先對向量做 L2 歸一化,將餘弦相似度轉為內積,再進一步轉為歐氏距離,以適配底層索引結構最佳化。
ANN 索引核心思想
ANN(Approximate Nearest Neighbor)演算法追求:以可接受的微量精度損失(例如召回率從 1.0 降至 0.95),換取檢索速度千倍以上的提升。核心思想是通過空間劃分、圖連線或編碼壓縮,將搜尋範圍從“全集暴力掃描”縮小到“高機率包含近鄰的候選集”。
主流索引結構:
- 雜湊方法(LSH,Locality Sensitive Hashing):利用一族雜湊函式,使相近向量以高機率落入同一雜湊桶,查詢時僅掃描候選桶。結構簡單,但記憶體效率與召回率中等,現多被替代。
- 量化方法(IVF + PQ):先通過 K‑Means 將全庫聚類,建置倒排檔案(IVF),查詢時只檢索最近的 nprobe 個聚類;每個向量用乘積量化(Product Quantization)編碼為短碼,距離計算在壓縮域進行。壓縮率高,適合十億級以上場景,Faiss 是該路線的代表性實現。
- 圖方法(HNSW,Hierarchical Navigable Small World):建置多層近似最近鄰圖,上層為“長程邊”,下層為“區域性邊”。查詢從頂層隨機點出發,貪心向下探索。檢索極快(亞毫秒),記憶體佔用較高,增量插入時圖結構可能退化,需要週期重建。代表實現:HNSWlib、部分 Milvus/Qdrant 引擎。
- 磁碟最佳化(DiskANN):在圖索引基礎上引入向量量化(VQ)與 SSD 友好的資料版面配置,使大部分索引駐留 SSD,僅熱點資料存於記憶體,適合百億級、記憶體受限環境。查詢比純記憶體方案增加約 1‑3ms 延遲(2023 年 DiskANN 論文基準)。
- 樹方法(Annoy、K‑D Tree 等):早期使用,現多被圖/量化方法取代。
混合檢索典型流水線:
查詢向量 q
├── 標量過濾:限定搜尋域(如 user_id = 123)
├── 粗排(Coarse Quantization):聚類定位 top‑nprobe 個候選簇
├── 精排(Refine):在候選簇內用原始向量或殘差向量計算真實距離
└── 返回 Top‑K,可選重排序(多模態分數融合、Cross‑encoder 精排)
RAG 整合模式
使用者問題 → LLM 嵌入模型 → 查詢向量
↓
向量資料庫 → 相關文本塊(Top‑K)
↓
提示建置:問題 + 檢索塊 → LLM 生成最終回答
在該模式下,向量資料庫充當高速語義知識庫,彌補 LLM 的知識截止日限制與幻覺問題。其延遲直接進入端到端使用者體驗的關鍵路徑。
關鍵引數
選型與運維需關注以下指標:
- 召回率(Recall@K):ANN 返回 Top‑K 與暴力搜尋 Top‑K 的重合比例,典型生產環境要求 0.95‑0.99。
- 延遲(P50/P99 延遲):單次查詢響應時間,互動場景要求 P99 < 100ms,即時推薦常需 < 10ms。
- 吞吐(QPS):每秒查詢數,取決於索引型別、併發設計、硬體規格。
- 索引建置/插入速率:向量寫入並建索引的速度,反映即時效能力。部分圖索引(HNSW)全量建置後增量插入效率顯著下降。
- 壓縮比:壓縮後儲存佔用與原 float32 儲存之比,影響記憶體/磁碟成本。乘積量化可實現 4×∼16× 壓縮(Jégou, TPAMI 2011)。
- 大規模下質量衰減:十億級資料時召回率是否斷崖下跌,DiskANN、IVF+PQ 等對此有專門最佳化。
- 資源佔用:記憶體、SSD、GPU 視訊記憶體開銷,直接決定總持有成本(TCO)。
注意:各產品在 ANN‑Benchmarks 等基準上的表現受資料集、維度、查詢分佈、引數調優影響顯著,具體數值須以最新官方基準或第三方實測為準。公開資料未見跨產品的統一權威基準報告。
技術路線
當前市場已分化為三大技術路線:
路線一:獨立向量資料庫(Native Vector Database)
代表:Pinecone、Weaviate、Zilliz(Milvus)、Qdrant。
特點:以向量為第一公民設計儲存引擎、索引結構與查詢最佳化器。原生支援分散式水平分片、流式寫入、混合搜尋、多模態重排序。提供雲端託管或開源部署選項,配套監控與資料生命週期管理工具。
優勢:功能最深,大規模場景下效能/召回可預期性最強。
劣勢:引入額外基礎設施成本與運維複雜度;資料生態與現有事務型資料庫分離。
路線二:傳統資料庫向量擴充套件(Vector‑Enabled DB)
代表:PostgreSQL(pgvector 外掛)、Elasticsearch、Redis、MongoDB。
特點:在已有資料庫核心上附加向量資料型別與 ANN 索引(常為簡化版 IVF 或 HNSW),複用原有 SQL/查詢語法與生態。
優勢:零額外部署,開發與 DBA 學習成本低;適用小規模(百萬級向量)或標量‑向量聯合查詢場景。
劣勢:分散式向量分片、動態索引維護能力弱於獨立方案;十億級場景下效能衰減通常更明顯。根據公開技術文件與社群反饋,pgvector 的 HNSW 實現不支援增量索引區域性重建,大規模寫入後查詢延遲可能波動(pgvector 0.7.0 版本,2024 年狀態,來源為 GitHub 倉庫 README 與 issue 討論)。
路線三:專用 ANN 演算法庫(Library)
代表:Faiss(Meta)、HNSWlib、ScaNN(Google)。
特點:純計算庫,提供極致最佳化的索引建置與檢索 API,不附帶資料庫功能(持久化、複製、SQL、多使用者),需開發者自行封裝。
優勢:演算法前沿、定製靈活、計算效率最高。
劣勢:不提供生產級資料管理能力;無動態刪改、無一致性保證。
對比總結(定性標定)
| 維度 | 獨立向量資料庫 | 傳統庫向量擴充套件 | 專用 ANN 庫 |
|---|
| 向量索引深度 | 深(HNSW/IVF/DiskANN/融合) | 淺(簡化版 IVF/HNSW) | 深(最新演算法跟進最快) |
| 分散式 | 原生支援 | 依賴主體庫機制 | 無 |
| 動態資料 | 流式增刪、即時可見 | 部分支援、有限調優 | 不支援 |
| 生態整合 | LangChain/LlamaIndex 深度整合 | 通過驅動適配 | 需自行封裝 |
| 運維成本 | 高(獨立部署/雲端服務費) | 低(利用現有例項) | 極高(需自建服務) |
注:上表為行業經驗推斷,非基於嚴格基準測試的量化結果。
上游
向量資料庫的上游供給主要包括兩類:
- 嵌入模型/服務:OpenAI(text-embedding-3-small/large)、Cohere(Embed API)、Hugging Face(BGE、GTE 系列)等提供的雲端端 embedding 介面,以及企業自部署開源模型。嵌入質量(語義表達能力、多語言覆蓋、維度效率)直接決定向量資料庫檢索召回率的上限。
- 硬體與雲端基礎設施:GPU/CPU 用於離線或即時嵌入生成;大記憶體與 NVMe SSD 支撐索引儲存與檢索;Kubernetes、物件儲存、訊息佇列等構成雲端原生分散式部署基座。根據公開資料,AWS、Azure、GCP 均提供 GPU 例項(如 p4d、NCv3)與全快閃記憶體塊儲存,是獨立向量資料庫廠商的預設部署環境來源(雲端廠商官網,2024 年 12 月訪問狀態)。
下游
向量資料庫的下游消費場景高度分層:
- LLM 應用架構:LangChain、LlamaIndex、Dify、Haystack 等通過統一介面抽象,實現對多款向量資料庫的呼叫,成為流量的“總閘口”。根據各架構文件(2024 年 12 月查閱),LangChain 已支援 20 餘種向量儲存後端。
- 垂直行業場景:
- 電商:個性化搜尋與推薦(基於使用者行為 embedding 的商品相似檢索)。
- 醫療:文獻/影像語義檢索、相似病例匹配。
- 自動駕駛:場景庫相似幀檢索(基於 BEV 特徵向量)。
- 金融:反欺詐交易圖嵌入檢索、合規文件去重。
- 企業 IT:內部知識庫、客服系統(RAG)、程式碼語義搜尋。
- 傳統企業數字化轉型:製造業圖紙檢索、法律文書去重、媒體內容相似檢測等。
下游需求驅動力本質是:非結構化資料的爆發增長與 LLM 對高質量外部知識的剛需之間形成的結構性缺口。
受益公司
以下為生態內各形態代表,排列不構成任何優先順序或投資建議:
獨立向量資料庫廠商:
- Pinecone:商業全託管向量資料庫,以開發者體驗與零運維著稱。公開資料未見其最新營收、估值資料(檢索截至 2024 年 12 月)。
- Weaviate:開源(BSD 協議),內建 GraphQL 原生介面與混合搜尋,側重多模態,提供雲端服務。公開資料未見財務資料。
- Qdrant:Rust 實現、高效能,社群活躍,提供 Qdrant Cloud 託管服務。公開資料未見財務資料。
- Zilliz:開源 Milvus 的商業公司,定位大規模分散式、雲端原生(存算分離架構),面向金融、生物醫藥等行業。公開資料未見其最新融資輪次與估值。
- Chroma:輕量級開源嵌入資料庫(Apache 2.0),以零配置、本地執行降低 AI 應用入門門檻。公開資料未見財務資料。
傳統資料庫/搜尋廠商擴充套件向量能力:
- Elastic(Elasticsearch):從 8.0 版本內建向量搜尋(HNSW),複用其倒排索引與聚合生態。
- Redis(Redis Stack):RedisSearch 模組支援向量相似度(FLAT/HNSW),利用記憶體優勢實現低延遲。
- PostgreSQL:pgvector 外掛推廣迅速,2024 年下載量增長迅猛(具體數字公開資料未見),成為中小規模場景的常用選項。
- 阿里雲端 Tair、騰訊雲端 VectorDB:雲端廠商自研或基於開源定製的向量資料庫服務。
雲端廠商整合服務:
- AWS(Amazon Kendra 語義搜尋、OpenSearch Service 的向量搜尋)、Azure(AI Search)、GCP(Vertex AI Matching Engine)均在其資料/AI 平台中提供向量搜尋能力,多與自身模型生態繫結。
公開資料未見以上任何公司的精確市場份額、營收對比或第三方權威排名(檢索截至 2024 年 12 月),故不予置入。
市場規模
由於檢索介面限制,以下僅基於行業趨勢的定性描述,不含具體金額數字:
- 增長驅動力:2023 年 ChatGPT 引爆的 RAG 模式使向量搜尋從實驗性技術躍升為“新預設架構”,企業對語義檢索的需求從頭部網際網路公司擴散至傳統行業。開源生態降低接入門檻,向量資料庫成為 AI 專案預算中的新支出項。
- 供給分層:市場分為純向量資料庫創業公司、傳統資料庫廠商、雲端廠商三層競爭。公開資料未檢索到 Gartner、IDC 或 Forrester 針對“向量資料庫”的專項市場規模估算報告(截至 2024 年 12 月),該品類或仍被歸類於“非關係型資料庫”或“AI 基礎設施”的大類統計中,未獨立揭露。
- 趨勢判斷:基於行業從業者共識,向量功能正從“獨立品類”向“資料庫標配”演化,該趨勢可能重塑市場邊界與規模度量口徑(來源:《What is a vector database?》Pinecone 部落格,2023;《Vector databases are the wrong abstraction》Gradient Flow,2024)。
讀者注意:本節缺乏可引用的量化資料,請勿據此做任何投資或專案決策。
玩家對比
以下不形成推薦或排序,僅基於公開技術文件整理各產品的架構差異點:
- 存算分離 vs. 存算一體:Milvus 自 2.0 起採用存算分離(計算節點、索引節點、儲存節點獨立),支援按需擴縮;Qdrant、Weaviate 為存算一體單程序(亦可叢集分片),運維相對簡單。
- 一致性模型:Pinecone 強調強一致性讀(通過寫入確認機制);部分開源方案在分片複製下為最終一致性,需業務容忍短暫分歧。
- 索引可擴充套件性:Zilliz(Milvus)與 Weaviate 支援多索引型別混用;pgvector 核心依賴 HNSW,索引型別較為單一。
- 權限與多租戶:Pinecone、Weaviate、Zilliz Cloud 提供 API Key/專案級隔離;開源版 Milvus 在 2.3 版本引入 RBAC(來源:Milvus 2.3 Release Notes,2023)。
公開資料未見針對所有廠商的標準化的第三方效能基準測試(如同等硬體、同等資料集、同等引數下的全維度對比),因此不提供量化得分表格。
風險
- 技術路線不確定風險:ANN 演算法更迭快,今天的領先索引結構可能被新方法取代(如基於學習型索引的方法近年有所關注)。廠商需持續投入研發以維持效能優勢。
- 開源商品化風險:基礎向量搜尋能力已通過 Faiss、HNSWlib 等開源專案高度商品化,入門壁壘低。獨立向量資料庫廠商的價值若無法在分散式、運維、安全與生態上拉開差距,可能被開源方案或雲端廠商免費功能替代。
- 雲端廠商降維打擊:若 AWS、Azure 等雲端廠商將向量搜尋作為資料庫或物件儲存的零成本附加功能提供,獨立廠商可能面臨巨大價格壓力。該風險已在 NoSQL、訊息佇列等歷次基礎設施品類競爭中被驗證。
- 效能與成本平衡:維持 95%+ 召回與毫秒延遲往往意味著高記憶體佔用或複雜的分散式結構,TCO 敏感場景下客戶可能被迫降低檢索質量要求。
- 產業泡沫:2023‑2024 年的資本與輿論熱度可能催生過度預期。部分企業可能將向量資料庫視為萬能 AI 入口,而忽視資料治理、嵌入策略等前置環節,導致專案效果不達預期。
- 合規與資料主權:跨境託管向量資料可能涉及資料本地化法規(如 GDPR、中國《資料安全法》),成為企業客戶採用海外雲端託管服務的障礙。
誤讀糾偏
誤讀 1:“向量資料庫就是加了 ANN 索引的常規資料庫,與 Elasticsearch 的向量擴充套件沒有本質區別。”
糾正:表面功能相似,但根本差異在於系統設計的向量優先。獨立向量資料庫在動態索引維護、近似召回的可預期性調優、混合標量‑向量過濾的執行計劃最佳化、跨分片合併策略等方面進行了核心級設計。傳統資料庫“附加”的向量搜尋,在大規模動態資料的場景下,效能波動與召回衰減通常更顯著(社群壓力測試報告零星、非標準對照,無法引用為權威證據,但已成為工程界經驗共識)。
誤讀 2:“只要接入向量資料庫,RAG 應用準確率就有保證。”
糾正:向量資料庫僅負責按距離返回最相似向量。語義相似 ≠ 答案正確。若嵌入模型未針對業務領域微調,或文本分塊(chunking)策略不當,檢索結果可能包含大量無關內容。RAG 的最終精度由嵌入模型、分塊切分、檢索後重排序(reranking)與提示詞工程等連鎖環節共同決定,向量資料庫是必要條件,非充分條件。
誤讀 3:“選一個最快的 ANN 演算法庫就行,資料庫層面的能力不重要。”
糾正:純 ANN 庫解決的是“單次計算最優”問題,而生產環境需要的是“持續穩定服務”。後者要求資料持久化、故障恢復、副本同步、訪問控制、監控告警、動態擴縮等資料庫級能力。自建封裝的工作量長期可能超過資料庫的授權或服務成本,且迭代維護風險由使用方承擔。
最新事件
基於公開檢索(截至 2024 年 12 月知識截止範圍):
- PostgreSQL pgvector 持續迭代:2023‑2024 年多個小版本改進了 HNSW 建置速度與並行查詢,成為小規模部署的首選方案來源之一(pgvector GitHub Release Notes)。
- 雲端廠商深入版面配置:AWS 在 re:Invent 2023 宣佈 OpenSearch Serverless 支援向量引擎;2024 年 Azure AI Search 更新向量搜尋與語義排序的整合。(來源:AWS、Azure 官方部落格,2023‑2024)
- 開源生態加速標準化:LangChain 與 LlamaIndex 2024 年均強化了向量資料庫的抽象層,簡化多後端切換,進一步向應用層隱藏資料庫差異(LangChain 文件,v0.2+)。
- 多家獨立廠商釋出雲端託管版本:部分之前僅提供開源版的廠商(如 Qdrant、Weaviate)加大了對各自雲端服務(Cloud)的投入,反映了託管營收的商業化路徑趨同。
- 中國廠商:公開資料顯示,阿里雲端 Tair 向量、騰訊雲端 VectorDB、百度的向量資料庫服務均已在 2023‑2024 上線,國內市場進入“雲端廠商+獨立廠商”並行階段(各公司官網)。
追蹤指標
如欲持續觀察該產業發展態勢,可關注以下指標與信源:
- 技術基準:ANN‑Benchmarks 社群倉庫(GitHub)的索引效能排名更新,關注不同資料集下 P99 延遲、召回率、建置時間的代際變化。
- 開源採用度:GitHub Star、下載量、Issue 活躍度(Milvus、Qdrant、Weaviate、Chroma、pgvector);PyPI/npm 下載統計(客戶端庫)。
- 架構整合情況:LangChain、LlamaIndex、Haystack 的“支援向量資料庫列表”變化及預設推薦是否有更替。
- 招聘訊號:LinkedIn/拉勾上“向量資料庫”相關崗位數量與薪資變化,反映企業投入方向。
- 學術/工業前沿:NeurIPS、SIGMOD、VLDB 等頂會中向量檢索相關論文,尤其關注“學習型索引”與“磁碟/記憶體混合”的新方案。
- 監管動態:各國資料本地化法規的後續細則,影響雲端託管向量資料庫的跨境部署方案。
信源
本文內容綜合以下公開來源,所有無精確數字之處或未找到權威依據之處均已標註“公開資料未見”:
- Jégou, H., Douze, M., & Schmid, C. (2011). Product Quantization for Nearest Neighbor Search. IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI).
- Malkov, Y. A., & Yashunin, D. A. (2020). Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs. ACM Transactions on Information Systems (TOIS).
- Subramanya, S. J., et al. (2019). DiskANN: Fast Accurate Billion-point Nearest Neighbor Search on a Single Node. NeurIPS.
- Faiss 官方倉庫:https://github.com/facebookresearch/faiss
- Milvus 官方文件:https://milvus.io/docs
- Qdrant 官方文件:https://qdrant.tech/documentation/
- Weaviate 官方文件:https://weaviate.io/developers/weaviate
- pgvector GitHub 倉庫:https://github.com/pgvector/pgvector
- Pinecone 部落格:What is a Vector Database? (2023)
- Ben Lorica et al., “Vector databases are the wrong abstraction,” Gradient Flow (2024)
- Elasticsearch 向量搜尋官方文件:https://www.elastic.co/guide/en/elasticsearch/reference/current/dense-vector.html
- Redis 向量相似度搜索文件:https://redis.io/docs/latest/develop/interact/search-and-query/advanced-concepts/vectors/
- LangChain 文件 (v0.2+):https://python.langchain.com/docs/integrations/vectorstores/
- AWS OpenSearch Serverless 向量引擎公告 (2023):https://aws.amazon.com/blogs/big-data/
- Azure AI Search 向量功能更新 (2024):https://azure.microsoft.com/en-us/updates/
(全文約 9,200 字)