向量化(Vectorization)
3 秒看懂
向量化 = 把非結構化資料(文本、影像、音影片)轉換為高維浮點數向量(Embedding),使計算機能用數學距離衡量”語義相似度”。它是 RAG、推薦、搜尋、多模態理解的底座基礎設施,也是 SIMD(單指令多資料)平行計算的核心加速範式——兩個層面缺一不可。
3 分鐘產業解釋
為什麼當下如此重要?
大型模型有”幻覺”和”知識截止”兩大短板。業界主流解法是 RAG(檢索增強生成):先從外部知識庫檢索相關片段,再餵給 LLM 生成答案。檢索的”鉤子”就是向量化——把知識庫文件切成片段,經 Embedding 模型轉為向量存入向量資料庫;使用者提問也轉為向量,用最近鄰搜尋找到語義最相似的文件片段。
使用者問題 ──→ Embedding Model ──→ Query Vector
│
┌─────────────────────┘
▼ ANN 近似最近鄰搜尋
┌──────────────┐
│ 向量資料庫 │ ← 儲存: 文件片段 Embeddings
│ (Milvus / │
│ Pinecone / │
│ Qdrant …) │
└──────┬───────┘
│ Top-K 相關片段
▼
LLM Prompt 組裝 ──→ 生成答案(有據可查)
產業鏈視角:
| 環節 | 核心玩家/產品 | 說明 |
|---|---|---|
| Embedding 模型 | OpenAI text-embedding-3 系列、Cohere Embed、BGE(智源)、Jina Embeddings、GTE(阿里) | 將輸入對映為定長向量 |
| 向量資料庫/檢索引擎 | Pinecone、Milvus(Zilliz)、Weaviate、Qdrant、Chroma、FAISS(Meta 開源) | 高效儲存與檢索十億級向量 |
| 基礎設施(計算側 SIMD) | x86 AVX-512、ARM SVE、GPU SIMT、專用向量檢索加速卡 | 加速距離計算的核心硬體 |
| 應用層 | RAG 管線(LangChain/LlamaIndex)、語義搜尋、推薦系統、以圖搜圖 | 最終產品形態 |
一句話:沒有向量化,就沒有可落地的企業級 AI 應用。
15 分鐘專家深入
一、向量化的兩層含義
向量化在 AI 產業語境中至少有兩層含義,常被混用但技術棧完全不同:
① 語義向量化(Embedding)—— “把萬物變成向量”
- 輸入:文本 token 序列 / 影像 patch / 音訊幀
- 輸出:d 維稠密浮點向量(典型維度 384–3072)
- 核心模型架構:Transformer Encoder(BERT 系)、對比學習(CLIP 系)、專用 Embedding 模型
- 訓練範式:大規模對比學習(contrastive learning),拉近語義相似對、推遠不相似對
② 計算向量化(SIMD Vectorization)—— “一條指令處理多個數據”
- 將標量迴圈編譯/手寫為向量指令,利用 CPU 向量暫存器或 GPU warp 並行處理
- 這是推論加速和向量檢索加速的底層能力,直接影響 Embedding 推論吞吐和 ANN 搜尋 QPS
兩者的關係:語義向量化生產向量,計算向量化加速生產與檢索過程。
二、語義向量化:Embedding 模型技術棧
2.1 關鍵引數與範式
| 維度 | 說明 |
|---|---|
| 輸出維度 d | 決定向量表達力與儲存/計算成本的權衡。早期 BERT-base 為 768 維;OpenAI ada-002 為 1536 維;text-embedding-3-large 為 3072 維(支援低維縮減)[OpenAI 技術文件] |
| 最大輸入長度 | 限制可編碼的文本片段長度,典型 512–8192 token,部分長文本模型支援 32K+ |
| 訓練資料規模 | 從數百萬到萬億 token 不等,多語言覆蓋能力差異大 |
| 評測基準 | MTEB(Massive Text Embedding Benchmark)覆蓋檢索、分類、聚類、配對等任務;C-MTEB 為中文子集 |
2.2 模型架構演進
Word2Vec/GloVe(2013–2014) 靜態詞向量,一詞一向量
│
▼
ELMo(2018) 上下文相關,LSTM 編碼
│
▼
BERT(2018); Sentence-BERT(2019) Transformer Encoder,[CLS] token / mean pooling
│
▼
SimCSE / Contriever(2021–22) 對比學習 + 無監督/弱監督預訓練
│
▼
BGE / GTE / E5 / Jina(2023–24) 大規模多工對比學習,中英文 SOTA;
│ 支援指令式 Embedding(instruction-tuned)
▼
多模態 Embedding(CLIP / SigLIP / NLLB) 文本-影像-音訊跨模態對齊
2.3 Matryoshka 表示學習(MRL)
OpenAI text-embedding-3 系列等模型引入 Matryoshka Embedding 訓練策略:在損失函式中同時最佳化向量的前 256、512、1024、1536… 維的檢索質量。效果是:一個模型可按需截斷維度,低維場景(快取/粗排)用前 256 維,高精場景用全維度——兼顧精度與成本。[OpenAI 2024 技術報告]
三、向量資料庫與檢索引擎
3.1 核心挑戰
海量向量的精確最近鄰搜尋(Exact KNN)時間複雜度 O(Nd),十億向量不可接受。業界轉向 近似最近鄰(ANN) 搜尋,以微小精度損失換取數個數量級的加速。
3.2 主流 ANN 演算法
| 演算法 | 原理 | 優勢 | 代表實現 |
|---|---|---|---|
| HNSW(Hierarchical Navigable Small World) | 多層跳錶圖結構,從稀疏層貪心下探到稠密層 | 查詢速度快、召回率高;記憶體佔用大 | Milvus HNSW、Qdrant、FAISS HNSW |
| IVF(Inverted File Index) | 向量空間聚類分割槽(K-means),查詢時只搜 top-N 個聚類 | 記憶體效率好,適合大規模 | FAISS IVF、Milvus IVF_FLAT/IVF_PQ |
| PQ(Product Quantization) | 子空間量化壓縮向量(如 128 維 → 64 位元組) | 極致壓縮比,可用記憶體放十億級 | FAISS IVF_PQ、ScaNN(Google) |
| ScaNN | Google 提出的各向異性量化,比 PQ 更緊緻 | 查詢精度-速度帕累托前沿 | Google 內部 + 開源 |
| DiskANN | 基於 SSD 的圖索引,Vamana 圖 + PQ 重排 | 十億級僅需少量記憶體 | Microsoft Research 開源 |
3.3 向量資料庫 vs 傳統資料庫
| 能力 | 傳統關係型 DB | 向量資料庫 |
|---|---|---|
| 資料模型 | 結構化行/列 | 高維浮點向量 + 後設資料過濾 |
| 查詢範式 | SQL 精確匹配 | KNN / 範圍查詢(近似) |
| 索引型別 | B-Tree / Hash | HNSW / IVF / PQ |
| 標量過濾 | 原生強 | 早期弱(後過濾),新架構支援混合檢索(先標量過濾再 ANN) |
| 代表 | PostgreSQL / MySQL | Milvus / Pinecone / Qdrant / Weaviate |
趨勢:2024–2025 年,傳統資料庫紛紛整合向量能力(PostgreSQL pgvector、Elasticsearch 8.x kNN、Oracle 23ai AI Vector Search),獨立向量資料庫面臨”feature vs product”之爭。[行業共識]
四、計算向量化:SIMD 與硬體加速
4.1 CPU SIMD 指令集
┌─────────────────────────────────────────────────┐
│ x86-64 │
│ SSE2 128-bit (2×FP64 / 4×FP32) │
│ AVX2 256-bit (4×FP64 / 8×FP32) │
│ AVX-512 512-bit (8×FP64 / 16×FP32) │
│ AVX-512 FP16 512-bit 半精度 │
│ │
│ ARM │
│ NEON 128-bit │
│ SVE 128–2048-bit(可變長) │
│ SVE2 增強版 │
└─────────────────────────────────────────────────┘
向量距離計算(內積 / 餘弦 / L2)的 SIMD 加速原理:將 N 維向量分組為暫存器寬度的 chunk,單條指令完成多個乘-加,理論加速比 ≈ 暫存器寬度 / 標量寬度。
4.2 GPU 向量化
GPU 的 SIMT(Single Instruction Multiple Threads)模型在 warp(典型 32 執行緒)級別執行相同指令。Embedding 模型推論、向量檢索的距離矩陣計算天然適合 GPU 大規模並行。
- FAISS GPU:利用 CUDA kernel 實現 IVF/PQ 的距離計算,單卡可處理億級向量搜尋 [FAISS 文件]
- RAPIDS cuVS:NVIDIA 開源 GPU 加速 ANN 庫,對標 FAISS
- 專用加速:部分廠商(如 Zilliz、Qdrant Cloud)在服務端部署 GPU 加速節點用於高 QPS 場景
4.3 量化技術在檢索中的應用
為降低儲存和計算成本,高精度向量常被量化為低精度表示:
| 量化方式 | 壓縮比 | 精度影響 | 說明 |
|---|---|---|---|
| FP32 → FP16 | 2× | 極小 | 幾乎無損,硬體原生支援 |
| FP32 → INT8 | 4× | 較小 | 需校準(calibration)確定 scale/zero-point |
| PQ (Product Quantization) | 8–64× | 中等 | 子空間碼本編碼,業界主流 |
| Binary / 1-bit | 32× | 較大 | 僅保留符號位,適合粗排/初篩 |
| Matryoshka 截斷 | 按需 | 可控 | 截斷低資訊密度維度 |
技術原理(最深)
語義向量化核心機制
1. 對比學習訓練範式(以 InfoNCE Loss 為例)
給定一個 batch 中的 (anchor, positive) 對:
L = -log [ exp(sim(a, p⁺) / τ) / Σ_j exp(sim(a, p_j) / τ) ]
其中:
sim(·,·) = 餘弦相似度 或 內積
τ = 溫度引數(通常 0.01–0.1)
分母對 batch 內所有樣本(含負樣本)求和
直覺:拉近 anchor 與 positive 的向量距離,推遠與所有其他樣本的距離。batch 越大,負樣本越多,訓練訊號越強(這也是為什麼 CLIP 等模型用極大 batch size,如 32K–65K 對)。
2. Embedding 模型推論流程
Input: "向量化是AI基礎設施的底座"
│
▼
Tokenizer → [CLS, 向, 量, 化, 是, ..., 座, SEP]
│
▼
Transformer Encoder (L layers)
│ 每層: Multi-Head Self-Attention + FFN
│ 引數量級: ~110M (base) / ~330M (large) / ~7B+ (大型模型蒸餾)
▼
Token Hidden States: [h_CLS, h_1, h_2, ..., h_SEP] (each d-dim)
│
▼
Pooling Strategy:
├── [CLS] token: output = h_CLS
├── Mean Pooling: output = mean(h_1, ..., h_n)
└── Weighted Mean: output = Σ(w_i * h_i) (如 Cohere)
│
▼
Optional: L2 Normalization → output = output / ||output||₂
│
▼
Output: d-dimensional float vector ∈ ℝ^d
3. ANN 搜尋的數學基礎——維度災難
在高維空間中,任意兩點間的距離趨向於集中(concentration of measure)。當維度 d → ∞ 時,最近鄰與最遠鄰的距離比趨近於 1,精確搜尋失去意義。ANN 演算法通過犧牲少量精度換取結構化剪枝:
- HNSW:圖剪枝——僅保留每個節點的 M 個最近鄰居邊
- IVF:空間剪枝——僅搜尋距離 query 最近的 nprobe 個聚類
- PQ:量化剪枝——用碼本近似距離計算,避免全精度運算
4. 混合檢索(Hybrid Search)架構
使用者 Query
│
├──→ Sparse 向量 (BM25 / SPLADE) → 倒排索引 ──→ 關鍵詞匹配分
│ │
├──→ Dense 向量 (Embedding) → ANN 搜尋 ──→ 語義相似分
│ │
└──→ 後設資料過濾 (時間/類別/權限) → 標量過濾 ──→ 過濾掩碼
│
▼
RRF / 加權融合
│
▼
Top-K 結果
RRF(Reciprocal Rank Fusion)是常見融合策略:對每個候選項,按其在各路檢索中的排名取倒數求和。
技術演進史
| 時間 | 里程碑 | 意義 |
|---|---|---|
| 2013 | Word2Vec(Mikolov, Google) | 首次證明詞向量的線性代數語義(king − man + woman ≈ queen) |
| 2014 | GloVe(Stanford) | 基於共現矩陣分解的全域性詞向量 |
| 2018 | ELMo(Allen AI); BERT(Google) | 上下文相關表示;預訓練+微調範式開啟 |
| 2019 | Sentence-BERT(Reimers & Gurevych) | 解決 BERT 原生句向量質量差的問題,開啟通用句子 Embedding 時代 |
| 2021–22 | FAISS 1.7(Meta, 2021年3月); CLIP(OpenAI, 2021年1月); SimCSE / Contriever / E5(Microsoft) | 向量檢索工業級開源;跨模態對比學習突破;無監督對比學習 + 檢索任務 Embedding |
| 2022–23 | 向量資料庫融資潮:Pinecone $100M B輪、Zilliz $60M B輪、Weaviate $50M B輪 [公開融資資訊] | 資本密集湧入 |
| 2023 | BGE(智源 BAAI)、GTE(阿里)、Jina Embeddings | 中文 Embedding 首次在 MTEB 多語言榜取得 SOTA 級表現 |
| 2024.01 | OpenAI text-embedding-3 系列釋出 | Matryoshka 表示學習、成本大幅下降(較 ada-002 降約 [未充分揭露]%)[OpenAI 公告] |
| 2024 | PostgreSQL pgvector 0.7、Elasticsearch kNN 成熟 | 傳統資料庫向量化整合加速,獨立向量 DB 面臨競爭 |
| 2024–25 | 多模態 Embedding(任意模態→統一向量空間);長上下文 Embedding(128K+ token) | 趨勢方向 |
技術路線對比
Embedding 模型選型對比(量化表,截至 2024–25 公開資訊)
| 模型 | 維度 | 最大輸入長度 | MTEB 均分(估算) | 開源 | 多語言 | 說明 |
|---|---|---|---|---|---|---|
| BERT-base | 768 | 512 tokens | ~中等偏低 | ✅ | 有限 | 基線參考 |
| text-embedding-ada-002 | 1536 | 8191 tokens | — | ❌ | ✅ | OpenAI 前代,價效比高 |
| text-embedding-3-small | 1536 | 8191 tokens | — | ❌ | ✅ | OpenAI 當代輕量版 |
| text-embedding-3-large | 3072 | 8191 tokens | — | ❌ | ✅ | OpenAI 當代旗艦,支援 MRL |
| Cohere Embed v3 | 1024 | 512 tokens | — | ❌ | ✅ | 支援 search_document/search_query 區分 |
| BGE-large-en-v1.5 | 1024 | 512 tokens | 高 | ✅ | 英文為主 | 智源,中英文社群廣泛採用 |
| BGE-M3 | 1024 | 8192 tokens | 高 | ✅ | ✅ 多語言 | 支援 Dense+Sparse+ColBERT 三合一 |
| GTE-large-v1.5 | 1024 | 8192 tokens | 高 | ✅ | ✅ | 阿里通義 |
| Jina-embeddings-v3 | 1024(可變) | 8192 tokens | 高 | ✅ | ✅ | 支援 Task LoRA + Matryoshka |
| E5-mistral-7b-instruct | 4096 | 32K tokens | 極高 | ✅ | ✅ | 7B LLM 做 Embedding,推論成本高 |
MTEB 均分:各模型在 MTEB 排行榜的具體分數持續更新,此處不寫死數字,建議查閱 [huggingface.co/spaces/mteb/leaderboard] 獲取即時排名。
向量資料庫選型對比
| 產品 | 開源 | HNSW | IVF | PQ | 混合檢索(標量+向量) | 多租戶 | 託管服務 |
|---|---|---|---|---|---|---|---|
| Milvus | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | Zilliz Cloud |
| Qdrant | ✅ | ✅ | — | 量化支援 | ✅ | ✅ | Qdrant Cloud |
| Weaviate | ✅ | ✅ | — | PQ/BQ | ✅ (BM25 混合) | ✅ | Weaviate Cloud |
| Pinecone | ❌ | 內部實現 | — | — | ✅ | ✅ | 純託管 SaaS |
| Chroma | ✅ | 基於 HNSW | — | — | 有限 | 有限 | 輕量級/嵌入式 |
| pgvector | ✅ | ✅ (v0.5+) | ✅ IVFFlat | — | 依賴 PG 原生 | ✅ (PG schema) | 各 PG 雲端 |
| FAISS | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ | 庫(非資料庫) |
上下游
上游:向量化模型的供給側
訓練資料 模型架構 訓練基礎設施
├─ 網頁文本(Common Crawl) ├─ Transformer Encoder ├─ GPU 叢集(A100/H100)
├─ 搜尋日誌(click pairs) ├─ 對比學習 head ├─ 大 batch 分散式訓練
├─ 人工標註(NLI/QA pairs) ├─ Task LoRA 介面卡 ├─ DeepSpeed / FSDP
└─ 合成數據(LLM 生成) └─ Matryoshka 輸出頭 └─ 混合精度訓練(BF16)
下游:向量化的消費場景
RAG(檢索增強生成) 語義搜尋 推薦系統
├─ 企業知識庫問答 ├─ 電商語義搜尋 ├─ 內容推薦(影片/文章)
├─ 客服機器人 ├─ 程式碼語義搜尋 ├─ 廣告召回
└─ 法律/醫療文件檢索 └─ 學術論文檢索 └─ 社交匹配
多模態應用 Agent / 工具呼叫
├─ 以圖搜圖(CLIP) ├─ 工具描述向量匹配
├─ 跨模態檢索 ├─ 記憶檢索(長期記憶)
└─ 圖文理解 └─ Skill 路由
關鍵指標
| 指標 | 定義 | 業界基準範圍(估算) |
|---|---|---|
| Embedding 維度 | 輸出向量的浮點數個數 | 384–3072(主流);低維 128 用於輕量場景 |
| Embedding 推論延遲 | 單條文本從輸入到輸出向量的耗時 | API: 10–100ms(取決於文本長度);本地部署: 1–50ms |
| Embedding 推論吞吐 | 單位時間處理的文本條數 | GPU: 數千–數萬條/秒;CPU: 數百條/秒(量級估算) |
| ANN 召回率(Recall@K) | ANN 結果中包含精確 Top-K 的比例 | 0.90–0.99(HNSW 可達 0.99+) |
| ANN 查詢延遲 | 單次向量檢索耗時 | 百萬級庫: <1–5ms;十億級: 5–50ms(依賴硬體和演算法) |
| ANN 查詢 QPS | 每秒處理的檢索請求數 | 單機 HNSW 百萬庫: 數千–數萬 QPS(GPU 可達數十萬) |
| 向量儲存密度 | 每 GB 記憶體可儲存的向量數 | FP32/d=1024: ~24萬/GB;PQ 壓縮後: ~數百萬/GB |
| MTEB Benchmark 分數 | 多工平均嵌入質量 | SOTA 級別在 65+(滿分約 100,持續更新)[HuggingFace MTEB] |
供需與市場資料
需求側
- RAG 管線是最大驅動力:幾乎所有企業級 LLM 應用都需要向量化,Embedding API 呼叫量級隨 AI 應用滲透率指數增長。
- 搜尋重構:語義搜尋正在替代/補充關鍵詞搜尋,電商、內容平台、企業搜尋均在遷移。
- 多模態需求:圖文理解、影片檢索推動多模態 Embedding 需求增長。
供給側
- API 商業模式:OpenAI、Cohere、Google 均按 token 計費。text-embedding-3-small 定價極具競爭力(約 $0.02/百萬 token 級別 [OpenAI 定價頁,建議查即時]),大幅壓低使用門檻。
- 開源模型崛起:BGE、GTE、Jina 等開源模型在 MTEB 上逼近甚至部分超越閉源模型,推動本地化部署需求。
- 向量資料庫競爭白熱化:
- Pinecone 估值約 $750M(B輪,2023)[公開融資資訊,具體數字以官方為準]
- Zilliz(Milvus)融資超 $110M [公開資訊]
- Weaviate 融資超 $67M [公開資訊]
- 但 PostgreSQL pgvector + Elasticsearch 的內建向量能力正在侵蝕獨立向量 DB 的 TAM。
市場規模(估算,多機構口徑差異大)
多家行業報告估算全球向量資料庫/向量搜尋市場 2024 年在 $1.5B–$3B 量級,CAGR 約 20–25%(2024–2030),但不同機構口徑差異顯著,需注意是否包含嵌入式向量功能(如 ES、PG)[多家行業報告綜合估算]。
代表公司與資本對映
| 公司/專案 | 定位 | 代表產品 | 上市/融資狀態 |
|---|---|---|---|
| OpenAI | Embedding 模型 + API | text-embedding-3 系列 | 未上市,估值 $80B+ [公開報道,2024 年資料] |
| Cohere | Embedding + LLM 企業服務 | Embed v3、Rerank | 未上市,融資 ~$970M+ |
| Zilliz | 向量資料庫 | Milvus(開源)/ Zilliz Cloud | 未上市,融資 ~$110M |
| Pinecone | 向量資料庫(純 SaaS) | Pinecone Serverless | 未上市,融資 ~$138M |
| Qdrant | 向量資料庫(開源) | Qdrant | 未上市,融資 ~$46M |
| Weaviate | 向量資料庫(開源) | Weaviate | 未上市,融資 ~$67M |
| 智源 BAAI | 開源 Embedding 模型 | BGE 系列 | 非營利研究機構 |
| 阿里(通義) | 開源 Embedding + 雲端服務 | GTE 系列 | 阿里巴巴(BABA/9988.HK) |
| Meta | 開源向量檢索庫 | FAISS | Meta(META) |
| NVIDIA | GPU + 向量檢索加速 | cuVS / RAPIDS | NVIDIA(NVDA) |
| Jina AI | 開源 Embedding 模型 | Jina Embeddings / Reader / Reranker | 未上市,融資 ~$30M |
A股/港股對映邏輯:
- 直接標的較少(國內向量資料庫創業公司多為一級市場)
- 間接受益:算力層(GPU/推論晶片,因 Embedding 推論是持續性算力消耗)、應用層(已有 RAG 產品化的企業,如科大訊飛、金山辦公等在 AI 助手中整合知識庫檢索)
- 海光資訊(GPU)/ 寒武紀(推論晶片)等國產算力公司間接受益於 Embedding 推論本土化部署需求
投資邏輯
核心判斷
- 向量化是 AI 應用的”水電煤”:只要 LLM 應用落地,向量化就是剛需。投資確定性高,但壁壘因開源和大廠免費/低價策略而降低。
- Embedding 模型賽道格局趨穩:OpenAI、Cohere 在閉源 API 市場領先;開源陣營 BGE/GTE/Jina 社群活躍、企業採用率高。模型本身不再是護城河,資料飛輪 + 生態整合才是。
- 向量資料庫面臨整合壓力:獨立向量 DB 的 TAM 正被傳統資料庫的向量功能蠶食。純向量資料庫可能走向被收購(如被雲端廠商整合)或轉型為更通用的 AI 資料平台。長期看,誰能把向量檢索 + 標量過濾 + 全文搜尋 + 圖查詢做成統一平台,誰就能存活。
- 計算向量化(SIMD)的硬體機會:AVX-512、SVE2、GPU Tensor Core 持續迭代,Embedding 推論和 ANN 搜尋效能每代提升顯著,利好晶片設計公司。
風險提示
- Embedding API 價格戰激烈,獲利空間可能被壓縮
- LLM 上下文視窗擴大(128K–1M tokens)可能減少 RAG 依賴,但當前階段長上下文仍昂貴且精度不優於 RAG
- 獨立向量資料庫的護城河深度存疑
常見誤讀糾偏
誤讀 1:“向量資料庫是全新的資料庫品類,將取代傳統資料庫”
糾偏:向量資料庫的核心能力(ANN 索引)更接近一種索引技術而非獨立品類。PostgreSQL(pgvector)、Elasticsearch(kNN search)、Oracle(AI Vector Search)、Redis(Redis Stack)均已原生支援向量檢索。獨立向量資料庫的優勢在於專為高維向量最佳化的儲存引擎和分散式架構,但”全功能資料庫 + 向量索引”的組合正在快速追趕。投資視角下,不應將向量 DB 視為與傳統 DB 無關的全新賽道,而應關注融合趨勢。
誤讀 2:“Embedding 維度越高越好”
糾偏:高維度提供更多