向量化(Vectorization)
3 秒看懂
向量化 = 把非结构化数据(文本、图像、音视频)转换为高维浮点数向量(Embedding),使计算机能用数学距离衡量”语义相似度”。它是 RAG、推荐、搜索、多模态理解的底座基础设施,也是 SIMD(单指令多数据)并行计算的核心加速范式——两个层面缺一不可。
3 分钟产业解释
为什么当下如此重要?
大模型有”幻觉”和”知识截止”两大短板。业界主流解法是 RAG(检索增强生成):先从外部知识库检索相关片段,再喂给 LLM 生成答案。检索的”钩子”就是向量化——把知识库文档切成片段,经 Embedding 模型转为向量存入向量数据库;用户提问也转为向量,用最近邻搜索找到语义最相似的文档片段。
用户问题 ──→ Embedding Model ──→ Query Vector
│
┌─────────────────────┘
▼ ANN 近似最近邻搜索
┌──────────────┐
│ 向量数据库 │ ← 存储: 文档片段 Embeddings
│ (Milvus / │
│ Pinecone / │
│ Qdrant …) │
└──────┬───────┘
│ Top-K 相关片段
▼
LLM Prompt 组装 ──→ 生成答案(有据可查)
产业链视角:
| 环节 | 核心玩家/产品 | 说明 |
|---|---|---|
| Embedding 模型 | OpenAI text-embedding-3 系列、Cohere Embed、BGE(智源)、Jina Embeddings、GTE(阿里) | 将输入映射为定长向量 |
| 向量数据库/检索引擎 | Pinecone、Milvus(Zilliz)、Weaviate、Qdrant、Chroma、FAISS(Meta 开源) | 高效存储与检索十亿级向量 |
| 基础设施(计算侧 SIMD) | x86 AVX-512、ARM SVE、GPU SIMT、专用向量检索加速卡 | 加速距离计算的核心硬件 |
| 应用层 | RAG 管线(LangChain/LlamaIndex)、语义搜索、推荐系统、以图搜图 | 最终产品形态 |
一句话:没有向量化,就没有可落地的企业级 AI 应用。
15 分钟专家深入
一、向量化的两层含义
向量化在 AI 产业语境中至少有两层含义,常被混用但技术栈完全不同:
① 语义向量化(Embedding)—— “把万物变成向量”
- 输入:文本 token 序列 / 图像 patch / 音频帧
- 输出:d 维稠密浮点向量(典型维度 384–3072)
- 核心模型架构:Transformer Encoder(BERT 系)、对比学习(CLIP 系)、专用 Embedding 模型
- 训练范式:大规模对比学习(contrastive learning),拉近语义相似对、推远不相似对
② 计算向量化(SIMD Vectorization)—— “一条指令处理多个数据”
- 将标量循环编译/手写为向量指令,利用 CPU 向量寄存器或 GPU warp 并行处理
- 这是推理加速和向量检索加速的底层能力,直接影响 Embedding 推理吞吐和 ANN 搜索 QPS
两者的关系:语义向量化生产向量,计算向量化加速生产与检索过程。
二、语义向量化:Embedding 模型技术栈
2.1 关键参数与范式
| 维度 | 说明 |
|---|---|
| 输出维度 d | 决定向量表达力与存储/计算成本的权衡。早期 BERT-base 为 768 维;OpenAI ada-002 为 1536 维;text-embedding-3-large 为 3072 维(支持低维缩减)[OpenAI 技术文档] |
| 最大输入长度 | 限制可编码的文本片段长度,典型 512–8192 token,部分长文本模型支持 32K+ |
| 训练数据规模 | 从数百万到万亿 token 不等,多语言覆盖能力差异大 |
| 评测基准 | MTEB(Massive Text Embedding Benchmark)覆盖检索、分类、聚类、配对等任务;C-MTEB 为中文子集 |
2.2 模型架构演进
Word2Vec/GloVe(2013–2014) 静态词向量,一词一向量
│
▼
ELMo(2018) 上下文相关,LSTM 编码
│
▼
BERT(2018); Sentence-BERT(2019) Transformer Encoder,[CLS] token / mean pooling
│
▼
SimCSE / Contriever(2021–22) 对比学习 + 无监督/弱监督预训练
│
▼
BGE / GTE / E5 / Jina(2023–24) 大规模多任务对比学习,中英文 SOTA;
│ 支持指令式 Embedding(instruction-tuned)
▼
多模态 Embedding(CLIP / SigLIP / NLLB) 文本-图像-音频跨模态对齐
2.3 Matryoshka 表示学习(MRL)
OpenAI text-embedding-3 系列等模型引入 Matryoshka Embedding 训练策略:在损失函数中同时优化向量的前 256、512、1024、1536… 维的检索质量。效果是:一个模型可按需截断维度,低维场景(缓存/粗排)用前 256 维,高精场景用全维度——兼顾精度与成本。[OpenAI 2024 技术报告]
三、向量数据库与检索引擎
3.1 核心挑战
海量向量的精确最近邻搜索(Exact KNN)时间复杂度 O(Nd),十亿向量不可接受。业界转向 近似最近邻(ANN) 搜索,以微小精度损失换取数个数量级的加速。
3.2 主流 ANN 算法
| 算法 | 原理 | 优势 | 代表实现 |
|---|---|---|---|
| HNSW(Hierarchical Navigable Small World) | 多层跳表图结构,从稀疏层贪心下探到稠密层 | 查询速度快、召回率高;内存占用大 | Milvus HNSW、Qdrant、FAISS HNSW |
| IVF(Inverted File Index) | 向量空间聚类分区(K-means),查询时只搜 top-N 个聚类 | 内存效率好,适合大规模 | FAISS IVF、Milvus IVF_FLAT/IVF_PQ |
| PQ(Product Quantization) | 子空间量化压缩向量(如 128 维 → 64 字节) | 极致压缩比,可用内存放十亿级 | FAISS IVF_PQ、ScaNN(Google) |
| ScaNN | Google 提出的各向异性量化,比 PQ 更紧致 | 查询精度-速度帕累托前沿 | Google 内部 + 开源 |
| DiskANN | 基于 SSD 的图索引,Vamana 图 + PQ 重排 | 十亿级仅需少量内存 | Microsoft Research 开源 |
3.3 向量数据库 vs 传统数据库
| 能力 | 传统关系型 DB | 向量数据库 |
|---|---|---|
| 数据模型 | 结构化行/列 | 高维浮点向量 + 元数据过滤 |
| 查询范式 | SQL 精确匹配 | KNN / 范围查询(近似) |
| 索引类型 | B-Tree / Hash | HNSW / IVF / PQ |
| 标量过滤 | 原生强 | 早期弱(后过滤),新架构支持混合检索(先标量过滤再 ANN) |
| 代表 | PostgreSQL / MySQL | Milvus / Pinecone / Qdrant / Weaviate |
趋势:2024–2025 年,传统数据库纷纷集成向量能力(PostgreSQL pgvector、Elasticsearch 8.x kNN、Oracle 23ai AI Vector Search),独立向量数据库面临”feature vs product”之争。[行业共识]
四、计算向量化:SIMD 与硬件加速
4.1 CPU SIMD 指令集
┌─────────────────────────────────────────────────┐
│ x86-64 │
│ SSE2 128-bit (2×FP64 / 4×FP32) │
│ AVX2 256-bit (4×FP64 / 8×FP32) │
│ AVX-512 512-bit (8×FP64 / 16×FP32) │
│ AVX-512 FP16 512-bit 半精度 │
│ │
│ ARM │
│ NEON 128-bit │
│ SVE 128–2048-bit(可变长) │
│ SVE2 增强版 │
└─────────────────────────────────────────────────┘
向量距离计算(内积 / 余弦 / L2)的 SIMD 加速原理:将 N 维向量分组为寄存器宽度的 chunk,单条指令完成多个乘-加,理论加速比 ≈ 寄存器宽度 / 标量宽度。
4.2 GPU 向量化
GPU 的 SIMT(Single Instruction Multiple Threads)模型在 warp(典型 32 线程)级别执行相同指令。Embedding 模型推理、向量检索的距离矩阵计算天然适合 GPU 大规模并行。
- FAISS GPU:利用 CUDA kernel 实现 IVF/PQ 的距离计算,单卡可处理亿级向量搜索 [FAISS 文档]
- RAPIDS cuVS:NVIDIA 开源 GPU 加速 ANN 库,对标 FAISS
- 专用加速:部分厂商(如 Zilliz、Qdrant Cloud)在服务端部署 GPU 加速节点用于高 QPS 场景
4.3 量化技术在检索中的应用
为降低存储和计算成本,高精度向量常被量化为低精度表示:
| 量化方式 | 压缩比 | 精度影响 | 说明 |
|---|---|---|---|
| FP32 → FP16 | 2× | 极小 | 几乎无损,硬件原生支持 |
| FP32 → INT8 | 4× | 较小 | 需校准(calibration)确定 scale/zero-point |
| PQ (Product Quantization) | 8–64× | 中等 | 子空间码本编码,业界主流 |
| Binary / 1-bit | 32× | 较大 | 仅保留符号位,适合粗排/初筛 |
| Matryoshka 截断 | 按需 | 可控 | 截断低信息密度维度 |
技术原理(最深)
语义向量化核心机制
1. 对比学习训练范式(以 InfoNCE Loss 为例)
给定一个 batch 中的 (anchor, positive) 对:
L = -log [ exp(sim(a, p⁺) / τ) / Σ_j exp(sim(a, p_j) / τ) ]
其中:
sim(·,·) = 余弦相似度 或 内积
τ = 温度参数(通常 0.01–0.1)
分母对 batch 内所有样本(含负样本)求和
直觉:拉近 anchor 与 positive 的向量距离,推远与所有其他样本的距离。batch 越大,负样本越多,训练信号越强(这也是为什么 CLIP 等模型用极大 batch size,如 32K–65K 对)。
2. Embedding 模型推理流程
Input: "向量化是AI基础设施的底座"
│
▼
Tokenizer → [CLS, 向, 量, 化, 是, ..., 座, SEP]
│
▼
Transformer Encoder (L layers)
│ 每层: Multi-Head Self-Attention + FFN
│ 参数量级: ~110M (base) / ~330M (large) / ~7B+ (大模型蒸馏)
▼
Token Hidden States: [h_CLS, h_1, h_2, ..., h_SEP] (each d-dim)
│
▼
Pooling Strategy:
├── [CLS] token: output = h_CLS
├── Mean Pooling: output = mean(h_1, ..., h_n)
└── Weighted Mean: output = Σ(w_i * h_i) (如 Cohere)
│
▼
Optional: L2 Normalization → output = output / ||output||₂
│
▼
Output: d-dimensional float vector ∈ ℝ^d
3. ANN 搜索的数学基础——维度灾难
在高维空间中,任意两点间的距离趋向于集中(concentration of measure)。当维度 d → ∞ 时,最近邻与最远邻的距离比趋近于 1,精确搜索失去意义。ANN 算法通过牺牲少量精度换取结构化剪枝:
- HNSW:图剪枝——仅保留每个节点的 M 个最近邻居边
- IVF:空间剪枝——仅搜索距离 query 最近的 nprobe 个聚类
- PQ:量化剪枝——用码本近似距离计算,避免全精度运算
4. 混合检索(Hybrid Search)架构
用户 Query
│
├──→ Sparse 向量 (BM25 / SPLADE) → 倒排索引 ──→ 关键词匹配分
│ │
├──→ Dense 向量 (Embedding) → ANN 搜索 ──→ 语义相似分
│ │
└──→ 元数据过滤 (时间/类别/权限) → 标量过滤 ──→ 过滤掩码
│
▼
RRF / 加权融合
│
▼
Top-K 结果
RRF(Reciprocal Rank Fusion)是常见融合策略:对每个候选项,按其在各路检索中的排名取倒数求和。
技术演进史
| 时间 | 里程碑 | 意义 |
|---|---|---|
| 2013 | Word2Vec(Mikolov, Google) | 首次证明词向量的线性代数语义(king − man + woman ≈ queen) |
| 2014 | GloVe(Stanford) | 基于共现矩阵分解的全局词向量 |
| 2018 | ELMo(Allen AI); BERT(Google) | 上下文相关表示;预训练+微调范式开启 |
| 2019 | Sentence-BERT(Reimers & Gurevych) | 解决 BERT 原生句向量质量差的问题,开启通用句子 Embedding 时代 |
| 2021–22 | FAISS 1.7(Meta, 2021年3月); CLIP(OpenAI, 2021年1月); SimCSE / Contriever / E5(Microsoft) | 向量检索工业级开源;跨模态对比学习突破;无监督对比学习 + 检索任务 Embedding |
| 2022–23 | 向量数据库融资潮:Pinecone $100M B轮、Zilliz $60M B轮、Weaviate $50M B轮 [公开融资信息] | 资本密集涌入 |
| 2023 | BGE(智源 BAAI)、GTE(阿里)、Jina Embeddings | 中文 Embedding 首次在 MTEB 多语言榜取得 SOTA 级表现 |
| 2024.01 | OpenAI text-embedding-3 系列发布 | Matryoshka 表示学习、成本大幅下降(较 ada-002 降约 [未充分披露]%)[OpenAI 公告] |
| 2024 | PostgreSQL pgvector 0.7、Elasticsearch kNN 成熟 | 传统数据库向量化集成加速,独立向量 DB 面临竞争 |
| 2024–25 | 多模态 Embedding(任意模态→统一向量空间);长上下文 Embedding(128K+ token) | 趋势方向 |
技术路线对比
Embedding 模型选型对比(量化表,截至 2024–25 公开信息)
| 模型 | 维度 | 最大输入长度 | MTEB 均分(估算) | 开源 | 多语言 | 说明 |
|---|---|---|---|---|---|---|
| BERT-base | 768 | 512 tokens | ~中等偏低 | ✅ | 有限 | 基线参考 |
| text-embedding-ada-002 | 1536 | 8191 tokens | — | ❌ | ✅ | OpenAI 前代,性价比高 |
| text-embedding-3-small | 1536 | 8191 tokens | — | ❌ | ✅ | OpenAI 当代轻量版 |
| text-embedding-3-large | 3072 | 8191 tokens | — | ❌ | ✅ | OpenAI 当代旗舰,支持 MRL |
| Cohere Embed v3 | 1024 | 512 tokens | — | ❌ | ✅ | 支持 search_document/search_query 区分 |
| BGE-large-en-v1.5 | 1024 | 512 tokens | 高 | ✅ | 英文为主 | 智源,中英文社区广泛采用 |
| BGE-M3 | 1024 | 8192 tokens | 高 | ✅ | ✅ 多语言 | 支持 Dense+Sparse+ColBERT 三合一 |
| GTE-large-v1.5 | 1024 | 8192 tokens | 高 | ✅ | ✅ | 阿里通义 |
| Jina-embeddings-v3 | 1024(可变) | 8192 tokens | 高 | ✅ | ✅ | 支持 Task LoRA + Matryoshka |
| E5-mistral-7b-instruct | 4096 | 32K tokens | 极高 | ✅ | ✅ | 7B LLM 做 Embedding,推理成本高 |
MTEB 均分:各模型在 MTEB 排行榜的具体分数持续更新,此处不写死数字,建议查阅 [huggingface.co/spaces/mteb/leaderboard] 获取实时排名。
向量数据库选型对比
| 产品 | 开源 | HNSW | IVF | PQ | 混合检索(标量+向量) | 多租户 | 托管服务 |
|---|---|---|---|---|---|---|---|
| Milvus | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | Zilliz Cloud |
| Qdrant | ✅ | ✅ | — | 量化支持 | ✅ | ✅ | Qdrant Cloud |
| Weaviate | ✅ | ✅ | — | PQ/BQ | ✅ (BM25 混合) | ✅ | Weaviate Cloud |
| Pinecone | ❌ | 内部实现 | — | — | ✅ | ✅ | 纯托管 SaaS |
| Chroma | ✅ | 基于 HNSW | — | — | 有限 | 有限 | 轻量级/嵌入式 |
| pgvector | ✅ | ✅ (v0.5+) | ✅ IVFFlat | — | 依赖 PG 原生 | ✅ (PG schema) | 各 PG 云 |
| FAISS | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ | 库(非数据库) |
上下游
上游:向量化模型的供给侧
训练数据 模型架构 训练基础设施
├─ 网页文本(Common Crawl) ├─ Transformer Encoder ├─ GPU 集群(A100/H100)
├─ 搜索日志(click pairs) ├─ 对比学习 head ├─ 大 batch 分布式训练
├─ 人工标注(NLI/QA pairs) ├─ Task LoRA 适配器 ├─ DeepSpeed / FSDP
└─ 合成数据(LLM 生成) └─ Matryoshka 输出头 └─ 混合精度训练(BF16)
下游:向量化的消费场景
RAG(检索增强生成) 语义搜索 推荐系统
├─ 企业知识库问答 ├─ 电商语义搜索 ├─ 内容推荐(视频/文章)
├─ 客服机器人 ├─ 代码语义搜索 ├─ 广告召回
└─ 法律/医疗文档检索 └─ 学术论文检索 └─ 社交匹配
多模态应用 Agent / 工具调用
├─ 以图搜图(CLIP) ├─ 工具描述向量匹配
├─ 跨模态检索 ├─ 记忆检索(长期记忆)
└─ 图文理解 └─ Skill 路由
关键指标
| 指标 | 定义 | 业界基准范围(估算) |
|---|---|---|
| Embedding 维度 | 输出向量的浮点数个数 | 384–3072(主流);低维 128 用于轻量场景 |
| Embedding 推理延迟 | 单条文本从输入到输出向量的耗时 | API: 10–100ms(取决于文本长度);本地部署: 1–50ms |
| Embedding 推理吞吐 | 单位时间处理的文本条数 | GPU: 数千–数万条/秒;CPU: 数百条/秒(量级估算) |
| ANN 召回率(Recall@K) | ANN 结果中包含精确 Top-K 的比例 | 0.90–0.99(HNSW 可达 0.99+) |
| ANN 查询延迟 | 单次向量检索耗时 | 百万级库: <1–5ms;十亿级: 5–50ms(依赖硬件和算法) |
| ANN 查询 QPS | 每秒处理的检索请求数 | 单机 HNSW 百万库: 数千–数万 QPS(GPU 可达数十万) |
| 向量存储密度 | 每 GB 内存可存储的向量数 | FP32/d=1024: ~24万/GB;PQ 压缩后: ~数百万/GB |
| MTEB Benchmark 分数 | 多任务平均嵌入质量 | SOTA 级别在 65+(满分约 100,持续更新)[HuggingFace MTEB] |
供需与市场数据
需求侧
- RAG 管线是最大驱动力:几乎所有企业级 LLM 应用都需要向量化,Embedding API 调用量级随 AI 应用渗透率指数增长。
- 搜索重构:语义搜索正在替代/补充关键词搜索,电商、内容平台、企业搜索均在迁移。
- 多模态需求:图文理解、视频检索推动多模态 Embedding 需求增长。
供给侧
- API 商业模式:OpenAI、Cohere、Google 均按 token 计费。text-embedding-3-small 定价极具竞争力(约 $0.02/百万 token 级别 [OpenAI 定价页,建议查实时]),大幅压低使用门槛。
- 开源模型崛起:BGE、GTE、Jina 等开源模型在 MTEB 上逼近甚至部分超越闭源模型,推动本地化部署需求。
- 向量数据库竞争白热化:
- Pinecone 估值约 $750M(B轮,2023)[公开融资信息,具体数字以官方为准]
- Zilliz(Milvus)融资超 $110M [公开信息]
- Weaviate 融资超 $67M [公开信息]
- 但 PostgreSQL pgvector + Elasticsearch 的内置向量能力正在侵蚀独立向量 DB 的 TAM。
市场规模(估算,多机构口径差异大)
多家行业报告估算全球向量数据库/向量搜索市场 2024 年在 $1.5B–$3B 量级,CAGR 约 20–25%(2024–2030),但不同机构口径差异显著,需注意是否包含嵌入式向量功能(如 ES、PG)[多家行业报告综合估算]。
代表公司与资本映射
| 公司/项目 | 定位 | 代表产品 | 上市/融资状态 |
|---|---|---|---|
| OpenAI | Embedding 模型 + API | text-embedding-3 系列 | 未上市,估值 $80B+ [公开报道,2024 年数据] |
| Cohere | Embedding + LLM 企业服务 | Embed v3、Rerank | 未上市,融资 ~$970M+ |
| Zilliz | 向量数据库 | Milvus(开源)/ Zilliz Cloud | 未上市,融资 ~$110M |
| Pinecone | 向量数据库(纯 SaaS) | Pinecone Serverless | 未上市,融资 ~$138M |
| Qdrant | 向量数据库(开源) | Qdrant | 未上市,融资 ~$46M |
| Weaviate | 向量数据库(开源) | Weaviate | 未上市,融资 ~$67M |
| 智源 BAAI | 开源 Embedding 模型 | BGE 系列 | 非营利研究机构 |
| 阿里(通义) | 开源 Embedding + 云服务 | GTE 系列 | 阿里巴巴(BABA/9988.HK) |
| Meta | 开源向量检索库 | FAISS | Meta(META) |
| NVIDIA | GPU + 向量检索加速 | cuVS / RAPIDS | NVIDIA(NVDA) |
| Jina AI | 开源 Embedding 模型 | Jina Embeddings / Reader / Reranker | 未上市,融资 ~$30M |
A股/港股映射逻辑:
- 直接标的较少(国内向量数据库创业公司多为一级市场)
- 间接受益:算力层(GPU/推理芯片,因 Embedding 推理是持续性算力消耗)、应用层(已有 RAG 产品化的企业,如科大讯飞、金山办公等在 AI 助手中集成知识库检索)
- 海光信息(GPU)/ 寒武纪(推理芯片)等国产算力公司间接受益于 Embedding 推理本土化部署需求
投资逻辑
核心判断
- 向量化是 AI 应用的”水电煤”:只要 LLM 应用落地,向量化就是刚需。投资确定性高,但壁垒因开源和大厂免费/低价策略而降低。
- Embedding 模型赛道格局趋稳:OpenAI、Cohere 在闭源 API 市场领先;开源阵营 BGE/GTE/Jina 社区活跃、企业采用率高。模型本身不再是护城河,数据飞轮 + 生态集成才是。
- 向量数据库面临整合压力:独立向量 DB 的 TAM 正被传统数据库的向量功能蚕食。纯向量数据库可能走向被收购(如被云厂商整合)或转型为更通用的 AI 数据平台。长期看,谁能把向量检索 + 标量过滤 + 全文搜索 + 图查询做成统一平台,谁就能存活。
- 计算向量化(SIMD)的硬件机会:AVX-512、SVE2、GPU Tensor Core 持续迭代,Embedding 推理和 ANN 搜索性能每代提升显著,利好芯片设计公司。
风险提示
- Embedding API 价格战激烈,利润空间可能被压缩
- LLM 上下文窗口扩大(128K–1M tokens)可能减少 RAG 依赖,但当前阶段长上下文仍昂贵且精度不优于 RAG
- 独立向量数据库的护城河深度存疑
常见误读纠偏
误读 1:“向量数据库是全新的数据库品类,将取代传统数据库”
纠偏:向量数据库的核心能力(ANN 索引)更接近一种索引技术而非独立品类。PostgreSQL(pgvector)、Elasticsearch(kNN search)、Oracle(AI Vector Search)、Redis(Redis Stack)均已原生支持向量检索。独立向量数据库的优势在于专为高维向量优化的存储引擎和分布式架构,但”全功能数据库 + 向量索引”的组合正在快速追赶。投资视角下,不应将向量 DB 视为与传统 DB 无关的全新赛道,而应关注融合趋势。
误读 2:“Embedding 维度越高越好”
纠偏:高维度提供更多