芯片层 开放阅读

向量化

Vectorization

概念 ID
vectorization
更新时间
2026-05-29
来源数量
待补

向量化(Vectorization)

3 秒看懂

向量化 = 把非结构化数据(文本、图像、音视频)转换为高维浮点数向量(Embedding),使计算机能用数学距离衡量”语义相似度”。它是 RAG、推荐、搜索、多模态理解的底座基础设施,也是 SIMD(单指令多数据)并行计算的核心加速范式——两个层面缺一不可。

3 分钟产业解释

为什么当下如此重要?

大模型有”幻觉”和”知识截止”两大短板。业界主流解法是 RAG(检索增强生成):先从外部知识库检索相关片段,再喂给 LLM 生成答案。检索的”钩子”就是向量化——把知识库文档切成片段,经 Embedding 模型转为向量存入向量数据库;用户提问也转为向量,用最近邻搜索找到语义最相似的文档片段。

用户问题 ──→ Embedding Model ──→ Query Vector
                                      │
                ┌─────────────────────┘
                ▼  ANN 近似最近邻搜索
          ┌──────────────┐
          │  向量数据库    │ ← 存储: 文档片段 Embeddings
          │  (Milvus /    │
          │   Pinecone /  │
          │   Qdrant …)   │
          └──────┬───────┘
                 │ Top-K 相关片段
                 ▼
          LLM Prompt 组装 ──→ 生成答案(有据可查)

产业链视角:

环节核心玩家/产品说明
Embedding 模型OpenAI text-embedding-3 系列、Cohere Embed、BGE(智源)、Jina Embeddings、GTE(阿里)将输入映射为定长向量
向量数据库/检索引擎Pinecone、Milvus(Zilliz)、Weaviate、Qdrant、Chroma、FAISS(Meta 开源)高效存储与检索十亿级向量
基础设施(计算侧 SIMD)x86 AVX-512、ARM SVE、GPU SIMT、专用向量检索加速卡加速距离计算的核心硬件
应用层RAG 管线(LangChain/LlamaIndex)、语义搜索、推荐系统、以图搜图最终产品形态

一句话:没有向量化,就没有可落地的企业级 AI 应用。


15 分钟专家深入

一、向量化的两层含义

向量化在 AI 产业语境中至少有两层含义,常被混用但技术栈完全不同:

① 语义向量化(Embedding)—— “把万物变成向量”

  • 输入:文本 token 序列 / 图像 patch / 音频帧
  • 输出:d 维稠密浮点向量(典型维度 384–3072)
  • 核心模型架构:Transformer Encoder(BERT 系)、对比学习(CLIP 系)、专用 Embedding 模型
  • 训练范式:大规模对比学习(contrastive learning),拉近语义相似对、推远不相似对

② 计算向量化(SIMD Vectorization)—— “一条指令处理多个数据”

  • 将标量循环编译/手写为向量指令,利用 CPU 向量寄存器或 GPU warp 并行处理
  • 这是推理加速向量检索加速的底层能力,直接影响 Embedding 推理吞吐和 ANN 搜索 QPS

两者的关系:语义向量化生产向量,计算向量化加速生产与检索过程。

二、语义向量化:Embedding 模型技术栈

2.1 关键参数与范式

维度说明
输出维度 d决定向量表达力与存储/计算成本的权衡。早期 BERT-base 为 768 维;OpenAI ada-002 为 1536 维;text-embedding-3-large 为 3072 维(支持低维缩减)[OpenAI 技术文档]
最大输入长度限制可编码的文本片段长度,典型 512–8192 token,部分长文本模型支持 32K+
训练数据规模从数百万到万亿 token 不等,多语言覆盖能力差异大
评测基准MTEB(Massive Text Embedding Benchmark)覆盖检索、分类、聚类、配对等任务;C-MTEB 为中文子集

2.2 模型架构演进

Word2Vec/GloVe(2013–2014)     静态词向量,一词一向量
        │
        ▼
ELMo(2018)                    上下文相关,LSTM 编码
        │
        ▼
BERT(2018); Sentence-BERT(2019)   Transformer Encoder,[CLS] token / mean pooling
        │
        ▼
SimCSE / Contriever(2021–22)  对比学习 + 无监督/弱监督预训练
        │
        ▼
BGE / GTE / E5 / Jina(2023–24) 大规模多任务对比学习,中英文 SOTA;
        │                        支持指令式 Embedding(instruction-tuned)
        ▼
多模态 Embedding(CLIP / SigLIP / NLLB)  文本-图像-音频跨模态对齐

2.3 Matryoshka 表示学习(MRL)

OpenAI text-embedding-3 系列等模型引入 Matryoshka Embedding 训练策略:在损失函数中同时优化向量的前 256、512、1024、1536… 维的检索质量。效果是:一个模型可按需截断维度,低维场景(缓存/粗排)用前 256 维,高精场景用全维度——兼顾精度与成本。[OpenAI 2024 技术报告]

三、向量数据库与检索引擎

3.1 核心挑战

海量向量的精确最近邻搜索(Exact KNN)时间复杂度 O(Nd),十亿向量不可接受。业界转向 近似最近邻(ANN) 搜索,以微小精度损失换取数个数量级的加速。

3.2 主流 ANN 算法

算法原理优势代表实现
HNSW(Hierarchical Navigable Small World)多层跳表图结构,从稀疏层贪心下探到稠密层查询速度快、召回率高;内存占用大Milvus HNSW、Qdrant、FAISS HNSW
IVF(Inverted File Index)向量空间聚类分区(K-means),查询时只搜 top-N 个聚类内存效率好,适合大规模FAISS IVF、Milvus IVF_FLAT/IVF_PQ
PQ(Product Quantization)子空间量化压缩向量(如 128 维 → 64 字节)极致压缩比,可用内存放十亿级FAISS IVF_PQ、ScaNN(Google)
ScaNNGoogle 提出的各向异性量化,比 PQ 更紧致查询精度-速度帕累托前沿Google 内部 + 开源
DiskANN基于 SSD 的图索引,Vamana 图 + PQ 重排十亿级仅需少量内存Microsoft Research 开源

3.3 向量数据库 vs 传统数据库

能力传统关系型 DB向量数据库
数据模型结构化行/列高维浮点向量 + 元数据过滤
查询范式SQL 精确匹配KNN / 范围查询(近似)
索引类型B-Tree / HashHNSW / IVF / PQ
标量过滤原生强早期弱(后过滤),新架构支持混合检索(先标量过滤再 ANN)
代表PostgreSQL / MySQLMilvus / Pinecone / Qdrant / Weaviate

趋势:2024–2025 年,传统数据库纷纷集成向量能力(PostgreSQL pgvector、Elasticsearch 8.x kNN、Oracle 23ai AI Vector Search),独立向量数据库面临”feature vs product”之争。[行业共识]

四、计算向量化:SIMD 与硬件加速

4.1 CPU SIMD 指令集

┌─────────────────────────────────────────────────┐
│  x86-64                                         │
│  SSE2    128-bit  (2×FP64 / 4×FP32)             │
│  AVX2    256-bit  (4×FP64 / 8×FP32)             │
│  AVX-512 512-bit  (8×FP64 / 16×FP32)            │
│  AVX-512 FP16  512-bit 半精度                    │
│                                                  │
│  ARM                                            │
│  NEON    128-bit                                 │
│  SVE     128–2048-bit(可变长)                   │
│  SVE2    增强版                                   │
└─────────────────────────────────────────────────┘

向量距离计算(内积 / 余弦 / L2)的 SIMD 加速原理:将 N 维向量分组为寄存器宽度的 chunk,单条指令完成多个乘-加,理论加速比 ≈ 寄存器宽度 / 标量宽度。

4.2 GPU 向量化

GPU 的 SIMT(Single Instruction Multiple Threads)模型在 warp(典型 32 线程)级别执行相同指令。Embedding 模型推理、向量检索的距离矩阵计算天然适合 GPU 大规模并行。

  • FAISS GPU:利用 CUDA kernel 实现 IVF/PQ 的距离计算,单卡可处理亿级向量搜索 [FAISS 文档]
  • RAPIDS cuVS:NVIDIA 开源 GPU 加速 ANN 库,对标 FAISS
  • 专用加速:部分厂商(如 Zilliz、Qdrant Cloud)在服务端部署 GPU 加速节点用于高 QPS 场景

4.3 量化技术在检索中的应用

为降低存储和计算成本,高精度向量常被量化为低精度表示:

量化方式压缩比精度影响说明
FP32 → FP16极小几乎无损,硬件原生支持
FP32 → INT8较小需校准(calibration)确定 scale/zero-point
PQ (Product Quantization)8–64×中等子空间码本编码,业界主流
Binary / 1-bit32×较大仅保留符号位,适合粗排/初筛
Matryoshka 截断按需可控截断低信息密度维度

技术原理(最深)

语义向量化核心机制

1. 对比学习训练范式(以 InfoNCE Loss 为例)

给定一个 batch 中的 (anchor, positive) 对:

  L = -log [ exp(sim(a, p⁺) / τ)  /  Σ_j exp(sim(a, p_j) / τ) ]

其中:
  sim(·,·) = 余弦相似度 或 内积
  τ = 温度参数(通常 0.01–0.1)
  分母对 batch 内所有样本(含负样本)求和

直觉:拉近 anchor 与 positive 的向量距离,推远与所有其他样本的距离。batch 越大,负样本越多,训练信号越强(这也是为什么 CLIP 等模型用极大 batch size,如 32K–65K 对)。

2. Embedding 模型推理流程

Input: "向量化是AI基础设施的底座"
  │
  ▼
Tokenizer → [CLS, 向, 量, 化, 是, ..., 座, SEP]
  │
  ▼
Transformer Encoder (L layers)
  │  每层: Multi-Head Self-Attention + FFN
  │  参数量级: ~110M (base) / ~330M (large) / ~7B+ (大模型蒸馏)
  ▼
Token Hidden States: [h_CLS, h_1, h_2, ..., h_SEP]  (each d-dim)
  │
  ▼
Pooling Strategy:
  ├── [CLS] token:      output = h_CLS
  ├── Mean Pooling:      output = mean(h_1, ..., h_n)
  └── Weighted Mean:     output = Σ(w_i * h_i)  (如 Cohere)
  │
  ▼
Optional: L2 Normalization → output = output / ||output||₂
  │
  ▼
Output: d-dimensional float vector ∈ ℝ^d

3. ANN 搜索的数学基础——维度灾难

在高维空间中,任意两点间的距离趋向于集中(concentration of measure)。当维度 d → ∞ 时,最近邻与最远邻的距离比趋近于 1,精确搜索失去意义。ANN 算法通过牺牲少量精度换取结构化剪枝:

  • HNSW:图剪枝——仅保留每个节点的 M 个最近邻居边
  • IVF:空间剪枝——仅搜索距离 query 最近的 nprobe 个聚类
  • PQ:量化剪枝——用码本近似距离计算,避免全精度运算

4. 混合检索(Hybrid Search)架构

用户 Query
    │
    ├──→ Sparse 向量 (BM25 / SPLADE)  → 倒排索引  ──→  关键词匹配分
    │                                                        │
    ├──→ Dense 向量 (Embedding)       → ANN 搜索  ──→  语义相似分
    │                                                        │
    └──→ 元数据过滤 (时间/类别/权限)   → 标量过滤  ──→  过滤掩码
                                                          │
                                                          ▼
                                                  RRF / 加权融合
                                                          │
                                                          ▼
                                                    Top-K 结果

RRF(Reciprocal Rank Fusion)是常见融合策略:对每个候选项,按其在各路检索中的排名取倒数求和。


技术演进史

时间里程碑意义
2013Word2Vec(Mikolov, Google)首次证明词向量的线性代数语义(king − man + woman ≈ queen)
2014GloVe(Stanford)基于共现矩阵分解的全局词向量
2018ELMo(Allen AI); BERT(Google)上下文相关表示;预训练+微调范式开启
2019Sentence-BERT(Reimers & Gurevych)解决 BERT 原生句向量质量差的问题,开启通用句子 Embedding 时代
2021–22FAISS 1.7(Meta, 2021年3月); CLIP(OpenAI, 2021年1月); SimCSE / Contriever / E5(Microsoft)向量检索工业级开源;跨模态对比学习突破;无监督对比学习 + 检索任务 Embedding
2022–23向量数据库融资潮:Pinecone $100M B轮、Zilliz $60M B轮、Weaviate $50M B轮 [公开融资信息]资本密集涌入
2023BGE(智源 BAAI)、GTE(阿里)、Jina Embeddings中文 Embedding 首次在 MTEB 多语言榜取得 SOTA 级表现
2024.01OpenAI text-embedding-3 系列发布Matryoshka 表示学习、成本大幅下降(较 ada-002 降约 [未充分披露]%)[OpenAI 公告]
2024PostgreSQL pgvector 0.7、Elasticsearch kNN 成熟传统数据库向量化集成加速,独立向量 DB 面临竞争
2024–25多模态 Embedding(任意模态→统一向量空间);长上下文 Embedding(128K+ token)趋势方向

技术路线对比

Embedding 模型选型对比(量化表,截至 2024–25 公开信息)

模型维度最大输入长度MTEB 均分(估算)开源多语言说明
BERT-base768512 tokens~中等偏低有限基线参考
text-embedding-ada-00215368191 tokensOpenAI 前代,性价比高
text-embedding-3-small15368191 tokensOpenAI 当代轻量版
text-embedding-3-large30728191 tokensOpenAI 当代旗舰,支持 MRL
Cohere Embed v31024512 tokens支持 search_document/search_query 区分
BGE-large-en-v1.51024512 tokens英文为主智源,中英文社区广泛采用
BGE-M310248192 tokens✅ 多语言支持 Dense+Sparse+ColBERT 三合一
GTE-large-v1.510248192 tokens阿里通义
Jina-embeddings-v31024(可变)8192 tokens支持 Task LoRA + Matryoshka
E5-mistral-7b-instruct409632K tokens极高7B LLM 做 Embedding,推理成本高

MTEB 均分:各模型在 MTEB 排行榜的具体分数持续更新,此处不写死数字,建议查阅 [huggingface.co/spaces/mteb/leaderboard] 获取实时排名。

向量数据库选型对比

产品开源HNSWIVFPQ混合检索(标量+向量)多租户托管服务
MilvusZilliz Cloud
Qdrant量化支持Qdrant Cloud
WeaviatePQ/BQ✅ (BM25 混合)Weaviate Cloud
Pinecone内部实现纯托管 SaaS
Chroma基于 HNSW有限有限轻量级/嵌入式
pgvector✅ (v0.5+)✅ IVFFlat依赖 PG 原生✅ (PG schema)各 PG 云
FAISS库(非数据库)

上下游

上游:向量化模型的供给侧

训练数据                    模型架构                  训练基础设施
├─ 网页文本(Common Crawl) ├─ Transformer Encoder   ├─ GPU 集群(A100/H100)
├─ 搜索日志(click pairs)  ├─ 对比学习 head         ├─ 大 batch 分布式训练
├─ 人工标注(NLI/QA pairs)  ├─ Task LoRA 适配器      ├─ DeepSpeed / FSDP
└─ 合成数据(LLM 生成)      └─ Matryoshka 输出头     └─ 混合精度训练(BF16)

下游:向量化的消费场景

RAG(检索增强生成)          语义搜索                 推荐系统
├─ 企业知识库问答            ├─ 电商语义搜索          ├─ 内容推荐(视频/文章)
├─ 客服机器人                ├─ 代码语义搜索          ├─ 广告召回
└─ 法律/医疗文档检索         └─ 学术论文检索          └─ 社交匹配

多模态应用                  Agent / 工具调用
├─ 以图搜图(CLIP)         ├─ 工具描述向量匹配
├─ 跨模态检索               ├─ 记忆检索(长期记忆)
└─ 图文理解                 └─ Skill 路由

关键指标

指标定义业界基准范围(估算)
Embedding 维度输出向量的浮点数个数384–3072(主流);低维 128 用于轻量场景
Embedding 推理延迟单条文本从输入到输出向量的耗时API: 10–100ms(取决于文本长度);本地部署: 1–50ms
Embedding 推理吞吐单位时间处理的文本条数GPU: 数千–数万条/秒;CPU: 数百条/秒(量级估算)
ANN 召回率(Recall@K)ANN 结果中包含精确 Top-K 的比例0.90–0.99(HNSW 可达 0.99+)
ANN 查询延迟单次向量检索耗时百万级库: <1–5ms;十亿级: 5–50ms(依赖硬件和算法)
ANN 查询 QPS每秒处理的检索请求数单机 HNSW 百万库: 数千–数万 QPS(GPU 可达数十万)
向量存储密度每 GB 内存可存储的向量数FP32/d=1024: ~24万/GB;PQ 压缩后: ~数百万/GB
MTEB Benchmark 分数多任务平均嵌入质量SOTA 级别在 65+(满分约 100,持续更新)[HuggingFace MTEB]

供需与市场数据

需求侧

  • RAG 管线是最大驱动力:几乎所有企业级 LLM 应用都需要向量化,Embedding API 调用量级随 AI 应用渗透率指数增长。
  • 搜索重构:语义搜索正在替代/补充关键词搜索,电商、内容平台、企业搜索均在迁移。
  • 多模态需求:图文理解、视频检索推动多模态 Embedding 需求增长。

供给侧

  • API 商业模式:OpenAI、Cohere、Google 均按 token 计费。text-embedding-3-small 定价极具竞争力(约 $0.02/百万 token 级别 [OpenAI 定价页,建议查实时]),大幅压低使用门槛。
  • 开源模型崛起:BGE、GTE、Jina 等开源模型在 MTEB 上逼近甚至部分超越闭源模型,推动本地化部署需求。
  • 向量数据库竞争白热化
    • Pinecone 估值约 $750M(B轮,2023)[公开融资信息,具体数字以官方为准]
    • Zilliz(Milvus)融资超 $110M [公开信息]
    • Weaviate 融资超 $67M [公开信息]
    • 但 PostgreSQL pgvector + Elasticsearch 的内置向量能力正在侵蚀独立向量 DB 的 TAM。

市场规模(估算,多机构口径差异大)

多家行业报告估算全球向量数据库/向量搜索市场 2024 年在 $1.5B–$3B 量级,CAGR 约 20–25%(2024–2030),但不同机构口径差异显著,需注意是否包含嵌入式向量功能(如 ES、PG)[多家行业报告综合估算]。


代表公司与资本映射

公司/项目定位代表产品上市/融资状态
OpenAIEmbedding 模型 + APItext-embedding-3 系列未上市,估值 $80B+ [公开报道,2024 年数据]
CohereEmbedding + LLM 企业服务Embed v3、Rerank未上市,融资 ~$970M+
Zilliz向量数据库Milvus(开源)/ Zilliz Cloud未上市,融资 ~$110M
Pinecone向量数据库(纯 SaaS)Pinecone Serverless未上市,融资 ~$138M
Qdrant向量数据库(开源)Qdrant未上市,融资 ~$46M
Weaviate向量数据库(开源)Weaviate未上市,融资 ~$67M
智源 BAAI开源 Embedding 模型BGE 系列非营利研究机构
阿里(通义)开源 Embedding + 云服务GTE 系列阿里巴巴(BABA/9988.HK)
Meta开源向量检索库FAISSMeta(META)
NVIDIAGPU + 向量检索加速cuVS / RAPIDSNVIDIA(NVDA)
Jina AI开源 Embedding 模型Jina Embeddings / Reader / Reranker未上市,融资 ~$30M

A股/港股映射逻辑

  • 直接标的较少(国内向量数据库创业公司多为一级市场)
  • 间接受益:算力层(GPU/推理芯片,因 Embedding 推理是持续性算力消耗)、应用层(已有 RAG 产品化的企业,如科大讯飞、金山办公等在 AI 助手中集成知识库检索)
  • 海光信息(GPU)/ 寒武纪(推理芯片)等国产算力公司间接受益于 Embedding 推理本土化部署需求

投资逻辑

核心判断

  1. 向量化是 AI 应用的”水电煤”:只要 LLM 应用落地,向量化就是刚需。投资确定性高,但壁垒因开源和大厂免费/低价策略而降低。
  2. Embedding 模型赛道格局趋稳:OpenAI、Cohere 在闭源 API 市场领先;开源阵营 BGE/GTE/Jina 社区活跃、企业采用率高。模型本身不再是护城河,数据飞轮 + 生态集成才是。
  3. 向量数据库面临整合压力:独立向量 DB 的 TAM 正被传统数据库的向量功能蚕食。纯向量数据库可能走向被收购(如被云厂商整合)或转型为更通用的 AI 数据平台。长期看,谁能把向量检索 + 标量过滤 + 全文搜索 + 图查询做成统一平台,谁就能存活。
  4. 计算向量化(SIMD)的硬件机会:AVX-512、SVE2、GPU Tensor Core 持续迭代,Embedding 推理和 ANN 搜索性能每代提升显著,利好芯片设计公司。

风险提示

  • Embedding API 价格战激烈,利润空间可能被压缩
  • LLM 上下文窗口扩大(128K–1M tokens)可能减少 RAG 依赖,但当前阶段长上下文仍昂贵且精度不优于 RAG
  • 独立向量数据库的护城河深度存疑

常见误读纠偏

误读 1:“向量数据库是全新的数据库品类,将取代传统数据库”

纠偏:向量数据库的核心能力(ANN 索引)更接近一种索引技术而非独立品类。PostgreSQL(pgvector)、Elasticsearch(kNN search)、Oracle(AI Vector Search)、Redis(Redis Stack)均已原生支持向量检索。独立向量数据库的优势在于专为高维向量优化的存储引擎和分布式架构,但”全功能数据库 + 向量索引”的组合正在快速追赶。投资视角下,不应将向量 DB 视为与传统 DB 无关的全新赛道,而应关注融合趋势。

误读 2:“Embedding 维度越高越好”

纠偏:高维度提供更多

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型