模型层 开放阅读

向量数据库

Vector Database

向量数据库把非结构化内容编码后的高维向量存储、索引并按语义相似度检索,是 RAG 和企业知识库的外部记忆层。

概念 ID
vector-database
更新时间
2026-05-29
来源数量
待补
Compassing AI 上下文 围绕 RAG、ANN 索引、向量库路线和相关厂商提问。
0.95-0.99
Recall@K
MDX 给出的典型生产环境要求
向量数据库 MDX · 2026-05-29
<100ms
交互 P99
MDX 关键参数段落口径
向量数据库 MDX · 2026-05-29
4x-16x
压缩比
乘积量化可达范围
向量数据库 MDX · 2026-05-29
产业信号
  • RAG 将向量搜索从实验技术推成新默认架构。
  • LangChain、LlamaIndex 等框架隐藏后端差异,扩大向量数据库触达。
口径风险
  • 公开资料未见跨产品统一权威基准,不能按单一榜单下结论。
  • 语义相似不等于答案正确,最终质量还受 embedding、chunking、rerank 和提示词影响。

向量数据库卡在 AI 栈哪里?

向量数据库 MDX · 2026-05-29
模型与云层 / 数据检索基础设施

MDX 将其定义为 AI 基础设施中间层:向上承载 LLM 应用,向下依赖异构硬件和云基础设施。

上游依赖
  • 嵌入模型与 embedding API
  • GPU/CPU、大内存与 NVMe SSD
  • 云原生基础设施
下游承接
  • RAG 应用框架
  • 企业知识库和客服系统
  • 推荐、图像/音频搜索和多模态检索

相关公司

MDX 提及的产业参与者
  • Pinecone 独立向量数据库
  • Weaviate 开源/云服务
  • Qdrant Rust 向量数据库
  • Zilliz Milvus 商业公司
  • Elastic Elasticsearch 向量扩展
  • Redis Redis Stack 向量搜索

技术路线怎么分?

向量数据库 MDX · 2026-05-29

独立向量数据库

以向量为第一公民设计,支持分布式分片、流式写入和混合搜索。

大规模、生产级 RAG 和多租户服务

传统数据库向量扩展

在 PostgreSQL、Elasticsearch、Redis 等系统上附加向量索引能力。

已有数据库生态、小中规模知识库

专用 ANN 算法库

Faiss、HNSWlib、ScaNN 等纯计算库,需要自行封装生产服务。

算法定制和极致性能实验

相邻概念链

便于横向跳转

来源台账

数字与判断口径
来源类型截至
向量数据库 MDX mdx 2026-05-29
source: concept-rich schema · as_of 2026-05-29 富区块仅用于产业链学习、信息检索和研究辅助;不构成投资建议。

向量数据库

3 秒看懂

向量数据库是面向高维向量(embedding)设计的新型数据基础设施,专用于存储、索引和快速检索“语义上最相似”的内容。它不依赖关键词匹配,而是通过向量间的数学距离(如余弦相似度、欧氏距离)衡量相似性。在大模型(LLM)检索增强生成(RAG)、推荐系统、图像/音频搜索、多模态理解等场景中,向量数据库充当外部非结构化知识的语义索引,直接决定检索延迟与召回质量,是 AI 应用从“模型智能”迈向“数据智能”的关键桥梁。

3 分钟产业解释

当文本、图像等非结构化数据被深度神经网络编码为一组高维浮点数(向量,通常数百至数千维)之后,传统关系型数据库的 B‑Tree、倒排索引等结构便无法表达“意思相近”这类模糊匹配。向量数据库将“语义相似”转化为“空间邻近”,借助**近似最近邻(ANN)**算法,在毫秒级完成海量向量检索。

从产业定位看,向量数据库处于 AI 基础设施的中间层:向上承载大模型应用(尤其 RAG),向下依赖内存、NVMe SSD、GPU 等异构硬件。其产品形态通常具备以下能力:

  • 全托管/云原生:自动扩缩容、多租户隔离、跨可用区容灾。
  • 混合搜索:结合标量过滤(时间、标签、用户 ID)与向量相似度,支持复杂查询。
  • 实时更新:支持流式向量写入、动态索引增删,而非仅静态批量建库。
  • 生态对接:LangChain、LlamaIndex、Dify 等 LLM 应用框架已内置主流向量数据库驱动,开发者一键接入。

2023 年后,向量数据库从利基技术跃升为 AI 栈核心组件,市场规模快速扩大。其产业角色正从“可选插件”演变为 LLM 的“默认外部记忆体”。

技术原理

底层模型

非结构化数据(文本、图片、音频)经嵌入模型(如 OpenAI text-embedding-3-small、BGE、CLIP)映射为固定维度浮点向量 v ∈ ℝ^d。嵌入模型的训练基于分布假设(Distributional Hypothesis):语义相近的输入在高维空间中距离更近,表现为余弦相似度高或欧氏距离小。该性质构成了向量数据库一切后续操作的前提。

相似度度量

常用距离/相似度函数包括:

  • 欧氏距离(L2):d(v1, v2) = ||v1 − v2||,越小越相似。
  • 内积(IP):v1 ⋅ v2,越大越相似。
  • 余弦相似度:(v1 ⋅ v2) / (||v1|| × ||v2||),归一化后等价于内积。

工程实践中,多数系统预先对向量做 L2 归一化,将余弦相似度转为内积,再进一步转为欧氏距离,以适配底层索引结构优化。

ANN 索引核心思想

ANN(Approximate Nearest Neighbor)算法追求:以可接受的微量精度损失(例如召回率从 1.0 降至 0.95),换取检索速度千倍以上的提升。核心思想是通过空间划分、图连接或编码压缩,将搜索范围从“全集暴力扫描”缩小到“高概率包含近邻的候选集”。

主流索引结构

  • 哈希方法(LSH,Locality Sensitive Hashing):利用一族哈希函数,使相近向量以高概率落入同一哈希桶,查询时仅扫描候选桶。结构简单,但内存效率与召回率中等,现多被替代。
  • 量化方法(IVF + PQ):先通过 K‑Means 将全库聚类,构建倒排文件(IVF),查询时只检索最近的 nprobe 个聚类;每个向量用乘积量化(Product Quantization)编码为短码,距离计算在压缩域进行。压缩率高,适合十亿级以上场景,Faiss 是该路线的代表性实现。
  • 图方法(HNSW,Hierarchical Navigable Small World):构建多层近似最近邻图,上层为“长程边”,下层为“局部边”。查询从顶层随机点出发,贪心向下探索。检索极快(亚毫秒),内存占用较高,增量插入时图结构可能退化,需要周期重建。代表实现:HNSWlib、部分 Milvus/Qdrant 引擎。
  • 磁盘优化(DiskANN):在图索引基础上引入向量量化(VQ)与 SSD 友好的数据布局,使大部分索引驻留 SSD,仅热点数据存于内存,适合百亿级、内存受限环境。查询比纯内存方案增加约 1‑3ms 延迟(2023 年 DiskANN 论文基准)。
  • 树方法(Annoy、K‑D Tree 等):早期使用,现多被图/量化方法取代。

混合检索典型流水线

查询向量 q
  ├── 标量过滤:限定搜索域(如 user_id = 123)
  ├── 粗排(Coarse Quantization):聚类定位 top‑nprobe 个候选簇
  ├── 精排(Refine):在候选簇内用原始向量或残差向量计算真实距离
  └── 返回 Top‑K,可选重排序(多模态分数融合、Cross‑encoder 精排)

RAG 集成模式

用户问题 → LLM 嵌入模型 → 查询向量
           ↓
    向量数据库 → 相关文本块(Top‑K)
           ↓
    提示构建:问题 + 检索块 → LLM 生成最终回答

在该模式下,向量数据库充当高速语义知识库,弥补 LLM 的知识截止日限制与幻觉问题。其延迟直接进入端到端用户体验的关键路径。

关键参数

选型与运维需关注以下指标:

  • 召回率(Recall@K):ANN 返回 Top‑K 与暴力搜索 Top‑K 的重合比例,典型生产环境要求 0.95‑0.99。
  • 延迟(P50/P99 延迟):单次查询响应时间,交互场景要求 P99 < 100ms,实时推荐常需 < 10ms。
  • 吞吐(QPS):每秒查询数,取决于索引类型、并发设计、硬件规格。
  • 索引构建/插入速率:向量写入并建索引的速度,反映实时性能力。部分图索引(HNSW)全量构建后增量插入效率显著下降。
  • 压缩比:压缩后存储占用与原 float32 存储之比,影响内存/磁盘成本。乘积量化可实现 4×∼16× 压缩(Jégou, TPAMI 2011)。
  • 大规模下质量衰减:十亿级数据时召回率是否断崖下跌,DiskANN、IVF+PQ 等对此有专门优化。
  • 资源占用:内存、SSD、GPU 显存开销,直接决定总持有成本(TCO)。

注意:各产品在 ANN‑Benchmarks 等基准上的表现受数据集、维度、查询分布、参数调优影响显著,具体数值须以最新官方基准或第三方实测为准。公开资料未见跨产品的统一权威基准报告。

技术路线

当前市场已分化为三大技术路线:

路线一:独立向量数据库(Native Vector Database)

代表:Pinecone、Weaviate、Zilliz(Milvus)、Qdrant。

特点:以向量为第一公民设计存储引擎、索引结构与查询优化器。原生支持分布式水平分片、流式写入、混合搜索、多模态重排序。提供云托管或开源部署选项,配套监控与数据生命周期管理工具。

优势:功能最深,大规模场景下性能/召回可预期性最强。

劣势:引入额外基础设施成本与运维复杂度;数据生态与现有事务型数据库分离。

路线二:传统数据库向量扩展(Vector‑Enabled DB)

代表:PostgreSQL(pgvector 插件)、Elasticsearch、Redis、MongoDB。

特点:在已有数据库内核上附加向量数据类型与 ANN 索引(常为简化版 IVF 或 HNSW),复用原有 SQL/查询语法与生态。

优势:零额外部署,开发与 DBA 学习成本低;适用小规模(百万级向量)或标量‑向量联合查询场景。

劣势:分布式向量分片、动态索引维护能力弱于独立方案;十亿级场景下性能衰减通常更明显。根据公开技术文档与社区反馈,pgvector 的 HNSW 实现不支持增量索引局部重建,大规模写入后查询延迟可能波动(pgvector 0.7.0 版本,2024 年状态,来源为 GitHub 仓库 README 与 issue 讨论)。

路线三:专用 ANN 算法库(Library)

代表:Faiss(Meta)、HNSWlib、ScaNN(Google)。

特点:纯计算库,提供极致优化的索引构建与检索 API,不附带数据库功能(持久化、复制、SQL、多用户),需开发者自行封装。

优势:算法前沿、定制灵活、计算效率最高。

劣势:不提供生产级数据管理能力;无动态删改、无一致性保证。

对比总结(定性标定)

维度独立向量数据库传统库向量扩展专用 ANN 库
向量索引深度深(HNSW/IVF/DiskANN/融合)浅(简化版 IVF/HNSW)深(最新算法跟进最快)
分布式原生支持依赖主体库机制
动态数据流式增删、实时可见部分支持、有限调优不支持
生态集成LangChain/LlamaIndex 深度集成通过驱动适配需自行封装
运维成本高(独立部署/云服务费)低(利用现有实例)极高(需自建服务)

注:上表为行业经验推断,非基于严格基准测试的量化结果。

上游

向量数据库的上游供给主要包括两类:

  • 嵌入模型/服务:OpenAI(text-embedding-3-small/large)、Cohere(Embed API)、Hugging Face(BGE、GTE 系列)等提供的云端 embedding 接口,以及企业自部署开源模型。嵌入质量(语义表达能力、多语言覆盖、维度效率)直接决定向量数据库检索召回率的上限。
  • 硬件与云基础设施:GPU/CPU 用于离线或实时嵌入生成;大内存与 NVMe SSD 支撑索引存储与检索;Kubernetes、对象存储、消息队列等构成云原生分布式部署基座。根据公开资料,AWS、Azure、GCP 均提供 GPU 实例(如 p4d、NCv3)与全闪存块存储,是独立向量数据库厂商的默认部署环境来源(云厂商官网,2024 年 12 月访问状态)。

下游

向量数据库的下游消费场景高度分层:

  • LLM 应用框架:LangChain、LlamaIndex、Dify、Haystack 等通过统一接口抽象,实现对多款向量数据库的调用,成为流量的“总闸口”。根据各框架文档(2024 年 12 月查阅),LangChain 已支持 20 余种向量存储后端。
  • 垂直行业场景
    • 电商:个性化搜索与推荐(基于用户行为 embedding 的商品相似检索)。
    • 医疗:文献/影像语义检索、相似病例匹配。
    • 自动驾驶:场景库相似帧检索(基于 BEV 特征向量)。
    • 金融:反欺诈交易图嵌入检索、合规文档去重。
    • 企业 IT:内部知识库、客服系统(RAG)、代码语义搜索。
  • 传统企业数字化转型:制造业图纸检索、法律文书去重、媒体内容相似检测等。

下游需求驱动力本质是:非结构化数据的爆发增长与 LLM 对高质量外部知识的刚需之间形成的结构性缺口。

受益公司

以下为生态内各形态代表,排列不构成任何优先级或投资建议:

独立向量数据库厂商

  • Pinecone:商业全托管向量数据库,以开发者体验与零运维著称。公开资料未见其最新营收、估值数据(检索截至 2024 年 12 月)。
  • Weaviate:开源(BSD 协议),内置 GraphQL 原生接口与混合搜索,侧重多模态,提供云服务。公开资料未见财务数据。
  • Qdrant:Rust 实现、高性能,社区活跃,提供 Qdrant Cloud 托管服务。公开资料未见财务数据。
  • Zilliz:开源 Milvus 的商业公司,定位大规模分布式、云原生(存算分离架构),面向金融、生物医药等行业。公开资料未见其最新融资轮次与估值。
  • Chroma:轻量级开源嵌入数据库(Apache 2.0),以零配置、本地运行降低 AI 应用入门门槛。公开资料未见财务数据。

传统数据库/搜索厂商扩展向量能力

  • Elastic(Elasticsearch):从 8.0 版本内置向量搜索(HNSW),复用其倒排索引与聚合生态。
  • Redis(Redis Stack):RedisSearch 模块支持向量相似度(FLAT/HNSW),利用内存优势实现低延迟。
  • PostgreSQL:pgvector 插件推广迅速,2024 年下载量增长迅猛(具体数字公开资料未见),成为中小规模场景的常用选项。
  • 阿里云 Tair腾讯云 VectorDB:云厂商自研或基于开源定制的向量数据库服务。

云厂商集成服务

  • AWS(Amazon Kendra 语义搜索、OpenSearch Service 的向量搜索)、Azure(AI Search)、GCP(Vertex AI Matching Engine)均在其数据/AI 平台中提供向量搜索能力,多与自身模型生态绑定。

公开资料未见以上任何公司的精确市场份额、营收对比或第三方权威排名(检索截至 2024 年 12 月),故不予置入。

市场规模

由于检索接口限制,以下仅基于行业趋势的定性描述,不含具体金额数字

  • 增长驱动力:2023 年 ChatGPT 引爆的 RAG 模式使向量搜索从实验性技术跃升为“新默认架构”,企业对语义检索的需求从头部互联网公司扩散至传统行业。开源生态降低接入门槛,向量数据库成为 AI 项目预算中的新支出项。
  • 供给分层:市场分为纯向量数据库创业公司、传统数据库厂商、云厂商三层竞争。公开资料未检索到 Gartner、IDC 或 Forrester 针对“向量数据库”的专项市场规模估算报告(截至 2024 年 12 月),该品类或仍被归类于“非关系型数据库”或“AI 基础设施”的大类统计中,未独立披露。
  • 趋势判断:基于行业从业者共识,向量功能正从“独立品类”向“数据库标配”演化,该趋势可能重塑市场边界与规模度量口径(来源:《What is a vector database?》Pinecone 博客,2023;《Vector databases are the wrong abstraction》Gradient Flow,2024)。

读者注意:本节缺乏可引用的量化数据,请勿据此做任何投资或项目决策。

玩家对比

以下不形成推荐或排序,仅基于公开技术文档整理各产品的架构差异点:

  • 存算分离 vs. 存算一体:Milvus 自 2.0 起采用存算分离(计算节点、索引节点、存储节点独立),支持按需扩缩;Qdrant、Weaviate 为存算一体单进程(亦可集群分片),运维相对简单。
  • 一致性模型:Pinecone 强调强一致性读(通过写入确认机制);部分开源方案在分片复制下为最终一致性,需业务容忍短暂分歧。
  • 索引可扩展性:Zilliz(Milvus)与 Weaviate 支持多索引类型混用;pgvector 核心依赖 HNSW,索引类型较为单一。
  • 权限与多租户:Pinecone、Weaviate、Zilliz Cloud 提供 API Key/项目级隔离;开源版 Milvus 在 2.3 版本引入 RBAC(来源:Milvus 2.3 Release Notes,2023)。

公开资料未见针对所有厂商的标准化的第三方性能基准测试(如同等硬件、同等数据集、同等参数下的全维度对比),因此不提供量化得分表格。

风险

  • 技术路线不确定风险:ANN 算法更迭快,今天的领先索引结构可能被新方法取代(如基于学习型索引的方法近年有所关注)。厂商需持续投入研发以维持性能优势。
  • 开源商品化风险:基础向量搜索能力已通过 Faiss、HNSWlib 等开源项目高度商品化,入门壁垒低。独立向量数据库厂商的价值若无法在分布式、运维、安全与生态上拉开差距,可能被开源方案或云厂商免费功能替代。
  • 云厂商降维打击:若 AWS、Azure 等云厂商将向量搜索作为数据库或对象存储的零成本附加功能提供,独立厂商可能面临巨大价格压力。该风险已在 NoSQL、消息队列等历次基础设施品类竞争中被验证。
  • 性能与成本平衡:维持 95%+ 召回与毫秒延迟往往意味着高内存占用或复杂的分布式结构,TCO 敏感场景下客户可能被迫降低检索质量要求。
  • 产业泡沫:2023‑2024 年的资本与舆论热度可能催生过度预期。部分企业可能将向量数据库视为万能 AI 入口,而忽视数据治理、嵌入策略等前置环节,导致项目效果不达预期。
  • 合规与数据主权:跨境托管向量数据可能涉及数据本地化法规(如 GDPR、中国《数据安全法》),成为企业客户采用海外云托管服务的障碍。

误读纠偏

误读 1:“向量数据库就是加了 ANN 索引的常规数据库,与 Elasticsearch 的向量扩展没有本质区别。”

纠正:表面功能相似,但根本差异在于系统设计的向量优先。独立向量数据库在动态索引维护、近似召回的可预期性调优、混合标量‑向量过滤的执行计划优化、跨分片合并策略等方面进行了内核级设计。传统数据库“附加”的向量搜索,在大规模动态数据的场景下,性能波动与召回衰减通常更显著(社区压力测试报告零星、非标准对照,无法引用为权威证据,但已成为工程界经验共识)。

误读 2:“只要接入向量数据库,RAG 应用准确率就有保证。”

纠正:向量数据库仅负责按距离返回最相似向量。语义相似 ≠ 答案正确。若嵌入模型未针对业务领域微调,或文本分块(chunking)策略不当,检索结果可能包含大量无关内容。RAG 的最终精度由嵌入模型、分块切分、检索后重排序(reranking)与提示词工程等连锁环节共同决定,向量数据库是必要条件,非充分条件。

误读 3:“选一个最快的 ANN 算法库就行,数据库层面的能力不重要。”

纠正:纯 ANN 库解决的是“单次计算最优”问题,而生产环境需要的是“持续稳定服务”。后者要求数据持久化、故障恢复、副本同步、访问控制、监控告警、动态扩缩等数据库级能力。自建封装的工作量长期可能超过数据库的授权或服务成本,且迭代维护风险由使用方承担。

最新事件

基于公开检索(截至 2024 年 12 月知识截止范围):

  • PostgreSQL pgvector 持续迭代:2023‑2024 年多个小版本改进了 HNSW 构建速度与并行查询,成为小规模部署的首选方案来源之一(pgvector GitHub Release Notes)。
  • 云厂商深入布局:AWS 在 re:Invent 2023 宣布 OpenSearch Serverless 支持向量引擎;2024 年 Azure AI Search 更新向量搜索与语义排序的集成。(来源:AWS、Azure 官方博客,2023‑2024)
  • 开源生态加速标准化:LangChain 与 LlamaIndex 2024 年均强化了向量数据库的抽象层,简化多后端切换,进一步向应用层隐藏数据库差异(LangChain 文档,v0.2+)。
  • 多家独立厂商发布云托管版本:部分之前仅提供开源版的厂商(如 Qdrant、Weaviate)加大了对各自云服务(Cloud)的投入,反映了托管收入的商业化路径趋同。
  • 中国厂商:公开资料显示,阿里云 Tair 向量、腾讯云 VectorDB、百度的向量数据库服务均已在 2023‑2024 上线,国内市场进入“云厂商+独立厂商”并行阶段(各公司官网)。

跟踪指标

如欲持续观察该产业发展态势,可关注以下指标与信源:

  • 技术基准:ANN‑Benchmarks 社区仓库(GitHub)的索引性能排名更新,关注不同数据集下 P99 延迟、召回率、构建时间的代际变化。
  • 开源采用度:GitHub Star、下载量、Issue 活跃度(Milvus、Qdrant、Weaviate、Chroma、pgvector);PyPI/npm 下载统计(客户端库)。
  • 框架集成情况:LangChain、LlamaIndex、Haystack 的“支持向量数据库列表”变化及默认推荐是否有更替。
  • 招聘信号:LinkedIn/拉勾上“向量数据库”相关岗位数量与薪资变化,反映企业投入方向。
  • 学术/工业前沿:NeurIPS、SIGMOD、VLDB 等顶会中向量检索相关论文,尤其关注“学习型索引”与“磁盘/内存混合”的新方案。
  • 监管动态:各国数据本地化法规的后续细则,影响云托管向量数据库的跨境部署方案。

信源

本文内容综合以下公开来源,所有无精确数字之处或未找到权威依据之处均已标注“公开资料未见”:

(全文约 9,200 字)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型