向量数据库
3 秒看懂
向量数据库是面向高维向量(embedding)设计的新型数据基础设施,专用于存储、索引和快速检索“语义上最相似”的内容。它不依赖关键词匹配,而是通过向量间的数学距离(如余弦相似度、欧氏距离)衡量相似性。在大模型(LLM)检索增强生成(RAG)、推荐系统、图像/音频搜索、多模态理解等场景中,向量数据库充当外部非结构化知识的语义索引 ,直接决定检索延迟与召回质量,是 AI 应用从“模型智能”迈向“数据智能”的关键桥梁。
3 分钟产业解释
当文本、图像等非结构化数据被深度神经网络编码为一组高维浮点数(向量,通常数百至数千维)之后,传统关系型数据库的 B‑Tree、倒排索引等结构便无法表达“意思相近”这类模糊匹配。向量数据库将“语义相似”转化为“空间邻近”,借助**近似最近邻(ANN)**算法,在毫秒级完成海量向量检索。
从产业定位看,向量数据库处于 AI 基础设施的中间层:向上承载大模型应用(尤其 RAG),向下依赖内存、NVMe SSD、GPU 等异构硬件。其产品形态通常具备以下能力:
全托管/云原生 :自动扩缩容、多租户隔离、跨可用区容灾。
混合搜索 :结合标量过滤(时间、标签、用户 ID)与向量相似度,支持复杂查询。
实时更新 :支持流式向量写入、动态索引增删,而非仅静态批量建库。
生态对接 :LangChain、LlamaIndex、Dify 等 LLM 应用框架已内置主流向量数据库驱动,开发者一键接入。
2023 年后,向量数据库从利基技术跃升为 AI 栈核心组件,市场规模快速扩大。其产业角色正从“可选插件”演变为 LLM 的“默认外部记忆体”。
技术原理
底层模型
非结构化数据(文本、图片、音频)经嵌入模型(如 OpenAI text-embedding-3-small、BGE、CLIP)映射为固定维度浮点向量 v ∈ ℝ^d。嵌入模型的训练基于分布假设(Distributional Hypothesis):语义相近的输入在高维空间中距离更近,表现为余弦相似度高或欧氏距离小。该性质构成了向量数据库一切后续操作的前提。
相似度度量
常用距离/相似度函数包括:
欧氏距离(L2) :d(v1, v2) = ||v1 − v2||,越小越相似。
内积(IP) :v1 ⋅ v2,越大越相似。
余弦相似度 :(v1 ⋅ v2) / (||v1|| × ||v2||),归一化后等价于内积。
工程实践中,多数系统预先对向量做 L2 归一化,将余弦相似度转为内积,再进一步转为欧氏距离,以适配底层索引结构优化。
ANN 索引核心思想
ANN(Approximate Nearest Neighbor)算法追求:以可接受的微量精度损失(例如召回率从 1.0 降至 0.95),换取检索速度千倍以上的提升。核心思想是通过空间划分、图连接或编码压缩,将搜索范围从“全集暴力扫描”缩小到“高概率包含近邻的候选集”。
主流索引结构 :
哈希方法(LSH,Locality Sensitive Hashing) :利用一族哈希函数,使相近向量以高概率落入同一哈希桶,查询时仅扫描候选桶。结构简单,但内存效率与召回率中等,现多被替代。
量化方法(IVF + PQ) :先通过 K‑Means 将全库聚类,构建倒排文件(IVF),查询时只检索最近的 nprobe 个聚类;每个向量用乘积量化(Product Quantization)编码为短码,距离计算在压缩域进行。压缩率高,适合十亿级以上场景,Faiss 是该路线的代表性实现。
图方法(HNSW,Hierarchical Navigable Small World) :构建多层近似最近邻图,上层为“长程边”,下层为“局部边”。查询从顶层随机点出发,贪心向下探索。检索极快(亚毫秒),内存占用较高,增量插入时图结构可能退化,需要周期重建。代表实现:HNSWlib、部分 Milvus/Qdrant 引擎。
磁盘优化(DiskANN) :在图索引基础上引入向量量化(VQ)与 SSD 友好的数据布局,使大部分索引驻留 SSD,仅热点数据存于内存,适合百亿级、内存受限环境。查询比纯内存方案增加约 1‑3ms 延迟(2023 年 DiskANN 论文基准)。
树方法(Annoy、K‑D Tree 等) :早期使用,现多被图/量化方法取代。
混合检索典型流水线 :
查询向量 q
├── 标量过滤:限定搜索域(如 user_id = 123)
├── 粗排(Coarse Quantization):聚类定位 top‑nprobe 个候选簇
├── 精排(Refine):在候选簇内用原始向量或残差向量计算真实距离
└── 返回 Top‑K,可选重排序(多模态分数融合、Cross‑encoder 精排)
RAG 集成模式
用户问题 → LLM 嵌入模型 → 查询向量
↓
向量数据库 → 相关文本块(Top‑K)
↓
提示构建:问题 + 检索块 → LLM 生成最终回答
在该模式下,向量数据库充当高速语义知识库 ,弥补 LLM 的知识截止日限制与幻觉问题。其延迟直接进入端到端用户体验的关键路径。
关键参数
选型与运维需关注以下指标:
召回率(Recall@K) :ANN 返回 Top‑K 与暴力搜索 Top‑K 的重合比例,典型生产环境要求 0.95‑0.99。
延迟(P50/P99 延迟) :单次查询响应时间,交互场景要求 P99 < 100ms,实时推荐常需 < 10ms。
吞吐(QPS) :每秒查询数,取决于索引类型、并发设计、硬件规格。
索引构建/插入速率 :向量写入并建索引的速度,反映实时性能力。部分图索引(HNSW)全量构建后增量插入效率显著下降。
压缩比 :压缩后存储占用与原 float32 存储之比,影响内存/磁盘成本。乘积量化可实现 4×∼16× 压缩(Jégou, TPAMI 2011)。
大规模下质量衰减 :十亿级数据时召回率是否断崖下跌,DiskANN、IVF+PQ 等对此有专门优化。
资源占用 :内存、SSD、GPU 显存开销,直接决定总持有成本(TCO)。
注意 :各产品在 ANN‑Benchmarks 等基准上的表现受数据集、维度、查询分布、参数调优影响显著,具体数值须以最新官方基准或第三方实测为准。公开资料未见跨产品的统一权威基准报告。
技术路线
当前市场已分化为三大技术路线:
路线一:独立向量数据库(Native Vector Database)
代表:Pinecone、Weaviate、Zilliz(Milvus)、Qdrant。
特点:以向量为第一公民设计存储引擎、索引结构与查询优化器。原生支持分布式水平分片、流式写入、混合搜索、多模态重排序。提供云托管或开源部署选项,配套监控与数据生命周期管理工具。
优势:功能最深,大规模场景下性能/召回可预期性最强。
劣势:引入额外基础设施成本与运维复杂度;数据生态与现有事务型数据库分离。
路线二:传统数据库向量扩展(Vector‑Enabled DB)
代表:PostgreSQL(pgvector 插件)、Elasticsearch、Redis、MongoDB。
特点:在已有数据库内核上附加向量数据类型与 ANN 索引(常为简化版 IVF 或 HNSW),复用原有 SQL/查询语法与生态。
优势:零额外部署,开发与 DBA 学习成本低;适用小规模(百万级向量)或标量‑向量联合查询场景。
劣势:分布式向量分片、动态索引维护能力弱于独立方案;十亿级场景下性能衰减通常更明显。根据公开技术文档与社区反馈,pgvector 的 HNSW 实现不支持增量索引局部重建,大规模写入后查询延迟可能波动(pgvector 0.7.0 版本,2024 年状态,来源为 GitHub 仓库 README 与 issue 讨论)。
路线三:专用 ANN 算法库(Library)
代表:Faiss(Meta)、HNSWlib、ScaNN(Google)。
特点:纯计算库,提供极致优化的索引构建与检索 API,不附带数据库功能(持久化、复制、SQL、多用户),需开发者自行封装。
优势:算法前沿、定制灵活、计算效率最高。
劣势:不提供生产级数据管理能力;无动态删改、无一致性保证。
对比总结(定性标定)
维度 独立向量数据库 传统库向量扩展 专用 ANN 库 向量索引深度 深(HNSW/IVF/DiskANN/融合) 浅(简化版 IVF/HNSW) 深(最新算法跟进最快) 分布式 原生支持 依赖主体库机制 无 动态数据 流式增删、实时可见 部分支持、有限调优 不支持 生态集成 LangChain/LlamaIndex 深度集成 通过驱动适配 需自行封装 运维成本 高(独立部署/云服务费) 低(利用现有实例) 极高(需自建服务)
注:上表为行业经验推断,非基于严格基准测试的量化结果。
上游
向量数据库的上游供给主要包括两类:
嵌入模型/服务 :OpenAI(text-embedding-3-small/large)、Cohere(Embed API)、Hugging Face(BGE、GTE 系列)等提供的云端 embedding 接口,以及企业自部署开源模型。嵌入质量(语义表达能力、多语言覆盖、维度效率)直接决定向量数据库检索召回率的上限。
硬件与云基础设施 :GPU/CPU 用于离线或实时嵌入生成;大内存与 NVMe SSD 支撑索引存储与检索;Kubernetes、对象存储、消息队列等构成云原生分布式部署基座。根据公开资料,AWS、Azure、GCP 均提供 GPU 实例(如 p4d、NCv3)与全闪存块存储,是独立向量数据库厂商的默认部署环境来源(云厂商官网,2024 年 12 月访问状态)。
下游
向量数据库的下游消费场景高度分层:
LLM 应用框架 :LangChain、LlamaIndex、Dify、Haystack 等通过统一接口抽象,实现对多款向量数据库的调用,成为流量的“总闸口”。根据各框架文档(2024 年 12 月查阅),LangChain 已支持 20 余种向量存储后端。
垂直行业场景 :
电商:个性化搜索与推荐(基于用户行为 embedding 的商品相似检索)。
医疗:文献/影像语义检索、相似病例匹配。
自动驾驶:场景库相似帧检索(基于 BEV 特征向量)。
金融:反欺诈交易图嵌入检索、合规文档去重。
企业 IT:内部知识库、客服系统(RAG)、代码语义搜索。
传统企业数字化转型 :制造业图纸检索、法律文书去重、媒体内容相似检测等。
下游需求驱动力本质是:非结构化数据的爆发增长与 LLM 对高质量外部知识的刚需之间形成的结构性缺口。
受益公司
以下为生态内各形态代表,排列不构成任何优先级或投资建议:
独立向量数据库厂商 :
Pinecone :商业全托管向量数据库,以开发者体验与零运维著称。公开资料未见其最新营收、估值数据(检索截至 2024 年 12 月)。
Weaviate :开源(BSD 协议),内置 GraphQL 原生接口与混合搜索,侧重多模态,提供云服务。公开资料未见财务数据。
Qdrant :Rust 实现、高性能,社区活跃,提供 Qdrant Cloud 托管服务。公开资料未见财务数据。
Zilliz :开源 Milvus 的商业公司,定位大规模分布式、云原生(存算分离架构),面向金融、生物医药等行业。公开资料未见其最新融资轮次与估值。
Chroma :轻量级开源嵌入数据库(Apache 2.0),以零配置、本地运行降低 AI 应用入门门槛。公开资料未见财务数据。
传统数据库/搜索厂商扩展向量能力 :
Elastic (Elasticsearch):从 8.0 版本内置向量搜索(HNSW),复用其倒排索引与聚合生态。
Redis (Redis Stack):RedisSearch 模块支持向量相似度(FLAT/HNSW),利用内存优势实现低延迟。
PostgreSQL :pgvector 插件推广迅速,2024 年下载量增长迅猛(具体数字公开资料未见),成为中小规模场景的常用选项。
阿里云 Tair 、腾讯云 VectorDB :云厂商自研或基于开源定制的向量数据库服务。
云厂商集成服务 :
AWS(Amazon Kendra 语义搜索、OpenSearch Service 的向量搜索)、Azure(AI Search)、GCP(Vertex AI Matching Engine)均在其数据/AI 平台中提供向量搜索能力,多与自身模型生态绑定。
公开资料未见 以上任何公司的精确市场份额、营收对比或第三方权威排名(检索截至 2024 年 12 月),故不予置入。
市场规模
由于检索接口限制,以下仅基于行业趋势的定性描述,不含具体金额数字 :
增长驱动力 :2023 年 ChatGPT 引爆的 RAG 模式使向量搜索从实验性技术跃升为“新默认架构”,企业对语义检索的需求从头部互联网公司扩散至传统行业。开源生态降低接入门槛,向量数据库成为 AI 项目预算中的新支出项。
供给分层 :市场分为纯向量数据库创业公司、传统数据库厂商、云厂商三层竞争。公开资料未检索到 Gartner、IDC 或 Forrester 针对“向量数据库”的专项市场规模估算报告(截至 2024 年 12 月),该品类或仍被归类于“非关系型数据库”或“AI 基础设施”的大类统计中,未独立披露。
趋势判断 :基于行业从业者共识,向量功能正从“独立品类”向“数据库标配”演化,该趋势可能重塑市场边界与规模度量口径(来源:《What is a vector database?》Pinecone 博客,2023;《Vector databases are the wrong abstraction》Gradient Flow,2024)。
读者注意 :本节缺乏可引用的量化数据,请勿据此做任何投资或项目决策。
玩家对比
以下不形成推荐或排序,仅基于公开技术文档整理各产品的架构差异点:
存算分离 vs. 存算一体 :Milvus 自 2.0 起采用存算分离(计算节点、索引节点、存储节点独立),支持按需扩缩;Qdrant、Weaviate 为存算一体单进程(亦可集群分片),运维相对简单。
一致性模型 :Pinecone 强调强一致性读(通过写入确认机制);部分开源方案在分片复制下为最终一致性,需业务容忍短暂分歧。
索引可扩展性 :Zilliz(Milvus)与 Weaviate 支持多索引类型混用;pgvector 核心依赖 HNSW,索引类型较为单一。
权限与多租户 :Pinecone、Weaviate、Zilliz Cloud 提供 API Key/项目级隔离;开源版 Milvus 在 2.3 版本引入 RBAC(来源:Milvus 2.3 Release Notes,2023)。
公开资料未见 针对所有厂商的标准化的第三方性能基准测试(如同等硬件、同等数据集、同等参数下的全维度对比),因此不提供量化得分表格。
风险
技术路线不确定风险 :ANN 算法更迭快,今天的领先索引结构可能被新方法取代(如基于学习型索引的方法近年有所关注)。厂商需持续投入研发以维持性能优势。
开源商品化风险 :基础向量搜索能力已通过 Faiss、HNSWlib 等开源项目高度商品化,入门壁垒低。独立向量数据库厂商的价值若无法在分布式、运维、安全与生态上拉开差距,可能被开源方案或云厂商免费功能替代。
云厂商降维打击 :若 AWS、Azure 等云厂商将向量搜索作为数据库或对象存储的零成本附加功能提供,独立厂商可能面临巨大价格压力。该风险已在 NoSQL、消息队列等历次基础设施品类竞争中被验证。
性能与成本平衡 :维持 95%+ 召回与毫秒延迟往往意味着高内存占用或复杂的分布式结构,TCO 敏感场景下客户可能被迫降低检索质量要求。
产业泡沫 :2023‑2024 年的资本与舆论热度可能催生过度预期。部分企业可能将向量数据库视为万能 AI 入口,而忽视数据治理、嵌入策略等前置环节,导致项目效果不达预期。
合规与数据主权 :跨境托管向量数据可能涉及数据本地化法规(如 GDPR、中国《数据安全法》),成为企业客户采用海外云托管服务的障碍。
误读纠偏
误读 1 :“向量数据库就是加了 ANN 索引的常规数据库,与 Elasticsearch 的向量扩展没有本质区别。”
纠正 :表面功能相似,但根本差异在于系统设计的向量优先 。独立向量数据库在动态索引维护、近似召回的可预期性调优、混合标量‑向量过滤的执行计划优化、跨分片合并策略等方面进行了内核级设计。传统数据库“附加”的向量搜索,在大规模动态数据的场景下,性能波动与召回衰减通常更显著(社区压力测试报告零星、非标准对照,无法引用为权威证据,但已成为工程界经验共识)。
误读 2 :“只要接入向量数据库,RAG 应用准确率就有保证。”
纠正 :向量数据库仅负责按距离返回最相似向量。语义相似 ≠ 答案正确。若嵌入模型未针对业务领域微调,或文本分块(chunking)策略不当,检索结果可能包含大量无关内容。RAG 的最终精度由嵌入模型、分块切分、检索后重排序(reranking)与提示词工程等连锁环节共同决定,向量数据库是必要条件,非充分条件。
误读 3 :“选一个最快的 ANN 算法库就行,数据库层面的能力不重要。”
纠正 :纯 ANN 库解决的是“单次计算最优”问题,而生产环境需要的是“持续稳定服务”。后者要求数据持久化、故障恢复、副本同步、访问控制、监控告警、动态扩缩等数据库级能力。自建封装的工作量长期可能超过数据库的授权或服务成本,且迭代维护风险由使用方承担。
最新事件
基于公开检索(截至 2024 年 12 月知识截止范围):
PostgreSQL pgvector 持续迭代 :2023‑2024 年多个小版本改进了 HNSW 构建速度与并行查询,成为小规模部署的首选方案来源之一(pgvector GitHub Release Notes)。
云厂商深入布局 :AWS 在 re:Invent 2023 宣布 OpenSearch Serverless 支持向量引擎;2024 年 Azure AI Search 更新向量搜索与语义排序的集成。(来源:AWS、Azure 官方博客,2023‑2024)
开源生态加速标准化 :LangChain 与 LlamaIndex 2024 年均强化了向量数据库的抽象层,简化多后端切换,进一步向应用层隐藏数据库差异(LangChain 文档,v0.2+)。
多家独立厂商发布云托管版本 :部分之前仅提供开源版的厂商(如 Qdrant、Weaviate)加大了对各自云服务(Cloud)的投入,反映了托管收入的商业化路径趋同。
中国厂商 :公开资料显示,阿里云 Tair 向量、腾讯云 VectorDB、百度的向量数据库服务均已在 2023‑2024 上线,国内市场进入“云厂商+独立厂商”并行阶段(各公司官网)。
跟踪指标
如欲持续观察该产业发展态势,可关注以下指标与信源:
技术基准 :ANN‑Benchmarks 社区仓库(GitHub)的索引性能排名更新,关注不同数据集下 P99 延迟、召回率、构建时间的代际变化。
开源采用度 :GitHub Star、下载量、Issue 活跃度(Milvus、Qdrant、Weaviate、Chroma、pgvector);PyPI/npm 下载统计(客户端库)。
框架集成情况 :LangChain、LlamaIndex、Haystack 的“支持向量数据库列表”变化及默认推荐是否有更替。
招聘信号 :LinkedIn/拉勾上“向量数据库”相关岗位数量与薪资变化,反映企业投入方向。
学术/工业前沿 :NeurIPS、SIGMOD、VLDB 等顶会中向量检索相关论文,尤其关注“学习型索引”与“磁盘/内存混合”的新方案。
监管动态 :各国数据本地化法规的后续细则,影响云托管向量数据库的跨境部署方案。
信源
本文内容综合以下公开来源,所有无精确数字之处或未找到权威依据之处均已标注“公开资料未见”:
Jégou, H., Douze, M., & Schmid, C. (2011). Product Quantization for Nearest Neighbor Search. IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI).
Malkov, Y. A., & Yashunin, D. A. (2020). Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs. ACM Transactions on Information Systems (TOIS).
Subramanya, S. J., et al. (2019). DiskANN: Fast Accurate Billion-point Nearest Neighbor Search on a Single Node. NeurIPS.
Faiss 官方仓库:https://github.com/facebookresearch/faiss
Milvus 官方文档:https://milvus.io/docs
Qdrant 官方文档:https://qdrant.tech/documentation/
Weaviate 官方文档:https://weaviate.io/developers/weaviate
pgvector GitHub 仓库:https://github.com/pgvector/pgvector
Pinecone 博客:What is a Vector Database? (2023)
Ben Lorica et al., “Vector databases are the wrong abstraction,” Gradient Flow (2024)
Elasticsearch 向量搜索官方文档:https://www.elastic.co/guide/en/elasticsearch/reference/current/dense-vector.html
Redis 向量相似度搜索文档:https://redis.io/docs/latest/develop/interact/search-and-query/advanced-concepts/vectors/
LangChain 文档 (v0.2+):https://python.langchain.com/docs/integrations/vectorstores/
AWS OpenSearch Serverless 向量引擎公告 (2023):https://aws.amazon.com/blogs/big-data/
Azure AI Search 向量功能更新 (2024):https://azure.microsoft.com/en-us/updates/
(全文约 9,200 字)
source: 公开披露与公开资料整理
本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。