模型层 开放阅读

Prefix Cache

Prefix Caching

概念 ID
prefix-caching
更新时间
2026-05-29
来源数量
待补

Prefix Cache

1. 3 秒看懂

Prefix Cache 是 LLM 推理的“防重复烧脑”机制。当多个请求共享相同前缀(如系统提示词、对话历史)时,系统通过重用注意力计算中产生的 Key-Value 张量,实现“一次计算,多人复用”。它将冗余的矩阵运算转化为显存读写,直接砍掉重复 prefill 时间与算力消耗,等价于把单次推理成本“打下来”。

2. 3 分钟产业解释

在 LLM 推理服务中,KV Cache 是提升自回归生成效率的基石:模型每生成一个新 token,都需要与所有历史 token 进行注意力运算。为避免重复计算历史的 Key 和 Value,它们会被缓存在 GPU 显存中。而 Prefix Caching 则将这一机制从“请求内”扩展至“跨请求”——当推理引擎发现新请求的前缀(如聊天机器人长达数千 token 的系统提示、RAG 场景中检索到的公共文档、或编程助手的静态指令集)与之前处理过的某段序列完全一致时,就会直接复用该前缀对应的物理显存块,完全跳过该前缀的 prefill 计算阶段

  • 商业价值:在千亿级模型的云服务中,用户 prompt 存在大批重复的系统前缀。命中一次缓存,能将“首 Token 延迟”削减数十毫秒至数秒,并释放宝贵的 GPU 算力去服务更多并发请求,这在云厂商层面直接转化为更高的服务密度和更低的单 token 服务成本。
  • 产业定位:它是推理引擎(如 vLLM、SGLang、Hugging Face TGI)的核心优化之一,与 PagedAttention、连续批处理、投机解码、量化等协同工作。其角色可理解为 LLM 从“实验室能跑”到“商业上能大规模、低成本部署”的关键一跃。

3. 技术原理

Prefix Caching 的技术逻辑植根于 Transformer 自回归解码的因果性:序列中第 i 个 token 的注意力计算只依赖于前 i 个 token,与未来 token 无关。它的实现可以分解为三个核心步骤:共享判定、分块管理和位置编码对齐。

  1. 共享前缀判定:系统需识别不同请求的 token 序列,找出它们从位置 0 开始的公共最长前缀。这不是简单的字符串匹配,而是基于 tokenizer 的精确序列比对。
  2. 块级管理 (Block-level Management):若以单个 token 为粒度管理缓存,元数据开销和查找延迟不可接受。因此,工业界普遍以块为最小单元——一个块包含固定数量 token(16 到 256 个)的 KV 向量组。系统通过计算块的哈希值或使用前缀树来索引这些物理显存块。
  3. 位置编码兼容:此机制对位置编码极其敏感。对于 RoPE 等主流方案,key 的计算会引入绝对位置信息。缓存的 KV 张量“固化”了它在首次计算时的绝对位置。因此,复用必须保证新请求的前缀也从位置 0 开始且内容完全一致,绝对位置才完全匹配,缓存才有效。若同一个提示词出现在序列中间,因绝对位置变化,朴素的缓存机制会失效,需重新计算。

性能杠杆

  • 延迟:将首 Token 延迟从与总长度平方相关的 O(L²) 量级,降至主要受不命中的后缀长度影响。在长系统提示词场景下,可削减 90% 以上的 prefill 耗时 [基于公开技术推演,非特定厂商实测]。
  • 吞吐:释放的 GPU 注意力计算单元,能直接用于提升批处理大小,提高整体服务并发数。
  • 显存:多个请求的 KV Cache 表项映射到同一块物理显存,通过引用计数管理,避免为相同前缀重复分配显存。

4. 关键参数

衡量和配置 Prefix Caching 系统的关键参数包括:

  • 块大小 (Block Size):管理 KV Cache 的最小粒度,通常为 16 至 256 个 token。较小的块(如 16)能减少块内因请求长度不一导致的“碎片化”浪费,但会增加元数据和查找开销。vLLM 早期版本默认值为 16,这是工程上权衡后的常见选择。
  • 缓存命中率 (Cache Hit Rate):核心效益指标,指命中缓存的请求数占总请求数的比例。在系统提示词高度固定(如“你是一位金融分析师…”)、多轮对话或大规模 RAG 场景中,该比率可达 80% 以上 [行业定性估算,非严谨统计口径]。
  • 首 Token 延迟缩减比例 (TTFT Reduction Ratio):近似遵循 1 - (L-P)² / L²,其中 L 是总前缀长度,P 是命中长度。P 越接近 L,收益越大。
  • 吞吐提升倍数 (Throughput Improvement Multiplier):因 Prefill 算力释放而带来的吞吐增益,在典型场景下约 1.2× 到 2× [行业定性估算]。具体数值高度依赖于模型架构、硬件和负载模式。
  • 显存去重比 (Memory Dedup Ratio):使用共享缓存后 GPU 显存占用与无共享时的比值。并发请求的相同前缀越长、数量越多,节省比例越显著。
  • 查找延迟 (Lookup Latency):缓存索引匹配的时间开销,必须控制在微秒量级,否则会抵消算力节省的收益。SGLang 的 RadixAttention 方案将此操作优化为 O(前缀长度) 的树形匹配。

5. 技术路线

从无缓存到智能共享,KV Cache 的管理技术经历了明确代际演进。

维度传统无缓存基础 KV Cache前缀缓存:块级 (Block-level)前缀缓存:结构化 (RadixAttention)
共享粒度隔离,每请求独立跨请求,以 Block 为单位跨请求,Block + 全局前缀树管理
重复前缀处理每次完整 prefill同一请求内不重复,跨请求仍重算命中时跳过整个前缀的 prefill同左,支持更灵活的部分匹配和自动合并
索引结构--哈希表 (Block Hash → 显存块指针)基数树/前缀树,O(长度) 复杂度
显存效率最低中,无法跨请求去重高,通过引用计数实现物理块共享同左,且能通过树结构管理碎片
实现复杂度高(需处理并发、引用计数)很高(需复杂的树操作与锁优化)
代表系统早期原型几乎所有现代推理框架vLLM (Automatic Prefix Caching)SGLang

当前,块级哈希表方案(vLLM)已成为事实标准,而基于前缀树的方案(SGLang)则代表了对极致效率的追求,二者共同构成了市场主流。

6. 上游

Prefix Caching 技术的实现和性能高度依赖上游软硬件生态:

  • 模型架构:业界主流仅 Decoder-only 架构(如 GPT 系列)能无缝、大规模受益。Encoder-Decoder 或多模态模型的序列结构差异使其实现更复杂,公开资料未见标准化方案。
  • 高效注意力算子:FlashAttention、PagedAttention 等提供了对显存块进行细粒度操作和管理的“原语”。PagedAttention 的虚拟内存抽象是 vLLM 实现块级缓存共享的前提。
  • 硬件与显存技术:HBM(高带宽显存)的容量直接决定缓存池大小上限,其带宽则决定了块查找和数据搬运的速度。来自 NVIDIA 的技术白皮书强调了此优化对大显存 GPU 的依赖性。
  • 编译与推理后端:如 Triton、TensorRT-LLM,负责将高层的缓存复用逻辑编译为高效的 GPU 内核,确保查找过程不成为瓶颈。

7. 下游

Prefix Caching 的普及,重塑了下游应用和服务的成本结构:

  • 推理引擎与服务:vLLM、SGLang、Hugging Face TGI、TensorRT-LLM 等是该技术的直接集成方。它们将 Prefix Caching 包装为 API 的默认能力,为上层提供低延迟、高吞吐的模型服务。例如,Fireworks AI 已将此类优化作为其无服务器推理产品的核心竞争力之一进行宣传 [依据 2024 年技术公告定性]。
  • 应用场景层
    • 聊天机器人/Agent:几十轮对话的完整历史成为公共前缀,每次新提问不再需要重读全部历史。
    • 检索增强生成:当多个用户查询命中同一批检索文档时,文档的 KV Cache 能被批处理中的多个请求共享。
    • 编程助手:静态的、长达数千 token 的系统指令和项目上下文环境,是该技术发挥最大价值的场景。
  • AI 云平台:决定其服务毛利率的关键。微软 Azure、AWS SageMaker、Google Cloud Vertex AI 等平台将此优化内化,直接影响了它们在 AI IaaS 层的定价权与服务竞争力。

8. 受益公司

Prefix Caching 作为基础设施层的核心技术,其价值沿着产业链分配,不同环节的受益逻辑各异:

  • 开源推理引擎团队及其商业实体
    • vLLM 生态:项目源于 UC Berkeley,已成推理引擎事实标准。其 Prefix Caching 特性推动了推理成本的显著下降。与该生态深度集成的公司,如专做 KV 缓存加速的 LMCache(公开报道显示其获得 a16z 等 VC 种子轮融资),成为直接受益者。
    • SGLang 生态:斯坦福大学与社区驱动,以 RadixAttention 技术吸引了 AMD、Intel 等芯片公司的适配与合作,其在处理复杂语言程序的结构化缓存方面具备差异化优势。
  • 独立 AI 推理服务商:如 Fireworks AIAnyscaleRun:ai(被 NVIDIA 收购)等。它们通过集成或自研同类优化,以更高的服务性价比获取客户,竞争力与缓存效率直接挂钩。
  • 推理硬件与云平台NVIDIA 自身在 TensorRT-LLM 中持续迭代该能力,是其企业级 AI 软件生态的护城河之一。同时,大型云厂商通过提供经深度优化的模型即服务,将硬件毛利转化为软件服务毛利。
  • 大规模应用 AI 的 SaaS 企业:如客服、营销文案生成、代码辅助类的 SaaS 公司,推理成本降低是其商业模型从负毛利转为正毛利的关键驱动力。它们是最终的算力消费者和受益方。

9. 市场规模

目前,尚无独立第三方机构(如 IDC、Gartner)发布针对“Prefix Caching”这一单一技术的全球市场规模数据(TAM)。其市场价值内嵌于更大的 LLM 推理市场AI 推理优化软件 赛道中。

  • 赋能市场:据 Precedence Research 等机构 2024 年报告预估,全球 AI 推理基础设施市场在未来数年将达数百亿美元规模。Prefix Caching 作为提升该市场服务效率的核心杠杆之一,其经济价值体现在降低同等算力消耗下的 Token 生成成本,而非一个可直接量化的独立市场。
  • 成本节约的量化估算:在高重复前缀场景(如系统提示词命中率达 80%)下,该技术能节省对应比例的 prefill 算力。据 Anyscale、Fireworks AI 等公司的 2024 年技术博客估算,综合优化(含 Prefix Caching)可将 LLM 推理的单位成本削减 50% 或更多。若将其贡献单独拆分,在中高重复度场景下,保守估计其能驱动总推理成本下降 20% 至 40% [基于行业方法论的情景推演,非财务审计数据]。
  • 资本映射:市场对该技术的价值评估,主要通过流向推理引擎初创公司及内部工具团队的 VC 投资来体现,多家相关公司在 2023-2024 年获得了高溢价融资,反映了市场对其技术经济杠杆的认可。

10. 玩家对比

当前的竞争格局主要围绕开源框架展开,各方案在工程哲学和性能特性上存在差异。

  • vLLM(哈希表流派)
    • 机制:基于 PagedAttention 的块哈希表。当新请求到来,计算其前缀块的哈希值并在全局哈希表中查找。
    • 核心优势:架构相对简单,与 PagedAttention 深度耦合,社区庞大,是行业默认选择,成熟度最高。
    • 核心劣势:哈希冲突需要处理;对于序列中段的、非前缀的公共子序列无法自动识别和复用。
  • SGLang(基数树流派)
    • 机制:采用 RadixAttention,用一棵全局基数树来管理所有 KV 缓存块。新请求沿途匹配树节点。
    • 核心优势:查找时间复杂度更稳定;能更自然地处理缓存淘汰(如驱逐整个分支);在调度结构化程序时效率更高。
    • 核心劣势:实现极其复杂,树在高并发下的锁竞争是其工程挑战,虽然已通过 RCU 等技术优化 [基于 2024 年论文内容]。
  • 闭源/平台方案
    • 玩家:NVIDIA TensorRT-LLM、各大云厂商内部沉淀。
    • 机制与特点:通常是硬件绑定的深度优化方案,可能结合了专有硬件特性。其实现细节不公开,性能极限更高,但生态锁定性强。公开资料未见直接可量化的对比测试。

11. 风险

该技术及应用存在多维度的结构性风险:

  • 适用场景的局限性风险:其收益与请求间前缀的重叠度强相关。在创意写作或每次 prompt 都独一无二的应用中,命中率可能极低,甚至会因查找开销引入微小的负收益。它并不是“万金油”。
  • 索引与查找开销风险:若缓存池规模巨大且索引设计不佳,前缀匹配的延迟可能从微秒级上升至毫秒级,完全抵消 prefill 节省的时间。这是对工程实现的严峻考验。
  • 碎片化与资源管理风险:跨请求的共享可能导致 GPU 显存分配出现复杂的外部碎片。当并发请求的前缀开始出现细微差别(分叉)时,高命中的“蜜月期”结束,显存管理复杂度陡增。
  • 隐私与安全风险:KV Cache 实质上是用户数据的深层神经网络表征。在未经严格隔离的多租户环境中,恶意的侧信道攻击在理论上有机会通过测量缓存命中/穿透的时延来推断其他用户的 prompt 内容 [基于计算机系统安全领域公开研究的延伸推演]。这是阻碍其在更敏感场景推广的潜在障碍。
  • 技术锁定风险:将业务深度绑定在某一种特定的、封闭的缓存实现上(如特定云厂商的内部方案),可能会牺牲在不同硬件平台间的可移植性。
  • 数据依赖的颗粒度风险:其缓存命中完全依赖 token 级别的精确匹配。一个空格的差异或同义词替换都可能导致命中失败,这与语义级的期望存在鸿沟。

12. 误读纠偏

  1. “Prefix Cache 就是高级的字符串缓存” 偏误:错。它被缓存的不是输入文本,而是经过深层 Transformer 网络计算后得到的、对位置敏感的 Key 和 Value 张量。其可用性受严格的 token 序列一致性和位置编码约束。两个输入只要在分词器那里产生一个 token 的偏差,整个前缀的 KV 缓存就完全不能复用。

  2. “只要系统提示一样,缓存就能一直命中” 偏误:不完全对。若系统提示后紧跟着不同的用户问题,为服务并发性,引擎常将用户问题和系统提示打包成一个连续序列进行批次处理。一旦批次内序列的公共前缀在用户输入部分发生分叉,缓存只能复用到分叉点。此外,许多基础实现要求共享的前缀必须严格从序列位置 0 开始

  3. “Prefix Caching 和 PagedAttention 是同一个东西” 偏误:不是。PagedAttention 是一种解决 KV Cache 内部碎片的内存管理技术(类似于操作系统的虚拟内存分页)。而 Prefix Caching 是在其之上构建的一套共享与去重逻辑,正是利用“分页”得到的块,来实现跨请求的“按页复用”。两者独立但互为增强。

  4. “开启此功能就一定能提速” 偏误:存在边界条件。在不具备共享前缀的负载下,开启此功能意味着每次请求都要额外执行一次哈希计算/树查找的步骤,这会引入微小的延迟。虽然现代系统设计已将其开销压到极低,但在极端零命中率场景下,理论上的“净损耗”存在可能。

13. 最新事件

  • 2024 年 Q1:SGLang 项目公开,并详细阐述了其 RadixAttention 技术。其针对复杂语言处理程序的缓存效率引起学术界和工业界的广泛关注,被视为对 vLLM 的 Automatic Prefix Caching 的一个重要技术回应。
  • 2024 年:LMCache 项目成立并获得风险投资(包括 a16z 的种子轮),它将 Prefix Caching 的范畴从 GPU 显存扩展至 CPU 内存和高速 SSD,试图构建一个分层大容量 KV 缓存系统,并与 vLLM 深度集成。
  • 2024 下半年:NVIDIA 收购 Run:ai,业界分析普遍认为,此举旨在吸纳 AI 推理任务编排和工作负载调度方面的顶尖人才与技术,其中包含了跨请求计算共享的深层优化逻辑,意在强化从硬件到软件推理栈的全套生态。
  • 2024-2025 持续迭代:Hugging Face TGI 和 NVIDIA TensorRT-LLM 均在持续更新,巩固和强化各自的 Prefix Caching 能力,使其集成更无缝、配置更自动化。该特性正从“差异化优势”加速转变为“基础必备项”。

14. 跟踪指标

对于希望评估或跟踪 Prefix Caching 技术价值的投资者和产业观察者,可以关注以下可获取或估算的指标:

  • 社区与生态指标(市场采用率)
    • vLLM GitHub 星数与贡献者增长:标志着该技术默认方案在开发者侧的渗透率。
    • 主要云平台提及率:在 Microsoft、AWS、GCP 的模型服务文档中,“Prefix Caching”作为默认特性的公开说明频率。
  • 推理经济性指标(技术效益)
    • AI 服务商的单 Token 推理成本变动:关注 Anyscale、Fireworks 等独立服务商在公开技术博客中披露的“服务密度”或“单位算力 Token 产出”改善数据。这是最直接的商业效益证明。
    • 基准测试 (Benchmark):关注 MLPerf Inference 等业界测试标准,在固定时延和吞吐条件下,引入缓存优化后的能效比提升数据。
  • 技术前沿指标(演进方向)
    • 头部引擎的分层缓存功能:跟踪 LMCache 等支持“显存-内存-SSD”分层 KV 缓存方案的迭代,这是突破显存容量限制的关键一步。
    • 跨模型/语义级缓存分享论文发表:在 arXiv 上,该方向的前沿研究成果,是判断技术能否突破“精确 token 匹配”限制、走向通用智能的重要观察窗口。

15. 信源

  • 核心论文
    • Kwon, W., et al. “Efficient Memory Management for Large Language Model Serving with PagedAttention.” Proceedings of the 29th Symposium on Operating Systems Principles (SOSP ‘23), 2023.
    • Zheng, L., et al. “SGLang: Efficient Execution of Structured Language Model Programs.” arXiv preprint arXiv:2312.07104, 2024.
  • 核心项目与社区
  • 商业实体与技术博客
    • LMCache 项目: https://lmcache.ai
    • Anyscale Blog: “How continuous batching enables 23x throughput…”
    • Fireworks AI Blog: 关于推理服务优化的技术披露文章
  • 产业趋势与资本动态
    • NVIDIA 官方技术白皮书 “Mastering LLM Techniques: Inference Optimization”.
    • 关于 LMCache 获得 a16z 等机构种子轮融资的公开报道 (2024)。
    • 关于 NVIDIA 收购 Run:ai 的交易公告与技术分析文章 (2024)。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型