Prefix Cache
1. 3 秒看懂
Prefix Cache 是 LLM 推論的“防重複燒腦”機制。當多個請求共享相同字首(如系統提示詞、對話歷史)時,系統通過重用注意力計算中產生的 Key-Value 張量,實現“一次計算,多人複用”。它將冗餘的矩陣運算轉化為視訊記憶體讀寫,直接砍掉重複 prefill 時間與算力消耗,等價於把單次推論成本“打下來”。
2. 3 分鐘產業解釋
在 LLM 推論服務中,KV Cache 是提升自迴歸生成效率的基石:模型每生成一個新 token,都需要與所有歷史 token 進行注意力運算。為避免重複計算歷史的 Key 和 Value,它們會被快取在 GPU 視訊記憶體中。而 Prefix Caching 則將這一機制從“請求內”擴充套件至“跨請求”——當推論引擎發現新請求的字首(如聊天機器人長達數千 token 的系統提示、RAG 場景中檢索到的公共文件、或程式設計助手的靜態指令集)與之前處理過的某段序列完全一致時,就會直接複用該字首對應的物理視訊記憶體塊,完全跳過該字首的 prefill 計算階段。
- 商業價值:在千億級模型的雲端服務中,使用者 prompt 存在大批重複的系統字首。命中一次快取,能將“首 Token 延遲”削減數十毫秒至數秒,並釋放寶貴的 GPU 算力去服務更多併發請求,這在雲端廠商層面直接轉化為更高的服務密度和更低的單 token 服務成本。
- 產業定位:它是推論引擎(如 vLLM、SGLang、Hugging Face TGI)的核心最佳化之一,與 PagedAttention、連續批處理、投機解碼、量化等協同工作。其角色可理解為 LLM 從“實驗室能跑”到“商業上能大規模、低成本部署”的關鍵一躍。
3. 技術原理
Prefix Caching 的技術邏輯植根於 Transformer 自迴歸解碼的因果性:序列中第 i 個 token 的注意力計算只依賴於前 i 個 token,與未來 token 無關。它的實現可以分解為三個核心步驟:共享判定、分塊管理和位置編碼對齊。
- 共享字首判定:系統需識別不同請求的 token 序列,找出它們從位置 0 開始的公共最長字首。這不是簡單的字串匹配,而是基於 tokenizer 的精確序列比對。
- 塊級管理 (Block-level Management):若以單個 token 為粒度管理快取,後設資料開銷和查詢延遲不可接受。因此,工業界普遍以塊為最小單元——一個塊包含固定數量 token(16 到 256 個)的 KV 向量組。系統通過計算塊的雜湊值或使用字首樹來索引這些物理視訊記憶體塊。
- 位置編碼相容:此機制對位置編碼極其敏感。對於 RoPE 等主流方案,
key的計算會引入絕對位置資訊。快取的 KV 張量“固化”了它在首次計算時的絕對位置。因此,複用必須保證新請求的字首也從位置 0 開始且內容完全一致,絕對位置才完全匹配,快取才有效。若同一個提示詞出現在序列中間,因絕對位置變化,樸素的快取機制會失效,需重新計算。
效能槓桿:
- 延遲:將首 Token 延遲從與總長度平方相關的 O(L²) 量級,降至主要受不命中的字尾長度影響。在長系統提示詞場景下,可削減 90% 以上的 prefill 耗時 [基於公開技術推演,非特定廠商實測]。
- 吞吐:釋放的 GPU 注意力計算單元,能直接用於提升批處理大小,提高整體服務併發數。
- 視訊記憶體:多個請求的 KV Cache 表項對映到同一塊物理視訊記憶體,通過引用計數管理,避免為相同字首重複分配視訊記憶體。
4. 關鍵引數
衡量和配置 Prefix Caching 系統的關鍵引數包括:
- 塊大小 (Block Size):管理 KV Cache 的最小粒度,通常為 16 至 256 個 token。較小的塊(如 16)能減少塊內因請求長度不一導致的“碎片化”浪費,但會增加後設資料和查詢開銷。vLLM 早期版本預設值為 16,這是工程上權衡後的常見選擇。
- 快取命中率 (Cache Hit Rate):核心效益指標,指命中快取的請求數佔總請求數的比例。在系統提示詞高度固定(如“你是一位金融分析師…”)、多輪對話或大規模 RAG 場景中,該比率可達 80% 以上 [行業定性估算,非嚴謹統計口徑]。
- 首 Token 延遲縮減比例 (TTFT Reduction Ratio):近似遵循
1 - (L-P)² / L²,其中 L 是總字首長度,P 是命中長度。P 越接近 L,收益越大。 - 吞吐提升倍數 (Throughput Improvement Multiplier):因 Prefill 算力釋放而帶來的吞吐增益,在典型場景下約 1.2× 到 2× [行業定性估算]。具體數值高度依賴於模型架構、硬體和負載模式。
- 視訊記憶體去重比 (Memory Dedup Ratio):使用共享快取後 GPU 視訊記憶體佔用與無共享時的比值。併發請求的相同字首越長、數量越多,節省比例越顯著。
- 查詢延遲 (Lookup Latency):快取索引匹配的時間開銷,必須控制在微秒量級,否則會抵消算力節省的收益。SGLang 的 RadixAttention 方案將此操作最佳化為 O(字首長度) 的樹形匹配。
5. 技術路線
從無快取到智慧共享,KV Cache 的管理技術經歷了明確代際演進。
| 維度 | 傳統無快取 | 基礎 KV Cache | 字首快取:塊級 (Block-level) | 字首快取:結構化 (RadixAttention) |
|---|---|---|---|---|
| 共享粒度 | 無 | 隔離,每請求獨立 | 跨請求,以 Block 為單位 | 跨請求,Block + 全域性字首樹管理 |
| 重複字首處理 | 每次完整 prefill | 同一請求內不重複,跨請求仍重算 | 命中時跳過整個字首的 prefill | 同左,支援更靈活的部分匹配和自動合併 |
| 索引結構 | - | - | 雜湊表 (Block Hash → 視訊記憶體塊指標) | 基數樹/字首樹,O(長度) 複雜度 |
| 視訊記憶體效率 | 最低 | 中,無法跨請求去重 | 高,通過引用計數實現物理塊共享 | 同左,且能通過樹結構管理碎片 |
| 實現複雜度 | 低 | 中 | 高(需處理併發、引用計數) | 很高(需複雜的樹操作與鎖最佳化) |
| 代表系統 | 早期原型 | 幾乎所有現代推論架構 | vLLM (Automatic Prefix Caching) | SGLang |
當前,塊級雜湊表方案(vLLM)已成為事實標準,而基於字首樹的方案(SGLang)則代表了對極致效率的追求,二者共同構成了市場主流。
6. 上游
Prefix Caching 技術的實現和效能高度依賴上游軟硬體生態:
- 模型架構:業界主流僅 Decoder-only 架構(如 GPT 系列)能無縫、大規模受益。Encoder-Decoder 或多模態模型的序列結構差異使其實現更復雜,公開資料未見標準化方案。
- 高效注意力運算元:FlashAttention、PagedAttention 等提供了對視訊記憶體塊進行細粒度操作和管理的“原語”。PagedAttention 的虛擬記憶體抽象是 vLLM 實現塊級快取共享的前提。
- 硬體與視訊記憶體技術:HBM(高頻寬視訊記憶體)的容量直接決定快取池大小上限,其頻寬則決定了塊查詢和資料搬運的速度。來自 NVIDIA 的技術白皮書強調了此最佳化對大視訊記憶體 GPU 的依賴性。
- 編譯與推論後端:如 Triton、TensorRT-LLM,負責將高層的快取複用邏輯編譯為高效的 GPU 核心,確保查詢過程不成為瓶頸。
7. 下游
Prefix Caching 的普及,重塑了下游應用和服務的成本結構:
- 推論引擎與服務:vLLM、SGLang、Hugging Face TGI、TensorRT-LLM 等是該技術的直接整合方。它們將 Prefix Caching 包裝為 API 的預設能力,為上層提供低延遲、高吞吐的模型服務。例如,Fireworks AI 已將此類最佳化作為其無伺服器推論產品的核心競爭力之一進行宣傳 [依據 2024 年技術公告定性]。
- 應用場景層:
- 聊天機器人/Agent:幾十輪對話的完整歷史成為公共字首,每次新提問不再需要重讀全部歷史。
- 檢索增強生成:當多個使用者查詢命中同一批檢索文件時,文件的 KV Cache 能被批處理中的多個請求共享。
- 程式設計助手:靜態的、長達數千 token 的系統指令和專案上下文環境,是該技術發揮最大價值的場景。
- AI 雲端平台:決定其服務毛利率的關鍵。微軟 Azure、AWS SageMaker、Google Cloud Vertex AI 等平台將此最佳化內化,直接影響了它們在 AI IaaS 層的定價權與服務競爭力。
8. 受益公司
Prefix Caching 作為基礎設施層的核心技術,其價值沿著產業鏈分配,不同環節的受益邏輯各異:
- 開源推論引擎團隊及其商業實體:
- vLLM 生態:專案源於 UC Berkeley,已成推論引擎事實標準。其 Prefix Caching 特性推動了推論成本的顯著下降。與該生態深度整合的公司,如專做 KV 快取加速的 LMCache(公開報道顯示其獲得 a16z 等 VC 種子輪融資),成為直接受益者。
- SGLang 生態:斯坦福大學與社群驅動,以 RadixAttention 技術吸引了 AMD、Intel 等晶片公司的適配與合作,其在處理複雜語言程式的結構化快取方面具備差異化優勢。
- 獨立 AI 推論服務商:如 Fireworks AI、Anyscale、Run:ai(被 NVIDIA 收購)等。它們通過整合或自研同類最佳化,以更高的服務價效比獲取客戶,競爭力與快取效率直接掛鉤。
- 推論硬體與雲端平台:NVIDIA 自身在 TensorRT-LLM 中持續迭代該能力,是其企業級 AI 軟體生態的護城河之一。同時,大型雲端廠商通過提供經深度最佳化的模型即服務,將硬體毛利轉化為軟體服務毛利。
- 大規模應用 AI 的 SaaS 企業:如客服、營銷文案生成、程式碼輔助類的 SaaS 公司,推論成本降低是其商業模型從負毛利轉為正毛利的關鍵驅動力。它們是最終的算力消費者和受益方。
9. 市場規模
目前,尚無獨立第三方機構(如 IDC、Gartner)釋出針對“Prefix Caching”這一單一技術的全球市場規模資料(TAM)。其市場價值內嵌於更大的 LLM 推論市場 和 AI 推論最佳化軟體 賽道中。
- 賦能市場:據 Precedence Research 等機構 2024 年報告預估,全球 AI 推論基礎設施市場在未來數年將達數百億美元規模。Prefix Caching 作為提升該市場服務效率的核心槓桿之一,其經濟價值體現在降低同等算力消耗下的 Token 生成成本,而非一個可直接量化的獨立市場。
- 成本節約的量化估算:在高重複字首場景(如系統提示詞命中率達 80%)下,該技術能節省對應比例的 prefill 算力。據 Anyscale、Fireworks AI 等公司的 2024 年技術部落格估算,綜合最佳化(含 Prefix Caching)可將 LLM 推論的單位成本削減 50% 或更多。若將其貢獻單獨拆分,在中高重複度場景下,保守估計其能驅動總推論成本下降 20% 至 40% [基於行業方法論的情景推演,非財務審計資料]。
- 資本對映:市場對該技術的價值評估,主要通過流向推論引擎初創公司及內部工具團隊的 VC 投資來體現,多家相關公司在 2023-2024 年獲得了高溢價融資,反映了市場對其技術經濟槓桿的認可。
10. 玩家對比
當前的競爭格局主要圍繞開源架構展開,各方案在工程哲學和效能特性上存在差異。
- vLLM(雜湊表流派):
- 機制:基於 PagedAttention 的塊雜湊表。當新請求到來,計算其字首塊的雜湊值並在全域性雜湊表中查詢。
- 核心優勢:架構相對簡單,與 PagedAttention 深度耦合,社群龐大,是行業預設選擇,成熟度最高。
- 核心劣勢:雜湊衝突需要處理;對於序列中段的、非字首的公共子序列無法自動識別和複用。
- SGLang(基數樹流派):
- 機制:採用 RadixAttention,用一棵全域性基數樹來管理所有 KV 快取塊。新請求沿途匹配樹節點。
- 核心優勢:查詢時間複雜度更穩定;能更自然地處理快取淘汰(如驅逐整個分支);在排程結構化程式時效率更高。
- 核心劣勢:實現極其複雜,樹在高併發下的鎖競爭是其工程挑戰,雖然已通過 RCU 等技術最佳化 [基於 2024 年論文內容]。
- 閉源/平台方案:
- 玩家:NVIDIA TensorRT-LLM、各大雲端廠商內部沉澱。
- 機制與特點:通常是硬體繫結的深度最佳化方案,可能結合了專有硬體特性。其實現細節不公開,效能極限更高,但生態鎖定性強。公開資料未見直接可量化的對比測試。
11. 風險
該技術及應用存在多維度的結構性風險:
- 適用場景的侷限性風險:其收益與請求間字首的重疊度強相關。在創意寫作或每次 prompt 都獨一無二的應用中,命中率可能極低,甚至會因查詢開銷引入微小的負收益。它並不是“萬金油”。
- 索引與查詢開銷風險:若快取池規模巨大且索引設計不佳,字首匹配的延遲可能從微秒級上升至毫秒級,完全抵消 prefill 節省的時間。這是對工程實現的嚴峻考驗。
- 碎片化與資源管理風險:跨請求的共享可能導致 GPU 視訊記憶體分配出現複雜的外部碎片。當併發請求的字首開始出現細微差別(分叉)時,高命中的“蜜月期”結束,視訊記憶體管理複雜度陡增。
- 隱私與安全風險:KV Cache 實質上是使用者資料的深層神經網路表徵。在未經嚴格隔離的多租戶環境中,惡意的側通道攻擊在理論上有機會通過測量快取命中/穿透的時延來推斷其他使用者的 prompt 內容 [基於計算機系統安全領域公開研究的延伸推演]。這是阻礙其在更敏感場景推廣的潛在障礙。
- 技術鎖定風險:將業務深度繫結在某一種特定的、封閉的快取實現上(如特定雲端廠商的內部方案),可能會犧牲在不同硬體平台間的可移植性。
- 資料依賴的顆粒度風險:其快取命中完全依賴 token 級別的精確匹配。一個空格的差異或同義詞替換都可能導致命中失敗,這與語義級的期望存在鴻溝。
12. 誤讀糾偏
-
“Prefix Cache 就是高階的字串快取” 偏誤:錯。它被快取的不是輸入文本,而是經過深層 Transformer 網路計算後得到的、對位置敏感的 Key 和 Value 張量。其可用性受嚴格的 token 序列一致性和位置編碼約束。兩個輸入只要在分詞器那裡產生一個 token 的偏差,整個字首的 KV 快取就完全不能複用。
-
“只要系統提示一樣,快取就能一直命中” 偏誤:不完全對。若系統提示後緊跟著不同的使用者問題,為服務併發性,引擎常將使用者問題和系統提示打包成一個連續序列進行批次處理。一旦批次內序列的公共字首在使用者輸入部分發生分叉,快取只能複用到分叉點。此外,許多基礎實現要求共享的字首必須嚴格從序列位置 0 開始。
-
“Prefix Caching 和 PagedAttention 是同一個東西” 偏誤:不是。PagedAttention 是一種解決 KV Cache 內部碎片的記憶體管理技術(類似於作業系統的虛擬記憶體分頁)。而 Prefix Caching 是在其之上建置的一套共享與去重邏輯,正是利用“分頁”得到的塊,來實現跨請求的“按頁複用”。兩者獨立但互為增強。
-
“開啟此功能就一定能提速” 偏誤:存在邊界條件。在不具備共享字首的負載下,開啟此功能意味著每次請求都要額外執行一次雜湊計算/樹查詢的步驟,這會引入微小的延遲。雖然現代系統設計已將其開銷壓到極低,但在極端零命中率場景下,理論上的“淨損耗”存在可能。
13. 最新事件
- 2024 年 Q1:SGLang 專案公開,並詳細闡述了其 RadixAttention 技術。其針對複雜語言處理程序的快取效率引起學術界和工業界的廣泛關注,被視為對 vLLM 的 Automatic Prefix Caching 的一個重要技術回應。
- 2024 年:LMCache 專案成立並獲得風險投資(包括 a16z 的種子輪),它將 Prefix Caching 的範疇從 GPU 視訊記憶體擴充套件至 CPU 記憶體和高速 SSD,試圖建置一個分層大容量 KV 快取系統,並與 vLLM 深度整合。
- 2024 下半年:NVIDIA 收購 Run:ai,業界分析普遍認為,此舉旨在吸納 AI 推論任務編排和工作負載排程方面的頂尖人才與技術,其中包含了跨請求計算共享的深層最佳化邏輯,意在強化從硬體到軟體推論棧的全套生態。
- 2024-2025 持續迭代:Hugging Face TGI 和 NVIDIA TensorRT-LLM 均在持續更新,鞏固和強化各自的 Prefix Caching 能力,使其整合更無縫、配置更自動化。該特性正從“差異化優勢”加速轉變為“基礎必備項”。
14. 追蹤指標
對於希望評估或追蹤 Prefix Caching 技術價值的投資者和產業觀察者,可以關注以下可獲取或估算的指標:
- 社群與生態指標(市場採用率):
- vLLM GitHub 星數與貢獻者增長:標誌著該技術預設方案在開發者側的滲透率。
- 主要雲端平台提及率:在 Microsoft、AWS、GCP 的模型服務文件中,“Prefix Caching”作為預設特性的公開說明頻率。
- 推論經濟性指標(技術效益):
- AI 服務商的單 Token 推論成本變動:關注 Anyscale、Fireworks 等獨立服務商在公開技術部落格中揭露的“服務密度”或“單位算力 Token 產出”改善資料。這是最直接的商業效益證明。
- 基準測試 (Benchmark):關注 MLPerf Inference 等業界測試標準,在固定時延和吞吐條件下,引入快取最佳化後的能效比提升資料。
- 技術前沿指標(演進方向):
- 頭部引擎的分層快取功能:追蹤 LMCache 等支援“視訊記憶體-記憶體-SSD”分層 KV 快取方案的迭代,這是突破視訊記憶體容量限制的關鍵一步。
- 跨模型/語義級快取分享論文發表:在 arXiv 上,該方向的前沿研究成果,是判斷技術能否突破“精確 token 匹配”限制、走向通用智慧的重要觀察視窗。
15. 信源
- 核心論文:
- Kwon, W., et al. “Efficient Memory Management for Large Language Model Serving with PagedAttention.” Proceedings of the 29th Symposium on Operating Systems Principles (SOSP ‘23), 2023.
- Zheng, L., et al. “SGLang: Efficient Execution of Structured Language Model Programs.” arXiv preprint arXiv:2312.07104, 2024.
- 核心專案與社群:
- vLLM 官方 GitHub 倉庫與文件: https://github.com/vllm-project/vllm
- SGLang 官方 GitHub 倉庫與文件: https://github.com/sgl-project/sglang
- Hugging Face Text Generation Inference (TGI) 文件: https://huggingface.co/docs/text-generation-inference
- 商業實體與技術部落格:
- LMCache 專案: https://lmcache.ai
- Anyscale Blog: “How continuous batching enables 23x throughput…”
- Fireworks AI Blog: 關於推論服務最佳化的技術揭露文章
- 產業趨勢與資本動態:
- NVIDIA 官方技術白皮書 “Mastering LLM Techniques: Inference Optimization”.
- 關於 LMCache 獲得 a16z 等機構種子輪融資的公開報道 (2024)。
- 關於 NVIDIA 收購 Run:ai 的交易公告與技術分析文章 (2024)。