模型層 開放閱讀

vLLM

vLLM

概念 ID
vllm
更新時間
2026-05-29
來源數量
待補

vLLM

3 秒看懂

vLLM 是一個用於大語言模型(LLM)推論與服務的高吞吐量、低延遲開源架構,核心創新是 PagedAttention 演算法。它將作業系統的分頁記憶體管理引入 Transformer 的 KV 快取,幾乎消除視訊記憶體碎片,使視訊記憶體利用率提升至接近理論極限;配合連續批處理(continuous batching) 等排程最佳化,在同等硬體上可實現 10–20 倍的吞吐量提升。vLLM 已成為業界最主流的 LLM 服務引擎之一,也是諸多大型模型 API 背後的基礎設施選擇。

3 分鐘產業解釋

傳統 LLM 推論架構(如 HuggingFace Transformers)留給 KV 快取的視訊記憶體採用預分配連續區塊,產生嚴重的內部與外部碎片,視訊記憶體浪費常達 60%–80%,且請求必須按批次靜態管理,視訊記憶體複用效率低。vLLM 於 2023 年由 UC Berkeley 團隊提出,其核心貢獻在於:

  • PagedAttention:將每層 Transformer 的鍵值快取劃分為固定大小的“頁面”(對應於視訊記憶體塊),按需非連續分配,通過頁表管理邏輯到物理的對映。這如同作業系統將虛擬記憶體分頁,讓 KV 快取在視訊記憶體中可以動態增長、共享和回收,將碎片降至極低,視訊記憶體利用率可接近 100%,且天然支援視訊記憶體共享(如 parallel sampling、beam search 等場景下多條序列共享同一 prompt 的 KV 快取)。
  • 連續批處理:不再等待批內所有請求完成才釋放視訊記憶體,而是細粒度地逐 token 排程,新請求可即時插入執行,實現了“準線上”的批處理效率,大幅提升 GPU 佔用率。

由此,vLLM 在同等模型與硬體下,吞吐量較原生 PyTorch 或 HuggingFace 實現提升一個數量級以上,迅速被 LMSYS 的 Chatbot Arena、Anyscale、BentoML、Amazon SageMaker 等平台採用,並與 PyTorch 生態整合,成為事實上的高效能 LLM 服務標準。

15 分鐘專家深入

vLLM 的架構可抽象為三層:中央排程器分散式執行引擎PagedAttention 視訊記憶體管理器

  1. 中央排程器(Scheduler):維護請求佇列,預測每個請求所需頁面數量,基於當前視訊記憶體池狀態決策可排程的請求序列。它採用搶佔式排程:當新請求到達但視訊記憶體不足時,可選擇將部分已執行序列的 KV 快取換出到 CPU 記憶體(swap out),待資源充足時再換回(swap in)。這一機制借鑑了作業系統虛擬記憶體管理,使系統可承受突發負載而不丟失已計算的中間結果。

  2. PagedAttention 記憶體管理器:以固定大小的 block 為基本單位管理 KV 快取。每個 block 存有固定數量 token 的鍵與值張量(如 block_size = 16)。推論過程中,為每個序列維護一個虛擬頁表,記錄每個邏輯 block 對應的物理 block 地址。寫入時按需分配新 block;讀取時通過 GPU 自定義核函式根據頁表 gather 物理 block 的資料,執行注意力計算。該設計支援:

    • 物理共享:不同序列的 prompt 字首共享同一物理 block,無需複製,節省大量記憶體。
    • 即時回收:序列結束後其佔用的所有 block 立即被回收,不存在等待同批次其他序列完成導致的浪費。
    • 零碎片:物理 block 的大小統一,分配與回收不產生碎片。
  3. 分散式執行引擎:相容張量並行(tensor parallelism),PagedAttention 的核函式已重寫以支援跨 GPU 分片操作。vLLM 提供與 OpenAI API 相容的介面,方便即裝即用。

工程上,vLLM 廣泛使用 CUDA/C++ 定製 kernel,如分組查詢注意力(GQA)的融合實現、FlashAttention 整合、用於 KV 快取打包/解包的 high‑bandwidth 核函式,確保了極低的排程與通訊開銷。

技術原理

PagedAttention 的核心是將每一層 Transformer 的 KV 快取以塊為單位對映。下面用簡化圖說明注意力計算流程。

傳統 KV 快取

序列:  [tok1][tok2][tok3] ... [tok N]
視訊記憶體:  [----------- 連續 K/V 張量 ----------]

分配時必須預留最大長度,內部碎片嚴重,不同序列無法共享字首。

vLLM PagedAttention

邏輯序列(虛擬頁號):VP0  VP1  VP2  VP3
                      ↓    ↓    ↓    ↓
頁表對映:            [0 → P3, 1 → P1, 2 → P5, 3 → P2]
物理視訊記憶體塊(block): P0(空)  P1(佔)  P2(佔)  P3(佔)  P4(空)  P5(佔)

注意力核心:給定 Q(查詢 token),根據頁表將對應的 K、V 塊拼接成完整序列,再執行 Scaled Dot-Product Attention。演算法虛擬碼如下:

function PagedAttention(Q, page_table, key_cache, value_cache, block_size):
    # Q: [num_heads, head_dim]
    # page_table: list of physical block indices for this sequence
    num_blocks = len(page_table)
    K_all = []
    V_all = []
    for blk in page_table:
        # 從 key_cache[blk] 讀取 [block_size, num_heads, head_dim]
        K_all.append(key_cache[blk])
        V_all.append(value_cache[blk])
    K = concat(K_all, dim=0)   # [sequence_length, num_heads, head_dim]
    V = concat(V_all, dim=0)
    # 執行標準注意力
    scores = matmul(Q, K.T) / sqrt(head_dim)
    attention = softmax(scores)
    output = matmul(attention, V)
    return output

實際實現使用融合核函式,直接在 GPU 上按頁表收集並計算,避免了中間的拼接與高頻寬記憶體交換。對於 GQA(分組查詢注意力),KV 頭數少於 Q 頭數,共享機制進一步降低視訊記憶體壓力。

前置條件

  • Transformer 模型必須使用 KV 快取,且支援按 token 增量推論。
  • 視訊記憶體分配粒度需與 block_size 對齊(典型值 16、32)。
  • 需要模型權重的高效視訊記憶體版面配置與自定義 CUDA kernel。

連續批處理機制:排程器遍歷待處理請求,每步迭代只讓每個請求前進一個 token,完成一個 token 後立即檢查是否有視訊記憶體可容納新請求,並動態插入;已完成序列當即釋放資源,使每個 GPU 核心週期都能被充分利用。

技術演進史

  • 2022 年前:LLM 推論主流使用 HuggingFace Transformers 等架構,KV 快取為原始 Tensor 分配,視訊記憶體利用率僅 30%–40%,吞吐量受限於批處理靜態管理。
  • 2022 年:FasterTransformer、DeepSpeed-Inference 等出現,引入了核函式融合、張量並行等最佳化,但 KV 快取管理仍無根本變革。
  • 2023 年 9 月:UC Berkeley 團隊釋出論文《vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention》,提出 PagedAttention 演算法和 vLLM 系統,開原始碼。首次將虛擬記憶體思想應用到推論引擎,吞吐量比 HuggingFace 高出 24 倍(據論文資料)。
  • 2023 下半年:快速迭代,增加對 Falcon、Llama 2、Mixtral 等模型的支援,整合 FlashAttention‑2,效能進一步提升。
  • 2024 年:prefix caching、推測解碼(speculative decoding)等特性整合;增加對 Gemma 等模型的支援;成為多家雲端廠商的預設推論引擎;vLLM 進入 PyTorch 生態,與 torch.compile 結合探索。
  • 2025 年(截至知識截止):社群活躍,支援數百種模型架構,多模態模型(LLaVA 等)也已適配。競爭架構如 SGLang、TGI 也在持續演進,但 vLLM 在開放性與生態整合上保持領先。

技術路線對比

下面表格展示主流 LLM 服務架構的核心差異(部分數值為定性估算或基於公開基準效能)。

特性vLLMHuggingFace TGITensorRT-LLMSGLang
KV 快取管理PagedAttention 分頁,零碎片,共享分頁管理(類似 PagedAttention)PagedKV Cache / 滑動視窗RadixAttention(字首樹共享)
批處理排程連續批處理,搶佔式 swap連續批處理連續批處理 (inflight batching)連續批處理+高效字首共享
字首快取共享物理塊共享,自動去重無(或需手動)手動或有限自動自動基於 Radix Tree 快取
視訊記憶體利用率(估算)接近理論極限40%–60%70%–85%相近於 vLLM
吞吐量(相對值)基準(參考)約 0.1–0.3x約 0.6–0.9x約 1.0–1.2x(特定場景)
模型支援廣度廣泛(社群貢獻數百模型)較廣(主要為 HuggingFace 模型)需手動建置模型定義較廣但略少於 vLLM
易用性一行命令,OpenAI 相容 API一行命令,OpenAI 相容 API需要編譯、工程化要求高一行命令,OpenAI 相容 API

注:吞吐量對比高度依賴於模型大小、序列長度分佈、硬體配置,且各架構版本迭代迅速。表中資料基於公開評測與社群反饋,非嚴格定量科學測試。

上下游

上游——依賴與資源

  • 硬體:NVIDIA GPU(支援 Ampere 以上架構為佳),依賴 CUDA、高頻寬視訊記憶體;對 HBM 容量敏感,vLLM 的高視訊記憶體利用率變相降低了對視訊記憶體總量的需求。
  • 模型格式:依賴 PyTorch 模型定義,通常從 HuggingFace Hub 載入;支援 GPTQ/AWQ 等量化後的模型。
  • 基礎軟體:PyTorch、CUDA Toolkit、FlashAttention 庫、自定義 C++ 擴充套件。

下游——應用場景

  • 雲端推論服務:Anyscale Endpoints、AWS SageMaker JumpStart、BentoML 等均基於 vLLM 提供 LLM API。
  • 對話系統:LMSYS Chatbot Arena(用於模型競技場推論)長期使用 vLLM 實現高併發服務。
  • 企業內部部署:支援離線批次推論(如資料標註、評估)和線上服務(聊天機器人、程式碼助手)。
  • 多模態應用:LLaVA 等集成了 vLLM 的推論後端。

關鍵指標

評價 vLLM 部署的關鍵效能與資源指標:

  • 吞吐量(tokens/s):單位時間生成的輸出 token 數。受模型尺寸、批處理效率、序列長度影響。
  • 延遲(ms):首 token 延遲(TTFT)和每個輸出 token 的時間。連續批處理可降低 TTFT。
  • 視訊記憶體佔用與利用率:GPU 視訊記憶體峰值使用量與理論可用量的比值。vLLM 可穩定在 95% 以上。
  • 可擴充套件性:張量並行度(多卡)、流水線並行度等對吞吐的線性度。
  • 系統魯棒性:面對請求爆發、超長序列時的 swap 頻率和重計算開銷(當視訊記憶體不足時 evict 已計算 KV 快取導致需重計算)。

具體數字因部署而異,無固定公式。業界部分標杆:使用單張 A100 服務 Llama2‑70B(量化後)達到數十 tokens/s 的吞吐是 vLLM 的典型能力。

供需與市場資料

由於無法檢索最新市場報告,以下提供定性趨勢分析(截至 2025 年中知識):

  • 需求端:生成式 AI 應用爆發,LLM 推論需求急劇增長。企業出於成本與資料隱私考慮,傾向於自建推論服務,對高吞吐、低延遲架構的需求強勁。vLLM 作為開源首選,佔據生態關鍵位置。
  • 供應端:vLLM 由社群和 UC Berkeley Sky Lab 等學術機構維護,無單一供應商控制;貢獻者包括多家雲端廠商與初創公司。該開源模型保障了長期可用性,但商業支援(如託管服務)則通過 Anyscale 等公司提供。
  • 市場規模:整體 LLM 推論市場正在高速增長,相關推論軟體與服務市場預計數十億美元級別(各方預測,無精確單一定量)。vLLM 在其中作為基礎軟體棧,直接營收難以量化,但通過賦能雲端服務間接貢獻巨大。
  • 競爭格局:類似開源專案包括 TGI、SGLang 等;商業產品有 NVIDIA Triton Inference Server with TensorRT-LLM、Amazon Bedrock 的內部引擎等。vLLM 憑藉 PagedAttention 的先發優勢、廣泛相容性與活躍社群保持領先,但效能優勢可能隨時間被追趕。

代表公司與資本對映

vLLM 是開源專案,其商業價值呈現在生態體系中:

  1. Anyscale:由 Ray 團隊創辦,資助了 vLLM 的早期研發,並提供 Anyscale Endpoints(基於 vLLM 的 LLM 服務)作為商業化產品。已獲多輪融資,投資方包括 A16Z、NEA 等。
  2. BentoML:提供 ML 模型部署平台,深度整合 vLLM 為其模型服務的核心 runtime。完成種子輪/ A 輪融資。
  3. 雲端廠商:AWS、Azure、Google Cloud 等通過各自 AI Platfrom 支援 vLLM 部署,或在其推論產品中使用類似技術(但通常為自研或整合開源)。
  4. 晶片廠商:NVIDIA 自身 Triton Inference Server 與 vLLM 定位有重疊,但 vLLM 的開放性更受開源社群偏愛。AMD、Intel 等也在推動 vLLM 對其硬體的適配,以進入 LLM 推論生態。
  5. 初創企業:眾多 AIGC 初創公司將 vLLM 作為推論棧核心,間接推高了對推論軟體的需求。

資本對映上,投資推論引擎開源專案並非直接,更多是版面配置能夠利用 vLLM 提供差異化服務的上層應用或雲端平台。專注於推論最佳化的方向也是風投關注點(如推測解碼、硬體加速)。

投資邏輯

若將 vLLM 視作產業鏈基礎件,其投資邏輯可歸納為:

  • 賦能型平台價值:vLLM 降低了 LLM 部署的算力門檻,使更多中小企業可以負擔大型模型推論。這有利於 AI 應用的滲透率提升,間接利好整個 AI 應用層公司。
  • 訂閱與託管服務:基於 vLLM 的商業推論 API(如 Anyscale)可以實現按呼叫量收費,商業模式清晰。關注此類公司的增長與客戶留存。
  • 硬體替代風險:vLLM 的高視訊記憶體利用率減少了單位吞吐所需的 GPU 數量,可能對 GPU 總需求產生輕微負面替代效應,但更多是推動應用爆發從而抵消。
  • 護城河:PagedAttention 演算法思想並非不可模仿(如 SGLang 的 RadixAttention、LightLLM 等),但 vLLM 擁有最大的社群、模型相容矩陣和先發優勢,短期內難以被替代。競爭可能導致效能趨同,但生態鎖定效應強。
  • 風險點:開源專案缺乏專屬商業實體,方向依賴社群共識;若主要維護方轉向或競爭架構在效能上大幅領先,vLLM 可能被邊緣化。此外,底層 LLM 架構變革(如放棄 KV 快取)可能動搖 PagedAttention 的根本假設。

常見誤讀糾偏

誤讀1:“vLLM 是一個模型,或者 vLLM 和 LLaMA 一類。”

  • 糾正:vLLM 是推論引擎,不是模型。它本身不包含模型權重,只負責載入模型並高效地提供服務。類似於資料庫管理系統之於資料,vLLM 是模型的“作業系統”。

誤讀2:“PagedAttention 就是普通的分塊注意力(block‑wise attention)。”

  • 糾正:分塊注意力通常指為了節省計算或視訊記憶體將序列切塊計算注意力矩陣,但其 KV 快取依然是連續或靜態分配的。PagedAttention 的關鍵在於動態虛擬記憶體對映與頁表管理,解決了視訊記憶體共享、碎片與回收問題,並天然支援物理塊共享,這是分塊注意力不具備的系統性設計。

學習路徑

對於想深入瞭解 vLLM 的讀者:

  1. 入門:閱讀 vLLM 官方文件 (docs.vllm.ai) 的 “Quickstart” 與 “Serving” 部分,嘗試在本地部署 Llama 等模型,體驗基本命令。
  2. 核心論文:細讀《vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention》(arXiv:2309.06180),理解 PagedAttention 的設計空間與排程邏輯。
  3. 原始碼閱讀:從 vllm/workervllm/core/scheduler.py 切入,追蹤一次請求的完整生命週期;接著看 vllm/attention/ops/paged_attn.py 中的定製核函式。
  4. 擴充套件知識:對比學習其他架構如 SGLang(arXiv:2312.07104)的 RadixAttention、TensorRT‑LLM 的 inflight batching,理解不同設計取捨。
  5. 系統最佳化:研究 vLLM 中的 swap 機制、prefix caching、推測解碼實現,探索如何在特定硬體上調優 block_size 和並行策略。

一句話總結

vLLM 用作業系統的分頁思想,把 GPU 視訊記憶體當作虛擬記憶體來管理 LLM 的推論快取,讓大型模型服務幾乎零資源浪費,把高吞吐推論變成了開箱即用的事。

延伸閱讀與來源

  • Kwon, W. et al. “vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention.” arXiv preprint arXiv:2309.06180, 2023. 【論文原始來源】
  • vLLM 官方 GitHub: https://github.com/vllm-project/vllm 【專案倉庫與文件】
  • vLLM 官方文件: https://docs.vllm.ai 【安裝、配置、模型支援】
  • LMSYS Org 技術部落格: “How We Made Chatbot Arena Fast and Cost-Efficient” 等文章,闡述了 vLLM 的應用。
  • 各雲端廠商技術部落格(AWS、Anyscale、BentoML 等)中關於 vLLM 部署的案例分析。
  • SGLang 論文: “Efficiently Programming Large Language Models using SGLang” (arXiv:2312.07104) 提供了與 vLLM 的技術對比視角。

說明:本文寫作時依賴作者對 vLLM 專案的公開知識,所有技術細節均基於開源論文與程式碼,市場資料與競爭格局基於行業定性認知。因搜尋功能不可用,未引用最新具體數字報告,相關數值已註明“估算”或“定性”。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型