概念庫 開放閱讀

推測執行(Speculative Decoding / Speculative Execution)

概念庫 · 開放閱讀

概念 ID
speculative-execution
更新時間
2026-06-03
來源數量
1

推測執行(Speculative Decoding / Speculative Execution)

推論最佳化 · 部署層 · chain-chip-core · 延遲壓縮

⚡ 1 3 秒看懂

推測執行把大型模型“逐字序列生成”變成先猜後驗的批次操作:用輕量草稿模型快速預測一串詞,主模型一次並行驗證並糾正,命中越多加速越猛。吞吐提升 2–4×、延遲年增率例壓縮,不換硬體不換主模型。

📖 2 3 分鐘產業解釋

大型模型自迴歸解碼每生成一個 token 都需要完整走一遍全部層,算力利用率在小 batch 時極低,導致長文本生成延遲線性累積。推測執行(Speculative Decoding) 將這個問題轉化為“檢驗比生成便宜”——引入引數量僅為主模型 1/10 以下的 Draft 模型,並行下注 γ 個候選 token,主模型在單次前向中完成全部候選的因果驗證,採納命中 token、丟棄未命中部分,嚴格保證最終輸出分佈(若實現無損耗拒絕取樣)與原模型一致。

整個產業鏈因此多出一個明確的效率槓桿:上游晶片視訊記憶體頻寬決定並行驗證上限,中游推論架構決定排程效率,下游應用的任務確定性決定實際收益。目前該技術已在 TensorRT-LLM、vLLM、llama.cpp 等主流推論架構中落地,成為大型模型從“能用”到“低成本好用”的關鍵部署元件。

🔬 3 技術原理

3.1 自迴歸瓶頸的形式化

標準自迴歸解碼中,每一步需要計算:

P(y_t \mid y_{<t}, x) \quad \Rightarrow \quad text(sample ) y_t

這等價於每生成一個 token 執行一次完整前向傳播,延遲隨生成長度線性增長,且視訊記憶體頻寬瓶頸顯著。小 batch 下 H100 理論算力利用率可低至 5%–10%(來源:NVIDIA 2023 推論白皮書,bs=1 實測)。

3.2 推測解碼三段式

  1. Draft 階段:Draft 模型 M_q 自迴歸生成候選序列 hat(y)_1, \dots, hat(y)_\gamma
  2. Verify 階段:主模型 M_p 一次性平行計算所有候選位置的機率分佈 p(y_t \mid x, hat(y)_{<t})
  3. Accept/Reject:從左至右逐 token 比對 q(hat(y)_t)p(hat(y)_t),根據拒絕取樣規則決定接受/截斷。第一個被拒絕 token 處停止,其左側全部接受,右側丟棄。

理論保證:若拒絕取樣正確實現,輸出分佈與 M_p 的自迴歸取樣嚴格一致(Leviathan et al., 2023;Chen et al., 2023)。

3.3 加速比建模

設單次 Draft 自迴歸成本 C_d,單次主模型驗證成本 C_v,接受率 \alpha

text(Speedup) = \frac{\gamma \cdot \alpha}{1 + frac(C_d + C_v){C_{text(AR)}}}

在實際高視訊記憶體頻寬場景下 C_d \ll C_v,公式簡化為 text(Speedup) \approx frac(1 - \alpha^{\gamma+1}){(1-\alpha)(C_v/C_{text(AR)} + \gamma \cdot C_d/C_{text(AR)})}(公開文獻綜合形式,2024)。核心驅動因子是 \alpha 與並行寬度 \gamma 的聯合最佳化。

3.4 樹狀推測與並行擴充套件

從序列候選序列擴充套件為 token tree:Draft 階段生成多分支候選樹,主模型利用 Tree Attention 並行驗證所有路徑。典型如 SpecInfer(Miao et al., 2024)將有效並行 token 數從 γ 擴充套件至 \gamma \times text(branching\_factor),在程式碼和結構化文本任務上將加速比進一步提升 1.2–1.5×。


📊 4 關鍵引數

引數含義典型值 / 範圍來源 / 口徑
Draft/主模型引數比草稿與主模型規模之比1:10 至 1:50公開文獻綜合,2024
接受率 \alpha(程式碼)草稿 token 被採納機率0.75–0.85MT-Bench/HumanEval 等公開基準,2024
接受率 \alpha(開放對話)同上0.50–0.70ShareGPT/WildChat 口徑,2024
候選長度 \gamma單次 Draft 序列 token 數3–10工程實踐值,NVIDIA TensorRT-LLM 文件 2024
加速比(同構 Draft)文本生成吞吐加速2–4×EAGLE-2/Medusa 公開 benchmark,2024
加速比(樹狀 Draft)含分支並行加速3.5–5×SpecInfer 等公開報告(特定任務),2024
視訊記憶體額外開銷Draft 模型 + 額外 KV Cache典型 +10%–20%社群實測與論文估算,2024
推論晶片視訊記憶體頻寬基準HBM3/3e 頻寬H200: 4.8 TB/s; MI300X: 5.3 TB/s廠商規格公開,2024

注:加速比數值均為 2024 年公開論文中特定模型+任務組合的 實驗室/benchmark 口徑,生產環境受請求分佈、排程策略、併發度影響。公開資料中未見跨雲端廠商的生產端對端加速比標準化排名。


🧭 5 技術路線

5.1 獨立 Draft 模型

代表:Leviathan et al. 2023 (DeepMind) 原始推測解碼架構。

  • 特點:Draft 與主模型完全解耦,可從任意小模型/早期 checkpoint 複用。
  • 優勢:零額外訓練,落地快;主模型升級無需改動 Draft 架構。
  • 劣勢:Draft 分佈與主模型失配時 \alpha 衰減;需要管理雙模型的生命週期。

5.2 共享主模型頭(多頭預測)

代表:Medusa (Cai et al., 2024)。

  • 特點:在主模型末層掛多個輕量預測頭,並行預測多步 token。
  • 優勢:無獨立 Draft 模型,保持統一推論引擎。
  • 劣勢:需要定製微調,預測頭結構依賴主模型,泛化至新架構成本高。

5.3 自草稿(Self-Drafting)

代表:EAGLE / EAGLE-2 (Li et al., 2024),Lookahead Decoding。

  • 特點:用主模型深層/中間特徵投影生成 Draft 序列,無額外模型權重。
  • 優勢:幾乎無額外模型開銷,接受率通常高於獨立 Draft。
  • 劣勢:需改造主模型推論圖,訓練複雜度高於純推論方案。

5.4 樹狀並行投機

代表:SpecInfer (Miao et al., 2024),Sequoia (Chen et al., 2024)。

  • 特點:候選結構從鏈擴充套件為樹/森林,最大化單次驗證的資訊量。
  • 優勢:在結構化生成任務(程式碼、JSON 輸出)接近理論頻寬上限。
  • 劣勢:排程複雜度高,對架構工程要求高。

5.5 路線選擇決策矩陣(2024–2025 工程實踐總結)

場景推薦路線理由
通用 API 服務、長尾任務獨立 Draft靈活適配,避免主模型頻繁改動
固定垂直模型(程式碼助手)Medusa / EAGLE定向微調可獲得更高 \alpha
端側 / 視訊記憶體極受限Self-Draft免除額外模型權重視訊記憶體佔用

⛓️ 6 上游

6.1 晶片與視訊記憶體頻寬

推測解碼的驗證階段是大 batch 並行 GEMM,直接受視訊記憶體頻寬約束。HBM 代際直接決定 \gamma 上限與驗證吞吐:H200(4.8 TB/s)允許並行驗證 8–12 個 token 而不顯著增加延遲,而 A100(2.0 TB/s)瓶頸更早出現。三星/海力士 HBM3e 量產進度(2024 年均已送樣)將影響 2025 推論硬體能力上限。國產華為昇騰 910B 的 HBM 頻寬具體數值與推測解碼專項適配程度,截至 2024 年底 公開資料未見 詳細揭露。

6.2 訓練側 Draft 模型供給

Draft 模型來源:通用小模型(TinyLlama、Qwen2-0.5B)、模型蒸餾、針對特定主模型微調的專用 Draft。訓練側無全新工藝壁壘,但維持高 \alpha 需要持續對齊主模型分佈,構成上游持續成本。

6.3 推論架構與編譯器

上游軟體棧(NVIDIA TensorRT-LLM、MLC-LLM TVM Unity)決定了推測執行的整合效率和易用性。架構是否原生支援 Tree Attention、是否提供自動 Draft 選擇策略,直接影響下游部署門檻。


💼 7 下游

7.1 對話與程式碼助手

辦公場景和程式碼補全是推測執行 收益最確定 的下游:任務確定性高(\alpha 高),生成延遲直接關聯使用者體驗。GitHub Copilot、Cursor、國內通義靈碼等 IDE 外掛均為潛在受益場景(廠商是否已部署推測執行方案,公開資料未見統一說明)。

7.2 雲端端大型模型 API

OpenAI、Anthropic、Google Cloud、智譜、位元組豆包等雲端端 API 是直接受益方。延遲下降 2× 意味著同等 SLA 下算力成本可壓縮 30%–40%(理論推演,非廠商揭露);2025 年價格戰中,推論層效率是核心競爭維度之一。

7.3 端側大型模型

端側晶片(高通驍龍 8 Gen 4、Apple A18 Pro、車規級 Orin)峰值視訊記憶體頻寬遠低於雲端端 HBM,自草稿/極小 Draft 路線在端側有更高的邊際收益——端側原始自迴歸的速度瓶頸更嚴重。面壁 MiniCPM 系列、vivo 藍心端側均已公開提及推論加速模組。

7.4 Agent 與工具呼叫

Agent 場景需要反覆生成工具呼叫 JSON 和推論鏈,輸出結構固定但長度長,推測解碼在 JSON 生成子任務 上加速比突出(Tree Draft 路線尤甚)。LangChain、LlamaIndex 等編排架構預設不涉及推論後端最佳化,其效率天花板受底層推論架構制約。


🏢 8 受益公司 / 機構

角色代表機構受益邏輯關鍵時間
雲端廠/API 供應商OpenAI、Anthropic、Google Cloud、智譜、位元組豆包推論成本下降,同等毛利可降價獲量2025 持續
晶片供應商NVIDIA、AMDH200/MI300X 驗證並行能力催生換卡需求2024–2025
推論架構方Anyscale (vLLM)、OctoML、面壁智慧推測解碼整合成核心差異化功能2024–2025
端側晶片+模型高通、Apple、聯發科、vivo端側推論效率決定裝置 AI 體驗天花板2025–2026
IDE/程式碼平台GitHub (Copilot)、Cursor、Anysphere推測解碼直接壓縮補全延遲2024 年末起

所有提及均為產業鏈邏輯關聯,不構成任何形式的推薦或投資判斷。


📈 9 市場規模與影響量化

  • 推論市場:根據 SemiAnalysis 2024 年 12 月估算,全球 AI 推論算力支出 2024 年約 $25B–$30B(口徑:GPU 等效租賃成本與自建折舊),2025 年預計增長至 $50B+。
  • 成本壓縮貢獻:綜合 vLLM 社群報告及 NVIDIA 2024 聯合客戶 case study,推測解碼在特定高確定性業務中可將推論延遲壓縮至 1/2–1/4。若 50% 雲端運算推論業務採用推測解碼並實現 40% 成本最佳化,等效釋放約 $5B–$10B 市場價值(2025 年估算,具體分配未公開)。
  • 硬體增量市場:推論晶片(H200/MI300X 及其後續)2025 年出貨預計超 200 萬張(來源:市場分析機構 Omdia 2024Q3 預測),其中推測解碼大規模部署對高頻寬 HBM 的需求彈性量化尚未見第三方詳細報告。

以上數字均為間接推算與行業公開預測綜合,不對未來市場規模做精確承諾。


⚔️ 10 玩家對比

玩家技術路線開源/閉源整合依託關鍵揭露
Google DeepMind獨立 Draft 原始論文 + SpecInfer 樹狀驗證開放論文,開源參考實現JAX/TensorFlow 生態2023 提出核心架構
Meta FAIR獨立 Draft + 社群協作 EAGLE開源llama.cpp、PyTorch 生態推動開源輔助生成介面
NVIDIA獨立 Draft + Tree Attention 硬體聯合最佳化閉源最佳化架構TensorRT-LLM2024 公佈 H200 推論基準
Anyscale (vLLM)獨立 Draft 開源整合開源vLLM ≥v0.42024 社群版滲透率領先
清華/面壁Self-Draft/端側 Draft + MiniCPM部分開源OpenBMB/MiniCPM 工具鏈端側輕量推論加速報道
頭部國內大型模型廠商細節公開資料未見推測為自研內部推論引擎未揭露技術選型與實測加速

對比基於 2024 年底公開可查資訊,廠商內部未揭露細節無法納入。


⚠️ 11 風險

11.1 技術風險

  • \alpha 漂移:生產環境請求分佈與訓練/測試分佈偏差導致接受率下滑,動態 Draft 選擇仍在研究階段,尚無標準化工程方案。
  • 輸出保真度:實現中若模擬拒絕取樣引入近似,輸出分佈可能與主模型不一致,對高風險場景構成合規隱患。
  • 長上下文退化:隨著上下文增長,Draft 模型的絕對質量衰減,且額外 KV Cache 管理的複雜度非線性增長。
  • 組合最佳化衝突:推測解碼 + 量化 + KV Cache 壓縮 + 稀疏 attention 的疊加收益非獨立,組合空間爆炸,目前缺少系統性最優配置指南。

11.2 市場與商業風險

  • 過度承諾:部分廠商宣傳材料使用“最高加速 10×”等實驗室峰值,實際多數業務加速 2–4×。
  • 硬體鎖定:極致最佳化(如 NVIDIA 專有 Tree Attention kernel)會加深對特定晶片架構的依賴,降低跨平台可移植性。
  • 投入產出不確定:對開放域聊天等低 \alpha 任務,部署推測解碼可能收益有限,未做任務細分評估而“全量上馬”可能虧損。

11.3 治理與合規

  • 間接降低濫用成本:推論效率提升同樣降低惡意生成與垃圾 API 呼叫成本,對內容安全水位形成更大壓力。
  • 專利叢林風險:Google、NVIDIA 在推測解碼工程實現上持續版面配置專利,開源架構存在潛在合規摩擦(公開資料未見訴訟案例,截至 2024 年底)。

❌ 12 誤讀糾偏

常見誤讀實際情況
❌ “推測執行能讓大型模型變快 10 倍”✅ 實際生產多數任務加速 2–4×;“10×”多為特定 benchmark 峰值
❌ “無損加速,任意模型適用”✅ 原始分佈無損依賴拒絕取樣正確實現,且收益高度依賴 \alpha;低確定性任務加速有限
❌ “Draft 模型越大越好”✅ Draft 模型過大將侵蝕驗證效率紅利,需在 Draft 推論成本與命中率間平衡
❌ “換了硬體就不需要推測解碼”✅ 演算法最佳化與硬體升級是疊加收益;高頻寬 HBM 提升 \gamma 上限,但不能替代 Draft 邏輯
❌ “這就是投機取樣,只能猜一個 token”✅ 現代推測解碼支援並行多 token 和樹狀多路分支,遠不止單 token 投機
❌ “只有開源架構支援,閉源 API 都沒用”✅ OpenAI、Anthropic 等 2024 年公開技術報告中均提及類似推論加速策略(具體細節未揭露)

📰 13 最新事件

  • 2025 年 1 月:NVIDIA 於 CES 2025 釋出 RTX 50 系列及資料中心 Blackwell 推論基準,多處提及推測解碼聯合最佳化。
  • 2024 年 12 月:vLLM v0.6 釋出,增強 Tree Attention 及自適應 Draft 選擇實驗性功能。
  • 2024 年 9 月:面壁智慧 MiniCPM-V 多模態端側模型釋出技術報告,揭露端側部署中推測解碼策略適配。
  • 2024 年 7 月:EAGLE-2 論文公開,在 Llama-3-70B 上實現 3.05–4.26× 加速(MT-Bench 口徑)。
  • 2024 年 6 月:OpenAI CTO 公開提及持續最佳化推論棧以“用更低延遲提供相同模型能力”,具體技術組合未公開。
  • 2024 年 Q2:AMD 宣佈 MI300X 在 vLLM 推論場景下效能追平 H100 並整合推測解碼支援。
  • 2024 年 Q1:DeepSeek 揭露 V2 模型推論系統部分使用多頭預測加速技術(細節公開資料未見定量揭露)。

📋 14 追蹤指標

指標觀察渠道含義
公開 Benchmark 加速比更新arXiv、MLPerf Inference、NVIDIA 釋出路線天花板變化
主流推論架構 Release NotevLLM、TensorRT-LLM、llama.cpp、SGLang工程落地成熟度
雲端端 API 延遲/價格變動各雲端廠定價頁與狀態頁推測解碼部署的間接證據
第三方實測報告(如 Artificial Analysis)artificialanalysis.ai獨立驗證的生成速度排行
HBM3e 及後續路線圖海力士/三星/美光官方、AnandTech硬體頻寬擴充套件能力
Draft 模型開源生態Hugging Face assisted generation 相關模型庫社群 Draft 模型供給質量
國內頭部模型廠商 API 延遲波動公開 API 狀態與使用者報告國內落地的間接訊號
專利公開/授權Google、NVIDIA 專利資料庫生態摩擦前瞻

📚 15 信源

  • Leviathan, Y., Kalman, M., & Matias, Y. (2023). Fast Inference from Transformers via Speculative Decoding. ICML 2023.
  • Chen, C., Borgeaud, S., et al. (2023). Accelerating Large Language Model Decoding with Speculative Sampling. arXiv:2302.01318.
  • Cai, T., Li, Y., Geng, Z., et al. (2024). Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads. ICML 2024.
  • Li, S., Zhang, J., et al. (2024). EAGLE / EAGLE-2: Speculative Decoding Requires Rethinking Feature Uncertainty. arXiv:2401.15077 / arXiv:2406.16858.
  • Miao, X., Oliaro, G., Zhang, Z., et al. (2024). SpecInfer: Accelerating Generative LLM Serving with Tree-based Speculative Inference. ASPLOS 2024.
  • NVIDIA. TensorRT-LLM Speculative Decoding 文件 (2023–2025).
  • vLLM 專案文件與 Release Notes (2024–2025).
  • SemiAnalysis. AI Server & Inference Cost Model (2024.12).
  • Omdia. AI Processor Market Forecast (2024Q3).
  • Artificial Analysis. Model API Performance Benchmarks (2024–2025).
  • Hugging Face. Assisted Generation 介面文件.
  • 面壁智慧技術報告 / vivo 藍心端側釋出會公開材料 (2024).

資料引用說明:所有財務、份額、產能數字均標註年份與來源,不確定處明確“公開資料未見”,無任何投資建議、買賣建議或漲跌預測。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型