模型層 開放閱讀

級聯推論

Cascaded Inference

概念 ID
cascaded-inference
更新時間
2026-05-29
來源數量
待補

級聯推論 (Cascaded Inference)

1. 3 秒看懂

核心思想:不直接用一個超大型模型處理所有請求,而是用一系列“小模型”快速判斷,再讓“大型模型”精修最複雜部分。如同醫院的分診系統:大部分常見病由全科醫生(小模型)處理,疑難雜症才轉給專家(大型模型),既保障了服務質量,又避免了專家的資源浪費。

2. 3 分鐘產業解釋

大語言模型(LLM)的推論成本正在成為生成式 AI 商業化的核心瓶頸。一個擁有數千億甚至萬億引數的超大型模型,每一次回答都需要數十張乃至上百張 GPU 協同計算,消耗的電力和時間成本極高。如果將所有使用者的請求——包括“你好”“今天天氣如何”這樣的簡單問題——全部交由最大型模型處理,無異於用航天發動機驅動腳踏車,成本結構完全不可持續。

成本與需求的尖銳矛盾

  • 成本與規模呈強相關:以 Transformer 架構為例,自迴歸生成每個 token 的計算量大致與模型引數量成正比。2024 年公開資料顯示,使用 NVIDIA H100 GPU 執行一個 1760 億引數的模型,單次查詢的推論成本是 70 億引數模型的 18‑25 倍(來源:公開技術報告估算)。當 API 呼叫量達到數十億次/日時,這種差異直接決定服務是盈利還是虧損。
  • 使用者請求的天然異構性:企業客服問答、即時翻譯、程式碼解釋、長文本邏輯推論……不同任務的計算複雜度差異巨大。簡單事實性問答僅需基礎語言能力,而數學證明或複雜程式碼生成則需要深層推論和長距離依賴建模,資源需求可能相差數十倍。
  • 級聯推論的商業邏輯:通過“路由‑分流”架構,將小而快的模型用於處理簡單請求,僅將困難請求交由大型模型。這並非追求單次請求的極致速度,而是追求每百萬 token 的平均推論成本的大幅降低。在保持平均回答質量幾乎不變的前提下,將總計算成本削減 30%‑70%,從而為 AI 服務的規模化盈利鋪平道路。

3. 技術原理

級聯推論的數學本質是一個在約束條件下最佳化計算資源分配的問題。系統需要為每一個請求動態選擇一個模型,在滿足全域性質量要求(如平均準確率不低於全大型模型方案的 99%)的前提下,最小化總計算成本(通常以 FLOPs 或 GPU‑hour 計)。

基本決策流程

For each input request x:
  For model m_i in cascade_set [M1, M2, ..., Mk]:   (M1最小,Mk最大)
    output, confidence = m_i.predict(x)
    if confidence > threshold(m_i):
      return output
  # 若所有模型的置信度均不達標,則返回最大型模型 Mk 的結果

這裡的關鍵在於:

  1. 路由決策(Router):輕量級路由器負責將請求導向最合適的模型。路由器可以是一個微小的神經網路分類器,也可以由啟發式規則(輸入長度、關鍵詞密度等)或上一級模型的置信度得分觸發。
  2. 置信度估計與退出機制:每一級模型不僅要生成答案,還必須輸出一個可靠的置信度分數(如生成機率的幾何平均、預測熵、或經校準後的標量)。當該分數超過預設閾值,即可直接返回結果,截斷後續呼叫。這是節省計算的核心所在。
  3. 質量控制閉環:路由器的訓練或調優需要兼顧“過保守”(直接把大量簡單請求送給大型模型,無成本節省)與“過激進”(將複雜請求錯誤交給小模型,導致回答錯誤)。通常通過強化學習或帶有成本約束的損失函式進行訓練。

系統層面的工程挑戰

  • 模型間對齊:不同規模、不同訓練範式的模型,其輸出的“置信度”數值範圍與含義並不直接可比,必須在統一閾值下進行校準,否則會出現系統性誤判。
  • KV‑Cache 與狀態遷移:在自迴歸生成中,不同模型的隱狀態維度、詞表、位置編碼可能不同,無法直接傳遞 KV‑Cache。系統必須為每一次模型切換進行上下文重構,帶來額外的計算與延遲。
  • 批處理與流水線最佳化:級聯的序列判斷會破壞傳統推論服務中大規模批處理的效率。需要利用非同步排程、請求重組和投機執行等機制,將多級呼叫的空閒時間壓縮至最低。

4. 關鍵引數

評估和最佳化一個級聯推論系統,需重點關注的引數包括:

  1. 置信度閾值對 (Confidence Threshold Set) 為每個模型獨立設定的“退出門檻”。閾值越低,越多的請求會被早期處理,成本越低但質量風險越高;閾值越高則相反。這是系統調優的首要槓桿。2024 年某頭部 AI 實驗室在內部技術報告中提及,其級聯絡統的閾值調節可使成本‑質量曲線移動 15‑20 個百分點(來源:基於公開論文的模式推斷,具體數值未揭露)。

  2. 路由計算開銷比率 (Router Overhead Ratio) 路由器的計算量佔該級模型推論計算量的百分比。理想情況下應控制在該級模型 FLOPs 的 1% 以內,否則路由本身成為了新的瓶頸。目前學術界公開的設計中,基於輕量分類器的路由開銷普遍在 0.3%‑0.8%(來源:ICML 2024 相關論文)。

  3. 模型切換延遲(μs 級)與上下文重組時間 不同推論引擎的記憶體管理差異巨大。使用統一記憶體池和預載入模型的系統,切換延遲可控制在百微秒量級;若需動態載入模型或重新建置 KV‑Cache,延遲可能達到秒級,直接抵消成本優勢。

  4. 質量損失率 (Quality Degradation, ΔQ) 在標準評測集上的平均準確率(或勝率)相較於全大型模型方案的下降幅度。行業當前的常見目標是 ΔQ < 1%,同時成本下降 30%‑50%。

  5. 吞吐量提升比 (Throughput Gain) 相同 GPU 叢集在單位時間內能夠處理的最大併發請求數。級聯將部分負載轉移至小模型,可釋放大型模型用於更多複雜請求,從而使整體吞吐量提升 2‑4 倍(來源:Anyscale LLMPerf 排行榜 2024Q3 監測資料,特定模型組合下)。

  6. 端到端平均延遲 (P50, P95 Latency) 儘管單次序列呼叫可能增加個別請求的處理時間,但通過減少大型模型的排隊等待,全域性 P50 延遲通常能夠降低,P95 延遲則需要針對尾部情況特別最佳化。

5. 技術路線

5.1 技術路線演進

  • 早期啟發(2018‑2020):源自計算機視覺中的“早退”(Early Exit)和模型級聯思想。在深度網路的中間層新增多個分類器,根據預測置信度提前退出。這對自迴歸生成任務效果有限,因為生成連續的 token 序列不宜中途“跳躍”。
  • 推測解碼(Speculative Decoding)的興起(2023):利用一個引數量僅為主模型 1/10‑1/50 的“草稿模型”快速生成候選 token 序列,再由大型模型一次性並行驗證。這實際上建置了一個隱式的兩層級聯結構,證明了“小模型打前站”的可行性,並顯著降低了生成延遲(來源:Leviathan et al., ICML 2023;Chen et al., 2023)。
  • 路由器獨立化與專業化(2023‑2024):隨著混合專家模型(MoE)流行,其內部的“路由門控”機制被外化為顯式請求排程器。同時,針對數學、程式碼、翻譯等細分任務訓練的專業化小模型,與通用大型模型形成更自然的“任務級聯”。
  • 系統深度融合階段(2024‑至今):推論架構開始將級聯排程作為核心原語,與 KV‑Cache 管理、連續批處理、異構硬體排程深度耦合。開源專案如 vLLM、TensorRT‑LLM 已出現基於多模型池的實驗性排程介面。

5.2 技術路線對比

技術路線核心機制成本最佳化方式質量影響典型代表/適用場景
級聯推論動態模型選擇 + 早退平均計算量大幅降低可控(路由精確時可忽略)請求複雜度差異大的線上 API
模型量化 (INT8/INT4)降低參數列示精度單次推論計算量×頻寬減半以上輕微效能下降(0‑2% loss)所有模型部署基線
模型剪枝/蒸餾產生固定的中小模型固定成本低通用能力部分丟失固定任務、邊緣裝置
推測解碼草稿模型生成→大型模型驗證降低生成延遲,吞吐提升顯著輸出分佈與全大型模型一致延遲敏感的互動式生成
MoE(模型內)大型模型內部少量專家啟用推論時啟用引數可控,但視訊記憶體佔用仍高與稠密大型模型持平或更優訓練期最佳化,超大規模模型部署

產業鏈影響:級聯推論催生了“模型路由中介軟體”這一新生態位。例如 Anyscale 在 2024 年釋出的“LLM‑native Routing”功能,允許在多個後端模型間自動切換;Modal 則提供根據請求延遲要求動態選擇 GPU 和模型的能力。這些工具使得中型企業無需自建排程系統即可享受級聯收益。

6. 上游

級聯推論的實現依賴以下技術棧與供應商:

  • 演算法與軟體
    • 路由器設計:需要基於強化學習或貝葉斯最佳化的路由策略,常來源於學術研究。最新路由演算法論文多發表於 ICML、NeurIPS、MLSys 等頂級會議。
    • 置信度校準工具:如 Isotonic Regression、Temperature Scaling 庫,部分整合在推論引擎中。
    • 模型訓練與最佳化架構:PyTorch、JAX,以及專門針對不同規模模型微調的庫。
  • 硬體與基礎設施
    • 異構 GPU 叢集:級聯要求叢集內同時部署不同大小的模型。需支援一部分低算力 GPU(如 NVIDIA L4、A10)執行小模型,另一部分高算力 GPU(如 H100、B200)執行大型模型,並通過高速互聯(如 NVLink、InfiniBand)協同。
    • 推論伺服器與排程系統:NVIDIA Triton Inference Server 提供了“模型整合”和動態載入功能,是建置級聯的基礎平台;開源專案 vLLM、SGLang 通過元件化設計允許在同一個服務內管理多個模型。
    • 記憶體與 KV‑Cache 管理技術:級聯需要在模型間傳遞上下文,要求高效共享記憶體池和極低的快取失效代價,這依賴於自研或第三方庫(如 PagedAttention、RadixAttention)的支援。
  • 半導體供應商動向:2024 年輝達(NVIDIA)釋出的 TensorRT‑LLM 更新中強化了多模型協同與 speculative decoding 支援;AMD 和 Intel 也在其 AI 軟體棧中增加對多模型編排的相容層,試圖降低對單一架構的依賴。

7. 下游

級聯推論直接服務於所有需要大規模提供 LLM 推論的應用場景:

  • 雲端端 AI 服務 API:如 OpenAI、Anthropic、Google Cloud Vertex AI、Azure OpenAI Service、阿里雲端、百度智慧雲端等提供的聊天、文本嵌入、程式碼生成介面。這些廠商的 API 定價(每 1M token)是級聯推論經濟價值的最直接反映。例如,2024 年 9 月 OpenAI o1‑preview 定價為 $15/1M 輸入 token,遠高於 GPT‑4o 的 $2.50/1M,顯露出複雜推論與簡單任務的成本分化,背後可能已部分使用路由策略(來源:OpenAI 官方定價頁面,2024‑09)。
  • 企業知識庫問答與 RAG 系統:內部成千上萬員工的日常查詢中,約 80% 為簡單檢索與摘要,僅 20% 需深度分析。級聯可使 RAG 系統的後臺成本下降 40% 以上。
  • AI‑native 程式設計助手:GitHub Copilot、Amazon CodeWhisperer 等,程式碼補全大多可由小模型完成,複雜重構或解釋才需大型模型,天然適合兩級級聯。
  • 搜尋引擎與內容生成:搜尋引擎的查詢理解、摘要和流暢回覆也呈現明顯長尾分佈,級聯有助於降低每搜尋次成本,支撐免費或低價服務。
  • 經濟影響:下游企業通過級聯降低的 TCO(總擁有成本)直接轉化為更高的毛利或更低的客戶訂閱價格。2024 年多家雲端廠商已提供“低價高效能模型”選項(如小型專用模型),這本質上是級聯思想的商業化變體。

8. 受益公司

級聯推論的推廣會使以下各類企業直接或間接受益:

  • AI 服務提供商(強受益) OpenAIAnthropicGoogleMetaMicrosoftAmazon阿里雲端等。這些巨頭擁有海量 API 呼叫,推論成本的每一百分點下降都對應千萬美元級的年度節省。雖然其內部級聯絡統細節高度保密,但已成為它們建置成本護城河的關鍵技術。 (注:具體公司的內部系統實現未公開,受益程度為基於商業邏輯的推斷。)

  • AI 推論基礎設施 / 晶片廠商(持續受益) NVIDIA:其 H100、B200 等高效能 GPU 是大型模型推論的基石,而 L40S、L4 等小算力 GPU 則適合級聯中的小模型節點,異構算力組合可直接拉動 GPU 銷售。AMDIntel 也在追趕中,其推論晶片搭配級聯排程具備差異化機會。

  • 推論架構與中介軟體公司(生態受益者) Anyscale(LLMPerf 排行榜、模型路由功能)、Modal(無伺服器 GPU 推論)、BentoMLOctoML 等,通過提供自動化模型選擇和成本最佳化工具,幫助中型企業及創業團隊落地級聯推論,可能成為“推論中介軟體”這一細分賽道的領先者。

  • AI 訓練/推論平台服務商 CoreWeaveLambda LabsTogether AI 等 GPU 雲端服務商,提供多種 GPU 型號和模型託管服務,客戶可在同一平台上靈活混合使用不同模型,自然形成級聯需求。其定價模型(如按 token 計費而非按 GPU 小時)間接反映了級聯最佳化帶來的成本彈性。

  • 公開資料未見專門“級聯推論公司”獨立上市,相關能力多內嵌於大型公司的技術棧中。

9. 市場規模

級聯推論本身尚無獨立市場統計口徑,但可以從 AI 推論市場和高效能運算市場的資料中定性判斷其經濟規模。

  • 全球 AI 推論晶片市場:根據 Omdia 2024 年 4 月釋出的《AI Inference Processors Market Tracker》,2023 年全球 AI 推論處理器(含 GPU、FPGA、ASIC)營收約為 160 億美元,預計 2027 年將增長至 540 億美元(來源:Omdia,2024)。級聯推論通過降低單次查詢的計算需求,實質上能夠擴大單位晶片可服務的請求量,從而加速推論晶片市場的擴張,並重塑價值分配。
  • AI 推論服務支出:IDC 在 2024 年 7 月的預測中指出,全球 AI 推論領域的 IT 支出(含伺服器、軟體、服務)在 2024 年將達到約 300 億美元,到 2028 年有望超過 650 億美元(來源:IDC,Worldwide AI Spending Guide,2024‑07)。級聯推論作為核心降本技術,其滲透率將直接影響這一支出的真實獲利水平。
  • 中國區相關規模:根據公開資料,中國 AI 推論硬體及雲端服務市場 2023 年約為 人民幣 300‑350 億元(含晶片、伺服器、雲端 API 營收,來源:IDC 中國 2024 年報告片段),其中大型模型推論佔比正快速提升。級聯推論在中國的採用預計將顯著影響推論雲端服務的定價與毛利率。
  • 具體至級聯推論軟體/中介軟體細分市場公開資料未見獨立量化資料,目前尚屬技術嵌入期,未形成獨立產品市場。

10. 玩家對比

不同廠商的推論最佳化策略及與級聯思想的結合程度(基於截至 2024 年 12 月公開資訊):

公司 / 專案已知推論最佳化措施是否公開採用級聯/路由策略可比推論成本(示意)備註
OpenAI推測解碼、量化、KV‑Cache 最佳化未正式公佈,但通過 API 可觀測到不同複雜度任務響應延遲差異GPT‑4o:$2.50/1M 輸入 token內部路由為高度機密
Anthropic推測解碼、提示詞快取、專用能力模型未明確說明Claude 3.5 Sonnet:$3/1M 輸入 token系統設計可能存在隱式級聯
Google Vertex AI模型蒸餾、MoE、自動模型路由(Model Garden)部分公開路由功能Gemini 1.5 Flash 極低價提供多模型選擇器
Meta (LLaMA)量化、推測解碼開源開源推測解碼實現需自部署社群自建級聯絡統案例豐富
vLLM (開源)PagedAttention、連續批處理實驗性多模型排程(v0.5.0+)取決於自建硬體逐漸成為級聯排程的關鍵平台
NVIDIA TensorRT‑LLM深度融合硬體最佳化、推測解碼、多模型支援釋出多模型編排示例極低的硬體利用成本Triton Server 支援動態模型載入

玩家策略總結:第一梯隊(OpenAI,Google)已把級聯思維深深融入其基礎設施,通過技術不公開建置成本與體驗的雙重壁壘;第二梯隊雲端廠商和架構提供者正在通過開源工具和可選服務將級聯能力交付給更廣泛的開發者,試圖在 AI 應用層分一杯羹;獨立中介軟體公司的機會在於填補大型廠商所忽略的中長尾客戶最佳化需求。

11. 風險

  • 路由失誤導致質量下滑與品牌損害:一旦路由器錯誤地將複雜請求分配給小型模型,可能產生錯誤答案或“編造”內容,在金融、醫療等嚴肅場景中產生嚴重後果。2024 年某研究提到,在未精細校準的情況下,級聯絡統的“不良回答率”可上升 2‑3 個百分點(來源:學術預印本 2024)。
  • 延遲不可預測性:級聯的序列判斷在部分請求中會引入額外的模型切換和排隊時間,可能導致 P95 延遲升高,損害對響應時間敏感的使用者體驗。
  • 系統複雜性與運維成本上升:需要同時維護多個模型、路由器和校準模型,出現故障的排查難度成倍增加。人力成本和工程資源要求遠高於單模型部署。
  • 模型更新時的對齊失效:當大型模型或小模型經過微調或版本迭代後,原有的置信度閾值可能不再適用,必須重新進行系統級調優,形成“上游模型更新,下游級聯絡統震盪”的問題。
  • 資料隱私與合規風險:在多級模型間傳遞使用者請求內容時,若不同模型部署在不同安全域或供應商,可能增加資料洩露的暴露面。
  • 競爭替代風險:如未來出現極低成本、低延遲的大型模型(例如基於新型架構或專用晶片),級聯的成本優勢可能被部分或全部抵消。不過,公開資料預計到 2027 年,推論成本仍將是主要約束,級聯的視窗期至少還存在 3‑5 年。

12. 誤讀糾偏

  • 誤讀 1:“級聯推論就是用小模型過濾,大型模型複查,等於序列呼叫兩次。” 糾偏:核心並非盲目序列,而是智慧退出。只有當前級模型不自信時才會呼叫下一級,大部分簡單請求會在第一級或第二級直接返回結果,不會觸發大型模型。一個設計合理的級聯絡統,通常超過 60% 的請求不會到達最大型模型。

  • 誤讀 2:“用了級聯推論,回答質量肯定變差。” 糾偏:這取決於路由準確率和閾值的設定。通過嚴格的離線評測、置信度校準和線上監控,完全可以將全域性質量損失控制在 0.5% 以內,但同時實現 40%‑60% 的成本降低。這是工程上可達到的平衡,並非零和博弈。

  • 誤讀 3:“級聯推論只適用於文本分類等判別任務,對生成任務無效。” 糾偏:推測解碼(Speculative Decoding)就是在生成任務中成功應用“小模型+大型模型”協同的典範。級聯推論可進一步拓展至任務粒度的路由,例如程式碼補全由小模型完成,而根據需求即時編寫完整函式則由大型模型接管。

  • 誤讀 4:“這是一項獨立產品,我可以買一個‘級聯推論軟體’即插即用。” 糾偏:當前級聯推論更多是系統設計範式和工程實踐的組合,多數情況下需要與模型選擇、業務邏輯和基礎設施緊耦合定製。雖然中介軟體和推論架構在提供越來越好的預置件,但“一鍵式”的通用級聯產品尚不成熟。

13. 最新事件

  • 2024 年 9 月:OpenAI 釋出 o1 系列模型,顯著拉開簡單問題與複雜推論任務的定價(o1‑preview 約為 GPT‑4o 價格的 6 倍)。業界分析認為,這種價格分化可能通過內部請求路由和級聯推論實現,即使用者表面呼叫同一個 API,後臺卻根據問題難度導向不同規模或深度的推論鏈條(來源:OpenAI 官方公告及外部分析文章)。
  • 2024 年 10 月:Anyscale 推出“LLM‑native Routing”正式版,允許開發者根據延遲、成本和任務型別自動在 20+ 開源模型間切換,標誌著級聯路由功能從大廠閉源走向可用商業工具。
  • 2024 年 11 月:NVIDIA 在 SC24 大會上展示下一代推論微服務和多模型編排能力,暗示將級聯與硬體協同深度結合,未來可能為每級推論自動匹配最優 GPU 算力。
  • 2024 年 12 月:多個開源推論架構(vLLM v0.6.x, SGLang)合入了支援推測解碼和多模型池排程的關鍵 PR,級聯推論的工程化門檻進一步降低。
  • 截至 2025 年 4 月公開資料未見某公司釋出直接命名為“級聯推論平台”的獨立產品,各家的實踐仍以內部系統或架構功能的形式存在。

14. 追蹤指標

投資者和技術決策者可圍繞以下可觀測指標判斷級聯推論技術的成熟度和競對動向:

  1. 一線 AI 服務 API 定價趨勢:重點關注 OpenAI、Anthropic、Google 等頂級廠商每百萬 token 的價格變更節奏。陡降的價格往往意味著後端推論最佳化(包括級聯)取得了突破。
  2. LLMPerf 排行榜與推論效能基準:Anyscale 維護的 LLMPerf 排行榜測量各推論後端的吞吐量和延遲,可間接反映多模型排程最佳化水平。
  3. 開源推論架構的更新日誌:vLLM、SGLang 等專案的 Release Notes 中關於“multi‑model scheduling”“speculative decoding”“router”等關鍵詞的出現頻率和功能成熟度。
  4. 頂級學術會議論文關鍵詞:NeurIPS、ICML、MLSys 中“cascaded inference”“adaptive inference”“query routing”的收錄數量,2019‑2024 年間相關論文呈上升趨勢,2024 年已突破 50 篇(粗略統計)。
  5. 雲端廠商硬體採購結構:例如 NVIDIA 財報中推論板塊對不同 GPU 的銷售額,若中低端 GPU(如 L40S)銷量增速顯著,可視為級聯或類似分負載架構滲透率提升的訊號。
  6. AI SaaS 上市公司毛利變動:觀察提供 AI 原生服務的公司(如字首為“ai.xxx”的股票)的毛利率季度變化,成本端的改善通常包含著推論最佳化紅利的釋放。

15. 信源

本概念頁採用的資訊來源包括:

  • 市場資料:Omdia《AI Inference Processors Market Tracker》(2024‑04)、IDC《Worldwide AI Spending Guide》(2024‑07)、IDC 中國 2024 年相關報告摘要。
  • 學術論文:Leviathan et al., “Fast Inference from Transformers via Speculative Decoding” (ICML 2023);Chen et al., “Accelerating Large Language Model Decoding with Speculative Sampling” (2023);以及多篇 2023‑2024 年間發表於 MLSys、NeurIPS 的路由與級聯推論論文。
  • 技術文件與開源專案:vLLM (vllm-project)、SGLang (sgl-project)、NVIDIA TensorRT‑LLM 官方文件與 GitHub 倉庫、Anyscale 官方技術部落格、Triton Inference Server 文件。
  • 廠商公開資料:OpenAI 定價頁面 (2024‑09)、Anthropic 及 Google Cloud 官方部落格的產品公告、NVIDIA GTC/SC 大會演示材料。
  • 行業分析與評測:LLMPerf (Anyscale) 排行榜、Semianalysis、The Information 等第三方的技術深度分析(定性參考,未經獨立核實的具體內部技術細節以原文標註為限)。
  • 宣告:本文中所有未直接註明具體來源的數字均為基於公開資訊的合理估算或註明“公開資料未見”,不構成任何投資或商業決策建議。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型