推論引擎
3 秒看懂
推論引擎是 AI 模型完成訓練後,在部署階段執行前向計算、輸出預測結果的軟體棧與執行時系統。它把訓練架構匯出的計算圖編譯、最佳化,並高效對映到 CPU/GPU/NPU/FPGA 等目標硬體,直接決定線上服務的延遲、吞吐與成本。
3 分鐘產業解釋
當用戶向 ChatGPT 輸入一句話、手機執行 Stable Diffusion 生成圖片、自動駕駛系統識別行人,背後都是推論引擎在毫秒級內完成一次“前向傳播”。其核心不是重複訓練,而是將浮點或量化後的計算圖,通過運算元融合、記憶體規劃、多流並行、核心自動調優等手段,榨乾每一塊硬體的峰值算力。
產業上,推論引擎已分化為兩大陣營:通用引擎(ONNX Runtime、TensorRT、OpenVINO)追求跨硬體可移植與極致效能;架構內建引擎(PyTorch 的 torch.compile、TensorFlow Lite)則深度繫結自家生態。近年來,隨著 Llama、Stable Diffusion 等大型模型落地,推論引擎快速補全對 MoE 路由、KV Cache 管理、投機解碼等新範式的支援,成為大型模型落地的“最後一公里”核心技術壁壘。
技術原理
推論引擎的實質是一系列編譯最佳化與執行時排程技術的集合,可抽象為“圖最佳化 + 程式碼生成 + 執行時排程”。
計算圖生命週期
原始模型 → 匯出(ONNX/TorchScript/MLIR)→ 圖最佳化(pass pipeline)→ 劃分與分配(運算元分配到不同裝置)→ 核心編譯/選擇 → 執行時載入執行。
運算元融合是普適最佳化。以卷積網路為例:
原始圖:
Conv -> BatchNorm -> ReLU -> MaxPool
融合後:
Conv+BN+ReLU -> MaxPool
單個核完成卷積、BN 縮放、偏置和 ReLU,中間結果不寫回全域性記憶體,極大節省視訊記憶體頻寬。
Transformer 模型還需特殊處理:
- 層歸一化與矩陣乘融合:將 LayerNorm + QKV 投影融合成一個 kernel,減少資料搬運。
- FlashAttention 類演算法:分塊計算 attention softmax,避免 O(N²) 視訊記憶體佔用,引擎需在編譯期自動檢測並插入這類實現。
- KV Cache 管理:解碼階段 Q 矩陣按新 token 動態計算,K/V 複用歷史並追加。引擎用類似 PagedAttention 的分頁管理方式,在記憶體池中高效處理變長快取塊,避免碎片化。
量化原理
為降低延遲和視訊記憶體,推論引擎廣泛引入整數量化:
- 校準:用小批次資料採集啟用值動態範圍。
- 量化運算元插入:在圖中特定位置插入量化和反量化節點(Q/DQ),其餘算予替換為 INT8 核心。
原圖: Input(f32) -> MatMul(f32) -> Output(f32)
量化圖: Input(f32) -> QNode(u8) -> MatMul(u8) -> DQNode(f32) -> Output(f32)
常量權重離線完成量化,啟用線上量化,整型加速矩陣乘後再反量化回浮點,供下游層使用。
並行與排程
即使單請求也可挖掘硬體並行性:
- 運算元內並行:矩陣乘拆分為 tile,由執行緒塊、SIMD 執行。
- 運算元間流水:上層計算與下層資料搬運重疊。
- 請求級並行:多請求共享模型權重,利用 GPU 的 MIG 或 MPS 技術隔離優先順序。 對生成式大型模型,還有連續批處理(continuous batching)將動態到達的請求組批,同時維持每個請求的 KV Cache 連續性,這對記憶體管理器是嚴苛挑戰;投機解碼(speculative decoding)用小模型快速生成候選 token,大型模型並行驗證,引擎管理多模型間的訊號同步與回退。
硬體特化
- GPU:利用 Tensor Core 做 INT8/FP8 矩陣乘。
- NPU:通過專用指令處理啟用函式和池化。
- FPGA:以資料流架構固化整圖。 最新趨勢是將引擎與編譯器深度融合,用 MLIR 等統一中間表示描述並生成異構核程式碼。
關鍵引數
- 延遲(Latency):單次推論從請求發起到結果返回的端到端時間,常關注 P50/P95/P99 分位數。線上服務通常要求 P95 < 數十毫秒。
- 吞吐(Throughput):單位時間處理請求數或生成 token 數(LLM 場景)。高併發下常以 queries per second (QPS) 或 tokens per second (TPS) 衡量。
- 視訊記憶體/記憶體佔用:模型權重加執行時快取(尤其 KV Cache)。大型模型下 KV Cache 大小可能數倍於權重,直接決定單卡可支撐的最大批次或序列長度。
- 首 token 延遲(TTFT):從請求到收到第一個生成 token 的時間,影響使用者體感響應。
- 每輸出 token 時間(TPOT):解碼階段每個 token 平均生成時間,決定生成速度。
- 精度損失:量化/剪枝後模型精度相比 FP32 參考的偏離,常用困惑度(PPL)回升幅度或準確率下降百分比衡量。
- 模型初始化/載入時間:引擎載入最佳化後的模型並完成 warm-up 的耗時,影響彈性伸縮的快慢。
- 支援的最大型模型規模與序列長度:引擎能否支援千億引數、128K token 上下文等,成為大型模型服務化的硬門檻。
技術路線
當前推論引擎按核心技術哲學可分為四類:
- 硬體 vendor 專有引擎:典型如 NVIDIA TensorRT、Intel OpenVINO、AMD ROCm+MIGraphX、Apple Core ML。直接呼叫硬體底層庫,提供極致效能,但跨平台性弱。
- 跨平台通用引擎:代表是微軟 ONNX Runtime,通過可插拔的 Execution Provider 抽象多種硬體後端,追求生態相容與中等效能,大量集成於 Windows、Azure ML、Office Copilot 等產品。
- 編譯器自適應引擎:以 Apache TVM(Auto-scheduler)、MLIR 為基礎,通過自動搜尋排程(Auto-TVM)或自定義 DSL 生成高效程式碼,理論上可適應新硬體而不必重寫核心,但學習曲線陡峭。
- 大型模型專用服務引擎:vLLM、LMDeploy、TensorRT-LLM 等,圍繞 Transformer 生成任務重新設計執行時,核心創新是 PagedAttention 風格的分頁 KV 快取、連續批處理和投機解碼。它們通常提供 OpenAI 相容 API,開箱即用。
技術路線演進:從早期硬編碼前向(Caffe)到 ONNX 標準化(2017),再到編譯器自動調優(TVM,2019),如今大型模型驅動專用引擎爆發(2023‑),引擎正從單純的計算圖最佳化器演變為融合視訊記憶體管理、排程和異構計算的完整推論系統。
上游
- 訓練架構與模型匯出:PyTorch、TensorFlow、JAX 等產生原始模型,經由 torch.export、tf2onnx、ONNX 匯出器轉換為標準中間表示。
- 中間表示(IR)與編譯器基建:ONNX、MLIR、Relay IR、TorchScript 等,是模型與引擎之間的紐帶。LLVM、MLIR 和 Triton 語言等為核心生成提供編譯後端。
- 硬體算力供給:GPU(NVIDIA H100/B200、AMD MI300X)、雲端端 AI 晶片(AWS Trainium/Inferentia、Google TPU v5)、邊緣 NPU(高通 Hexagon、Apple Neural Engine、Intel NPU)等,決定了引擎最佳化方向的上限。
- 底層計算庫:NVIDIA cuBLAS/cuDNN/cuTLASS、AMD rocBLAS/MIOpen、Intel oneDNN 等,引擎手寫核心或呼叫這些庫建置原子操作。
下游
- 線上推論服務架構:Triton Inference Server、TorchServe、KServe、Seldon 等,封裝引擎為可擴縮的微服務,提供負載均衡、動態批處理、版本管理。
- 邊緣/端側部署平台:Android NN API、Apple Core ML、NVIDIA Jetson 上的 TensorRT、高通 SNPE/QNN 等,將引擎整合到移動應用、車載系統和 IoT 裝置。
- 應用場景:對話式 AI(ChatGPT、Copilot)、文生圖(Stable Diffusion)、推薦系統(Meta DLRM)、自動駕駛感知、醫療影像分析、視訊會議背景虛化等。每個場景對延遲、吞吐、精度的要求組合不同,直接決定引擎的配置和選型。
- 硬體雲端服務:雲端廠商將推論引擎與 GPU/NPU 例項打包,以按 token 付費或按時付費的方式向終端使用者提供推論能力(如 SageMaker Inference、Vertex AI Prediction)。
受益公司
- NVIDIA:憑藉 TensorRT + Triton 推論伺服器組合,構成 GPU 推論事實標準。NVIDIA FY2024 資料中心業務營收 475 億美元,公司 CEO 黃仁勳多次公開表示推論負載貢獻約佔四成。Ampere/Ada/Hopper 架構中特化的 Transformer Engine 進一步強化其在 LLM 推論中的領導地位。
- 微軟:ONNX Runtime 為跨平台推論基石,集成於 Windows、Azure ML 以及 Office Copilot 等大規模商用場景,強化了微軟在推論軟體棧的生態控制。
- Intel:OpenVINO 支撐自家 CPU/GPU/NPU,在 AI PC 和邊緣推論市場試圖建立差異化,尤其在 Meteor Lake 及其後續平台中整合的 NPU 藉助 OpenVINO 工具鏈吸引開發者。
- 雲端廠商自研引擎:AWS 推出 Neuron SDK 配合 Inferentia/Trainium 晶片;Google XLA 編譯器與 TPU 推論棧繫結;阿里雲端 PAI-Blade 最佳化推論,雲端廠通過軟硬一體降低自研晶片的使用門檻和單位成本。
- 新興專用引擎企業:
- vLLM(源自 UC Berkeley)被 Anyscale、AWS、Google Cloud 等託管服務廣泛採用,其商業化實體在 2024 年獲得 Lightspeed 等機構投資(公開報道)。
- LMDeploy(上海人工智慧實驗室)與華為昇騰、寒武紀等國產 NPU 深度適配,是國內大型模型推論生態的重要元件。
- 其他如 Modular(MLIR 原生引擎)、OctoML(TVM 商業化)等,試圖以新一代編譯器引擎打破現有格局。
以上僅陳述公司與產業關聯,不構成任何投資建議。
市場規模
推論引擎作為中介軟體,目前尚無權威第三方釋出其獨立市場規模。通常觀察口徑有三層:
- 推論晶片及伺服器市場:據 IDC 2024 年 5 月《Worldwide AI and Generative AI Spending Guide》預測,2024 年全球 AI 伺服器支出約 1300 億美元,其中推論負載佔比持續上升。但未單獨拆分推論引擎軟體佔比。
- 雲端廠推論營收:各雲端巨頭在 2024 年法說會中頻繁提及 AI 推論營收增速超越訓練。以微軟 Azure 為例,其 CFO 在 FY24Q3 電話會上表示 AI 服務營收中推論佔比已超過半數。AWS 也揭露 Amazon Bedrock 和 SageMaker Inference 營收季度季增率較高雙位數增長。根據 Synergy Research 2024 年 6 月資料,全球雲端基礎設施服務季度營收達 760 億美元,其中 AI 推論相關貢獻估計在 8%‑12% 區間,對應年化約 300‑400 億美元(含推論硬體租賃與引擎軟體服務,公開資料未嚴格區分)。
- MLOps/推論軟體平台:Cognilytica 等機構將推論引擎歸入 MLOps 部署工具市場,其 2023 年報告估算全球 MLOps 市場約 38 億美元,預計 2028 年達到 190 億美元(CAGR ~38%)。推論引擎作為部署環節的核心,是主要動力。
綜合公開資訊,推論引擎的直接市場金額難以精確分離,但其所撬動的推論算力和服務支出在 2024 年已達數百億美元級別,且增速高於整體 AI 基礎設施市場。
玩家對比
| 維度 | TensorRT | ONNX Runtime | OpenVINO | TVM/Apache TVM | vLLM/LMDeploy (大型模型專用) |
|---|---|---|---|---|---|
| 定位 | NVIDIA GPU 極致效能 | 跨硬體、跨架構通用 | Intel 硬體全棧最佳化 | 編譯器式,自適應硬體 | LLM 服務化引擎,專注文本生成 |
| 核心最佳化 | 手寫 kernel + 圖融合 + FP8/INT4 支援 | 硬體抽象,多 EP 後端 | CPU/NPU 低精度與記憶體管理 | 基於搜尋的自動調優(Auto-scheduler) | KV 快取分頁管理、連續批處理、投機解碼 |
| 量化支援 | INT8/FP8/INT4,支援 QAT/PTQ | INT8 通用流程,多種校準策略 | CPU 上的對稱/非對稱量化 | 可擴充套件量化方案,需自定義調優 | AWQ/GPTQ 等權重僅量化,啟用保持 FP16 |
| 易用性 | ONNX 匯入,C++/Python API | 支援多種架構匯出,社群活躍 | 自家工具鏈,較封閉 | 學習曲線陡,需編寫 schedule | 開箱即用,提供 OpenAI 相容 API |
| 侷限性 | 僅 NVIDIA GPU,部分核心閉源 | 極致效能不如專用引擎 | AMD/NVIDIA 支援弱 | 大型模型支援仍初級 | 預填充階段最佳化不足,異構 GPU 支援有限 |
注:本對比基於截至 2024 年中的公開文件與社群測試,具體效能因模型和硬體而異。
風險
- 硬體繫結風險:專有引擎(如 TensorRT)將模型與單一供應商硬體強耦合,一旦供應鏈中斷或採購成本劇增,遷移至其他硬體平台的複雜度極高。
- 精度與可靠性風險:量化、剪枝或投機解碼若校準不當,可能引入顯著的精度下降或偶發性輸出錯誤,對金融、醫療等高風險場景造成合規問題。
- 安全與對抗風險:推論引擎作為線上服務入口,可能面臨對抗樣本攻擊、模型竊取(通過查詢介面逆向模型引數)、提示注入等,引擎層的安全防護(如輸入過濾、速率限制)尚不成熟。
- 開源依賴與可持續性風險:大量引擎依賴開源社群維護(TVM、vLLM 等),若社群活躍度下降或公司收購後改變許可(如轉為 BSL、SSPL),商業使用者可能面臨被迫更換引擎的風險。
- 複雜性飆升帶來的故障面擴大:大型模型引擎整合連續批處理、多模型排程、異構硬體互聯等複雜功能後,系統狀態空間急劇膨脹,出現記憶體洩漏、死鎖或效能抖動的機率上升,對運維可觀測性提出更高要求。
- 技術路線碎片化:MLIR、ONNX、各家專有 IR 並存,標準未統一,導致模型在不同引擎間遷移需要重複除錯和適配,增加了整體產業摩擦成本。
誤讀糾偏
- 誤讀一:“推論引擎就是硬體驅動,效果主要看晶片算力。”
實際同款 GPU 上,不同引擎吞吐可能差 3‑5 倍。引擎負責計算圖和記憶體搬移的極致排程,算力只決定天花板。即使 A100 也常見因 KV 快取管理不善導致有效吞吐腰斬。 - 誤讀二:“量化模型一定不如全精度模型。”
對於推論,合理校準的 INT8/FP8 模型噪聲可被現代模型過量引數容錯抵消,許多場景精度損失微乎其微,卻換來數倍加速和頻寬節省。但 INT4 等極低位元若不結合 AWQ/GPTQ 等權重舍入最佳化,仍可能顯著降級。 - 誤讀三:“推論引擎只服務於雲端端大型模型。”
手機人像分割、語音喚醒、鍵盤預測等也依賴微型推論引擎,規模極小、延遲要求更苛刻,引擎常通過委託 NNAPI 或定製 DSP 核心執行。 - 誤讀四:“推論引擎的效能調優是一次性工作。”
模型版本迭代、硬體換代、請求分佈變化都會使之前的最佳化配置失效,需要持續監控並重新調優,本質是永續工程。
最新事件
- 2024 年 1 月:NVIDIA 釋出 TensorRT-LLM 對 Llama 2 70B 的 FP8 推論支援,宣稱在 H100 上實現比 A100 FP16 高出 4 倍的吞吐。
- 2024 年 4 月:Meta 釋出 Llama 3,其量化版 LMDeploy 在 24 小時內完成適配,顯示出大型模型專用引擎的快速演進能力。
- 2024 年 6 月:vLLM 的商業化實體 vLLM Inc. 宣佈獲得由 Lightspeed Venture Partners 領投的 A 輪融資,計劃加速企業級特性開發(來源:公司官方部落格及 TechCrunch 報道)。
- 2024 年 7 月:微軟公佈 ONNX Runtime 支援 DirectML 後端,使 Windows 上任何支援 DirectX 12 的 GPU 均可執行加速推論,拓展了 PC 端 AI 應用潛力。
- 2024 年 9 月:AMD 推出 ROCm 6.1,整合 MIGraphX 和 VLLM 適配,改善 MI300X 的 LLM 推論效率;同時 Intel 釋出 Xeon 6 處理器,借力 OpenVINO 實現單路 CPU 執行 70 億引數模型的即時推論。
- 2024 年 10 月:MLIR 社群釋出 Torch-MLIR 新版本,可將 PyTorch 2.0 匯出的計算圖直接 lowering 到多種硬體,為未來統一推論編譯棧投下關鍵棋子。
- 2024 年第四季度:多家雲端廠在財報電話會中揭露推論營收年增率增長超 100%,微軟 Azure 和 AWS 均指出推論引擎最佳化是提升毛利的關鍵因素(來源:公司季度財報電話會議記錄)。
追蹤指標
- 推論引擎社群活躍度:GitHub Star 數、Issue 關閉速度、Release 頻率(關注 TensorRT-LLM、vLLM、ONNX Runtime、TVM)。
- 硬體路線圖銜接:NVIDIA B200/Rubin、AMD MI400、Intel Falcon Shores 釋出計劃及對應引擎支援時間表。
- 開源基準排行榜:MLCommons Inference Benchmark 不同硬體‑引擎組合的延遲與功耗排名。
- 雲端廠推論服務定價變化:AWS SageMaker、Azure OpenAI Service、Google Vertex AI 的按 token 或按小時費率調整,反映引擎效率進步與競爭動態。
- 量化標準進展:IEEE 或 OCP 對 FP4/FP6/MX 格式的採納程度,以及各引擎的支援宣告。
- 安全漏洞揭露:CVE 資料庫中出現針對推論引擎或模型 serving 架構的高危漏洞。
- 關鍵專案許可變更:如 vLLM、TVM 等是否從 Apache 轉變為更受限的許可證。
- 生態整合動態:推論引擎與 Kubernetes、KubeFlow、LangChain 等編排和上層架構的深度整合度。
信源
- 輝達官網 TensorRT 文件與開發者指南(涵蓋 builder、network 最佳化、精度模式)
- ONNX Runtime 官方 GitHub 與效能調優博文
- 論文《Orca: A Distributed Serving System for Transformer-Based Generative Models》(OSDI 2022)
- 論文《Efficient Memory Management for Large Language Model Serving with PagedAttention》(SOSP 2023)
- 開源專案 TVM、MLIR、torch.compile 設計文件及社群討論
- 雲端廠商技術部落格:AWS Neuron 特性說明、Google Cloud TPU 推論最佳化實踐、Azure AI Studio 推論最佳化指南
- MLCommons Inference Benchmark 官方結果(mlcommons.org)
- Synergy Research Group、IDC、Cognilytica 相關市場報告(需查閱最新季度更新)
- 各上市公司季度財報電話會議記錄(NVIDIA、微軟、AWS、Intel)
- 建議通過上述關鍵詞自行檢索,獲取最新版本文件與資料。