推論服務
1. 3 秒看懂
推論服務把 GPU 從“訓練資產”變成“按 token 週轉的產能資產”,2026 年瓶頸從單卡 TFLOPS 轉向 KV cache、continuous batching 和尾延時。123
vLLM、TensorRT-LLM 和 SGLang 的差異不是 1 個架構偏好,而是 3 條產能利用率路線:通用吞吐、NVIDIA 深度最佳化、結構化/Agent 工作流。123
投資上,營收彈性沿“token 量 × 單 token 成本下降 × GPU 利用率提升 × 雲端廠商加價率”傳導,若 P95 延時不降或 GPU 利用率低於 40%,推論服務的毛利擴張會被電力和折舊吞噬。456
2. 3 分鐘產業解釋
推論服務是把大型模型部署成線上 API、批次離線生成或企業專屬 endpoint 的系統層,核心目標是在 10-1,000 個併發請求下同時壓低首 token 延時、平均 token 成本和 P95/P99 尾延時。12 訓練側的核心變數是叢集規模和收斂效率,推論側的核心變數是 prefill/decode 拆分、KV cache 複用、動態批處理、量化精度和路由排程,因此軟體架構能直接改變同一 GPU 的可售 token 容量。123
2025-2026 年,推論需求從“聊天問答”向“長上下文、程式碼、搜尋、RAG、工具呼叫、Agent”擴散,單次請求的輸入 token、輸出 token 和 cache 佔用同步上升。378 NVIDIA 在 2026 年 5 月揭露 Q1 FY2027 資料中心營收 752 億美元、年增率增長 92%,並稱 Dynamo 1.0 在 Blackwell 上可把生成式和 agentic inference 提升最高 7 倍,說明推論軟體已經進入硬體銷售敘事的中心。4
對雲端廠商,推論服務是把 GPU capex 轉成營收的“利用率閘門”。Microsoft FY2026Q3 Intelligent Cloud 營收 346.81 億美元、年增率增長 30%,Azure 和其他雲端服務增長 40%;Amazon Q1 2026 AWS 營收 375.87 億美元、年增率增長 28%,AWS TTM operating margin 為 35.2%;Alphabet Q1 2026 Google Cloud 營收 200.28 億美元、年增率增長 63%,這 3 組資料共同表明雲端側 AI 需求仍在擴張,但資本支出、記憶體價格和容量交付會決定毛利方向。567
3. 15 分鐘專家深入
推論服務的第一層約束是記憶體而非算力,因為每個請求在 decode 階段都要保留 KV cache,且長上下文會把視訊記憶體佔用從權重常數項變成“併發數 × 上下文長度”的線性項。19 vLLM 的 PagedAttention 把 KV cache 切成 block 並像虛擬記憶體一樣管理,論文報告在相同延時水平下相對 FasterTransformer 和 Orca 吞吐提升 2-4 倍,投資含義是同一張 H100/H200/B200 可以承載更高併發而非只提升單請求速度。1
第二層約束是排程。傳統靜態 batching 必須等同批次最慢請求完成,continuous batching 則允許已完成請求退出、新請求插入,因此高併發場景下 GPU idle 時間下降、P50 延時和吞吐的衝突被緩和。210 TensorRT-LLM 的商業價值在於把 in-flight batching、paged KV cache、FP8/FP4/INT4 量化、speculative decoding 和多 GPU/多節點執行打包進 NVIDIA 生態,進而把 Blackwell、NVLink、Triton 和 NIM 的硬體繫結做深。24
第三層約束是工作流結構。SGLang 的 RadixAttention 面向多輪對話、few-shot、RAG 和 Agent 分支,把共享 prefix 的 KV cache 複用為 radix tree,並在論文實驗中對結構化任務相對當時系統實現最高 6.4 倍吞吐提升。3 這意味著“推論服務”不能只看每秒 token,還要看 cache hit rate、schema/JSON 輸出成功率、tool-call 分支數和請求路由命中率;若 Agent 請求從 1 次生成擴充套件到 5-20 次模型呼叫,架構層的快取和排程收益會被放大。38
可計算口徑應拆成 推論服務營收 = 可用 GPU 小時 × GPU 利用率 × 有效 token/s × 單 token 價格 ÷ 1,000,000,再用 毛利 = 營收 - GPU 折舊 - 電力 - 網路 - 運維 約束獲利率。456 由於 NVIDIA、AMD、Microsoft、Amazon 和 Alphabet 均未單列“推論服務軟體營收”或“vLLM/TensorRT-LLM/SGLang 營收”,本文只能把資料中心硬體營收、雲端營收和 AI cloud 營收作為上限代理,所有單架構份額必須寫成情景假設而非事實。456711
競爭格局上,NVIDIA 擁有 CUDA、TensorRT-LLM、Triton、NIM 和 Dynamo 的一體化優勢;AMD 依賴 ROCm、MI300/MI350/MI450 和開源架構適配改善供給彈性;雲端廠商則通過自研晶片、模型服務和路由層爭奪毛利。2468 反證指標是清晰的:若 MLPerf Inference 或公開客戶 benchmark 顯示非 NVIDIA 平台在 Llama/DeepSeek/Qwen 類模型上持續低於 NVIDIA 價效比 20%以上,AMD/TPU/Trainium 的推論份額會低於資本支出預期;若 vLLM/SGLang 在企業 SLA 場景 P99 不穩定,閉源託管服務會獲得更高溢價。1011
4. 技術原理
一次 LLM 推論通常分為 prefill 和 decode 兩段,prefill 並行處理輸入 token,decode 逐 token 生成輸出,因此首 token 延時主要受輸入長度、attention kernel 和並行度影響,吞吐主要受 decode 階段 batch occupancy 和 KV cache 容量影響。12
vLLM 的核心是 PagedAttention、continuous batching、prefix caching 和分散式推論,適合多模型、多租戶和 OpenAI-compatible API 場景;TensorRT-LLM 的核心是 engine 編譯、NVIDIA kernel、in-flight batching、quantization 和 Triton/NIM 整合,適合 NVIDIA GPU 上追求極致吞吐和 SLA;SGLang 的核心是 RadixAttention、結構化生成、zero-overhead scheduler、prefill-decode disaggregation 和 multi-LoRA batching,適合 Agent/RAG/JSON 輸出密集場景。123
推論效能的 5 個關鍵引數是 TTFT、TPOT、tokens/s、P95/P99 延時和 GPU KV cache usage;其中 TTFT 上升通常代表 prefill 或排隊壓力,TPOT 上升通常代表 decode batch 或視訊記憶體壓力,KV cache usage 接近 90%會顯著增加搶佔、換頁或拒絕請求風險。19 工程上,FP8/FP4/INT4 量化、speculative decoding、chunked prefill、prefix cache 和 disaggregated serving 能把單位 token 成本下降 10%-70%不等,但具體收益必須由模型、上下文長度和流量分佈驗證,不能直接從單模型 benchmark 外推到全部生產負載。2310
5. 上游依賴 / 下游影響
上游依賴
- GPU/ASIC:NVIDIA Q1 FY2027 資料中心 compute 營收 604 億美元、networking 營收 148 億美元,推論服務的可售 token 產能仍高度依賴 Blackwell/Rubin、NVLink、InfiniBand/Ethernet 和 HBM 供給。4
- 替代加速器:AMD Q1 2026 Data Center 營收 57.75 億美元、年增率增長 57%,且 Meta 與 AMD 計劃部署最高 6GW 的 AMD Instinct GPU,說明 MI450 進入 2027 年後有機會形成推論供給第二來源。8
- 雲端容量:AWS Q1 2026 揭露 210 萬顆以上 AI chips 在過去 12 個月落地、其中超過一半為 Trainium,並計劃從 2026 年開始部署 100 萬顆以上 NVIDIA GPU,雲端側推論服務會同時消耗自研晶片和 NVIDIA 供給。6
- 記憶體與電力:Amazon Q1 2026 TTM FCF 從 259 億美元降至 12 億美元,並明確 AI 投資帶動 PPE 採購增加 593 億美元,說明推論服務即使營收高增長也會顯著壓低自由現金流量。6
下游影響
- 雲端 API:Microsoft FY2026Q3 Microsoft Cloud 營收 545 億美元 [MSFT]、年增率增長 29%,Azure 和其他雲端服務增長 40%,推論服務的價格體系會直接影響 Azure OpenAI、Foundry 和企業 Agent 的毛利率。5
- 搜尋與廣告:Alphabet Q1 2026 Google Cloud 營收 200.28 億美元、Google Cloud operating income 65.98 億美元,推論服務的成本下降會提高 Gemini API、AI Search 和企業工作流的單位經濟性。7
- AI cloud:Nebius Q1 2026 宣佈 Pennsylvania AI factory 獲得最高 1.2GW 電力和土地,專用 AI cloud 的推論服務競爭會從“誰有 GPU”升級為“誰能把 GPU 轉成低延時 SLA”。12
- 應用層:Agent 請求可能把單使用者互動從 1 次模型呼叫擴充套件到 5-20 次工具鏈呼叫,若 cache hit rate 和排程效率不能同步提高,應用層 gross margin 會隨 token 量上升而下降。39
6. 技術路線對比表
| 路線 | 速率/單位 | 典型功耗或成本變數 | 距離或維度 | 標準成熟度 | 量產機率 2026 | 反證指標 |
|---|---|---|---|---|---|---|
| vLLM + PagedAttention | 論文報告吞吐提升 2-4x | 視訊記憶體碎片下降、GPU 利用率上升 | 多模型 API、多租戶、OpenAI-compatible | Linux Foundation/開源生態成熟 | 85% | P99 延時在企業 SLA 下連續 2 個季度劣於託管閉源服務 |
| TensorRT-LLM + Triton/NIM | NVIDIA 揭露 Dynamo 最高 7x 推論提升 | FP8/FP4/INT4、Blackwell kernel、NVLink | NVIDIA GPU 單叢集到多節點 | NVIDIA 官方生產棧成熟 | 90% | 非 NVIDIA 架構在同模型同功耗下價效比高出 20%以上 |
| SGLang + RadixAttention | 論文報告結構化任務最高 6.4x | Prefix KV 複用、zero-overhead scheduler | Agent/RAG/JSON/多輪對話 | 開源快速迭代,企業 SLA 待驗證 | 70% | Radix cache hit rate 低於 20%且結構化輸出失敗率高於 1% |
| Speculative decoding | 1 個小模型 draft + 1 個大型模型 verify | 額外視訊記憶體換取 decode 加速 | 輸出 token 密集型任務 | TensorRT-LLM/vLLM/SGLang 均在推進 | 65% | 接受率低於 40%導致額外算力成本高於節省 |
| Prefill-decode disaggregation | prefill 節點與 decode 節點分離 | 網路傳輸 KV cache 換取資源匹配 | 長上下文、RAG、批次生成 | 2025-2026 年由架構和雲端廠加速驗證 | 55% | KV 傳輸頻寬或排隊延時抵消 10%以上吞吐收益 |
| 自研雲端晶片推論棧 | Trainium/TPU/ASIC tokens/s 待按模型揭露 | 折舊、軟體適配和可用模型生態 | 雲端內閉環 API | AWS/Google 成熟度高於第三方生態 | 60% | 主流開源模型適配慢於 NVIDIA 2 個版本週期以上 |
7. 關鍵指標
- TTFT:按模型和上下文長度分層追蹤,若 8k context 的 P95 TTFT 連續 2 週上升 30%以上,說明 prefill 或排隊成為瓶頸。12
- TPOT:按輸出 token 流式追蹤,若 TPOT 高於 SLA 目標 20%以上,說明 decode batch、量化或 KV cache 壓力需要重調。210
- GPU 利用率:按
SM utilization × memory bandwidth utilization × batch occupancy拆分,若平均 GPU 利用率低於 40%,推論服務的折舊吸收能力弱於營收增長。19 - KV cache usage:按 P50/P95 監控,若 P95 長期超過 90%,搶佔、OOM 或請求拒絕機率上升,且長上下文業務會壓縮短請求可用併發。19
- Prefix/cache hit rate:RAG、few-shot 和 Agent 工作流應高於普通聊天,若 SGLang/vLLM prefix hit rate 低於 20%,快取路線對毛利的貢獻低於預期。3
- tokens/$:按硬體、架構、模型和上下文長度追蹤,若 Blackwell/TensorRT-LLM 相對 H100/vLLM 的成本改善低於 20%,硬體升級 ROI 會被延後。24
- P95/P99 SLA:按客戶 tier 和區域追蹤,若 P99 高於 P50 的 5 倍以上,企業 API 的溢價會轉向託管閉源服務或專屬容量。56
8. 可算傳導表
| 驅動變數 | NVIDIA | AMD | Nebius | 來源/公式 |
|---|---|---|---|---|
| TAM | Q1 FY2027 Data Center 營收 752 億美元作為推論/訓練硬體上限代理 | Q1 2026 Data Center 營收 57.75 億美元作為 GPU+CPU 資料中心上限代理 | FY2026 revenue guidance 30-34 億美元待以股東信核對;Q1 2026 AI cloud 營收需從 PDF 補表 | 4812 |
| 出貨/容量 | Blackwell/Dynamo 已量產;GPU 出貨未揭露,標 [未核實 — 待補 A/B 源] | MI450 首個 1GW Meta deployment 從 2027 年開始,2026 出貨未揭露 | Pennsylvania 最高 1.2GW 電力和土地,GPU 數未揭露 | 4812 |
| ASP/單價 | GPU/系統 ASP 未揭露,用 Data Center revenue ÷ shipped units 待補 A/B 源 | Instinct ASP 未揭露,用 Data Center GPU revenue ÷ shipped units 待補 A/B 源 | AI cloud 單 GPU 小時價格未揭露,用 AI cloud revenue ÷ billable GPU hours 待補 A/B 源 | 4812 |
| 份額 | 情景假設推論 GPU 份額 70%/80%/90%,非公司揭露 | 情景假設推論 GPU 份額 5%/10%/15%,非公司揭露 | 情景假設專用 AI cloud 份額 1%/2%/3%,非公司揭露 | 情景推算 |
| 營收 | 有效 GPU 小時 × tokens/s × token 價格;硬體代理為 752 億美元/季 | 有效 GPU 小時 × tokens/s × token 價格;硬體代理為 57.75 億美元/季 | 可售 GPU 小時 × 利用率 × GPU 小時單價;公司營收 guidance 待核 | 4812 |
| 毛利 | Q1 FY2027 GAAP GM 74.9%,752 × 74.9% = 563.0 億美元 資料中心粗代理 | Q1 2026 GAAP GM 53%,57.75 × 53% = 30.61 億美元 資料中心粗代理 | 毛利率待揭露;AI cloud 折舊和電力會壓低早期 GM | 4812 |
| PE | 2026-05-27 16:00 EDT 收盤價 212.60 美元 [NVDA],市值 5.15 萬億美元 [NVDA],PE TTM 32.56x [NVDA] | 2026-05-27 收盤價 495.54 美元,市值 8,080.3 億美元,PE TTM 168.03x | NBIS PE 因早期虧損不適用,應用 EV/Sales 或 EV/ARR | 131415 |
| 估值 | Data Center EBIT × 目標 PE,若推論營收佔比提升且 GM 維持 70%+,估值中樞上行 | Data Center EBIT × 目標 PE,若 MI450 份額達 10%且軟體適配改善,估值彈性高但 PE 容錯低 | FY2026 revenue × EV/Sales,若利用率低於 50%,估值從容量溢價轉向折舊折價 | 推算 |
9. 同業硬指標對比表
| 公司 | 營收 | 增速 | GM/OM | 淨利 | FCF margin | 客戶集中度 | 技術代際 | PE TTM | 反證條件 |
|---|---|---|---|---|---|---|---|---|---|
| NVIDIA | Q1 FY2027 營收 816.15 億美元 [NVDA],Data Center 752 億美元 [NVDA] | 總營收 +85%,Data Center +92% | GAAP GM 74.9% | GAAP net income 583.21 億美元 | 待 10-Q 現金流量表補齊 | Hyperscale 約佔 Data Center 50%,其餘 ACIE 約 50% | Blackwell、Dynamo 1.0、TensorRT-LLM | 32.56x [NVDA],2026-05-27 16:00 EDT,美元,StockAnalysis TTM | Data Center networking 或 compute 季增率低於 10%,且 Dynamo 客戶 adoption 不達預期 |
| AMD | Q1 2026 營收 102.53 億美元,Data Center 57.75 億美元 | 總營收 +38%,Data Center +57% | GAAP GM 53%,Data Center op margin 27.7% | GAAP net income 13.83 億美元 | FCF margin 25% | Meta 最高 6GW 合作形成單一大客戶驗證風險 | MI300/MI350/MI450、ROCm、vLLM/SGLang 適配 | 168.03x,2026-05-27 收盤,美元,StockAnalysis TTM | MI450 2027 1GW 部署延期,或 ROCm 主流模型落後 NVIDIA 2 個版本週期 |
| Microsoft | FY2026Q3 營收 828.86 億美元 [MSFT],Intelligent Cloud 346.81 億美元 | 總營收 +18%,Intelligent Cloud +30% | Microsoft Cloud GM 66% | net income 317.78 億美元 | FCF margin 待 10-Q 補齊 | OpenAI commitments 影響 bookings,客戶集中度未單列 | Azure AI、Foundry、OpenAI、NVIDIA/自研混合 | 24.58x [MSFT],2026-05-27,美元,StockAnalysis TTM | Azure AI capacity 交付低於需求,且 Cloud GM 連續 2 季下行 |
| Alphabet | Q1 2026 營收 1,098.96 億美元,Google Cloud 200.28 億美元 | 總營收 +22%,Cloud +63% | Cloud operating margin 32.9% | net income 626 億美元 | FCF margin 待 10-Q 補齊 | Search 仍佔獲利核心,Cloud backlog 待逐季轉化 | TPU、Gemini、Vertex AI、vLLM/自研 Serving | 29.27x,2026-05-27,美元,StockAnalysis GOOG TTM | Cloud 增速回落至 30%以下且 TPU 供給不能緩解容量約束 |
| Amazon | Q1 2026 營收 1,815.19 億美元,AWS 375.87 億美元 | 總營收 +17%,AWS +28% | AWS TTM OM 35.2% | net income 302.55 億美元 | TTM FCF margin 0.2% | OpenAI 2GW、Anthropic 5GW、Meta Graviton cores 提高大客戶集中度 | Trainium、Graviton、Bedrock、NVIDIA GPU | 32.52x,2026-05-27,美元,行情快照 | AWS chips 20B run-rate 不能轉化為推論服務毛利,且 FCF 連續 2 季接近 0 |
| Nebius | Q1 2026 營收和 ARR 需以股東信補表;公開揭露最高 1.2GW 新 AI factory | 公開揭露 AI cloud 高增長,精確增速待 PDF 補表 | 早期 AI cloud margin 待揭露 | 早期獲利率待揭露 | 早期 FCF 待揭露 | Microsoft/NVIDIA 等大客戶和供應商集中度高 | NVIDIA full-stack AI cloud、Token Factory | PE 不適用,早期虧損/高折舊 | 1.2GW 站點延後、融資成本上升或 GPU 利用率低於 50% |
10. 投資邏輯 + 業績傳導
推論服務的主線是“訓練 capex 的二次變現”。2026 年 NVIDIA Data Center 已達 752 億美元/季,Microsoft、Amazon 和 Alphabet 的雲端業務分別以 30%、28%和 63%增速擴張,說明模型服務需求仍在把 GPU/ASIC 產能轉成雲端營收。4567 但推論不像訓練一次性佔滿叢集,營收兌現更依賴流量波峰、長上下文分佈、cache hit rate 和多租戶排程,因而 vLLM、TensorRT-LLM、SGLang 這類架構會決定同一 capex 的週轉率。123
估值落點分 3 層:NVIDIA 和 AMD 享受硬體和軟體繫結溢價,Microsoft/Google/Amazon 享受推論 API 和企業 Agent 的雲端毛利溢價,Nebius/CoreWeave 類 AI cloud 享受稀缺容量溢價但承擔折舊和融資波動。45612 反證閾值是 3 個:GPU 利用率低於 40%、P99/P50 高於 5 倍、單位 token 成本 2 個季度沒有下降;任一閾值成立,推論服務從“軟體槓桿”退回“重資產出租”。1910
企業/消費者 Agent 請求數 × 每請求 5-20 次模型呼叫
↓
輸入/輸出 token × context length × cache hit rate
↓
vLLM / TensorRT-LLM / SGLang 排程效率
↓
GPU 有效利用率 × tokens/s × 單 token 價格
↓
雲端營收 - GPU折舊 - 電力 - 網路 - 運維
↓
FCF × PE / EV-Sales = 情景市值架構
11. 常見誤讀糾偏
誤讀 1:推論服務只要 GPU 更多,營收就線性增長。
實際情況:推論營收由 GPU 小時 × 利用率 × tokens/s × token price 決定,GPU 數只是第一項,KV cache、continuous batching 和路由效率會讓同一 GPU 的可售 token 量出現 2-4 倍差異。19
證據:vLLM 論文報告 PagedAttention 在相同延時下提升 2-4 倍吞吐,NVIDIA TensorRT-LLM 文件把 in-flight batching、paged KV cache 和量化列為核心推論最佳化,二者共同說明軟體層直接影響產能。12
誤讀 2:vLLM、TensorRT-LLM、SGLang 是互斥替代關係。
實際情況:vLLM 更像多租戶開源預設棧,TensorRT-LLM 更像 NVIDIA 硬體最佳化棧,SGLang 更像結構化/Agent 工作流棧,3 條路線會在同一雲端廠按模型、SLA 和客戶型別並存。123
證據:SGLang GitHub 揭露支援 RadixAttention、prefill-decode disaggregation、speculative decoding、continuous batching 和 multi-LoRA batching,NVIDIA 文件同時維護 vLLM、SGLang 和 TensorRT-LLM 容器,說明生態並非單一路線勝出。231617
誤讀 3:推論服務天然高毛利,token 量越大越好。
實際情況:Amazon Q1 2026 TTM FCF 從 259 億美元降至 12 億美元,並將 PPE 增加主要歸因於 AI 投資,說明 token 量增長若伴隨 GPU、HBM、電力和資料中心擴張,短期 FCF 可能反向下降。6
證據:AWS Q1 2026 營收年增率增長 28%且 TTM operating margin 為 35.2%,但集團 TTM FCF margin 僅約 0.2%,營收和現金流量方向在 AI capex 週期內可能背離。6
12. 最新事件
- [已發生] 2026-05-20:NVIDIA 公佈 Q1 FY2027 營收 816.15 億美元 [NVDA]、Data Center 營收 752 億美元,並揭露 Dynamo 1.0 在 Blackwell 上可最高提升 7 倍生成式和 agentic inference 效能。4
- [已發生] 2026-05-05:AMD 公佈 Q1 2026 Data Center 營收 57.75 億美元、年增率增長 57%,並揭露 Meta 計劃部署最高 6GW 的 AMD Instinct GPU,其中首個 1GW 基於 MI450。8
- [已發生] 2026-04-29:Microsoft 公佈 FY2026Q3 Intelligent Cloud 營收 346.81 億美元、年增率增長 30%,Azure 和其他雲端服務營收增長 40%。5
- [已發生] 2026-04-29:Amazon 公佈 Q1 2026 AWS 營收 375.87 億美元、年增率增長 28%,並揭露 AWS chips business 超過 200 億美元年化營收 run rate。6
- [已發生] 2026-04-29:Alphabet 公佈 Q1 2026 Google Cloud 營收 200.28 億美元、年增率增長 63%,Google Cloud operating income 達 65.98 億美元。7
13. 來源 footnotes
1 Efficient Memory Management for Large Language Model Serving with PagedAttention — UC Berkeley / arXiv — 2023-09 — https://arxiv.org/abs/2309.06180 (A)
2 TensorRT LLM / TensorRT-LLM Documentation — NVIDIA Developer / NVIDIA Docs — 2026 — https://developer.nvidia.com/tensorrt-llm ; https://docs.nvidia.com/tensorrt-llm/ (B)
3 SGLang: Efficient Execution of Structured Language Model Programs — LMSYS / arXiv — 2023-12 — https://arxiv.org/abs/2312.07104 (A)
4 NVIDIA Announces Financial Results for First Quarter Fiscal 2027 — NVIDIA Investor Relations — 2026-05-20 — https://investor.nvidia.com/news/press-release-details/2026/NVIDIA-Announces-Financial-Results-for-First-Quarter-Fiscal-2027/default.aspx (B)
5 FY26 Q3 Press Release and Performance — Microsoft Investor Relations — 2026-04-29 — https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast (B)
6 Amazon.com Announces First Quarter 2026 Results — Amazon Investor Relations — 2026-04-29 — https://s2.q4cdn.com/299287126/files/doc_earnings/2026/q1/earnings-result/AMZN-Q1-2026-Earnings-Release.pdf (B)
7 Alphabet Announces First Quarter 2026 Results — Alphabet Investor Relations — 2026-04-29 — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf (B)
8 AMD Reports First Quarter 2026 Financial Results — AMD Investor Relations — 2026-05-05 — https://www.amd.com/en/newsroom/press-releases/2026-5-5-amd-reports-first-quarter-2026-financial-results.html (B)
9 Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference — arXiv — 2026-04 — https://arxiv.org/abs/2604.09613 (A)
10 MLPerf Inference v5.0 Results — MLCommons — 2025-04 — https://mlcommons.org/2025/04/mlperf-inference-v5-0-results/ (A)
11 NVIDIA Blackwell Delivers Massive Performance Leaps in MLPerf Inference v5.0 — NVIDIA Technical Blog — 2025-04 — https://developer.nvidia.com/blog/nvidia-blackwell-delivers-massive-performance-leaps-in-mlperf-inference-v5-0/ (B)
12 Nebius Reports First Quarter 2026 Financial Results — Nebius Group — 2026-05-13 — https://nebius.com/newsroom/nebius-reports-first-quarter-2026-financial-results (B)
13 NVIDIA Financial Ratios and Market Cap Snapshot — StockAnalysis — 2026-05-27 16:00 EDT — https://stockanalysis.com/stocks/nvda/financials/ratios/ (C)
14 AMD Stock Price & Statistics Snapshot — StockAnalysis — 2026-05-27 16:00 EDT — https://stockanalysis.com/stocks/amd/ ; https://stockanalysis.com/stocks/amd/statistics/ (C)
15 Microsoft, Alphabet, Amazon Market Snapshots — StockAnalysis / Finance Feed — 2026-05-27 16:00 EDT — https://stockanalysis.com/stocks/msft/financials/ratios/ ; https://stockanalysis.com/stocks/goog/financials/ratios/ ; https://stockanalysis.com/stocks/amzn/ (C)
16 vLLM Overview — NVIDIA Docs — 2026-04-29 — https://docs.nvidia.com/deeplearning/frameworks/vllm-release-notes/overview.html (B)
17 SGLang Overview — NVIDIA Docs — 2026-04-29 — https://docs.nvidia.com/deeplearning/frameworks/sglang-release-notes/overview.html (B)
18 vLLM Documentation — vLLM Project — 2026 — https://docs.vllm.ai/en/stable/index.html (B)
19 SGLang GitHub Repository — SGLang Project — 2026 — https://github.com/sgl-project/sglang (B)
20 vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention — Microsoft Research / arXiv — 2024-05 — https://arxiv.org/abs/2405.04437 (A)