推理服务
1. 3 秒看懂
推理服务把 GPU 从“训练资产”变成“按 token 周转的产能资产”,2026 年瓶颈从单卡 TFLOPS 转向 KV cache、continuous batching 和尾延时。123
vLLM、TensorRT-LLM 和 SGLang 的差异不是 1 个框架偏好,而是 3 条产能利用率路线:通用吞吐、NVIDIA 深度优化、结构化/Agent 工作流。123
投资上,收入弹性沿“token 量 × 单 token 成本下降 × GPU 利用率提升 × 云厂商加价率”传导,若 P95 延时不降或 GPU 利用率低于 40%,推理服务的毛利扩张会被电力和折旧吞噬。456
2. 3 分钟产业解释
推理服务是把大模型部署成在线 API、批量离线生成或企业专属 endpoint 的系统层,核心目标是在 10-1,000 个并发请求下同时压低首 token 延时、平均 token 成本和 P95/P99 尾延时。12 训练侧的核心变量是集群规模和收敛效率,推理侧的核心变量是 prefill/decode 拆分、KV cache 复用、动态批处理、量化精度和路由调度,因此软件框架能直接改变同一 GPU 的可售 token 容量。123
2025-2026 年,推理需求从“聊天问答”向“长上下文、代码、搜索、RAG、工具调用、Agent”扩散,单次请求的输入 token、输出 token 和 cache 占用同步上升。378 NVIDIA 在 2026 年 5 月披露 Q1 FY2027 数据中心收入 752 亿美元、同比增长 92%,并称 Dynamo 1.0 在 Blackwell 上可把生成式和 agentic inference 提升最高 7 倍,说明推理软件已经进入硬件销售叙事的中心。4
对云厂商,推理服务是把 GPU capex 转成收入的“利用率闸门”。Microsoft FY2026Q3 Intelligent Cloud 收入 346.81 亿美元、同比增长 30%,Azure 和其他云服务增长 40%;Amazon Q1 2026 AWS 收入 375.87 亿美元、同比增长 28%,AWS TTM operating margin 为 35.2%;Alphabet Q1 2026 Google Cloud 收入 200.28 亿美元、同比增长 63%,这 3 组数据共同表明云侧 AI 需求仍在扩张,但资本开支、内存价格和容量交付会决定毛利方向。567
3. 15 分钟专家深入
推理服务的第一层约束是内存而非算力,因为每个请求在 decode 阶段都要保留 KV cache,且长上下文会把显存占用从权重常数项变成“并发数 × 上下文长度”的线性项。19 vLLM 的 PagedAttention 把 KV cache 切成 block 并像虚拟内存一样管理,论文报告在相同延时水平下相对 FasterTransformer 和 Orca 吞吐提升 2-4 倍,投资含义是同一张 H100/H200/B200 可以承载更高并发而非只提升单请求速度。1
第二层约束是调度。传统静态 batching 必须等同批次最慢请求完成,continuous batching 则允许已完成请求退出、新请求插入,因此高并发场景下 GPU idle 时间下降、P50 延时和吞吐的冲突被缓和。210 TensorRT-LLM 的商业价值在于把 in-flight batching、paged KV cache、FP8/FP4/INT4 量化、speculative decoding 和多 GPU/多节点执行打包进 NVIDIA 生态,进而把 Blackwell、NVLink、Triton 和 NIM 的硬件绑定做深。24
第三层约束是工作流结构。SGLang 的 RadixAttention 面向多轮对话、few-shot、RAG 和 Agent 分支,把共享 prefix 的 KV cache 复用为 radix tree,并在论文实验中对结构化任务相对当时系统实现最高 6.4 倍吞吐提升。3 这意味着“推理服务”不能只看每秒 token,还要看 cache hit rate、schema/JSON 输出成功率、tool-call 分支数和请求路由命中率;若 Agent 请求从 1 次生成扩展到 5-20 次模型调用,框架层的缓存和调度收益会被放大。38
可计算口径应拆成 推理服务收入 = 可用 GPU 小时 × GPU 利用率 × 有效 token/s × 单 token 价格 ÷ 1,000,000,再用 毛利 = 收入 - GPU 折旧 - 电力 - 网络 - 运维 约束利润率。456 由于 NVIDIA、AMD、Microsoft、Amazon 和 Alphabet 均未单列“推理服务软件收入”或“vLLM/TensorRT-LLM/SGLang 收入”,本文只能把数据中心硬件收入、云收入和 AI cloud 收入作为上限代理,所有单框架份额必须写成情景假设而非事实。456711
竞争格局上,NVIDIA 拥有 CUDA、TensorRT-LLM、Triton、NIM 和 Dynamo 的一体化优势;AMD 依赖 ROCm、MI300/MI350/MI450 和开源框架适配改善供给弹性;云厂商则通过自研芯片、模型服务和路由层争夺毛利。2468 反证指标是清晰的:若 MLPerf Inference 或公开客户 benchmark 显示非 NVIDIA 平台在 Llama/DeepSeek/Qwen 类模型上持续低于 NVIDIA 性价比 20%以上,AMD/TPU/Trainium 的推理份额会低于资本开支预期;若 vLLM/SGLang 在企业 SLA 场景 P99 不稳定,闭源托管服务会获得更高溢价。1011
4. 技术原理
一次 LLM 推理通常分为 prefill 和 decode 两段,prefill 并行处理输入 token,decode 逐 token 生成输出,因此首 token 延时主要受输入长度、attention kernel 和并行度影响,吞吐主要受 decode 阶段 batch occupancy 和 KV cache 容量影响。12
vLLM 的核心是 PagedAttention、continuous batching、prefix caching 和分布式推理,适合多模型、多租户和 OpenAI-compatible API 场景;TensorRT-LLM 的核心是 engine 编译、NVIDIA kernel、in-flight batching、quantization 和 Triton/NIM 集成,适合 NVIDIA GPU 上追求极致吞吐和 SLA;SGLang 的核心是 RadixAttention、结构化生成、zero-overhead scheduler、prefill-decode disaggregation 和 multi-LoRA batching,适合 Agent/RAG/JSON 输出密集场景。123
推理性能的 5 个关键参数是 TTFT、TPOT、tokens/s、P95/P99 延时和 GPU KV cache usage;其中 TTFT 上升通常代表 prefill 或排队压力,TPOT 上升通常代表 decode batch 或显存压力,KV cache usage 接近 90%会显著增加抢占、换页或拒绝请求风险。19 工程上,FP8/FP4/INT4 量化、speculative decoding、chunked prefill、prefix cache 和 disaggregated serving 能把单位 token 成本下降 10%-70%不等,但具体收益必须由模型、上下文长度和流量分布验证,不能直接从单模型 benchmark 外推到全部生产负载。2310
5. 上游依赖 / 下游影响
上游依赖
- GPU/ASIC:NVIDIA Q1 FY2027 数据中心 compute 收入 604 亿美元、networking 收入 148 亿美元,推理服务的可售 token 产能仍高度依赖 Blackwell/Rubin、NVLink、InfiniBand/Ethernet 和 HBM 供给。4
- 替代加速器:AMD Q1 2026 Data Center 收入 57.75 亿美元、同比增长 57%,且 Meta 与 AMD 计划部署最高 6GW 的 AMD Instinct GPU,说明 MI450 进入 2027 年后有机会形成推理供给第二来源。8
- 云容量:AWS Q1 2026 披露 210 万颗以上 AI chips 在过去 12 个月落地、其中超过一半为 Trainium,并计划从 2026 年开始部署 100 万颗以上 NVIDIA GPU,云侧推理服务会同时消耗自研芯片和 NVIDIA 供给。6
- 内存与电力:Amazon Q1 2026 TTM FCF 从 259 亿美元降至 12 亿美元,并明确 AI 投资带动 PPE 采购增加 593 亿美元,说明推理服务即使收入高增长也会显著压低自由现金流。6
下游影响
- 云 API:Microsoft FY2026Q3 Microsoft Cloud 收入 545 亿美元 [MSFT]、同比增长 29%,Azure 和其他云服务增长 40%,推理服务的价格体系会直接影响 Azure OpenAI、Foundry 和企业 Agent 的毛利率。5
- 搜索与广告:Alphabet Q1 2026 Google Cloud 收入 200.28 亿美元、Google Cloud operating income 65.98 亿美元,推理服务的成本下降会提高 Gemini API、AI Search 和企业工作流的单位经济性。7
- AI cloud:Nebius Q1 2026 宣布 Pennsylvania AI factory 获得最高 1.2GW 电力和土地,专用 AI cloud 的推理服务竞争会从“谁有 GPU”升级为“谁能把 GPU 转成低延时 SLA”。12
- 应用层:Agent 请求可能把单用户交互从 1 次模型调用扩展到 5-20 次工具链调用,若 cache hit rate 和调度效率不能同步提高,应用层 gross margin 会随 token 量上升而下降。39
6. 技术路线对比表
| 路线 | 速率/单位 | 典型功耗或成本变量 | 距离或维度 | 标准成熟度 | 量产概率 2026 | 反证指标 |
|---|---|---|---|---|---|---|
| vLLM + PagedAttention | 论文报告吞吐提升 2-4x | 显存碎片下降、GPU 利用率上升 | 多模型 API、多租户、OpenAI-compatible | Linux Foundation/开源生态成熟 | 85% | P99 延时在企业 SLA 下连续 2 个季度劣于托管闭源服务 |
| TensorRT-LLM + Triton/NIM | NVIDIA 披露 Dynamo 最高 7x 推理提升 | FP8/FP4/INT4、Blackwell kernel、NVLink | NVIDIA GPU 单集群到多节点 | NVIDIA 官方生产栈成熟 | 90% | 非 NVIDIA 框架在同模型同功耗下性价比高出 20%以上 |
| SGLang + RadixAttention | 论文报告结构化任务最高 6.4x | Prefix KV 复用、zero-overhead scheduler | Agent/RAG/JSON/多轮对话 | 开源快速迭代,企业 SLA 待验证 | 70% | Radix cache hit rate 低于 20%且结构化输出失败率高于 1% |
| Speculative decoding | 1 个小模型 draft + 1 个大模型 verify | 额外显存换取 decode 加速 | 输出 token 密集型任务 | TensorRT-LLM/vLLM/SGLang 均在推进 | 65% | 接受率低于 40%导致额外算力成本高于节省 |
| Prefill-decode disaggregation | prefill 节点与 decode 节点分离 | 网络传输 KV cache 换取资源匹配 | 长上下文、RAG、批量生成 | 2025-2026 年由框架和云厂加速验证 | 55% | KV 传输带宽或排队延时抵消 10%以上吞吐收益 |
| 自研云芯片推理栈 | Trainium/TPU/ASIC tokens/s 待按模型披露 | 折旧、软件适配和可用模型生态 | 云内闭环 API | AWS/Google 成熟度高于第三方生态 | 60% | 主流开源模型适配慢于 NVIDIA 2 个版本周期以上 |
7. 关键指标
- TTFT:按模型和上下文长度分层追踪,若 8k context 的 P95 TTFT 连续 2 周上升 30%以上,说明 prefill 或排队成为瓶颈。12
- TPOT:按输出 token 流式追踪,若 TPOT 高于 SLA 目标 20%以上,说明 decode batch、量化或 KV cache 压力需要重调。210
- GPU 利用率:按
SM utilization × memory bandwidth utilization × batch occupancy拆分,若平均 GPU 利用率低于 40%,推理服务的折旧吸收能力弱于收入增长。19 - KV cache usage:按 P50/P95 监控,若 P95 长期超过 90%,抢占、OOM 或请求拒绝概率上升,且长上下文业务会压缩短请求可用并发。19
- Prefix/cache hit rate:RAG、few-shot 和 Agent 工作流应高于普通聊天,若 SGLang/vLLM prefix hit rate 低于 20%,缓存路线对毛利的贡献低于预期。3
- tokens/$:按硬件、框架、模型和上下文长度追踪,若 Blackwell/TensorRT-LLM 相对 H100/vLLM 的成本改善低于 20%,硬件升级 ROI 会被延后。24
- P95/P99 SLA:按客户 tier 和区域追踪,若 P99 高于 P50 的 5 倍以上,企业 API 的溢价会转向托管闭源服务或专属容量。56
8. 可算传导表
| 驱动变量 | NVIDIA | AMD | Nebius | 来源/公式 |
|---|---|---|---|---|
| TAM | Q1 FY2027 Data Center 收入 752 亿美元作为推理/训练硬件上限代理 | Q1 2026 Data Center 收入 57.75 亿美元作为 GPU+CPU 数据中心上限代理 | FY2026 revenue guidance 30-34 亿美元待以股东信核对;Q1 2026 AI cloud 收入需从 PDF 补表 | 4812 |
| 出货/容量 | Blackwell/Dynamo 已量产;GPU 出货未披露,标 [未核实 — 待补 A/B 源] | MI450 首个 1GW Meta deployment 从 2027 年开始,2026 出货未披露 | Pennsylvania 最高 1.2GW 电力和土地,GPU 数未披露 | 4812 |
| ASP/单价 | GPU/系统 ASP 未披露,用 Data Center revenue ÷ shipped units 待补 A/B 源 | Instinct ASP 未披露,用 Data Center GPU revenue ÷ shipped units 待补 A/B 源 | AI cloud 单 GPU 小时价格未披露,用 AI cloud revenue ÷ billable GPU hours 待补 A/B 源 | 4812 |
| 份额 | 情景假设推理 GPU 份额 70%/80%/90%,非公司披露 | 情景假设推理 GPU 份额 5%/10%/15%,非公司披露 | 情景假设专用 AI cloud 份额 1%/2%/3%,非公司披露 | 情景推算 |
| 收入 | 有效 GPU 小时 × tokens/s × token 价格;硬件代理为 752 亿美元/季 | 有效 GPU 小时 × tokens/s × token 价格;硬件代理为 57.75 亿美元/季 | 可售 GPU 小时 × 利用率 × GPU 小时单价;公司收入 guidance 待核 | 4812 |
| 毛利 | Q1 FY2027 GAAP GM 74.9%,752 × 74.9% = 563.0 亿美元 数据中心粗代理 | Q1 2026 GAAP GM 53%,57.75 × 53% = 30.61 亿美元 数据中心粗代理 | 毛利率待披露;AI cloud 折旧和电力会压低早期 GM | 4812 |
| PE | 2026-05-27 16:00 EDT 收盘价 212.60 美元 [NVDA],市值 5.15 万亿美元 [NVDA],PE TTM 32.56x [NVDA] | 2026-05-27 收盘价 495.54 美元,市值 8,080.3 亿美元,PE TTM 168.03x | NBIS PE 因早期亏损不适用,应用 EV/Sales 或 EV/ARR | 131415 |
| 估值 | Data Center EBIT × 目标 PE,若推理收入占比提升且 GM 维持 70%+,估值中枢上行 | Data Center EBIT × 目标 PE,若 MI450 份额达 10%且软件适配改善,估值弹性高但 PE 容错低 | FY2026 revenue × EV/Sales,若利用率低于 50%,估值从容量溢价转向折旧折价 | 推算 |
9. 同业硬指标对比表
| 公司 | 收入 | 增速 | GM/OM | 净利 | FCF margin | 客户集中度 | 技术代际 | PE TTM | 反证条件 |
|---|---|---|---|---|---|---|---|---|---|
| NVIDIA | Q1 FY2027 收入 816.15 亿美元 [NVDA],Data Center 752 亿美元 [NVDA] | 总收入 +85%,Data Center +92% | GAAP GM 74.9% | GAAP net income 583.21 亿美元 | 待 10-Q 现金流表补齐 | Hyperscale 约占 Data Center 50%,其余 ACIE 约 50% | Blackwell、Dynamo 1.0、TensorRT-LLM | 32.56x [NVDA],2026-05-27 16:00 EDT,美元,StockAnalysis TTM | Data Center networking 或 compute 环比低于 10%,且 Dynamo 客户 adoption 不达预期 |
| AMD | Q1 2026 收入 102.53 亿美元,Data Center 57.75 亿美元 | 总收入 +38%,Data Center +57% | GAAP GM 53%,Data Center op margin 27.7% | GAAP net income 13.83 亿美元 | FCF margin 25% | Meta 最高 6GW 合作形成单一大客户验证风险 | MI300/MI350/MI450、ROCm、vLLM/SGLang 适配 | 168.03x,2026-05-27 收盘,美元,StockAnalysis TTM | MI450 2027 1GW 部署延期,或 ROCm 主流模型落后 NVIDIA 2 个版本周期 |
| Microsoft | FY2026Q3 收入 828.86 亿美元 [MSFT],Intelligent Cloud 346.81 亿美元 | 总收入 +18%,Intelligent Cloud +30% | Microsoft Cloud GM 66% | net income 317.78 亿美元 | FCF margin 待 10-Q 补齐 | OpenAI commitments 影响 bookings,客户集中度未单列 | Azure AI、Foundry、OpenAI、NVIDIA/自研混合 | 24.58x [MSFT],2026-05-27,美元,StockAnalysis TTM | Azure AI capacity 交付低于需求,且 Cloud GM 连续 2 季下行 |
| Alphabet | Q1 2026 收入 1,098.96 亿美元,Google Cloud 200.28 亿美元 | 总收入 +22%,Cloud +63% | Cloud operating margin 32.9% | net income 626 亿美元 | FCF margin 待 10-Q 补齐 | Search 仍占利润核心,Cloud backlog 待逐季转化 | TPU、Gemini、Vertex AI、vLLM/自研 Serving | 29.27x,2026-05-27,美元,StockAnalysis GOOG TTM | Cloud 增速回落至 30%以下且 TPU 供给不能缓解容量约束 |
| Amazon | Q1 2026 收入 1,815.19 亿美元,AWS 375.87 亿美元 | 总收入 +17%,AWS +28% | AWS TTM OM 35.2% | net income 302.55 亿美元 | TTM FCF margin 0.2% | OpenAI 2GW、Anthropic 5GW、Meta Graviton cores 提高大客户集中度 | Trainium、Graviton、Bedrock、NVIDIA GPU | 32.52x,2026-05-27,美元,行情快照 | AWS chips 20B run-rate 不能转化为推理服务毛利,且 FCF 连续 2 季接近 0 |
| Nebius | Q1 2026 收入和 ARR 需以股东信补表;公开披露最高 1.2GW 新 AI factory | 公开披露 AI cloud 高增长,精确增速待 PDF 补表 | 早期 AI cloud margin 待披露 | 早期利润率待披露 | 早期 FCF 待披露 | Microsoft/NVIDIA 等大客户和供应商集中度高 | NVIDIA full-stack AI cloud、Token Factory | PE 不适用,早期亏损/高折旧 | 1.2GW 站点延后、融资成本上升或 GPU 利用率低于 50% |
10. 投资逻辑 + 业绩传导
推理服务的主线是“训练 capex 的二次变现”。2026 年 NVIDIA Data Center 已达 752 亿美元/季,Microsoft、Amazon 和 Alphabet 的云业务分别以 30%、28%和 63%增速扩张,说明模型服务需求仍在把 GPU/ASIC 产能转成云收入。4567 但推理不像训练一次性占满集群,收入兑现更依赖流量波峰、长上下文分布、cache hit rate 和多租户调度,因而 vLLM、TensorRT-LLM、SGLang 这类框架会决定同一 capex 的周转率。123
估值落点分 3 层:NVIDIA 和 AMD 享受硬件和软件绑定溢价,Microsoft/Google/Amazon 享受推理 API 和企业 Agent 的云毛利溢价,Nebius/CoreWeave 类 AI cloud 享受稀缺容量溢价但承担折旧和融资波动。45612 反证阈值是 3 个:GPU 利用率低于 40%、P99/P50 高于 5 倍、单位 token 成本 2 个季度没有下降;任一阈值成立,推理服务从“软件杠杆”退回“重资产出租”。1910
企业/消费者 Agent 请求数 × 每请求 5-20 次模型调用
↓
输入/输出 token × context length × cache hit rate
↓
vLLM / TensorRT-LLM / SGLang 调度效率
↓
GPU 有效利用率 × tokens/s × 单 token 价格
↓
云收入 - GPU折旧 - 电力 - 网络 - 运维
↓
FCF × PE / EV-Sales = 情景市值框架
11. 常见误读纠偏
误读 1:推理服务只要 GPU 更多,收入就线性增长。
实际情况:推理收入由 GPU 小时 × 利用率 × tokens/s × token price 决定,GPU 数只是第一项,KV cache、continuous batching 和路由效率会让同一 GPU 的可售 token 量出现 2-4 倍差异。19
证据:vLLM 论文报告 PagedAttention 在相同延时下提升 2-4 倍吞吐,NVIDIA TensorRT-LLM 文档把 in-flight batching、paged KV cache 和量化列为核心推理优化,二者共同说明软件层直接影响产能。12
误读 2:vLLM、TensorRT-LLM、SGLang 是互斥替代关系。
实际情况:vLLM 更像多租户开源默认栈,TensorRT-LLM 更像 NVIDIA 硬件优化栈,SGLang 更像结构化/Agent 工作流栈,3 条路线会在同一云厂按模型、SLA 和客户类型并存。123
证据:SGLang GitHub 披露支持 RadixAttention、prefill-decode disaggregation、speculative decoding、continuous batching 和 multi-LoRA batching,NVIDIA 文档同时维护 vLLM、SGLang 和 TensorRT-LLM 容器,说明生态并非单一路线胜出。231617
误读 3:推理服务天然高毛利,token 量越大越好。
实际情况:Amazon Q1 2026 TTM FCF 从 259 亿美元降至 12 亿美元,并将 PPE 增加主要归因于 AI 投资,说明 token 量增长若伴随 GPU、HBM、电力和数据中心扩张,短期 FCF 可能反向下降。6
证据:AWS Q1 2026 收入同比增长 28%且 TTM operating margin 为 35.2%,但集团 TTM FCF margin 仅约 0.2%,收入和现金流方向在 AI capex 周期内可能背离。6
12. 最新事件
- [已发生] 2026-05-20:NVIDIA 公布 Q1 FY2027 收入 816.15 亿美元 [NVDA]、Data Center 收入 752 亿美元,并披露 Dynamo 1.0 在 Blackwell 上可最高提升 7 倍生成式和 agentic inference 性能。4
- [已发生] 2026-05-05:AMD 公布 Q1 2026 Data Center 收入 57.75 亿美元、同比增长 57%,并披露 Meta 计划部署最高 6GW 的 AMD Instinct GPU,其中首个 1GW 基于 MI450。8
- [已发生] 2026-04-29:Microsoft 公布 FY2026Q3 Intelligent Cloud 收入 346.81 亿美元、同比增长 30%,Azure 和其他云服务收入增长 40%。5
- [已发生] 2026-04-29:Amazon 公布 Q1 2026 AWS 收入 375.87 亿美元、同比增长 28%,并披露 AWS chips business 超过 200 亿美元年化收入 run rate。6
- [已发生] 2026-04-29:Alphabet 公布 Q1 2026 Google Cloud 收入 200.28 亿美元、同比增长 63%,Google Cloud operating income 达 65.98 亿美元。7
13. 来源 footnotes
1 Efficient Memory Management for Large Language Model Serving with PagedAttention — UC Berkeley / arXiv — 2023-09 — https://arxiv.org/abs/2309.06180 (A)
2 TensorRT LLM / TensorRT-LLM Documentation — NVIDIA Developer / NVIDIA Docs — 2026 — https://developer.nvidia.com/tensorrt-llm ; https://docs.nvidia.com/tensorrt-llm/ (B)
3 SGLang: Efficient Execution of Structured Language Model Programs — LMSYS / arXiv — 2023-12 — https://arxiv.org/abs/2312.07104 (A)
4 NVIDIA Announces Financial Results for First Quarter Fiscal 2027 — NVIDIA Investor Relations — 2026-05-20 — https://investor.nvidia.com/news/press-release-details/2026/NVIDIA-Announces-Financial-Results-for-First-Quarter-Fiscal-2027/default.aspx (B)
5 FY26 Q3 Press Release and Performance — Microsoft Investor Relations — 2026-04-29 — https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast (B)
6 Amazon.com Announces First Quarter 2026 Results — Amazon Investor Relations — 2026-04-29 — https://s2.q4cdn.com/299287126/files/doc_earnings/2026/q1/earnings-result/AMZN-Q1-2026-Earnings-Release.pdf (B)
7 Alphabet Announces First Quarter 2026 Results — Alphabet Investor Relations — 2026-04-29 — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf (B)
8 AMD Reports First Quarter 2026 Financial Results — AMD Investor Relations — 2026-05-05 — https://www.amd.com/en/newsroom/press-releases/2026-5-5-amd-reports-first-quarter-2026-financial-results.html (B)
9 Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference — arXiv — 2026-04 — https://arxiv.org/abs/2604.09613 (A)
10 MLPerf Inference v5.0 Results — MLCommons — 2025-04 — https://mlcommons.org/2025/04/mlperf-inference-v5-0-results/ (A)
11 NVIDIA Blackwell Delivers Massive Performance Leaps in MLPerf Inference v5.0 — NVIDIA Technical Blog — 2025-04 — https://developer.nvidia.com/blog/nvidia-blackwell-delivers-massive-performance-leaps-in-mlperf-inference-v5-0/ (B)
12 Nebius Reports First Quarter 2026 Financial Results — Nebius Group — 2026-05-13 — https://nebius.com/newsroom/nebius-reports-first-quarter-2026-financial-results (B)
13 NVIDIA Financial Ratios and Market Cap Snapshot — StockAnalysis — 2026-05-27 16:00 EDT — https://stockanalysis.com/stocks/nvda/financials/ratios/ (C)
14 AMD Stock Price & Statistics Snapshot — StockAnalysis — 2026-05-27 16:00 EDT — https://stockanalysis.com/stocks/amd/ ; https://stockanalysis.com/stocks/amd/statistics/ (C)
15 Microsoft, Alphabet, Amazon Market Snapshots — StockAnalysis / Finance Feed — 2026-05-27 16:00 EDT — https://stockanalysis.com/stocks/msft/financials/ratios/ ; https://stockanalysis.com/stocks/goog/financials/ratios/ ; https://stockanalysis.com/stocks/amzn/ (C)
16 vLLM Overview — NVIDIA Docs — 2026-04-29 — https://docs.nvidia.com/deeplearning/frameworks/vllm-release-notes/overview.html (B)
17 SGLang Overview — NVIDIA Docs — 2026-04-29 — https://docs.nvidia.com/deeplearning/frameworks/sglang-release-notes/overview.html (B)
18 vLLM Documentation — vLLM Project — 2026 — https://docs.vllm.ai/en/stable/index.html (B)
19 SGLang GitHub Repository — SGLang Project — 2026 — https://github.com/sgl-project/sglang (B)
20 vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention — Microsoft Research / arXiv — 2024-05 — https://arxiv.org/abs/2405.04437 (A)