Usage Expansion
3秒看懂
Usage Expansion(使用量扩张):指人工智能(AI)算力需求从模型训练为主转向训练与推理并重、且推理需求占比急速攀升并成为主导力量的结构性转变。其核心是“用模型”的次数和强度远超“炼模型”,驱动算力总量持续增长并重构产业链价值分布。
3分钟产业解释
过去数年,AI产业的核心叙事是“训练”——用成百上千个GPU,花费数月,训练出一个能力强大的基础大模型。这个过程需要一次性、脉冲式的巨大计算资源投入,业内常称之为“炼丹”。
当前更深刻、更持久的趋势是Usage Expansion。当基础模型(如GPT‑4、Llama 3、文心大模型等)被训练出来后,真正的商业价值在于将其部署到亿万个应用场景中去。每一次用户提问、每一张AI生成的图片、每一段代码补全、每一次自动驾驶的决策,都是一次模型推理。随着AI应用从早期采用者扩散至主流企业与消费者,推理请求的数量正以指数级增长。
由此带来算力需求结构的根本变化:
- 训练需求:持续增长,驱动力来自更大规模的多模态模型、更长上下文的模型、强化学习对齐技术(如RLHF)以及新领域模型的不断涌现。
- 推理需求:爆发式增长,成为增长主引擎。它具有高并发、低延迟、持续不断的特点,并直接与商业收入和用户规模挂钩。
对于产业链而言,这意味着机会与挑战的转移:从支撑“炼丹”的高端训练集群,更多转向支撑大规模、高效率、低成本“用丹”的推理系统,并催生自研芯片、边缘推理等全新战场。
技术原理
Usage Expansion 的底层是推理计算模式的独特性,使其能够进行一系列专门优化,从而在给定硬件上最大化服务效率、压低成本。
1. 计算模式的根本差异 推理的核心是基于固定计算图的前向传播。与训练不同,它没有反向传播和梯度更新,计算图在模型加载后保持不变,这使得大量离线与在线优化成为可能。
2. 推理优化技术栈 现代推理服务依赖多层协同优化:
+-------------------------------------------------------+
| 应用层 (API, Chatbot, Agent) |
+--------------------------|----------------------------+
请求与批处理调度 (Dynamic Batching)
+-------------------------------------------------------+
| 模型编译器 & 优化器 (TensorRT-LLM, vLLM) |
| +-------------+ +-------------+ +------------------+ |
| | 算子融合 | | 内存规划 | | 计算图优化 | |
| +-------------+ +-------------+ +------------------+ |
+-------------------------------------------------------+
| 运行时 (CUDA, ROCm, SYCL, OneAPI) |
+--------------------------|----------------------------+
量化 (INT8, FP8, GPTQ, AWQ)
+-------------------------------------------------------+
| 硬件层 (GPU, ASIC, NPU, CPU) |
| +-------------+ +-------------+ +------------------+ |
| | 计算单元 | | 高速缓存 | | 内存带宽 (HBM) | |
| +-------------+ +-------------+ +------------------+ |
+-------------------------------------------------------+
- 动态批处理(Dynamic Batching):将同时到达的多个请求合并为一个批次进行计算,极大提升硬件利用率(MFU),是吞吐量提升的关键。
- 量化(Quantization):将模型权重和激活值从较高的浮点精度(FP32/FP16)转换为低精度(INT8、FP8),甚至近期出现的4‑bit量化(如GPTQ、AWQ),以减少内存占用和计算量。量化是降低单次推理成本的杀手锏技术,通常可将推理成本降低50%~80%,且通过模型校准几乎不损失质量。
- KV缓存(Key‑Value Cache):对于自回归生成式模型(如大语言模型),对已计算的键(Key)和值(Value)向量进行缓存,避免在每生成一个 token 时重复计算历史 token 的注意力,是空间换时间的经典策略。KV缓存管理(如PagedAttention)是vLLM等框架的核心创新。
- 算子融合与编译优化:将多个细粒度的算子(如矩阵乘法、激活函数、LayerNorm)融合为单个优化内核,减少显存访问次数和Kernel Launch开销。TensorRT‑LLM、MLIR等工具链即侧重于此。
- 推测解码(Speculative Decoding):用一个轻量级“草稿模型”快速生成多个候选 token,再由目标大模型一次验证,从而在保持输出分布不变的前提下,实现2倍~3倍的推理加速,尤其适合大语言模型。
上述技术共同指向一个商业目标:极致降低每百万 token 的生成成本,这也是Usage Expansion在经济学上能够成立的核心支柱。
关键参数
判断推理系统效率和产业景气度的核心指标:
- 推理吞吐量(Tokens/s 或 Images/s 或 Requests/s):单位时间内可处理的请求量,直接决定服务容量和收入潜力。对于大语言模型,常以每秒生成 token 数(TGS)衡量。
- 推理延迟(Latency):
- 首 token 延迟(Time to First Token, TTFT):用户感知响应速度的关键,影响交互体验。
- 每 token 延迟(Inter‑token Latency):影响生成流式输出的流畅度。
- 每请求/每百万 token 成本(Cost per Request / per 1M tokens):推理经济学的核心。它由硬件采购成本摊销、电力成本、软件优化水平、硬件利用率等共同决定。例如,某头部模型API定价在2024年中已降至每百万输入 token 约 $0.15、输出 token $0.60(来源:OpenAI定价页面,2024年8月),且仍在快速下降。
- 硬件利用率(Model FLOPs Utilization, MFU):实际算力与硬件理论峰值算力的比值。典型训练MFU约在35%~50%,而推理通过深度优化可达60%~80%甚至更高。
- 能效比(TOPS/W):每瓦功耗提供的算力,是衡量推理硬件——尤其是边缘端和超大规模数据中心——竞争力的核心。根据公开芯片规格,英伟达H200的FP8推理能效比约为3.2 TOPS/W(来源:NVIDIA H200 数据表,2024年)。
- 总计算量(Training FLOPs):虽主要表示训练需求,但模型规模的膨胀(如从百亿参数到万亿参数)直接抬高单次推理的算力门槛,从而放大推理总需求。
- 显存带宽与容量:大语言模型推理的性能瓶颈多在显存带宽而非算力,HBM的容量和带宽直接决定单个加速卡可服务的最大模型规模与批处理大小。
技术路线
技术演进路径
- 前奏期 (2012–2017):深度学习复兴,小模型推理与训练需求混杂,GPU通用性足够,无明显推理专用设计。
- 分化期 (2018–2022):Transformer及大型语言模型(GPT‑3)出现,大规模训练集群成为焦点,NVIDIA A100等训练卡主导。推理需求增长但被视为附属,部分云厂商开始定制推理芯片(如AWS Inferentia 2019发布)。
- 爆发前夜 (2022–2023):ChatGPT引爆生成式AI,首次让亿万用户体验到对话式AI能力,推理请求量垂直攀升。产业开始严肃讨论“推理经济学”。
- 扩张确认期 (2023–至今):多模态模型、AI Agent、具身智能等应用涌现,推理场景多元化。云厂商财报显示AI相关收入(主要由推理驱动)增长迅猛。NVIDIA推出专用推理卡(L40S)及推理软件栈(TensorRT‑LLM),AMD MI300X强化推理性能,自研芯片加速迭代。
训练与推理的技术路线对比
| 维度 | 模型训练 | 模型推理 |
|---|---|---|
| 核心目标 | 最小化损失函数,学习数据分布 | 最小化延迟/成本,最大化吞吐 |
| 计算模式 | 前向+反向传播,通信密集(AllReduce) | 仅前向传播,计算密集带宽 |
| 数据特征 | 大规模静态数据集 | 流式、动态、持续的用户请求 |
| 精度需求 | 倾向高精度(FP32/BF16/TF32)以保证收敛 | 可接受低精度(INT8/FP8/INT4)以提效率 |
| 硬件瓶颈 | 算力、显存容量、互联带宽 | 显存带宽、能效比(TOPS/W)、推理专用引擎 |
| 优化关键 | 数据并行、模型并行、梯度同步 | 量化、KV缓存、批处理、算子融合、推测解码 |
| 商业模式 | 项目制、资源租赁 | 按调用量收费,与最终用户量线性绑定 |
| 代表软件栈 | Megatron‑LM, DeepSpeed | TensorRT‑LLM, vLLM, Triton Inference Server |
产业的长期路线聚焦于:更大规模的推理集群(可达数万卡)、更高效的专用推理芯片、云端‑边缘混合推理架构,以及更先进的模型压缩与系统调度技术。
上游
算力硬件
- GPU/加速卡:英伟达(Hopper/H100、H200、L40S,2024年发布Blackwell B200)、AMD(MI300X于2024年量产)是主要供应商。据Mercury Research 2024年Q2报告,英伟达在数据中心GPU市场份额超过90%(销售额口径)。
- 定制AI芯片(ASIC):云厂商自研芯片占比提升。谷歌TPU v5p(2023年推出)、AWS Trainium2/Inferentia2、微软Maia 100(2024年部署)、Meta MTIA v2等。Omdia在2024年报告中估算,2023年云厂商自研AI加速器出货约占总AI加速器的~15%(单位数量)。
- 边缘推理芯片:高通骁龙8 Gen 3/ X Elite(集成NPU)、苹果M4芯片、联发科天玑9300等移动SoC均大幅提升终端AI推理能力,典型INT8算力超过40 TOPS。
- HBM内存:推理性能严重依赖显存带宽,HBM为关键上游。SK海力士、三星、美光三足鼎立,2024年HBM3E为主要供应。据TrendForce 2024年8月报告,HBM在整体DRAM产能中占比已超5%,预计2025年进一步上升,供应仍偏紧。
互联与封装
- 片间互联:NVLink、Infinity Fabric,保证多卡推理扩展性。
- Chiplet先进封装:台积电CoWoS(Chip‑on‑Wafer‑on‑Substrate)产能直接制约高端GPU和AI芯片供应。台积电2024年Q2法说会预计CoWoS产能至2025年底将翻倍,但仍供不应求。
软件与工具链
- AI编译器与框架:TensorRT‑LLM、vLLM、OpenAI Triton、MLIR等构成推理软件栈的核心。英伟达CUDA生态仍处垄断地位,AMD ROCm正加速追赶,自主生态如华为CANN亦在成长。
下游
Usage Expansion 的最终驱动力来自广袤的下游应用,将推理请求量分摊至不同的行业和场景:
- 云端API与对话服务:ChatGPT、Claude、文心一言等大模型对话服务,是当前推理流量的最大来源之一。根据Similarweb估计,ChatGPT网站在2024年3月的访问量达~18亿次,每次访问可能产生多次推理调用。
- AI搜索与内容生成:微软Copilot、谷歌AI Overviews将推理融入搜索引擎,每一次搜索都可能触发大模型推理。图像生成模型(如DALL‑E 3、Midjourney、Stable Diffusion)每次生成即是推理。
- 代码辅助:GitHub Copilot每日为超百万开发者提供代码补全,其推理调用已是数十亿次/天量级。据微软2024财年Q4电话会议,GitHub Copilot带来的年化营收已超过20亿美元(基于公开披露口径推算),侧面映射出巨大推理负载。
- 企业知识库与Agent:Salesforce Einstein GPT、ServiceNow、SAP Joule等将推理嵌入企业工作流;AI Agent执行多步推理(如AutoGPT、Claude Computer Use),每步调用皆需模型推理。
- 自动驾驶与机器人:特斯拉的端到端驾驶算法、机器人的动作规划均需在车端或边缘进行实时推理,对低延迟和可靠性要求极高。
- AI PC与手机:AI PC(如联想、戴尔的新品)和AI手机通过端侧推理实现照片修图、通话摘要、离线翻译等。IDC在2024年6月预测,2024年全球AI PC出货量将达到约5000万台,2027年渗透率超过60%。
下游最核心的逻辑是:推理请求量直接绑定终端用户数与使用频次,因此下游应用的用户基数和活跃度成为判断Usage Expansion实际进度的领先指标。
受益公司
以下分类旨在说明产业链位置和受益逻辑,不构成任何投资建议。
算力硬件层
- 英伟达:通过数据中心GPU(H100/B200)和推理软件(TensorRT‑LLM)占据主导地位。2025财年Q1(截至2024年4月)数据中心收入达226亿美元,同比增长427%,其中推理相关营收占比管理层在财报电话会中称已达约40%。(来源:英伟达2025财年Q1财报及电话会议)
- AMD:MI300X于2024年量产,ROCm生态逐渐完善,主要受益于推理多元化需求和对第二供应方的渴求。
- 云厂商自研芯片部门:谷歌、AWS、微软等通过自研推理芯片降低外采依赖,自研芯片主要供内部服务使用,长期有利于优化大模型服务成本。
- 边缘AI SoC芯片:高通、联发科、苹果等,受益于端侧推理装载,将NPU作为SoC的关键差异化功能,驱动换机周期。
云与模型平台层
- 微软Azure、AWS、Google Cloud:提供GPU租赁和模型API服务,是推理需求扩大的直接变现者。微软Azure AI服务收入在2024财年Q2首次披露超33亿美元(年化),并称大部分为推理贡献(来源:微软2024财年Q2财报电话会议)。Gartner 2024年7月报告估计,2024年全球AI云服务市场(含推理即服务)规模将超过550亿美元。
模型与应用层
- OpenAI、Anthropic、Google DeepMind:提供前沿模型API,按调用量收费,推理扩张直接转化为营收增长。据The Information 2024年6月报道,OpenAI年化营收已超过34亿美元,其中绝大部分来自推理API及ChatGPT订阅。
- 开源模型厂商与ISV:Meta(Llama)、Mistral等推动开源模型生态,降低推理使用门槛,间接加速用量扩张。广泛的独立软件开发商(ISV)将模型嵌入垂直行业SaaS,是推理需求的最终播种机。
受益逻辑总结:Usage Expansion的确定性受益链条为“底层硬件→云基础设施→模型API→终端应用”的逐层传导,其中硬件与云层在上行周期中受益较早和较确定,而应用层的价值释放决定整个叙事能否长期持续。
市场规模
市场规模数据因覆盖范围、口径不同差异较大,以下列举基于第三方机构报告的公开估算,需注意各自假设。
- AI推理芯片市场:Omdia在2024年7月报告中预测,全球AI推理加速器市场(包含GPU、ASIC等)将从2023年的约150亿美元增长至2028年的780亿美元,年复合增长率约39%。该机构认为推理加速器市场份额将很快超过训练芯片。
- AI服务器市场:TrendForce在2024年1月报告估算,2023年AI服务器出货量约为120万台,同比增长约28%,其中推理服务器占比约35%,预计2025年推理占比将提升至近50%。DIGITIMES Research指出,2024年AI服务器出货将增长约20%。(含有预测)
- 推理即服务市场:MarketsandMarkets在2023年12月发布报告,预计全球推理即服务(Inference as a Service)市场规模从2023年的94亿美元增长到2028年的332亿美元,预测基于API调用收入及定制推理平台。(注:该报告尚未覆盖最新growing,作为参考)
- 端侧AI芯片市场:Strategy Analytics拆解数据指出,2023年全球带有AI引擎的智能手机出货量占比已超90%;Counterpoint预测,AI手机渗透率在2024年将达20%,其推理算力总和将极为可观。公开资料未见完整规模预测的统一口径。
- 全口径AI计算市场:IDC在2024年5月发布的Worldwide AI Infrastructure Tracker中,将AI计算支出分为训练与推理,认为2024年推理支出增速将首次超过训练,并预计2027年推理支出将达AI计算总额的60%以上。但具体美元数字因报告非公开而省略。
注:上述预测均基于公开摘要或引用,各机构方法论和统计口径不同,不宜直接加总比较。增长方向的一致性高于绝对数值。
玩家对比
基于当前主流推理硬件平台的关键维度对比(截至2024年底已公开信息):
| 维度 | 英伟达 H200 / Blackwell | AMD MI300X | 谷歌 TPU v5p | AWS Inferentia2 |
|---|---|---|---|---|
| 芯片定位 | 通用AI训练/推理GPU | 通用AI加速GPU | 自研云推理/训练ASIC | 自研云专用推理ASIC |
| FP8峰值算力 | ~1,979 TFLOPS (B200) | ~1,307 TFLOPS (FP8稀疏) | ~459 TFLOPS (per chip) | 公开资料未见 |
| HBM容量/带宽 | H200:141GB/4.8TB/s; B200:192GB/8TB/s | 192GB/5.3TB/s | 95GB (HBM2E)/2.76TB/s | 32GB HBM/1.15TB/s (单个芯片) |
| 推理优化软件 | TensorRT‑LLM, vLLM | ROCm, 兼容vLLM等(移植中) | JAX, TensorFlow Serving | Neuron SDK |
| 生态成熟度 | 极高,CUDA护城河深 | 中等,ROCm快速迭代,部分模型支持良好 | 高(内部优化,外部有限) | 内部优化,仅限AWS |
| 供货模式 | OEM/ODM服务器及云租赁 | OEM/ODM服务器及云租赁 | 仅通过GCP提供云服务 | 仅通过AWS提供云服务 |
| 典型推理性能(Llama‑3‑70B) | >10,000 tokens/s / 8‑GPU 服务器 (来源: 英伟达博客) | ~8,000 tokens/s / 8‑GPU (来源: AMD社区测试) | 公开资料未见 | 公开资料未见 |
注:性能数字依赖软件栈版本和模型优化程度,不同条件下结果差异较大,仅供示意见对比。
玩家策略分化明显:英伟达与AMD主打通用生态,通过大规模供货覆盖所有客户;云厂商自研ASIC则走垂直整合路线,降低内部推理总拥有成本(TCO),但其对外影响力和通用性有限。
风险
- AI应用商业化不及预期:若最终用户对AI应用付费意愿低、企业ROI证明困难,则推理请求量的增速可能显著低于预期,导致资本开支效率降低。据摩根士丹利2024年7月调查,企业大规模AI部署仍面临模型准确性、成本和数据隐私三大障碍。
- 供给瓶颈持续:高端制程(台积电N3/N4)、CoWoS先进封装和高带宽存储器HBM的扩产周期长,一旦需求超预期,供应短缺将推高硬件成本,拖慢推理规模部署的节奏。台积电在2024年多次强调CoWoS产能紧张。
- 技术替代风险:新型模型架构(如状态空间模型 Mamba)、端侧高效模型(如Phi‑3、Gemma)的突破可能大幅降低单次推理算力需求,导致原本预估的硬件需求被高估。
- 能效与散热瓶颈:超大规模推理集群的电力消耗和散热已成为现实制约。国际能源署(IEA)2024年1月报告估计,数据中心用电量到2026年可能超过1000太瓦时,推理集群的能效优化若跟不上,可能遭遇监管和成本的双重压力。
- 地缘政策风险:高端芯片的出口管制持续,影响全球供应链格局和部分市场的推理需求满足度。
误读纠偏
- 误读一:Usage Expansion 等同于购买更多GPU。
- 纠偏:这只是表面。更深层的是需求结构变化驱动软硬件架构协同创新。单纯堆砌为训练设计的GPU集群可能无法经济高效地服务推理负载(延迟高、利用率低)。产业正在围绕“推理时代”重新设计从芯片(推理专用加速器)到调度软件的整个技术栈。
- 误读二:训练需求将见顶并停滞。
- 纠偏:训练需求仍在增长,用于开发多模态、具身智能、世界模型等更复杂能力的模型,以及持续的对齐和微调。其增速相对放缓,且增长模式从“暴力规模扩展”转向“更高效地训练”。训练与推理的 “双螺旋”增长才是完整图景。
- 误读三:端侧AI将取代云端推理。
- 纠偏:两者是互补与协同关系。端侧处理即时、隐私敏感的轻量任务(本地语音识别、照片优化);云端处理需要超大模型、复杂逻辑、跨知识库的重型任务。混合AI架构是未来主流,数据和任务在端、边、云之间智能调度。
- 误读四:只有大模型公司受益。
- 纠偏:推理扩张的受益方远不止模型厂商。硬件、云基础设施、企业IT服务商、乃至利用AI降本增效的各行业应用端都是主要受益者。推理需求越分散,整个生态越繁荣。
最新事件
以下汇集截至2024年12月前后与Usage Expansion直接相关的重点事件,旨在反映趋势动能。
- 英伟达Blackwell平台发布与量产:2024年3月GTC大会,英伟达发布Blackwell架构B200 GPU,宣称推理性能较H100提升30倍(在特定大语言模型场景),并重点突出推理能效。据公司通报,B200于2024年下半年开始向客户发货,预计将推动更高效的推理集群建设。(来源:英伟达新闻稿,2024年3月18日)
- AMD MI300X规模化部署:AMD在2024年Q1业绩电话会议中表示,MI300系列仅在2024年便贡献超40亿美元营收,主要客户用于推理工作负载。微软Azure于2024年5月宣布大量采用MI300X实例,用于GPT规模模型的推理。(来源:AMD 2024年Q1电话会议,5月1日)
- 云厂商自研推理芯片商用加速:微软在2024年Build大会上公开其自研AI推理加速器Maia 100已在内部支持Azure OpenAI服务,计划于2024年底前全面集成。(来源:微软官方博客,2024年5月21日)
- OpenAI o1系列模型发布:2024年9月,OpenAI推出o1系列模型,其“思维链”推理过程需要大量的中间推理步骤,导致单次回答的推理计算量比普通模型高一个数量级以上。这种新范式可能在未来进一步拉高推理需求强度。(来源:OpenAI发布说明,2024年9月12日)
- 端侧AI硬件扎堆发布:2024年WWDC上苹果发布Apple Intelligence,需要A17 Pro/M系列芯片支持本地推理;高通骁龙X Elite PC平台重点宣传每秒45 TOPS的NPU能力;三星Galaxy S24系列全面引入端侧AI功能,拉动推理芯片需求。(来源:各公司发布会,2024年2‑9月)
- AI API价格大幅下降:2024年5月,多家中国大模型厂商开始大幅调降推理API价格,如字节跳动豆包大模型、阿里云通义千问等下调幅度最高达99%。价格战虽压缩短期利润率,但实质降低了应用开发门槛,有利于中长期用量扩张。(来源:公开新闻报道,2024年5月)
跟踪指标
监控Usage Expansion进程的领先与同步指标:
- 云巨头资本开支(CapEx)及指引:微软、谷歌、亚马逊、Meta的季度资本开支及其“AI相关”占比,直接反映基础设施投入动能。例如,微软2025财年Q1(2024年Q3)资本开支环比增长,并以满足AI推理需求为主要理由。
- AI推理硬件出货与占比:通过主要厂商(英伟达、AMD)的数据中心GPU出货结构、或调研机构(如IDC)的AI服务器中推理服务器占比数据,观察推理硬件比重变化。
- 英伟达数据中心业务中推理占比:英伟达每季度财报电话会议中披露的推理在数据中心营收的占比,是重要直接指标。2024年Q1该比例约40%。
- 模型API调用量及价格趋势:跟踪主要模型API提供商的公开定价页面、或第三方估计的调用量增长。API价格下降速率变缓而用量仍在加速,可能预示着需求弹性的释放。
- 主要AI应用月活跃用户(MAU)与日活(DAU):ChatGPT、Character.AI、GitHub Copilot等应用的用户规模直接传导至推理请求量。
- HBM与先进封装产能利用率及价格:HBM价格与CoWoS交期是供应链紧张度的晴雨表。若供应缓解而需求依然旺盛,则行业扩张步伐有望加快。
- 数据中心能耗与PUE趋势:推理消耗的电力增长与能效提升的平衡,反映产业可持续性。
- 企业AI支出调研:摩根士丹利、Gartner等的CIO调查或企业IT预算数据,揭示企业对AI推理的真实部署意愿。
信源
- 公司财报与电话会议:英伟达、AMD、微软、谷歌、亚马逊、Meta、OpenAI(通过媒体转述)的季度财报及管理层评论。
- 第三方市场研究:Omdia(AI Accelerator Market Tracker),IDC(Worldwide AI Infrastructure Tracker),TrendForce,Gartner,MarketsandMarkets,Counterpoint。
- 产业分析与博客:SemiAnalysis, The Information, The Next Platform, TechInsights。
- 学术与开源社区:vLLM、TensorRT‑LLM、MLIR等开源项目文档与性能报告;MLSys、Hot Chips会议论文。
- 厂商官方博客与公告:NVIDIA Developer Blog,Microsoft Azure Blog,AWS Machine Learning Blog,Google Cloud Blog,台积电法说会纪要。
- 新闻与公开报道:Reuters、Bloomberg、CNBC、国内主流科技媒体报道。
声明:本文引用的市场数据和预测均来自公开可得的第三方报告或公司披露,标注年份及出处。部分非公开报告内容通过公开摘要引用,不能完全排除研究方法差异。所有分析限于产业逻辑,不构成任何投资建议。