模型层 开放阅读

推理

Inference

概念 ID
inference
更新时间
2026-05-29
来源数量
待补

推理

1. 3 秒看懂

推理是将训练好的深度学习模型部署上线,对真实输入数据给出即时计算结果的过程。与训练不同,推理不修改模型权重,只做确定性前向计算,是 AI 模型从实验室走进应用的唯一路径。核心目标是在保证输出质量的前提下,实现低延迟、高吞吐与低功耗的最优平衡。

2. 3 分钟产业解释

AI 的生命周期被严格划分为训练与推理两大阶段。训练如同学生通过海量题库学习解题方法,消耗巨大算力且需要数周甚至数月;推理则如同学生上考场,看到新题快速作答,每次运算都是独立的、不改变已有知识。当生成式 AI 应用(如智能客服、代码助手、AI 绘画)拥有数亿用户时,每天数十亿次调用累积的算力消耗、电力成本和硬件损耗,远超训练本身。推理因此成为 AI 商业化的经济命脉。

产业界对推理的诉求浓缩为“低延迟、高吞吐、低功耗”的平衡:用户不能等太久,服务商需要在一张显卡上同时处理尽可能多的请求,还要把电费压到最低。这要求整个系统在芯片设计、内存带宽、编译优化、调度策略上高度协同。推理已不是训练后的附属环节,而是决定 AI 能否大规模盈利的关键战场。

3. 技术原理

推理计算的核心是确定性的前向传播。与训练时动态构建计算图、保存中间激活以求解梯度不同,推理仅执行静态计算图的一次正向计算,既不涉及反向传播,也不保存优化器状态。这一差异导致算力需求不再是唯一瓶颈,内存带宽往往成为第一约束,原因在于模型权重、KV-Cache 和中间激活在海量并发请求下会被频繁读取,GPU 计算核心常处于“数据饥饿”状态(即业界所说的“内存墙”)。

以 Transformer 大模型为例,其生成文本采用自回归方式:每输出一个新 Token,都需要将当前的 Query 向量与历史上所有 Token 的 Key、Value 向量进行注意力计算。若每次都全量重算,计算量将随生成长度呈平方级增长。KV-Cache 通过缓存各层注意力头的历史 Key、Value 张量,将复杂度降为线性,但会大量消耗显存。对于 Llama-2-70B 模型,单请求 4096 上下文长度下,KV-Cache 需要约 1.7 GB 显存;128 并发时总需求可达数百 GB(来源:vLLM 团队 2023 年技术报告估算)。因此,推理优化本质上是带宽利用率和显存效率的联合调度问题。

4. 关键参数

衡量推理系统的关键参数包括:

  • 延迟(Latency):单次请求的响应时间,常关注 P50、P99 分位值。在线对话服务通常要求 P99 延迟低于数百毫秒。
  • 吞吐量(Throughput):单位时间处理的请求数或生成的 Token 数,直接影响服务成本和可支撑的用户规模。
  • 并发数:同时服务的请求数量,受显存容量和 KV-Cache 管理效率制约。
  • 单 Token 能耗/成本:每生成一个 Token 的电力或货币成本,是推理经济性的核心指标。
  • 模型容量与精度保持率:量化、剪枝后模型性能相比原始 FP32 模型的指标(如困惑度、准确率)下降幅度。
  • 首 Token 延迟(Time to First Token):用户从发出请求到看到第一个回复字符的时间,影响交互体验。

这些指标互相制约:提高并发通常会增加延迟,降低精度可以换取更高吞吐。优化目标是在满足服务等级协议(SLA)的前提下最小化单位成本。

5. 技术路线

当前推理优化的主流技术路线围绕带宽与显存瓶颈展开:

模型量化:将 FP32 权重和激活值映射为 INT8 甚至 INT4 整数,成倍减小模型体积和内存带宽需求。后训练量化(PTQ)通过少量校准数据即可完成,量化感知训练(QAT)则可获得更高精度。代表性方法包括 GPTQ、AWQ、SmoothQuant 等。在 2024 年开源社区中,INT4 量化已成为大模型部署的事实标准,可使 70B 模型在单张 A100 80GB 上运行(来源:Hugging Face 模型库部署实例)。

KV-Cache 管理:通过 PagedAttention(vLLM 提出)、vAttention 等动态内存分配技术,消除显存碎片,将利用率提升至 95% 以上;引入换入换出机制将冷数据 offload 至 CPU 内存或 NVMe。分组查询注意力(GQA)和多查询注意力(MQA)则从模型结构上压缩缓存体积 2-4 倍。

并行与调度:张量并行、流水线并行和专家并行组合使用,解决单卡装不下大模型的问题。连续批处理(Continuous Batching)允许请求动态加入和退出,使 GPU 始终满载,可提高吞吐 2-5 倍。

投机推理:用小模型快速生成候选 Token,大模型并行校验,打破自回归串行依赖,实测可加速 2-3 倍(来源:Google Research 2023 年 Speculative Decoding 论文)。

硬件专用化:云端推理芯片(如 Google TPU v5e、AWS Inferentia2)和端侧 NPU(苹果 Neural Engine、高通 Hexagon)通过牺牲部分通用性换取更高能效比,在特定负载下能耗降低 50% 以上(来源:各厂商产品白皮书)。

6. 上游

推理产业链上游包括核心硬件、智算基础设施和基础软件。

芯片与硬件:数据中心推理主力仍是 NVIDIA GPU(H100、A100、L40S 等),但专用 ASIC 和 FPGA 加速渗透。2024 年 NVIDIA 财报显示其数据中心收入中推理占比已超 40%(来源:NVIDIA FY2024 Q4 财报电话会议)。其他核心器件包括 HBM 内存(SK 海力士、三星),2023 年 HBM 市场 SK 海力士份额约 50%(来源:TrendForce 2023 年报告);高速互联 IP(如 NVLink、PCIe、CXL)和光模块(2024 年 800G 光模块部署量显著增长,来源:LightCounting)。

制造与封装:先进制程(台积电 4nm、3nm)和 CoWoS 封装直接决定 AI 芯片的产能和成本。2023 年末至 2024 年初,台积电 CoWoS 产能持续紧张,曾导致 GPU 交付周期延长(来源:台积电 2023Q4 法说会及 DigiTimes 报道)。

基础软件:推理引擎(TensorRT-LLM、vLLM、ONNX Runtime、OpenVINO)、编译器框架(MLIR、TVM、PyTorch Inductor)和分布式调度系统构成底层软件栈。开源社区贡献巨大,vLLM 和 llama.cpp 等项目使低成本部署大模型成为可能。

7. 下游

下游是推理技术的最终应用场景,可分云端、边缘和端侧三层。

云端服务:大语言模型即服务(MaaS),如 ChatGPT、Claude、文心一言、通义千问等,每日推理调用量达数十亿次。2024 年 OpenAI 年化收入预估超过 30 亿美元(来源:The Information 2024 年报道),绝大部分来自推理 API 和订阅。图像生成(Midjourney、Stable Diffusion)、视频生成(Sora、Runway)等对延迟要求较高,推动高吞吐推理集群建设。

企业应用:代码助手(GitHub Copilot、Codeium)、智能客服、知识库问答、金融风控、医疗影像辅助诊断等。企业级部署注重数据隐私、私有化定制和 SLA 保障,常采用边缘或混合云方案。

边缘与端侧:自动驾驶(车载 Orin/Thor 芯片)、工业视觉、手机端本地大模型(如高通骁龙 8 Gen 3 支持 10B 参数模型端侧运行)、XR 设备。苹果在 2024 年 WWDC 上展示了端侧运行的多模态模型,强调隐私与低延迟(来源:Apple 2024 WWDC Keynote)。

8. 受益公司

推理市场爆发使以下类别公司受益(仅客观罗列,不构成投资建议):

  • 芯片供应商:NVIDIA(数据中心 GPU 绝对领先);Broadcom(定制 ASIC,如 Google TPU 合作);AMD(MI300X 在 2024 年开始大规模出货用于推理);Intel(Gaudi 系列);新兴创企如 Groq(LPU 架构,宣称极致推理速度)、Cerebras(晶圆级引擎)、d-Matrix(存内计算推理加速)。
  • 云服务商:Microsoft Azure(OpenAI 推理独家运行平台)、AWS(Trainium/Inferentia 自研芯片)、Google Cloud(TPU v5e)、阿里云(含光 800、灵积推理服务)、百度智能云(昆仑芯)。
  • 推理引擎与工具链:NVIDIA(TensorRT-LLM 生态)、Anyscale(vLLM 维护者)、OctoML(Apache TVM 商业化)、Hugging Face(TGI 服务与开源模型部署)。
  • 终端厂商:苹果(A17 Pro/M4 内置 Neural Engine)、高通(骁龙 8 系列 NPU)、特斯拉(Dojo 及车端 FSD 推理)。
  • 应用开发商:OpenAI、Anthropic、Midjourney、微软(Copilot)、Salesforce(Einstein GPT)、Adobe(Firefly)等直接通过推理服务创收的公司。

9. 市场规模

推理市场的估算口径多样,涵盖芯片、服务器、云服务多个层面。

  • AI 推理芯片市场:根据 MarketsandMarkets 2023 年报告,全球 AI 推理芯片市场规模 2023 年约为 150 亿美元,预计 2028 年将增长至 400 亿美元以上,年复合增长率超过 20%。其中 GPU 占比最大,但专用 ASIC 和 NPU 增速更快。
  • 推理云服务市场:因直接与模型调用次数挂钩,增长极为迅猛。据 Synergy Research 2024 年数据,AI 即服务(AIaaS)和生成式 AI 推理带动公有云 AI 收入在 2023 年同比增长 50% 以上。
  • 端侧推理:高通在 2024 年投资者日上表示,骁龙 NPU 的 AI 引擎出货量已超 20 亿颗(累计),手机端 AI 推理每年处理超万亿次计算。
  • 单位成本趋势:2023 年主流大模型 API 推理价格(如 GPT-4-8K)约为每百万输出 Token 60 美元,到 2024 年中已降至 30 美元左右,部分开源模型自部署成本低于 10 美元/百万 Token(来源:公开 API 定价页面及云计算成本测算),反映了推理优化的快速演进。

(注:以上数字来自公开研究报告和官方定价,具体年份和口径已在文字中标注,部分预测数据可能随市场变化修订。)

10. 玩家对比

推理硬件赛道的玩家可分为三类:

  1. 通用 GPU 巨头
    NVIDIA H100/H200:拥有最大生态,软件栈 TensorRT-LLM 经过深度优化,H200 的 HBM3e 带宽达 4.8 TB/s,特别适合大 KV-Cache 场景。缺点:功耗高(H100 典型 700W)、供应紧俏。
    AMD MI300X:192 GB HBM3,内存带宽 5.3 TB/s,理论性价比优于 H100,在 2024 年获得多家云厂商推理实例部署,软件生态 RoCM 逐渐成熟但仍有差距。

  2. 云端专用 ASIC
    Google TPU v5e:针对自家 PaLM、Gemini 模型极致优化,能效比领先,但不对外销售芯片,仅通过 GCP 提供。
    AWS Inferentia2:每瓦性能高,适合大规模推理集群,与 AWS Neuron SDK 紧密集成,支持 PyTorch 等主流框架,成本约为 GPU 实例的 30%~50%(AWS 官方数据)。
    Qualcomm Cloud AI 100:在 ResNet、DLRM 等视觉和推荐模型推理上能效比出色,单卡 AI 算力 350 INT8 TOPS,2023 年开始在公有云中部署。

  3. 新兴架构与推理专用芯片
    Groq LPU:创新采用静态调度和软件定义流处理,以极致低延迟著称,在 2024 年初的公开演示中达到每秒 500+ Token 的生成速度(针对 Llama-2-70B),但单卡显存较小,需多卡协同。
    Cerebras CS-3:晶圆级引擎,拥有超大的片上 SRAM,可免除 HBM 带来的内存墙,尤其适合大模型推理的批量处理,2024 年与阿联酋 G42 合作部署推理集群。
    d-Matrix:专注于预填阶段的推理加速,利用存内计算减少数据搬运,瞄准生成式 AI 的首 Token 延迟痛点,预计 2025 年量产。

软件层面,vLLM 凭借开源生态成为最受关注的推理引擎,TensorRT-LLM 则在高性能闭源领域保持领先,而 llama.cpp 在消费级硬件上推动了大模型平民化。

11. 风险

推理产业面临多重风险:

  • 技术路线不确定性:量化精度损失可能在某些任务上导致不可接受的输出质量下降;稀疏化、投机推理等新技术的实际加速比在复杂场景下可能不达预期。
  • 硬件供给与供应链:先进封装(CoWoS)产能仍是瓶颈,地缘政治可能导致高端 GPU 出口限制,2023 年美国出口管制已影响特定 AI 芯片对华销售(来源:BIS 2023 年 10 月规则)。专用推理芯片的流片和量产风险较高,新创企可能遭遇良率或资金问题。
  • 推理需求波动:模型能力迭代快,今天部署的推理架构可能因新模型结构(如状态空间模型替代 Transformer)而需重构。若生成式 AI 应用渗透速度慢于预期,推理基础设施投资可能回报不佳。
  • 隐私与合规:推理数据可能涉及个人隐私和商业机密,端云协同时的数据传输需满足 GDPR 等法规;部分行业(医疗、金融)对数据离境有严格要求,限制了公有云推理的适用性。
  • 成本超支:推理成本可能因调用量失控或能效优化不足而侵蚀利润。2023 年曾有报道部分创业公司因推理 API 费用过高而难以为继(来源:Business Insider 2023 年报道)。
  • 安全风险:对抗攻击(提示注入)、模型盗用(通过反复调用蒸馏模型)等威胁推理服务安全性和商业价值。

12. 误读纠偏

误读一:“训练比推理重要,推理只是简单重复计算。”
纠偏:训练决定模型能力上限,但推理决定商业闭环。没有高效低成本的推理,最强大的模型也无法实现规模化变现。事实上,大型云厂商的 AI 收入中推理占比已超过训练(NVIDIA 2024 年声明推理在其数据中心收入中约占 40%)。

误读二:“推理优化就是堆 GPU,算力越强越好。”
纠偏:推理瓶颈在内存带宽而非算力。盲目堆叠浮点算力可能造成资源浪费,优化访存、批处理和内存管理往往更有效。专用推理芯片 TPU v5e、Inferentia2 在特定任务上以更低的算力达到更高吞吐。

误读三:“量化一定会大幅降低模型精度。”
纠偏:精心实施的 INT4 量化(如 AWQ)可使 70B 模型的困惑度上升不到 1%,基本无损。激活值量化(如 SmoothQuant)更进一步压缩显存。但极低比特(2-bit)量化目前仍有精度损失,不适合所有场景。

误读四:“端侧推理大可取代云端推理。”
纠偏:端侧推理适用于时延敏感、隐私保护场景,但受限于芯片面积和功耗,模型规模和能力远不及云端大模型。两者为互补关系,多云协同比纯端侧方案更现实。

误读五:“推理引擎开源项目已足够成熟,无需商业产品。”
纠偏:vLLM 等开源引擎迭代迅速,但企业级部署还需要稳定性保障、安全合规、监控告警和长期支持,许多云厂商和独立软件商提供基于开源内核的企业级推理平台。

13. 最新事件

  • 2024 年 5 月,NVIDIA 发布 NVIDIA NIM 推理微服务,提供预构建的容器化推理引擎,支持 TensorRT-LLM、vLLM 等多种后端,旨在简化企业 AI 部署(来源:NVIDIA 2024 GTC 与官方博客)。
  • 2024 年 6 月,Apple 发布 Apple Intelligence,引入端侧多模态模型,明确将本地推理作为核心能力,所用模型尺寸控制在约 3B 参数并采用 4-bit 量化(来源:WWDC 2024)。
  • 2024 年 3 月,Groq 公开演示其 LPU 集群运行 Llama-2-70B 达到每秒超过 500 Token 的生成速度,引发业界对推理专用芯片的新一轮讨论(来源:Groq 官方 Twitter/博客)。
  • 2024 年 1 月,vLLM 项目宣布支持多模态模型推理与 LoRA 适配器热插拔,进一步巩固其在开源推理引擎中的领先地位(来源:vLLM GitHub Release Notes)。
  • 2023 年底,AMD MI300X 正式出货,多家云厂商(微软 Azure、Oracle)推出 MI300X 推理实例,直接与 H100 竞争(来源:AMD 官方新闻稿)。
  • 2024 年初,OpenAI 和 Anthropic 相继下调模型 API 价格,GPT-4o 推理成本比 GPT-4 降低约 50%,反映出推理优化的成果(来源:两家公司官方定价页及公开声明)。

14. 跟踪指标

追踪推理行业发展,可关注以下定量和定性指标:

  • 推理芯片季度出货量与收入:主要厂商(NVIDIA 数据中心、AMD 数据中心、云厂商自研芯片部署数量)公开财报数据。
  • 公有云推理 API 价格走势:如 OpenAI GPTo、Claude、Gemini Pro 的每百万 Token 定价变化,以及开源模型自部署的平均云实例成本。
  • 推理吞吐基准:MLPerf Inference 成绩,特别是 GPT-J、Llama-2-70B 等常用基准的服务器和离线条目。
  • 开源生态活跃度:vLLM、TensorRT-LLM、llama.cpp 等项目的 GitHub Star、贡献者数量和版本更新频率。
  • KV-Cache/量化技术演进:新方法(如 3-bit 量化、KV-Cache 无损压缩)的精度与效率提升百分比。
  • 终端 AI 渗透率:支持端侧大模型的手机 SoC 出货量(高通、联发科、苹果 A 系列),汽车智能驾驶芯片前装数量。
  • 能源指标:大型推理集群的 PUE 和每千次推理能耗公开披露数据。
  • 人才与资本流动:推理芯片和软件初创企业的融资事件、关键人才引进。

15. 信源

  • NVIDIA 官方博客与 GTC 演讲材料 (nvidia.com)
  • vLLM 技术报告:Kwon et al., “Efficient Memory Management for Large Language Model Serving with PagedAttention”, SOSP 2023
  • AWQ 论文:Lin et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”, MLSys 2024
  • SmoothQuant 论文:Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models”, ICML 2023
  • TensorRT-LLM 文档 (github.com/NVIDIA/TensorRT-LLM)
  • Groq 官方博客 (groq.com)
  • AMD MI300X 产品页面 (amd.com)
  • AWS Inferentia2 产品页面 (aws.amazon.com)
  • MarketsandMarkets, “AI Inference Chip Market - Global Forecast to 2028”, 2023
  • TrendForce, HBM 市场报告, 2023
  • Synergy Research Group, “Public Cloud AI Services Market Share”, 2024
  • Apple WWDC 2024 Keynote
  • 各公司财报电话会议(NVIDIA, AMD, Intel, Qualcomm)
  • 公开模型 API 定价页面(OpenAI, Anthropic, Google, 阿里云)
  • 第三方技术评测与分析(Semianalysis, The Information, DCD, Tom’s Hardware 等)
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型