芯片层 开放阅读

延迟

Latency

概念 ID
latency
更新时间
2026-05-29
来源数量
待补

延迟

3秒看懂

延迟(Latency)是系统从接收请求到产生响应所经历的时间间隔。 在AI产业链中,延迟直接决定实时交互体验(如语音助手、自动驾驶)、大规模训练的并行效率以及推理服务的成本与质量。降低延迟是算力优化、架构设计和通信技术演进的核心原动力之一。

3分钟产业解释

延迟在不同的AI场景中表现为多种具体形态:模型推理时用户等待结果的时间、分布式训练中GPU间同步梯度的耗时、内存访问时计算单元等待数据的周期。产业界对延迟的极度敏感催生了一系列技术:NVIDIA NVLink与InfiniBand将节点间通信延迟压至微秒级,HBM(高带宽内存)通过堆叠和宽接口将显存访问延迟压缩至百纳秒级,而针对推理服务的批处理调度和量化压缩则旨在控制毫秒级的用户端延迟。
延迟与吞吐量(系统单位时间处理的数据量)构成经典的性能跷跷板——提高吞吐量往往会通过增大批处理尺寸而拉长单个请求的耗时。在AI商业化中,实时场景(如高频交易、对话AI)几乎只追求低尾延迟(即最坏情况下的延迟),而离线训练更关注吞吐量,但即便训练任务,过高的通信延迟也会使昂贵的算力空转,严重拖累迭代速度。

15分钟专家深入

延迟是一个横跨指令、内存、I/O、网络、算法等多层面的叠加效果。在AI语境下,它可分解为:

  • 推理服务端到端延迟:从客户端请求到达网关,经过预处理、模型前向计算、后处理,到返回响应的全部耗时。其中模型计算因通常依赖GPU并行,批处理内延迟差别大,尾延迟(P99)决定了服务质量。
  • 分布式训练通信延迟:同步数据并行中,所有设备必须完成AllReduce梯度同步才能进入下一轮迭代。通信延迟主要由网络往返时间(RTT)、交换机排队延迟和协议栈开销构成。于千亿参数级大模型而言,每轮迭代的通信延迟可达百毫秒量级,若GPU计算时间不足以掩盖通信,则整体效率骤降。
  • 内存/缓存访问延迟:处理器读取数据时,若发生缓存缺失,需逐级访问GPU显存(HBM或传统GDDR)、主机DRAM乃至远端存储。现代AI芯片在缓存不命中时,一次HBM读取典型延迟约百纳秒级,而计算一个矩阵乘累加可能只需亚纳秒,如此悬殊的“内存墙”迫使架构设计向近存计算、存算一体演进。
  • 系统瓶颈转移:随着芯片算力迅猛增长(如张量核心的吞吐量翻倍),相对不变或下降缓慢的内存带宽和网络带宽使得延迟问题愈发突出,系统性能越来越受限于数据移动而非运算本身。

度量延迟的常见手段包括工具链探查(NVIDIA Nsight、Intel VTune)、应用端埋点以及分布式训练的迭代计时。优化延迟的核心思路是缩短数据搬运路径、提高并行度并智能调度计算与通信重叠。

技术原理

延迟的本质是信息传输与处理所需时间,涉及物理传播延时、设备处理延时和排队延迟。

一次典型AI推理请求的数据流(简化时序):

客户端                    网关/调度器               AI推理节点
|                           |                        |
| ---- 请求(HTTP/gRPC) --> |                        |
|                           | --- 转发请求 ---------> |
|                           |                        |  <-- 到达队列,等待批处理
|                           |                        |  <-- 批组合后送入GPU
|                           |                        |  <-- 模型前向计算(含多次内存访存)
|                           |                        |  <-- 后处理
|                           | <--- 返回结果 --------- |
| <---- 响应 ---------------|                        |

计算与通信交织——分布式训练中的AllReduce延迟模型(以环AllReduce为例):
N个设备执行一次梯度聚合,延迟 ≈ 2×(N-1)×(单次传输延迟 + 数据块大小/带宽) ,其中数据块大小等于总梯度量除以设备数N。此公式包含了ReduceScatter和AllGather两个阶段,若仅用 (N-1)×(2×单次传输延迟 + 数据块大小/带宽) 会忽略第二阶段带宽开销,导致带宽项仅为正确值的一半,严重低估通信时间。对于大规模集群,数据块拆分细碎,延迟主要取决于单次传输的固定开销(RTT)。Megatron-LM等张量并行方案在每个Transformer层进行列/行切分,前向与反向过程需要频繁的AllReduce通信,是强延迟敏感型操作。而MoE(混合专家)模型的专家路由则使用All-to-All集合通信,其延迟特性不同,所有节点同时向所有节点发送令牌,通信模式更复杂,对网络的全互连延迟要求苛刻。这也是为何高级互联(如NVSwitch)将针对这两种通信模式进行拓扑级优化。

内存系统延迟层次(典型数量级,基于行业常识估算):

  • GPU寄存器:数纳秒级
  • GPU共享内存(SRAM):十纳秒级(通常10~30ns)
  • L1缓存:十纳秒级
  • L2缓存:百纳秒级(例如 100–200 纳秒)
  • HBM显存:百纳秒级(取决于访存模式)
  • 主机DRAM通过PCIe访问:微秒级
  • 远端节点存储(通过NVLink/IB访问):数微秒至数十微秒

关键公式(概念性):

  • Little 定律:系统内平均请求数 = 到达率 × 平均延迟,用于推理服务容量规划。
  • 并行效率泛化式:效率 ≈ 计算时间 / (计算时间 + 通信延迟 + 其他开销),延迟过大直接侵蚀并行效率。

技术演进史

  • 早期CPU时代:AI推理在CPU上完成,模型简单,延迟多在数十至数百毫秒,瓶颈在单核频率和内存带宽。
  • GPU引入(2010年代):CUDA并行将矩阵计算延迟大幅降低,但PCIe总线引入的CPU-GPU数据传输延迟成为新瓶颈,催生了GPU直连技术(如NVIDIA GPUDirect)。
  • 专用互联崛起(2015–至今):NVIDIA NVLink 1.0(2016年)将GPU间通信带宽提升并显著降低延迟,后续NVLink 2.0/3.0及NVSwitch将单机内GPU延迟压缩至百纳秒级;InfiniBand从EDR(100Gb/s)演进到NDR(400Gb/s),交换机延迟从亚微秒向数百纳秒迈进;CXL联盟推动内存池化低延迟互连。
  • 内存体系进化:从GDDR5到HBM2/HBM3/HBM3e,显存带宽成倍增长的同时,物理堆叠和宽接口有效控制了访问延迟。3D封装与硅光互连正尝试突破跨封装延迟瓶颈。
  • 推理服务栈优化:Triton推理服务器、Ray Serve等实现了动态批处理、模型并行和请求级调度,将尾延迟管理技术推进到P99 < 100ms的在线服务标准。边缘AI持续推进模型量化、蒸馏,把延迟从云端百毫秒砍至端侧数毫秒。

技术路线对比

技术维度典型实现延迟特性定性描述适用场景
芯片内互连NVLink/NVSwitch, AMD Infinity Fabric跨GPU直连延迟<微秒级,机内AllReduce极快单机8/16卡密集训练
机间网络InfiniBand NDR, 超以太网端到端通信延迟微秒级;交换机跳数敏感数百上千节点分布式训练
内存层次HBM vs GDDR vs DDRHBM延迟低于GDDR且带宽远优,CSR访存友好AI加速卡,HPC
软件通信库NCCL(环形/树算法), MPINCCL针对拓扑优化,AllReduce延迟近理论下限分布式训练框架底层
推理服务框架Triton, TorchServe, vLLM连续批处理降低排队延迟;KV缓存管理影响首token延迟LLM在线推理
体系结构优化存内计算、近存计算避免数据搬运,将计算与存储延迟合二为一低功耗边缘端,未来云端内存墙缓解

注:具体延迟数字因硬件代数、消息大小、拓扑而异,此表仅作方向性对比。

上下游

  • 上游硬件与IP:高速SerDes IP(如Cadence、Synopsys)、光电转换器件、交换机芯片(Broadcom、Marvell、NVIDIA)、内存接口(Rambus、澜起科技)、先进封装(台积电CoWoS、英特尔EMIB)——这些决定物理层延迟。
  • 下游应用场景
    • 实时交互AI(语音助手、在线翻译、对话机器人):用户耐心通常≤2秒,端到端延迟需控制在百毫秒级。
    • 自动驾驶:感知-决策-控制的闭环延迟必须<百毫秒甚至更低,对硬件和算法确定性要求极高。
    • 金融交易:高频做市和欺诈检测需要微秒级的推理延迟,推动FPGA和专用网卡。
    • 元宇宙/AR/VR:运动到显示(M2P)延迟若超过20ms会引发眩晕,考验端-边-云协同。
    • 大模型训练:千卡/万卡集群的通信延迟若不理想,集群利用率大幅下降,直接抬升训练成本。

关键指标

指标定义与含义
P50 / P99 / P999 延迟中位数延迟、最慢1%、最慢0.1%请求的耗时;反映服务稳定性和“尾延迟爆炸”风险。
往返时间(RTT)数据从源到目的地再返回的时间,决定分布式通信的基础延迟。
单比特/消息传输延迟网络设备(交换机、网卡)纯粹处理一个比特或最小消息产生的延迟。
内存访问延迟从发出地址请求到返回数据的时间,包含行地址选通、列地址选通等多个周期。
TOPS/Watt与延迟的乘积能效与低延迟的平衡指标,部分场景用“每延迟的能效”衡量。
First Token Latency大模型生成式推理中,从收到请求到产生第一个输出token的时间,显著影响用户体感。

供需与市场数据

由于搜索未能获取最新精确数据,以下为基于行业公开信息的定性判断:

  • 需求端:生成式AI蓬勃发使得实时推理延迟成为差异化核心,企业级客户愿意为“保证低尾延迟”的推理服务支付溢价;万卡级训练集群对每跳延迟和互联半截面带宽的饥渴推动了InfiniBand及超级以太网的市场增长。
  • 供给端:NVIDIA凭借NVLink、InfiniBand和NVSwitch占领低延迟互联生态高地;AMD、Intel通过Infinity Fabric和CXL构建开放阵营;云厂商自研网络芯片(如AWS Nitro)力图通过软硬协同降低虚拟化下的尾延迟。
  • 趋势:延迟的绝对数值正在从毫秒级向微秒级下沉,下一代互联(PCIe 6.0、CXL 3.0、Ultra Ethernet)将重点解决内存池化及多节点通信的延迟抖动。[市场规模具体数字未检索到,需参阅第三方半导体市场报告。]

代表公司与资本映射

  • NVIDIA:无缝整合计算、互联(NVLink/NVSwitch/Mellanox)与软件(NCCL),提供业界最低的GPU间和节点间通信延迟,是AI延迟优化的标杆,股价同步映射AI基础设施投资强度。
  • Broadcom:网络交换芯片和SerDes技术的龙头,为数据中心和AI集群提供高性能低延迟交换,收益于AI网络升级周期。
  • Arista/思科:数据中心交换机厂商,其低延迟交换产品在AI后端网络中应用,是集群级延迟表现的重要环节。
  • AMD:通过Infinity Fabric架构将CPU、GPU以及FPGA互连,推进低延迟异构计算,在HPC和部分AI训练中直接与NVIDIA竞争。
  • Astera Labs / Marvell/Credo:专注于CXL/PCIe重定时器、有源电缆和DSP芯片,为机架内和跨机架低延迟互联提供物理层保障,部分已上市获资金追捧。
  • 云厂商(AWS、微软、谷歌):自研推理芯片(Trainium、Maia)重点优化延迟带宽比,并通过自研网络协议将虚拟化引入的延迟降至最低,资本市场关注其AI服务毛利率中延迟优化带来的溢价。

投资逻辑

  1. 横向算力升级已遇内存墙和通信墙,延迟优化环节成为新的价值高地:投资低延迟互联(NVLink生态、CXL、硅光)、高带宽低延迟内存(HBM)以及与之配套的先进封装供应链,具备长期逻辑。
  2. 推理市场爆发,低延迟为服务定价的核心锚点:能在同成本下稳定提供更低推理延迟的软硬件方案(如专用推理芯片、vLLM框架)的商业化主体,将获取更高的净利润率,映射到初创估值和上市企业估值溢价。
  3. 复杂并行策略扩大延迟的乘数效应:MoE路由、张量并行等要求All-to-All和低延迟AllReduce,促使数据中心主动升级至高阶InfiniBand或超级以太网,交换机、光模块及DAC/AEC出货量更依赖AI延迟指标而非单纯的带宽数值。
  4. 边缘AI对超低延迟的刚性需求:工业、自动驾驶等领域无法接受云回传延迟,边缘AI芯片、轻量化框架成为独立赛道,注意衡量单位推理延迟的能量效率。

常见误读纠偏

  • 误读1:“降低延迟必然牺牲吞吐量。”
    纠偏:流水线、计算与通信重叠(如NVIDIA的多流与GDRCopy)、请求级动态批处理等技术可以在不拉高延迟的前提下维持或提升吞吐量。延迟和吞吐量的关系取决于系统架构与调度策略,而非简单对立。
  • 误读2:“AllReduce通信不管什么并行算法都差不多,反正就是传梯度。”
    纠偏:并行模式不同,通信模式截然不同。Megatron的张量并行在Transformer每层的分块矩阵乘之后执行AllReduce或ReduceScatter,消息量巨大且延迟极为敏感;而MoE的专家路由产生的是All-to-All通信,每个Token根据路由结果发送到不同专家,流量模式和延迟瓶颈完全不同,常需要更灵活的拓扑和专门的拥塞控制。将二者混为一谈会导致错误的训练优化方向。
  • 误读3:“推理延迟主要由模型计算时间决定。”
    纠偏:对于大语言模型,KV缓存不足引发的重计算、调度器排队延迟、网络传输(尤其是云部署)后处理等环节常占据端到端延迟的大头,P99尾延迟更易受系统软件栈不稳定影响。

学习路径

  1. 基础:阅读《计算机组成与设计》中关于内存层次和I/O章节;理解并发系统排队论基础。
  2. 系统感知:学习NVIDIA 《CUDA C++ Best Practices Guide》中关于内存合并和延迟隐藏部分;使用Nsight Systems分析单次推理或训练迭代的延迟分布。
  3. 分布式通信:研读《NCCL: Accelerated Collective Communication》白皮书和Megatron-LM论文,弄清AllReduce、All-to-All、ReduceScatter的延迟特征。
  4. 推理优化:阅读vLLM论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》,理解连续批处理和KV缓存如何压制尾延迟。
  5. 前沿跟踪:关注Hot Chips、IEEE Micro、MLSys等会议关于存内计算、CXL互连延迟、硅光子互联的最新报告。

一句话总结

延迟是AI系统从硬件原子到云端服务的“时间税”,每一纳秒的削减背后都是材料、架构和算法的协同颠覆,其优化深度衡量着AI商业化的真实质感。

延伸阅读与来源

  • Dean, Justin, et al. “Large Scale Distributed Deep Networks.” NIPS 2012. (引入参数服务器及通信效率的经典)
  • Shoeybi, Mohammad, et al. “Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.” 2019. (详述张量并行的通信模式)
  • Lepikhin, Dmitry, et al. “GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding.” ICLR 2021. (阐述MoE及All-to-All通信)
  • NVIDIA Developer Blog: “in-depth NCCL”, “NVLink and NVSwitch” 系列文章。
  • Kwon, Woosuk, et al. “Efficient Memory Management for Large Language Model Serving with PagedAttention.” SOSP 2023. (vLLM推理系统)
  • 由于实时检索失败,以上信息基于长期累积的行业公开知识与经典文献,部分量化指标无法核实最新数值,建议参考AnandTech、ServeTheHome、Semianalysis等第三方机构的最新硬件评测和市场报告获取精确数据。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型