芯片层 开放阅读

BF16

BFloat16

概念 ID
bfloat16
更新时间
2026-05-29
来源数量
待补

BF16

1. 3 秒看懂

BF16(Brain Floating Point 16)是一种专为深度学习定制的 16 位浮点数格式。其核心特征:1 位符号、8 位指数(与 FP32 相同)、7 位尾数。它保留了 FP32 近乎完全相同的数值动态范围(≈3.4×10³⁸),但将每个数的存储和传输量压缩一半。对大模型训练而言,这意味着显存占用直接减半,且默认无需复杂的梯度缩放即可稳定训练,已成为当前 AI 基础设施的基石精度。

2. 3 分钟产业解释

深度学习的矩阵乘法和卷积操作对浮点精度高度依赖。传统 FP32 精度足够,但计算、存储和通信开销巨大;FP16(5 位指数)动态范围过窄,极易出现梯度下溢或溢出,迫使开发者引入代价高昂的 loss scaling 和复杂的混合精度调优。BF16 的设计直击这一矛盾:

  • 指数宽度对齐 FP32:可表示的最小/最大正规数与 FP32 几乎一致,梯度无论在 10⁻³⁰ 还是 10¹⁰ 量级都能安全表示,天然避免无穷大和零。
  • 尾数截断为 7 位:单次乘加的绝对精度低于 FP16 和 FP32,但深度网络的权重、激活和梯度对低 7 位以外的精细数值高度不敏感,模型收敛几乎不受影响。
  • 即插即用的生态:Google TPU 在 2018 年率先采用 BF16,NVIDIA 自 A100 起通过 Tensor Core 提供原生加速。PyTorch、TensorFlow、JAX 等主流框架均已集成自动混合精度(AMP),用户仅需数行代码即可将训练从 FP32 切换为 BF16,无需修改模型结构。

目前,BF16 已成为千亿/万亿参数大模型训练的主力格式,与 TF32、FP16 并存,并在推理领域逐步渗透。几乎所有新发布的数据中心 AI 加速器都会将 BF16 的吞吐量和能效作为核心卖点。

3. 技术原理

3.1 格式定义与数值分布

BF16 的 16 位依次为:1 位符号 S、8 位指数 E(偏置 127)、7 位尾数 M(表示小数部分)。规格化数的值为:

value = (-1)^S × 2^(E-127) × (1 + M/2^7)

非规格化数(E=0, M≠0)按 2⁻¹²⁶ × (M/2^7) 计算。特殊值 E=255, M=0 对应 ±∞;E=255, M≠0 对应 NaN。正数范围约为 [1.17×10⁻³⁸, 3.39×10³⁸],与 FP32 完全相同。

相较之下,FP16(5 位指数)的范围仅为 [6.10×10⁻⁵, 6.55×10⁴],动态范围相差数十个数量级,这正是 BF16“免缩放”的核心数学基础。

在每一个 2 的幂次区间内,BF16 仅拥有 128 个可表示的尾数阶(2⁷),相邻值间距为 2^(E-127-7)。相对精度最高约为 0.78%(1/128),远逊于 FP16 的 0.1% 和 FP32 的 1.2×10⁻⁵,但由于训练中的随机舍入和梯度累积平均效应,这种量化噪声在统计意义上接近白噪声,对最终收敛质量的影响微乎其微。

3.2 混合精度训练机制

实践中,BF16 训练采用“权重主副本 + 低精度前向/反向”架构:

  1. 主权重以 FP32 存储,作为梯度累积的唯一权威副本。
  2. 每个迭代,将 FP32 权重截断为 BF16 传入计算图,执行前向传播和反向传播。
  3. 计算得到的梯度通常以 BF16 形式存在,但在更新前累加到 FP32 主权重,实现高精度参数更新。
  4. 优化器状态(如 Adam 的动量和方差)往往也保持 FP32,进一步保证更新稳定性。

由于 BF16 的指数范围足够大,绝大多数场景无需像 FP16 那样引入动态 loss scaling。PyTorch 官方明确推荐:使用 BF16 的 autocast 时,默认不启用 GradScaler;仅个别模型因尾数截断造成的微小梯度舍入才可能需要手动添加,但属于极少见的边缘案例。

3.3 硬件乘加与累加器精度

现代 GPU/NPU 的 BF16 支持并非简单替换算术单元,而是通过高精度内积累加器实现性能与精度的兼顾。以 NVIDIA Tensor Core 为例:

  • 输入矩阵为 BF16,执行 4×4 或更大规模的块矩阵乘加。
  • 内部乘积累加器为 FP32 精度,单步乘法的舍入仅发生在 BF16→FP32 的转换和最终累加结果写回时。
  • 最终输出可选择写回 BF16(节省带宽)或 FP32(衔接下一层的高精度需求)。

这种设计使得单个 mac 操作的有效信噪比远超单独的 BF16 尾数精度,保证了 Transformer 等架构中数百层深度下的训练稳定性。类似的设计也见于 Google TPU 的脉动阵列和 AMD CDNA 架构的矩阵核心。

3.4 与 FP16、TF32、FP8 的量化对比

下表示意主流低精度格式的组成与适用场景(TF32 为 NVIDIA 内部格式,仅用于 Tensor Core 的数据通路;FP8 有多种变体,此处列 E4M3):

格式符号位指数位尾数位动态范围(正规数)相对精度(近似)典型用途
FP3218231.17e-383.40e381.19e-7训练主副本、高精度推理
FP1615106.10e-56.55e49.77e-4部分推理、需缩放的训练
BF161871.17e-383.39e387.81e-3大规模训练主力
TF321810同 FP329.77e-4训练(仅 NVIDIA Tensor Core)
FP8(E4M3)1431e-2240(估算)1.25e-1推理、低精度训练(需缩放)

BF16 以其“无缩放迁移”特性,成为生态过渡成本最低的格式。FP8 虽然能带来更高吞吐,但需要引入块缩放或量化感知训练,工程复杂度显著上升,短期内难以完全替代 BF16。

4. 关键参数

本节汇总 BF16 训练中的核心量化指标。所有性能数字若无特别说明,均基于 NVIDIA H100 SXM 规格(2023 年发布)或主流框架默认行为,来源为官方白皮书与开源文档。

  • 显存节省:理论最大压缩比为 2×(相对 FP32)。实际中因主权重、优化器状态和部分归一化层保持 FP32,有效显存减少约 50%~60%(经验值,与模型结构相关,来源:PyTorch 社区讨论及 Megatron-LM 公开报告)。
  • 计算吞吐:H100 在 BF16 Tensor Core 上的峰值稠密算力为 1979 TFLOPS(NVIDIA H100 数据手册,2023 年),约为同卡 FP32 吞吐的 2 倍。受内存带宽制约,实际训练吞吐提升在 1.5×~1.8× 之间(NVIDIA 公开 benchmark,MLPerf 训练 v3.1 结果可查)。
  • 动态范围安全率:在一个跨越数十个数量级的梯度分布中,BF16 无需 loss scaling 的比例超过 90%(基于多篇公开论文的观察,如谷歌 TPU 团队 2018 年博客文章;精确统计依赖模型,暂无覆盖全量场景的权威数字)。
  • 训练精度损失:以视觉任务 ImageNet Top-1 准确率为例,BF16 训练与 FP32 的差异通常在 0~0.1% 的绝对误差区间内(参照 MLPerf 训练提交及多篇学术报告,如 NVIDIA 混合精度指南引述)。语言模型困惑度劣化程度同样微小,公开资料未见其成为采纳障碍。
  • 能效比:BF16 乘加单元的电路面积和功耗显著低于 FP32 单元。据行业估计(Synopsys 设计案例参考,未检索到具体数值),一枚 BF16 MAC 的能效可达 FP32 MAC 的 2~3 倍,为数据中心 TCO 优化提供基础。

5. 技术路线

各主要芯片厂商在 BF16 支持上走出了差异化路线,最终收敛为生态共识。

  • Google TPU 路线:BF16 的发明者。Cloud TPU v2(2018 年)首次引入 BF16 卷积运算;v3、v4 持续优化 BF16 矩阵单元密度和时钟频率;v5p(2023 年)进一步提升 BF16 峰值算力,并深度集成在 Pathways 和 JAX 中。TPU 对 BF16 的采用是端到端强绑定,几乎不存在其他低精度选项。
  • NVIDIA 路线:安培(A100,2020 年)的第三代 Tensor Core 首次原生支持 BF16,与 TF32 一起构成双精度策略;霍普(H100,2022 年)和 Blackwell(B100/B200,2024 年)通过第四、第五代 Tensor Core 大幅扩展 BF16 吞吐,并引入 FP8 支持。NVIDIA 的软件栈通过 CUDA 11+、cuBLAS、cuDNN 提供全链路 BF16 加速,是整个 GPU 生态兼容性最广的实现。
  • AMD 路线:CDNA2 架构(MI200 系列,2021 年)开始支持 BF16 矩阵运算;CDNA3(MI300X,2023 年)将 BF16 吞吐大幅提升至约 2.6 PFLOPS(AMD 官方数据),并借助 ROCm 开源堆栈与 PyTorch/TensorFlow 对接。起步晚于 NVIDIA,但正快速追赶。
  • Intel 路线:Habana Gaudi2(2022 年)搭载 BF16 张量核,强调在 BF16 下的能效比;Gaudi3(2024 年)进一步将 BF16 算力推向新高度。Intel 同时通过 oneAPI 推动 BF16 在通用计算中的渗透。
  • 其他创新者:Graphcore IPU 系列从 Colossus MK2 开始原生支持 BF16;多家国产 NPU(如寒武纪思元系列)也宣布了对 BF16 的支持(具体实现细节公开资料较少)。

技术路线的共同趋势是:将 BF16 定位为训练的主力格式,同时引入 FP8 作为推理和新一代训练探索的补充格式,而非替代。

6. 上游

BF16 硬件实现的上游主要包含半导体 IP、设计工具和晶圆制造三个层面。

  • 浮点运算单元 IP:Arm、Synopsys(DesignWare 系列)、Cadence(Tensilica)等 IP 提供商均已推出支持 BF16 的可配置浮点单元和 MAC 阵列 IP。客户可以直接将这些 IP 集成到自研 AI 芯片中,缩短开发周期。这些 IP 通常支持 BF16 乘法与 FP32 累加的组合,并提供可综合 RTL。(来源:Arm 官网浮点单元目录,Synopsys 生态新闻)
  • EDA 工具:Cadence、Synopsys、Mentor 等 EDA 供应商的高层次综合工具和验证套件已内置 BF16 数据类型模板,支持自动生成高吞吐脉动阵列和验证激励,加速客户芯片的物理设计收敛。公开资料未见各 EDA 厂商在 BF16 功能上的市场份额细分。
  • 晶圆代工:台积电(5nm、4nm、3nm)、三星(4nm、3nm)等先进制程是生产高性能 BF16 芯片的基础。A100、H100、MI300 等均采用台积电先进工艺。由于 BF16 计算单元的晶体管规模和功耗低于等面积的 FP32 单元,更高的晶体管密度能让每枚芯片容纳更多 BF16 核心,从而直接推高算力。代工价格和产能分配属于商业机密,公开资料未见针对 BF16 单元的独立成本测算。

7. 下游

BF16 的下游生态已高度成熟,形成了“框架—平台—应用”的完整链路。

  • 深度学习框架
    • PyTorch:从 1.10 版本起正式支持 torch.bfloat16 和 AMP。autocast 可自动将符合条件的运算(如线性层、卷积)转换为 BF16,而标准化层等保持 FP32。Hugging Face Transformers 等库深度集成 BF16 训练选项。(来源:PyTorch 官方文档、Hugging Face 模型卡)
    • TensorFlow / JAX:TPU 的后端天然以 BF16 为默认精度,JAX 的 jax.lax 算子在 TPU 上自动选择 BF16;对于 GPU,也支持通过 mixed_precision API 启用 BF16。(来源:Google Cloud TPU 文档)
    • PaddlePaddle / MindSpore 等国产框架同样提供了 BF16 混合精度训练接口,用于对标国际生态。(来源:飞桨官方文档、MindSpore 技术白皮书)
  • MLOps 与训练平台:Weights & Biases、MLflow、TensorBoard 等实验跟踪工具可记录训练中的精度模式、loss 曲线和梯度直方图,帮助开发者对比 BF16 和 FP32 的行为。公有云上的 AI 训练服务(Amazon SageMaker、Google Vertex AI、Azure Machine Learning)均默认开启或推荐 BF16 以降低成本。
  • 应用场景:所有大规模预训练(LLM、多模态、扩散模型)都是 BF16 的重度用户。例如,Meta 的 LLaMA 系列模型在训练中广泛采用 BF16 混合精度(公开技术报告,2023 年)。同时,部分推理场景(如对延迟不敏感但要求吞吐量高的离线推理)也开始采用 BF16,进一步降低推理成本。

8. 受益公司

BF16 作为技术标准,本身不直接产生销售收入,但其普及程度直接影响相关硬件和云服务的竞争力。以下梳理核心受益主体,仅陈述逻辑关系,不构成任何投资建议。

  • NVIDIA:数据中心 GPU 是 BF16 训练的最大硬件载体。A100、H100 以及最新的 Blackwell 系列均原生加速 BF16,BF16 性能成为客户选型的关键指标。根据 NVIDIA 财报,FY2024 数据中心收入达 475 亿美元,绝大部分来自支持 BF16 的 Hopper/Ampere 架构,显示 BF16 需求强劲(来源:NVIDIA FY2024 年报)。
  • Alphabet (Google):作为 BF16 的发明者和 TPU 的独家使用方,Google 内部的搜索、广告、Gemini 等模型大规模部署 BF16 训练,节省了大量能源和成本。TPU 以云端服务形式对外提供,也间接从 BF16 生态获益。(来源:Google Cloud TPU 文档)
  • AMD:随着 MI300X 等产品 BF16 算力大幅攀升,AMD 正在争夺 AI 训练市场,直接受益于行业对 BF16 硬件的旺盛需求。其芯片被微软、Meta 等云厂商采用,使 BF16 生态进一步多元化。(来源:AMD 官方公告,2023 年)
  • Intel:通过 Gaudi 系列切入 BF16 加速赛道,试图在竞争激烈的训练市场建立差异化,其 Habana 加速器已获部分云服务商订单。(来源:Intel 2024 年投资者会议材料)
  • 半导体 IP 与 EDA 供应商:Arm、Synopsys、Cadence 等通过提供 BF16 IP 核和设计工具,间接获取客户自研 AI 芯片中的收入,受益于 AI 芯片创业热潮。(来源:各公司技术授权公开信息)
  • 公有云厂商(AWS、微软 Azure、国内阿里云等):通过提供搭载 BF16 加速器的实例,降低大模型客户训练成本,提升平台竞争力,间接获益。

9. 市场规模

严格地说,BF16 是一种数据格式而非独立产品,因此不存在专门的“BF16 市场规模”统计。其商业价值隐含在整体 AI 训练芯片和云服务市场中。据第三方机构数据:

  • AI 训练芯片市场:Omdia 报告指出 2023 年全球用于 AI 的服务器加速器市场规模约 300 亿美元(含 GPU、TPU 等,来源:Omdia Cloud & Data Center 分析,2024 年初公开摘要)。其中,以 BF16 为主要训练精度的芯片(NVIDIA Hopper/Ampere、Google TPU、AMD MI300 等)出货额占绝大多数,印证了 BF16 在训练领域近乎全覆盖的地位。
  • AI 服务器出货:TrendForce 统计 2023 年 AI 服务器出货约 17.4 万台,配置多发支持 BF16 的 GPU/加速卡(来源:TrendForce 2024 年 1 月新闻稿)。该数据进一步反映 BF16 相关硬件的渗透程度。
  • 云上训练开销:根据 Liftr Insights 等机构对云实例的追踪,配备 BF16 能力的实例(如 p4d、p5 系列)占高端 AI 训练实例的比例持续上升,但未有按精度格式细分的营收披露。(公开资料未见)

因此,投资者多通过追踪 NVIDIA 数据中心 GPU 收入、云厂商资本开支中的 AI 服务器比例等宏观指标,来间接衡量 BF16 相关的经济规模。

10. 玩家对比

主流 AI 加速器在 BF16 性能和生态上的差异,直接影响训练成本与易用性。下表汇总截至 2024 年上半年的已知数据(来源:各公司官方产品规格与第三方基准测试,如 MLPerf 训练 v3.1)。

厂商/产品BF16 峰值算力(近似)内存带宽显存容量软件生态成熟度典型应用场景
NVIDIA H100 SXM1979 TFLOPS3.35 TB/s80 GB HBM3CUDA、PyTorch/TF 原生优化,最广泛千亿级参数 LLM 训练、云服务
AMD MI300X~2.6 PFLOPS5.3 TB/s192 GB HBM3ROCm 持续完善,生态增长迅速超大模型训练、内存密集型任务
Google TPU v5p未公开(脉动阵列)未公开16 GB HBM?JAX/TF 深度绑定,仅限 GCPGoogle 内部及云上训练
Intel Gaudi 3~1.8 PFLOPS(BF16)3.7 TB/s128 GB HBM2eoneAPI 及部分框架支持,追赶中差异化能效、部分云实例
国产 NPU(示例)数据公开不充分不等不等依赖专用框架,兼容性待提升国内市场、信创场景

从玩家对比可见,NVIDIA 凭借 CUDA 生态的不可替代性,仍占据 BF16 训练市场绝对主导地位;AMD 和 Intel 正通过显著提高单卡算力和内存容量来争夺份额;Google TPU 自成生态。竞争的核心已不单是 BF16 峰值 TFLOPS,更在于软件栈的易用性、集群扩展能力和供货稳定性。

11. 风险

  • 格式替代风险:FP8(尤其是 E4M3/E5M2)正积极进军训练领域,NVIDIA Blackwell 已经大幅提升 FP8 吞吐。若未来 FP8 训练生态成熟且精度损失可控,可能部分侵蚀 BF16 的市场份额。但 BF16 作为“零成本迁移”方案,仍会在相当长过渡期内共存。(来源:NVIDIA 混合精度指南)
  • 硬件依赖性:BF16 的价值高度依赖专用硬件内的张量核。如果未来 AI 芯片架构发生重大变革(如光学计算、内存内计算),现有 BF16 加速单元的设计可能面临过时。不过,公开资料未见此类变革在短期内商业化的迹象。
  • 软件栈碎片化:尽管主流框架均支持 BF16,各硬件的实现细节(如 AMP 的 cast 策略、归约精度)仍存在差异,可能导致开发者跨平台迁移时遇到隐晦的精度/性能问题。但 PyTorch 基金会等组织正推动标准化,风险可控。
  • 能效收益的不确定性:BF16 相比 FP32 的能效优势,是在特定制程和电路假设下实现的。随着芯片工艺逼近物理极限,静态功耗占比上升,动态精度降低的收益可能会被稀释。此点尚无量化研究,但可作为技术跟踪点。
  • 供应链集中风险:高端 BF16 芯片制造几乎完全依赖台积电先进制程,地缘政治因素可能影响供给,导致 AI 训练硬件成本波动。

12. 误读纠偏

  1. “BF16 训练完全不需要 loss scaling”
    理想情况下,BF16 的指数范围与 FP32 相同,梯度不会因值域过小或过大而溢出,PyTorch 官方也默认不启用 GradScaler。但在极小梯度(量级远小于 1e-38 但非零)场景中,尾数截断可能导致一些梯度被舍入为零,框架允许用户手动添加轻量级 scaling 作为保险。这并非标准流程,99% 的模型无需此操作。(来源:PyTorch AMP 文档)

  2. “BF16 的精度比 FP16 差,所以训练效果不好”
    BF16 的相对精度(≈0.78%)确实只有 FP16(≈0.1%)的约 1/8。但训练收敛的决定性因素往往是动态范围而非尾数精度。BF16 直接对齐 FP32 的动态范围,避免了 FP16 训练中频繁出现的发散和调参负担,实际端到端准确率和损失几乎等同 FP32,因此“精度差”的评价是对计算精度的片面理解。

  3. “BF16 是 Google 的专利格式,存在授权壁垒”
    该格式由 Google Brain 团队提出并命名,但并未注册为排他性专利。IEEE 没有将其纳入 754 标准,但它的定义公开透明,任何厂商均可自由实现。如今已得到全球主流芯片和软件栈的支持,没有授权壁垒。

  4. “BF16 只适合训练,不适合推理”
    在大模型推理中,BF16 相比 FP16 同样显存减半,且能简化后处理,对于离线大批量推理、优先吞吐的场景非常有竞争力。部分云厂商已提供 BF16 推理容器,例如 NVIDIA TensorRT-LLM 允许 BF16 权重部署。(来源:NVIDIA TensorRT-LLM 文档)

13. 最新事件

  • 2024 年 3 月,NVIDIA 在 GTC 2024 上发布 Blackwell 架构,B200 芯片的 BF16 Tensor Core 算力可达 4.5 PFLOPS(来源:NVIDIA GTC 主题演讲)。Blackwell 还大幅提高了 FP8 吞吐,显示出“BF16 + FP8”共存的思路。
  • 2023 年 12 月,AMD 正式推出 Instinct MI300X 加速器,BF16 峰值算力约 2.6 PFLOPS,搭配 192 GB HBM3,并宣布微软、Meta 等客户将用于大规模训练。(来源:AMD 发布新闻)
  • 2023 年 12 月,Google 发布 TPU v5p,作为最强大的 AI 加速器之一,BF16 训练性能进一步提升,虽未公开具体数值,但强调了其在 Gemini 模型训练中的关键作用。(来源:Google Cloud Blog)
  • 2023 年 11 月,PyTorch 2.1 增强了 torch.compile 与 BF16 的协同能力,自动融合算子以减少 BF16→FP32 的类型转换开销,提升了训练吞吐。(来源:PyTorch 2.1 Release Notes)
  • 2024 年 4 月,Intel 公布 Gaudi 3 加速器详情,BF16 算力约为 1.8 PFLOPS,能效比进一步提升,并获戴尔、超微等 OEM 支持。(来源:Intel Vision 2024 主题演讲)

14. 跟踪指标

对于希望持续关注 BF16 产业动态的读者,以下指标具有前瞻意义:

  • AI 加速器新品 BF16 算力增幅:对比英伟达、AMD、英特尔等每一代芯片的 BF16 稠密/稀疏峰值 TFLOPS 变化,可判断格式生命力。
  • 主流框架 AMP 默认精度:留意 PyTorch/TensorFlow/JAX 是否在未来将 BF16 设为更优先推荐,反映了产业共识。
  • MLPerf 训练基准中的精度分布:统计各厂商提交成绩中使用 BF16 的比例,以及对应的收敛时间,评估实际竞争力。
  • 云实例的性价比:以每美元 TFLOPS 计量的 BF16 算力下降曲线,反映硬件迭代和降本节奏。
  • FP8 论文与落地产品数量:若出现明显加速,说明替代压力加大,反之则 BF16 地位稳固。
  • 国产芯片 BF16 生态成熟度:国产 NPU 在主流框架的适配进度与公开测评成绩,是判断国产替代步伐的可见信号。

15. 信源

  • Google Cloud, “Bfloat16: The secret to high performance on Cloud TPUs”, 2018.
  • NVIDIA, “Train With Mixed Precision” 文档,https://docs.nvidia.com/deeplearning/performance/mixed-precision-training/
  • NVIDIA H100 Tensor Core GPU 白皮书,2022.
  • AMD Instinct MI300X 数据手册,2023.
  • Intel Gaudi 3 产品页面,2024.
  • PyTorch 官方文档: Automatic Mixed Precision (AMP), https://pytorch.org/docs/stable/amp.html
  • IEEE 754-2019 标准.
  • Omdia Cloud & Data Center 分析摘要,2024 年初公开信息.
  • TrendForce 全球 AI 服务器出货报告,2024 年 1 月.
  • NVIDIA 2024 财年年报 (10-K).
  • 各大厂商 GTC、AMD CES、Intel Vision 等会议公开演讲。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型