BF16
1. 3 秒看懂
BF16(Brain Floating Point 16)是一種專為深度學習定製的 16 位浮點數格式。其核心特徵:1 位符號、8 位指數(與 FP32 相同)、7 位尾數。它保留了 FP32 近乎完全相同的數值動態範圍(≈3.4×10³⁸),但將每個數的儲存和傳輸量壓縮一半。對大型模型訓練而言,這意味著視訊記憶體佔用直接減半,且預設無需複雜的梯度縮放即可穩定訓練,已成為當前 AI 基礎設施的基石精度。
2. 3 分鐘產業解釋
深度學習的矩陣乘法和卷積操作對浮點精度高度依賴。傳統 FP32 精度足夠,但計算、儲存和通訊開銷巨大;FP16(5 位指數)動態範圍過窄,極易出現梯度下溢或溢位,迫使開發者引入代價高昂的 loss scaling 和複雜的混合精度調優。BF16 的設計直擊這一矛盾:
- 指數寬度對齊 FP32:可表示的最小/最大正規數與 FP32 幾乎一致,梯度無論在 10⁻³⁰ 還是 10¹⁰ 量級都能安全表示,天然避免無窮大和零。
- 尾數截斷為 7 位:單次乘加的絕對精度低於 FP16 和 FP32,但深度網路的權重、啟用和梯度對低 7 位以外的精細數值高度不敏感,模型收斂幾乎不受影響。
- 即插即用的生態:Google TPU 在 2018 年率先採用 BF16,NVIDIA 自 A100 起通過 Tensor Core 提供原生加速。PyTorch、TensorFlow、JAX 等主流架構均已整合自動混合精度(AMP),使用者僅需數行程式碼即可將訓練從 FP32 切換為 BF16,無需修改模型結構。
目前,BF16 已成為千億/萬億引數大型模型訓練的主力格式,與 TF32、FP16 並存,並在推論領域逐步滲透。幾乎所有新發布的資料中心 AI 加速器都會將 BF16 的吞吐量和能效作為核心賣點。
3. 技術原理
3.1 格式定義與數值分佈
BF16 的 16 位依次為:1 位符號 S、8 位指數 E(偏置 127)、7 位尾數 M(表示小數部分)。規格化數的值為:
value = (-1)^S × 2^(E-127) × (1 + M/2^7)
非規格化數(E=0, M≠0)按 2⁻¹²⁶ × (M/2^7) 計算。特殊值 E=255, M=0 對應 ±∞;E=255, M≠0 對應 NaN。正數範圍約為 [1.17×10⁻³⁸, 3.39×10³⁸],與 FP32 完全相同。
相較之下,FP16(5 位指數)的範圍僅為 [6.10×10⁻⁵, 6.55×10⁴],動態範圍相差數十個數量級,這正是 BF16“免縮放”的核心數學基礎。
在每一個 2 的冪次區間內,BF16 僅擁有 128 個可表示的尾數階(2⁷),相鄰值間距為 2^(E-127-7)。相對精度最高約為 0.78%(1/128),遠遜於 FP16 的 0.1% 和 FP32 的 1.2×10⁻⁵,但由於訓練中的隨機舍入和梯度累積平均效應,這種量化噪聲在統計意義上接近白噪聲,對最終收斂質量的影響微乎其微。
3.2 混合精度訓練機制
實踐中,BF16 訓練採用“權重主副本 + 低精度前向/反向”架構:
- 主權重以 FP32 儲存,作為梯度累積的唯一權威副本。
- 每個迭代,將 FP32 權重截斷為 BF16 傳入計算圖,執行前向傳播和反向傳播。
- 計算得到的梯度通常以 BF16 形式存在,但在更新前累加到 FP32 主權重,實現高精度引數更新。
- 最佳化器狀態(如 Adam 的動量和方差)往往也保持 FP32,進一步保證更新穩定性。
由於 BF16 的指數範圍足夠大,絕大多數場景無需像 FP16 那樣引入動態 loss scaling。PyTorch 官方明確推薦:使用 BF16 的 autocast 時,預設不啟用 GradScaler;僅個別模型因尾數截斷造成的微小梯度舍入才可能需要手動新增,但屬於極少見的邊緣案例。
3.3 硬體乘加與累加器精度
現代 GPU/NPU 的 BF16 支援並非簡單替換算術單元,而是通過高精度內積累加器實現效能與精度的兼顧。以 NVIDIA Tensor Core 為例:
- 輸入矩陣為 BF16,執行 4×4 或更大規模的塊矩陣乘加。
- 內部乘積累加器為 FP32 精度,單步乘法的舍入僅發生在 BF16→FP32 的轉換和最終累加結果寫回時。
- 最終輸出可選擇寫回 BF16(節省頻寬)或 FP32(銜接下一層的高精度需求)。
這種設計使得單個 mac 操作的有效訊雜比遠超單獨的 BF16 尾數精度,保證了 Transformer 等架構中數百層深度下的訓練穩定性。類似的設計也見於 Google TPU 的脈動陣列和 AMD CDNA 架構的矩陣核心。
3.4 與 FP16、TF32、FP8 的量化對比
下表示意主流低精度格式的組成與適用場景(TF32 為 NVIDIA 內部格式,僅用於 Tensor Core 的資料通路;FP8 有多種變體,此處列 E4M3):
| 格式 | 符號位 | 指數位 | 尾數位 | 動態範圍(正規數) | 相對精度(近似) | 典型用途 |
|---|---|---|---|---|---|---|
| FP32 | 1 | 8 | 23 | 1.19e-7 | 訓練主副本、高精度推論 | |
| FP16 | 1 | 5 | 10 | 9.77e-4 | 部分推論、需縮放的訓練 | |
| BF16 | 1 | 8 | 7 | 7.81e-3 | 大規模訓練主力 | |
| TF32 | 1 | 8 | 10 | 同 FP32 | 9.77e-4 | 訓練(僅 NVIDIA Tensor Core) |
| FP8(E4M3) | 1 | 4 | 3 | 1.25e-1 | 推論、低精度訓練(需縮放) |
BF16 以其“無縮放遷移”特性,成為生態過渡成本最低的格式。FP8 雖然能帶來更高吞吐,但需要引入塊縮放或量化感知訓練,工程複雜度顯著上升,短期內難以完全替代 BF16。
4. 關鍵引數
本節彙總 BF16 訓練中的核心量化指標。所有效能數字若無特別說明,均基於 NVIDIA H100 SXM 規格(2023 年釋出)或主流架構預設行為,來源為官方白皮書與開源文件。
- 視訊記憶體節省:理論最大壓縮比為 2×(相對 FP32)。實際中因主權重、最佳化器狀態和部分歸一化層保持 FP32,有效視訊記憶體減少約 50%~60%(經驗值,與模型結構相關,來源:PyTorch 社群討論及 Megatron-LM 公開報告)。
- 計算吞吐:H100 在 BF16 Tensor Core 上的峰值稠密算力為 1979 TFLOPS(NVIDIA H100 資料手冊,2023 年),約為同卡 FP32 吞吐的 2 倍。受記憶體頻寬制約,實際訓練吞吐提升在 1.5×~1.8× 之間(NVIDIA 公開 benchmark,MLPerf 訓練 v3.1 結果可查)。
- 動態範圍安全率:在一個跨越數十個數量級的梯度分佈中,BF16 無需 loss scaling 的比例超過 90%(基於多篇公開論文的觀察,如Google TPU 團隊 2018 年部落格文章;精確統計依賴模型,暫無覆蓋全量場景的權威數字)。
- 訓練精度損失:以視覺任務 ImageNet Top-1 準確率為例,BF16 訓練與 FP32 的差異通常在 0~0.1% 的絕對誤差區間內(參照 MLPerf 訓練提交及多篇學術報告,如 NVIDIA 混合精度指南引述)。語言模型困惑度劣化程度同樣微小,公開資料未見其成為採納障礙。
- 能效比:BF16 乘加單元的電路面積和功耗顯著低於 FP32 單元。據行業估計(Synopsys 設計案例參考,未檢索到具體數值),一枚 BF16 MAC 的能效可達 FP32 MAC 的 2~3 倍,為資料中心 TCO 最佳化提供基礎。
5. 技術路線
各主要晶片廠商在 BF16 支援上走出了差異化路線,最終收斂為生態共識。
- Google TPU 路線:BF16 的發明者。Cloud TPU v2(2018 年)首次引入 BF16 卷積運算;v3、v4 持續最佳化 BF16 矩陣單元密度和時脈頻率;v5p(2023 年)進一步提升 BF16 峰值算力,並深度整合在 Pathways 和 JAX 中。TPU 對 BF16 的採用是端到端強繫結,幾乎不存在其他低精度選項。
- NVIDIA 路線:安培(A100,2020 年)的第三代 Tensor Core 首次原生支援 BF16,與 TF32 一起構成雙精度策略;霍普(H100,2022 年)和 Blackwell(B100/B200,2024 年)通過第四、第五代 Tensor Core 大幅擴充套件 BF16 吞吐,並引入 FP8 支援。NVIDIA 的軟體棧通過 CUDA 11+、cuBLAS、cuDNN 提供全鏈路 BF16 加速,是整個 GPU 生態相容性最廣的實現。
- AMD 路線:CDNA2 架構(MI200 系列,2021 年)開始支援 BF16 矩陣運算;CDNA3(MI300X,2023 年)將 BF16 吞吐大幅提升至約 2.6 PFLOPS(AMD 官方資料),並藉助 ROCm 開源堆疊與 PyTorch/TensorFlow 對接。起步晚於 NVIDIA,但正快速追趕。
- Intel 路線:Habana Gaudi2(2022 年)搭載 BF16 張量核,強調在 BF16 下的能效比;Gaudi3(2024 年)進一步將 BF16 算力推向新高度。Intel 同時通過 oneAPI 推動 BF16 在通用計算中的滲透。
- 其他創新者:Graphcore IPU 系列從 Colossus MK2 開始原生支援 BF16;多家國產 NPU(如寒武紀思元系列)也宣佈了對 BF16 的支援(具體實現細節公開資料較少)。
技術路線的共同趨勢是:將 BF16 定位為訓練的主力格式,同時引入 FP8 作為推論和新一代訓練探索的補充格式,而非替代。
6. 上游
BF16 硬體實現的上游主要包含半導體 IP、設計工具和晶圓製造三個層面。
- 浮點運算單元 IP:Arm、Synopsys(DesignWare 系列)、Cadence(Tensilica)等 IP 提供商均已推出支援 BF16 的可配置浮點單元和 MAC 陣列 IP。客戶可以直接將這些 IP 整合到自研 AI 晶片中,縮短開發週期。這些 IP 通常支援 BF16 乘法與 FP32 累加的組合,並提供可綜合 RTL。(來源:Arm 官網浮點單元目錄,Synopsys 生態新聞)
- EDA 工具:Cadence、Synopsys、Mentor 等 EDA 供應商的高層次綜合工具和驗證套件已內建 BF16 資料型別模板,支援自動生成高吞吐脈動陣列和驗證激勵,加速客戶晶片的物理設計收斂。公開資料未見各 EDA 廠商在 BF16 功能上的市場份額細分。
- 晶圓代工:台積電(5nm、4nm、3nm)、三星(4nm、3nm)等先進製程是生產高效能 BF16 晶片的基礎。A100、H100、MI300 等均採用台積電先進工藝。由於 BF16 計算單元的電晶體規模和功耗低於等面積的 FP32 單元,更高的電晶體密度能讓每枚晶片容納更多 BF16 核心,從而直接推高算力。代工價格和產能分配屬於商業機密,公開資料未見針對 BF16 單元的獨立成本測算。
7. 下游
BF16 的下游生態已高度成熟,形成了“架構—平台—應用”的完整鏈路。
- 深度學習架構:
- PyTorch:從 1.10 版本起正式支援
torch.bfloat16和 AMP。autocast可自動將符合條件的運算(如線性層、卷積)轉換為 BF16,而標準化層等保持 FP32。Hugging Face Transformers 等庫深度整合 BF16 訓練選項。(來源:PyTorch 官方文件、Hugging Face 模型卡) - TensorFlow / JAX:TPU 的後端天然以 BF16 為預設精度,JAX 的
jax.lax運算元在 TPU 上自動選擇 BF16;對於 GPU,也支援通過mixed_precisionAPI 啟用 BF16。(來源:Google Cloud TPU 文件) - PaddlePaddle / MindSpore 等國產架構同樣提供了 BF16 混合精度訓練介面,用於對標國際生態。(來源:飛槳官方文件、MindSpore 技術白皮書)
- PyTorch:從 1.10 版本起正式支援
- MLOps 與訓練平台:Weights & Biases、MLflow、TensorBoard 等實驗追蹤工具可記錄訓練中的精度模式、loss 曲線和梯度直方圖,幫助開發者對比 BF16 和 FP32 的行為。公有雲端上的 AI 訓練服務(Amazon SageMaker、Google Vertex AI、Azure Machine Learning)均預設開啟或推薦 BF16 以降低成本。
- 應用場景:所有大規模預訓練(LLM、多模態、擴散模型)都是 BF16 的重度使用者。例如,Meta 的 LLaMA 系列模型在訓練中廣泛採用 BF16 混合精度(公開技術報告,2023 年)。同時,部分推論場景(如對延遲不敏感但要求吞吐量高的離線推論)也開始採用 BF16,進一步降低推論成本。
8. 受益公司
BF16 作為技術標準,本身不直接產生銷售營收,但其普及程度直接影響相關硬體和雲端服務的競爭力。以下梳理核心受益主體,僅陳述邏輯關係,不構成任何投資建議。
- NVIDIA:資料中心 GPU 是 BF16 訓練的最大硬體載體。A100、H100 以及最新的 Blackwell 系列均原生加速 BF16,BF16 效能成為客戶選型的關鍵指標。根據 NVIDIA 財報,FY2024 資料中心營收達 475 億美元,絕大部分來自支援 BF16 的 Hopper/Ampere 架構,顯示 BF16 需求強勁(來源:NVIDIA FY2024 年報)。
- Alphabet (Google):作為 BF16 的發明者和 TPU 的獨家使用方,Google 內部的搜尋、廣告、Gemini 等模型大規模部署 BF16 訓練,節省了大量能源和成本。TPU 以雲端端服務形式對外提供,也間接從 BF16 生態獲益。(來源:Google Cloud TPU 文件)
- AMD:隨著 MI300X 等產品 BF16 算力大幅攀升,AMD 正在爭奪 AI 訓練市場,直接受益於行業對 BF16 硬體的旺盛需求。其晶片被微軟、Meta 等雲端廠商採用,使 BF16 生態進一步多元化。(來源:AMD 官方公告,2023 年)
- Intel:通過 Gaudi 系列切入 BF16 加速賽道,試圖在競爭激烈的訓練市場建立差異化,其 Habana 加速器已獲部分雲端服務商訂單。(來源:Intel 2024 年投資者會議材料)
- 半導體 IP 與 EDA 供應商:Arm、Synopsys、Cadence 等通過提供 BF16 IP 核和設計工具,間接獲取客戶自研 AI 晶片中的營收,受益於 AI 晶片創業熱潮。(來源:各公司技術授權公開資訊)
- 公有雲端廠商(AWS、微軟 Azure、國內阿里雲端等):通過提供搭載 BF16 加速器的例項,降低大型模型客戶訓練成本,提升平台競爭力,間接獲益。
9. 市場規模
嚴格地說,BF16 是一種資料格式而非獨立產品,因此不存在專門的“BF16 市場規模”統計。其商業價值隱含在整體 AI 訓練晶片和雲端服務市場中。據第三方機構資料:
- AI 訓練晶片市場:Omdia 報告指出 2023 年全球用於 AI 的伺服器加速器市場規模約 300 億美元(含 GPU、TPU 等,來源:Omdia Cloud & Data Center 分析,2024 年初公開摘要)。其中,以 BF16 為主要訓練精度的晶片(NVIDIA Hopper/Ampere、Google TPU、AMD MI300 等)出貨額佔絕大多數,印證了 BF16 在訓練領域近乎全覆蓋的地位。
- AI 伺服器出貨:TrendForce 統計 2023 年 AI 伺服器出貨約 17.4 萬臺,配置多發支援 BF16 的 GPU/加速卡(來源:TrendForce 2024 年 1 月新聞稿)。該資料進一步反映 BF16 相關硬體的滲透程度。
- 雲端上訓練開銷:根據 Liftr Insights 等機構對雲端例項的追蹤,配備 BF16 能力的例項(如 p4d、p5 系列)佔高階 AI 訓練例項的比例持續上升,但未有按精度格式細分的營收揭露。(公開資料未見)
因此,投資者多通過追蹤 NVIDIA 資料中心 GPU 營收、雲端廠商資本支出中的 AI 伺服器比例等宏觀指標,來間接衡量 BF16 相關的經濟規模。
10. 玩家對比
主流 AI 加速器在 BF16 效能和生態上的差異,直接影響訓練成本與易用性。下表彙總截至 2024 年上半年的已知資料(來源:各公司官方產品規格與第三方基準測試,如 MLPerf 訓練 v3.1)。
| 廠商/產品 | BF16 峰值算力(近似) | 記憶體頻寬 | 視訊記憶體容量 | 軟體生態成熟度 | 典型應用場景 |
|---|---|---|---|---|---|
| NVIDIA H100 SXM | 1979 TFLOPS | 3.35 TB/s | 80 GB HBM3 | CUDA、PyTorch/TF 原生最佳化,最廣泛 | 千億級引數 LLM 訓練、雲端服務 |
| AMD MI300X | ~2.6 PFLOPS | 5.3 TB/s | 192 GB HBM3 | ROCm 持續完善,生態增長迅速 | 超大型模型訓練、記憶體密集型任務 |
| Google TPU v5p | 未公開(脈動陣列) | 未公開 | 16 GB HBM? | JAX/TF 深度繫結,僅限 GCP | Google 內部及雲端上訓練 |
| Intel Gaudi 3 | ~1.8 PFLOPS(BF16) | 3.7 TB/s | 128 GB HBM2e | oneAPI 及部分架構支援,追趕中 | 差異化能效、部分雲端例項 |
| 國產 NPU(示例) | 資料公開不充分 | 不等 | 不等 | 依賴專用架構,相容性待提升 | 國內市場、信創場景 |
從玩家對比可見,NVIDIA 憑藉 CUDA 生態的不可替代性,仍佔據 BF16 訓練市場絕對主導地位;AMD 和 Intel 正通過顯著提高單卡算力和記憶體容量來爭奪份額;Google TPU 自成生態。競爭的核心已不單是 BF16 峰值 TFLOPS,更在於軟體棧的易用性、叢集擴充套件能力和供貨穩定性。
11. 風險
- 格式替代風險:FP8(尤其是 E4M3/E5M2)正積極進軍訓練領域,NVIDIA Blackwell 已經大幅提升 FP8 吞吐。若未來 FP8 訓練生態成熟且精度損失可控,可能部分侵蝕 BF16 的市場份額。但 BF16 作為“零成本遷移”方案,仍會在相當長過渡期內共存。(來源:NVIDIA 混合精度指南)
- 硬體依賴性:BF16 的價值高度依賴專用硬體內的張量核。如果未來 AI 晶片架構發生重大變革(如光學計算、記憶體內計算),現有 BF16 加速單元的設計可能面臨過時。不過,公開資料未見此類變革在短期內商業化的跡象。
- 軟體棧碎片化:儘管主流架構均支援 BF16,各硬體的實現細節(如 AMP 的 cast 策略、歸約精度)仍存在差異,可能導致開發者跨平台遷移時遇到隱晦的精度/效能問題。但 PyTorch 基金會等組織正推動標準化,風險可控。
- 能效收益的不確定性:BF16 相比 FP32 的能效優勢,是在特定製程和電路假設下實現的。隨著晶片工藝逼近物理極限,靜態功耗佔比上升,動態精度降低的收益可能會被稀釋。此點尚無量化研究,但可作為技術追蹤點。
- 供應鏈集中風險:高階 BF16 晶片製造幾乎完全依賴台積電先進製程,地緣政治因素可能影響供給,導致 AI 訓練硬體成本波動。
12. 誤讀糾偏
-
“BF16 訓練完全不需要 loss scaling”
理想情況下,BF16 的指數範圍與 FP32 相同,梯度不會因值域過小或過大而溢位,PyTorch 官方也預設不啟用GradScaler。但在極小梯度(量級遠小於 1e-38 但非零)場景中,尾數截斷可能導致一些梯度被舍入為零,架構允許使用者手動新增輕量級 scaling 作為保險。這並非標準流程,99% 的模型無需此操作。(來源:PyTorch AMP 文件) -
“BF16 的精度比 FP16 差,所以訓練效果不好”
BF16 的相對精度(≈0.78%)確實只有 FP16(≈0.1%)的約 1/8。但訓練收斂的決定性因素往往是動態範圍而非尾數精度。BF16 直接對齊 FP32 的動態範圍,避免了 FP16 訓練中頻繁出現的發散和調參負擔,實際端到端準確率和損失幾乎等同 FP32,因此“精度差”的評價是對計算精度的片面理解。 -
“BF16 是 Google 的專利格式,存在授權壁壘”
該格式由 Google Brain 團隊提出並命名,但並未註冊為排他性專利。IEEE 沒有將其納入 754 標準,但它的定義公開透明,任何廠商均可自由實現。如今已得到全球主流晶片和軟體棧的支援,沒有授權壁壘。 -
“BF16 只適合訓練,不適合推論”
在大型模型推論中,BF16 相比 FP16 同樣視訊記憶體減半,且能簡化後處理,對於離線大批次推論、優先吞吐的場景非常有競爭力。部分雲端廠商已提供 BF16 推論容器,例如 NVIDIA TensorRT-LLM 允許 BF16 權重部署。(來源:NVIDIA TensorRT-LLM 文件)
13. 最新事件
- 2024 年 3 月,NVIDIA 在 GTC 2024 上釋出 Blackwell 架構,B200 晶片的 BF16 Tensor Core 算力可達 4.5 PFLOPS(來源:NVIDIA GTC 主題演講)。Blackwell 還大幅提高了 FP8 吞吐,顯示出“BF16 + FP8”共存的思路。
- 2023 年 12 月,AMD 正式推出 Instinct MI300X 加速器,BF16 峰值算力約 2.6 PFLOPS,搭配 192 GB HBM3,並宣佈微軟、Meta 等客戶將用於大規模訓練。(來源:AMD 釋出新聞)
- 2023 年 12 月,Google 釋出 TPU v5p,作為最強大的 AI 加速器之一,BF16 訓練效能進一步提升,雖未公開具體數值,但強調了其在 Gemini 模型訓練中的關鍵作用。(來源:Google Cloud Blog)
- 2023 年 11 月,PyTorch 2.1 增強了
torch.compile與 BF16 的協同能力,自動融合運算元以減少 BF16→FP32 的型別轉換開銷,提升了訓練吞吐。(來源:PyTorch 2.1 Release Notes) - 2024 年 4 月,Intel 公佈 Gaudi 3 加速器詳情,BF16 算力約為 1.8 PFLOPS,能效比進一步提升,並獲戴爾、超微等 OEM 支援。(來源:Intel Vision 2024 主題演講)
14. 追蹤指標
對於希望持續關注 BF16 產業動態的讀者,以下指標具有前瞻意義:
- AI 加速器新品 BF16 算力增幅:對比輝達、AMD、英特爾等每一代晶片的 BF16 稠密/稀疏峰值 TFLOPS 變化,可判斷格式生命力。
- 主流架構 AMP 預設精度:留意 PyTorch/TensorFlow/JAX 是否在未來將 BF16 設為更優先推薦,反映了產業共識。
- MLPerf 訓練基準中的精度分佈:統計各廠商提交成績中使用 BF16 的比例,以及對應的收斂時間,評估實際競爭力。
- 雲端例項的價效比:以每美元 TFLOPS 計量的 BF16 算力下降曲線,反映硬體迭代和降本節奏。
- FP8 論文與落地產品數量:若出現明顯加速,說明替代壓力加大,反之則 BF16 地位穩固。
- 國產晶片 BF16 生態成熟度:國產 NPU 在主流架構的適配進度與公開測評成績,是判斷國產替代步伐的可見訊號。
15. 信源
- Google Cloud, “Bfloat16: The secret to high performance on Cloud TPUs”, 2018.
- NVIDIA, “Train With Mixed Precision” 文件,https://docs.nvidia.com/deeplearning/performance/mixed-precision-training/
- NVIDIA H100 Tensor Core GPU 白皮書,2022.
- AMD Instinct MI300X 資料手冊,2023.
- Intel Gaudi 3 產品頁面,2024.
- PyTorch 官方文件: Automatic Mixed Precision (AMP), https://pytorch.org/docs/stable/amp.html
- IEEE 754-2019 標準.
- Omdia Cloud & Data Center 分析摘要,2024 年初公開資訊.
- TrendForce 全球 AI 伺服器出貨報告,2024 年 1 月.
- NVIDIA 2024 財年年報 (10-K).
- 各大廠商 GTC、AMD CES、Intel Vision 等會議公開演講。