晶片層 開放閱讀

FLOPS

Floating-Point Operations Per Second

概念 ID
floating-point-operations-per-second
更新時間
2026-05-29
來源數量
待補

FLOPS

3秒看懂

FLOPS(Floating-Point Operations Per Second)是衡量計算機每秒能完成多少次浮點運算的速率單位。在深度學習中,它用於量化訓練或推論一個模型需要多少算力,以及某塊晶片能提供多少算力。FLOPS越高,數學上“跑得快”的潛力越大,但實際模型執行效率還與記憶體頻寬、軟體排程、數值精度等因素強相關,不能只用FLOPS“一刀切”地比較系統性能。

3分鐘產業解釋

在深度學習產業裡,FLOPS 被拆成兩個層面:需求側(模型計算量)與供給側(硬體算力)。

  • 模型側:一個神經網路(如 Transformer)處理固定規格輸入時,前向傳播所需的浮點運算次數通常用“FLOPs”(注意大小寫,這裡表示運算總量,單位為浮點操作次數)來表示,對應的是每個 token 或每張圖片的計算開銷。訓練還需要加上反向傳播,大致是前向的 2~3 倍。
  • 硬體側:GPU/AI 加速卡的理論峰值 FLOPS 指晶片在所有計算單元滿載、主頻最高時,每秒可完成的浮點運算上限。工業界常用的精度有 FP32(單精度)、FP16/BF16(半精度/腦浮點)、TF32(NVIDIA 的混合精度)以及推論用的 INT8。不同精度下峰值 FLOPS 差別極大,例如同一款 GPU 的 FP16 張量核心算力可能是 FP32 的數倍到十數倍。

因為大型模型訓練需要海量算力(通常以 ExaFLOPs 來衡量總計算量),產業界關心的不只是單晶片的 FLOPS,還有通過高頻寬互聯(NVLink、InfiniBand)將成千上萬塊加速卡組織起來後,所能實現的“有效 FLOPS”或“FLOPS 利用率”(MFU, Model FLOPs Utilization)。

15分鐘專家深入

進入專家視野後,FLOPS 被細化為一套評價體系:理論值、實測有效值、精度譜系、計算/訪存比,以及分散式訓練下的通訊開銷如何侵蝕有效 FLOPS

理論峰值 vs 有效 FLOPS 晶片標稱的峰值 FLOPS 是在理想條件下(所有乘加單元全開、無訪存等待、無系統噪聲)的算術上限。然而,深度學習計算是典型的“訪存 + 計算”交替模式:矩陣乘法(GEMM)屬於計算密集型,可以達到較高 FLOPS 利用率;而注意力機制、層歸一化、啟用函式等屬於訪存或延遲敏感型,常讓計算單元空轉。因此,產業和學術圈常用 MFU 來衡量真實利用率: MFU ≈ (實測每秒浮點運算數)/(理論峰值 FLOPS)。 大型模型分散式訓練中,哪怕用最好的軟硬體棧,MFU 通常在 30%~60% 之間,能超過 50% 已屬極佳工程水平。

精度與 FLOPS 的折算 為了提升算力或降低功耗,現代 AI 加速器在硬體層面引入了準 FP32、FP16、BF16、TF32 等格式以及稀疏計算模式,理論上 2:1 或更高倍率的結構化稀疏可將 FLOPS 倍增(需軟體側支援網路剪枝)。因此,比較兩款晶片時,必須明確是哪種精度下的 FLOPS,否則很容易被營銷話術誤導。常見精度關係(定性):

  • FP32:深度學習訓練的基礎精度,通用性最強,理論 FLOPS 相對較低。
  • FP16/BF16:半精度,矩陣乘加速,理論 FLOPS 通常是 FP32 的 2 倍甚至更高(依賴張量核心數量)。
  • TF32:NVIDIA Ampere 及之後架構引入,資料格式為 19 位(1 位符號 + 8 位指數 + 10 位尾數),乘累加操作使用 FP32 累加器,輸入/輸出類似 FP32,程式設計透明,提供接近 FP16 的吞吐,但輸出仍是 FP32 精度。
  • INT8:推論用,理論 FLOPS 更高,但需量化校準。
  • FP8:最新的 H100 等支援,進一步翻倍吞吐,可視為 FP16 的加速版,訓練和推論均可使用,對軟體棧要求極高。

分散式叢集的總有效 FLOPS 千卡、萬卡叢集的總 FLOPS 不等於單卡 × 卡數。資料並行、張量並行、流水並行以及 MoE 的 All-to-All 通訊,都會消耗頻寬和時間,造成計算資源閒置。例如,張量並行中的 AllReduce/ReduceScatter 會在每一層後同步梯度或啟用,若網路頻寬不足,多卡的有效 FLOPS 會驟降。

技術原理

FLOPS 的數學定義與深度學習中的“數 FLOP”方法

FLOPS (Floating-Point Operations Per Second) 為速率單位,1 FLOPS = 每秒 1 次浮點運算。深度學習常用的運算次數估算單位是 FLOP(或 FLOPs),代表一次浮點加法/乘法,通常乘加操作(MAC, Multiply-Accumulate)算作兩次浮點運算(一次乘 + 一次加)。因此:

  • 矩陣乘 C = A × B,其中 A 尺寸 (m×k),B 尺寸 (k×n),總 MAC 數為 m×k×n,對應 FLOP 約為 2×m×k×n。
  • 對於全連線層,輸入維度 b,輸出維度 d,則前向 FLOP ≈ 2×b×d。
  • 對於卷積層,輸入特徵圖 H×W×C_in,卷積核 K×K,輸出通道 C_out,步長相關輸出尺寸 H_out×W_out,FLOP ≈ 2×K×K×C_in×C_out×H_out×W_out。

Transformer 模型 FLOP 計算示例(定性公式)

一個標準 Transformer 層(自注意+前饋網路)輸入序列長度 s,隱藏維度 h,前饋中間維度 d_ff,頭數 n_heads,分頭維度 d_k = h / n_heads。

  • 自注意力 QKV 投影:約 3× 2×h×h × s (矩陣乘)或簡化為 ~ 6sh²。
  • 注意力分數 QKᵀ:約 2×s²×h 。
  • 加權求和:約 2×s²×h。
  • 輸出投影:約 2×h²×s。
  • 前饋網路(兩層):約 2×s×h×d_ff + 2×s×d_ff×h = 4sh·d_ff。 每 token 前向 FLOPs(總浮點運算次數)大致為 O(sh² + s²h) 級別。大型模型隱藏維度 h 很大,sh² 項主導短序列,長序列時 s²h 項顯著。

反向傳播:因需要計算權重的梯度和輸入的梯度,所需 FLOPs 通常是前向的 2~3 倍,取決於具體最佳化器與啟用重計算策略。

晶片 FLOPS 計算邏輯

晶片峰值 FLOPS ≈ (計算單元數量) × (每單元每週期可執行的浮點運算次數) × (執行頻率)。以 GPU 為例,SM 中有大量 CUDA 核與 Tensor Core,Tensor Core 每時鐘週期可完成多個乘加運算(例如 4×4 矩陣乘以 4×4 矩陣,一次操作完成 64 次浮點乘加,折算 128 次浮點運算)。廠家公佈的峰值 FLOPS 就是所有 Tensor Core 和 CUDA Core 累加並乘上最高 Boost 頻率得到的數值。

[ 計算單元陣列 ] ——> 訪存請求 ——> 快取/視訊記憶體
       |                |
    FLOPS 計算        頻寬 (GB/s)
       |
   乘加操作: 1 MAC = 2 FLOP

技術演進史

早期階段:深度學習興起前,FLOPS 主要用於高效能運算(HPC)領域,衡量超級計算機的科學計算能力。GPU 的通用計算(GPGPU)依賴 FP32 單精度。

2012-2016:AlexNet 時代,神經網路算力需求快速增長,NVIDIA 推出強化半精度計算的 GPU(如 Tesla P100),FP16 算力大幅提升,但主要服務於推論。訓練仍以 FP32 為主,但開始探索混合精度。

2017-2019:Transformer 架構出現,訓練計算量呈量級躍升。NVIDIA Volta 架構引入第一代 Tensor Core,專為矩陣乘加速,提供 FP16 下的數倍 FLOPS 提升。後續 Turing 架構新增 INT8/INT4 加速。此時 FLOPS 指標正式走向“張量核心 FLOPS”差異化道路。

2020-2022:Ampere 架構引入 TF32 格式,在 FP32 輸入下直接利用 Tensor Core 獲得近似 FP16 吞吐,簡化了混合精度訓練的工程複雜度。BF16 也在Google TPU 和 NVIDIA A100 上廣泛支援,成為大型模型訓練標配。同時,稀疏化導致的 2 倍 FLOPS 提升成為營銷和實際加速點。

2023-至今:Hopper 架構支援 FP8,可用於訓練,進一步倍增峰值 FLOPS。AI 專用加速器(如 AMD MI250/300、華為昇騰、Google TPU v5p)普遍採用類似多精度策略,理論 FLOPS 進入數百 TFLOPS 乃至 PFLOPS 級別(單晶片)。系統級 FLOPS 以 ExaFLOPs 為單位,萬卡叢集成為大型模型公司標配。產業從單純追逐峰值 FLOPS 轉向關注 MFU、互聯頻寬和能效比(FLOPS/W)。

技術路線對比(量化表)

因本次檢索未獲取各廠商最新晶片的具體 FLOPS 引數,以下對比基於行業通用規格特徵進行定性表述,具體數值隨版本迭代變化,此處用“高/中/低”或相對關係示意。

維度通用 GPU 路線(NVIDIA/AMD)自研 AI 加速器(Google TPU 系)可重構 / FPGA 方案CPU 向量化方案(x86/Arm)
峰值 FP32 FLOPS高(數十 TFLOPS 級)中-高(早期側重低精度)低-中低(1~2 TFLOPS)
峰值 FP16/BF16 FLOPS很高(可達 FP32 的 2~6 倍)極高(專為矩陣乘設計)定製可高低或無高效支援
FP8/INT8 推論 FLOPS很高,可達數倍於 FP16極高,設計上原生支援可專項最佳化依賴擴充套件指令集,中等
FLOPS 利用率(典型 MFU)中等-高(工程最佳化好可 > 50%)高(軟硬協同設計,利用率高)因架構而異低(通用核排程開銷大)
精度生態靈活性極高(FP32/FP16/BF16/TF32/INT8/FP8)較窄(通常 BF16/FP8 等,FP32 較弱)可自定義依賴 SIMD/AVX,格式受限
擴充套件叢集總 FLOPS易於橫向擴充套件,但受互聯限制專有互聯(如 ICI),有效 FLOPS 高非主流極少用於大規模 AI 叢集
能效比 (FLOPS/W)中(高功耗)高(低功耗,專用架構)中-高
代表場景訓練+推論全覆蓋大規模訓練與推論(閉源生態)特定低延遲推論雲端 CPU 推論/小型模型

注:上表“高/低”基於各代際中高階產品的相對關係,具體數值需參照各廠商最新白皮書,此處不作確數認定。

上下游

上游:決定 FLOPS 的硬體與軟體基礎

  • 晶片架構設計(指令集、計算單元、片上網路)
  • 先進製程與封裝(製程升級提升頻率與能效,3D 封裝擴大總 FLOPS)
  • 高速互連(NVLink/PCIe/CXL,決定多卡 FLOPS 聚合效率)
  • 數學庫與編譯器(cuBLAS、cuDNN、Triton、MLIR 等,直接影響 MFU)
  • 精度格式標準(IEEE 754 擴充套件,TF32、BF16 等)

下游:消耗 FLOPS 的應用場景

  • 大語言模型訓練(千卡~萬卡叢集,訓練一個模型需數十億 ExaFLOPs)
  • AI 推論服務(每 token 需要的 FLOPs 決定服務成本和延遲)
  • 科學計算與模擬(分子動力學、氣象預測等,常與 AI 融合)
  • 自動駕駛(端側晶片 FLOPS 限制模型部署)
  • 生成式內容(文生圖、影片生成,單次推論 FLOPs 很高)

關鍵指標

  • 理論峰值 FLOPS(按精度分列):單加速器/晶片的計算上限,用於比較硬體潛力。
  • 總訓練運算量 (Total FLOPs):訓練一個完成模型所需的浮點運算總次數,衡量訓練門檻。
  • Token 級推論 FLOPs:每生成一個 token 所需運算數,決定生成速度和成本。
  • FLOPS 利用率 (MFU):實際達到的 FLOPS / 理論峰值 FLOPS,反映系統工程能力。
  • FLOPS/W (能效比):每瓦算力,資料中心和邊緣部署的核心成本指標。
  • FLOPS/$ (算力成本):單位資金可購得的算力,涉及採購、能源、運維。
  • 有效叢集 FLOPS:聯機系統在真實工作負載下的聚合 FLOPS,減去通訊等開銷後的產出。
  • 計算密度 (FLOPS/Byte):每從記憶體讀取一個位元組資料能進行的浮點運算數,反映演算法是否計算受限。

供需與市場資料

受限於檢索失敗,以下為基於行業研究架構的定性描述,未引用具體第三方數字。

需求側 大型模型規模持續擴張,據公開資訊:從GPT-3到GPT-4推測的訓練 FLOPs 增長了 2~3 個數量級;當前最強開源模型一次預訓練耗用數以萬計 GPU 小時,相當於數 ZettaFLOPs 量級(1 ZettaFLOPs = 1e21 FLOPs)。業界預測,為了維持 scaling law 的效益,未來訓練算力需求可能每18個月翻十倍。雲端端推論方面,生成式 AI 的每日 token 消耗已達萬億級,對應的推論 FLOPs 需求極其巨大。

供給側 GPU 和 AI 加速器出貨量持續攀升,單晶片 FP16/BF16 算力每代提升約 2~3 倍(受架構和製程紅利驅動)。主力訓練卡現普遍可達數百 TFLOPS,即將突破 1 PFLOPS(BF16)。但供給側存在明顯的產能和能效瓶頸,峰值 FLOPS 的增長速度落後於頭部模型訓練需求,迫使產業採用更多叢集化與稀疏化手段。

市場供需特徵 高 FLOPS 算力供不應求,尤其在 FP8/BF16 訓練和推論卡上。等候週期長,雲端租賃價格高企。FLOPS 已成為 AI 時代硬通貨,各國將算力基礎設施等同於戰略資源。

代表公司與資本對映

  • NVIDIA:全球 FLOPS 生態的絕對核心。通過 GPU 架構迭代(Tensor Core 演進)、互聯技術(NVLink/NVSwitch)和軟體棧(CUDA、NeMo Megatron)定義了 AI 算力標準。
  • AMD:Instinct 系列隨 CDNA 架構迭代,FP16/BF16 FLOPS 追趕 NVIDIA,開源 ROCm 生態逐步完善。
  • Google:TPU 路線由自身巨大內部需求驅動,在低精度 FLOPS 和利用率上樹立標杆,並與 JAX 架構耦合,對外提供雲端服務。
  • NVIDIA 的競爭挑戰者:包括 Intel(Gaudi/Falcon Shores)、自研晶片的 AWS(Trainium/Inferentia)、華為昇騰等,均試圖在特定精度 FLOPS 和能效上差異化。
  • 大型模型公司與雲端廠商:OpenAI、Meta、Microsoft、位元組、阿里、騰訊等是 FLOPS 最大的消費者,同時通過自研或定製化方案爭取供應鏈話語權。

資本對映:算力指數級消耗推動資料中心和半導體投資,NVIDIA 估值與 AI 算力 FLOPS 需求高度繫結。圍繞 FLOPS 利用率提升、分散式訓練加速、專用推論晶片的初創公司持續獲得融資。

投資邏輯

  • 單點峰值不可迷信:一隻股票/公司的長期價值在於能否提供“高有效 FLOPS”和低遷移成本,而不只是紙面算力。
  • 能耗比與總擁有成本:隨著電力約束加大,FLOPS/W 成為比絕對 FLOPS 更重要的投資壁壘。
  • 軟體生態護城河:CUDA 生態使得 NVIDIA 在同等 FLOPS 下實際產出更高,後進者即使硬體 FLOPS 接近,商業替代難度仍很大。
  • 推論側 FLOPS 爆發:當訓練增長曲線逐步平緩,推論將成為更大算力市場,低精度推論 FLOPS 和高吞吐服務的公司更受益。
  • 叢集化效率:能夠提供從矽、封裝到互聯的全棧方案(如 NVL 一體化機櫃)的公司,將控制下一代有效 PFLOPS 密度。

常見誤讀糾偏

誤讀1:把 FLOPS 當成實際的神經網路執行速度¹ 很多宣傳中用晶片峰值 FP16 FLOPS 來線性推斷模型訓練/推論時長,但忽略了記憶體頻寬、編譯器最佳化、架構開銷和通訊代價。真實效能須用實測吞吐( tokens/s )衡量。高 FLOPS 晶片若搭配傳統記憶體或不善程式設計,實測可能遠不如一枚中 FLOPS 但架構平衡的晶片。

誤讀2:不同精度 FLOPS 可以直接比較² 誤以為 “A 卡 300 TFLOPS(FP8) > B 卡 200 TFLOPS(BF16),所以 A 更快”。實際上 FP8 數值範圍較小,需要特定的縮放、量化演算法支援,不一定適用於所有模型;BF16 訓練穩定性更優。必須看目標負載對應的可用精度和支援度,而非直接比數字。

誤讀3:FLOPs 與 FLOPS 混淆³ 許多論文和報告將 FLOPs(運算次數)與 FLOPS(速率)混用。如“模型有 3e23 FLOPs”指總運算量,而非 3e23 FLOPS 的速率。高 FLOPs 模型只表示耗算力大,不意味速度快。

學習路徑

  1. 基礎理解:閱讀 NVIDIA CUDA 程式設計指南中關於 FLOPS 計算的理論,以及 Roofline 模型(效能上限由計算和頻寬共同決定)。
  2. 深度學習算力估算:研究“Scaling Laws for Neural Language Models”(Kaplan et al.)中訓練計算量的計算方法;學習 Transformer 網路中每 token 的 FLOPs 公式推導(Karpathy 的 Llama.c 等文章)。
  3. 精度與數值格式:查閱 IEEE 754 及相關擴充套件,理解 FP32/FP16/BF16/TF32/FP8 的位元分佈,以及混合精度訓練論文(Micikevicius et al., 2018)。
  4. 分散式訓練:深入 Megatron-LM 和 DeepSpeed 原始碼,分析張量/流水/資料並行如何影響有效 FLOPS,理解通訊原語(AllReduce, ReduceScatter, All-to-All)的時間開銷。
  5. 硬體測讀:比較 NVIDIA A100/H100、AMD MI250X/MI300X、Google TPU v5p 等白皮書,親手計算各精度峰值 FLOPS,並學習使用 NVIDIA Nsight 或效能撥測工具觀測 MFU。
  6. 產業追蹤:關注三大雲端廠商和 Meta 的硬體部署演講,以及 SemiAnalysis 等渠道對於有效 FLOPS 趨勢的分析。

一句話總結

FLOPS 是深度學習算力的標尺,但真正決定速度和成本的是“在正確精度上、以可接受的時延和能效,實際輸出多少個有效的 FLOPS”;脫離精度、利用率和系統瓶頸談 FLOPS,無異於只看引擎功率不看整車傳動。

延伸閱讀與來源

  • 因本次檢索失敗,未能提供具體連結。建議查閱:
  • NVIDIA 各代 GPU 架構白皮書(Volta, Ampere, Hopper)中關於張量核心 FLOPS 計算的章節。
  • Google TPU 論文“A Domain-Specific Architecture for Deep Neural Networks”及後續 v4/v5 論文,瞭解其 FLOPS 效率設計。
  • “Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM” (Narayanan et al.),學習分散式訓練 FLOPS 利用。
  • 行業追蹤部落格:SemiAnalysis、Chiplet 相關研究報告,定期更新各晶片 FLOPS 資料和利用率分析。
  • 公開專題討論:MLPerf 基準測試結果,可對比各平台在特定模型上的實際 FLOPS 產出。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型