模型層 開放閱讀

GPU 小時

GPU-hour

概念 ID
gpu-hour
更新時間
2026-05-29
來源數量
待補

GPU 小時

3 秒看懂

GPU 小時 (GPU-hour) 是衡量 GPU 計算資源使用量的標準計量單位,1 GPU 小時 = 1 塊 GPU 執行 1 小時。它既是雲端廠商的計價基礎,也是 AI 模型訓練成本與研發效率的企業級標尺——訓練一個千億引數大型模型所消耗的數十萬甚至數百萬 GPU 小時,可以直接換算為數百萬至數千萬美元的算力賬單。

3 分鐘產業解釋

在 AI 產業化浪潮下,GPU 小時已取代“浮點運算次數”(FLOPS) 成為更落地的算力衡量指標。它將硬體型號差異(H100/B200/A100/昇騰等)、叢集互聯效率、虛擬化開銷、軟體棧成熟度等複雜變數統一抽象為可比較、可交易、可預算的標準化服務單元,是算力從“技術規格”走向“商品流通”的關鍵一步。

這一指標對產業的實質意義體現在三個層面:

  • 成本核算:企業根據模型訓練預估所需 GPU 小時總量制定研發預算,進而做出雲端上租賃或自建叢集的資本支出決策。以 2024 年行業慣例計,一個千億稠密引數模型從零訓練約需 50 萬–200 萬 H100 GPU 小時,對應按需市場賬單約 150 萬–600 萬美元 [Meta 與各大實驗室公開訓練報告推算區間]。
  • 效率標尺:架構與推論引擎最佳化(如 vLLM、TensorRT-LLM、DeepSpeed)的價值常被量化為“單次訓練/推論的 GPU 小時消耗降低百分比”,這直接換算為節省的雲端開支或等額算力可支撐的額外業務量。
  • 行業景氣度晴雨表:頭部雲端廠商 GPU 小時消耗總量及其年增率增速,間接反映 AI 應用的落地規模與模型訓推活躍度。2024 年全球主要雲端廠商 AI 例項營收年增率增速普遍超過 100% [各雲端廠商 2024 財年報告彙總]。

GPU 小時的定價受 GPU 型號、雲端供應商、區域、承諾使用量(按需/預留/競價)等多維因素影響。據 2024 年主流雲端廠商公開定價頁面彙總,單張 H100 按需 GPU 小時價格約在 2–5 美元區間(不同區域與例項規格差異顯著),而大規模預留例項或自建叢集可將單位 GPU 小時成本壓縮至按需價格的 30%–50% [雲端廠商財報及算力雲端平台公開定價,2024]。

技術原理

GPU 小時本質上是對平行計算時間資源的商品化度量,其底層機制涉及 GPU 時間片排程、虛擬化切分、功耗管理與計費邊界定義。

硬體時間計量基礎

GPU 內部整合高精度時鐘計數器,精度通常在納秒級。當 GPU 計算核心執行 CUDA kernel 時,其實際執行時間 = kernel 所需時鐘週期數 ÷ 核心執行頻率。現代資料中心 GPU 普遍支援動態頻率調節(Dynamic Frequency Scaling),受溫度、功耗上限、負載型別影響,同一 kernel 在不同條件下的耗時波動可達 5%–15% [NVIDIA 官方技術白皮書,2023]。雲端廠商對使用者暴露的 GPU 小時並非 kernel 實際執行時間的累計,而是物理 GPU 被整卡分配的時間視窗——即把 GPU 全部計算單元(CUDA Core/Tensor Core)、視訊記憶體、NVLink 埠等資源打包獨佔的時段,不論使用者實際利用率高低,均以牆鍾時間計費。

虛擬化與多例項 GPU (MIG)

部分資料中心 GPU 支援物理資源切分:以 NVIDIA A100 的 MIG (Multi-Instance GPU) 技術為例,單張 A100-80GB 最多可切分為 7 個獨立 GPU 例項,每份獲得約 1/7 的計算單元與視訊記憶體資源。1 個 MIG GPU 小時即為一個切分例項執行 1 小時,其定價通常按整卡小時價格的 1/7 比例上浮 10%–20% 的隔離溢價。切分帶來的效能損失約 2%–3%(主要來自記憶體頻寬隔離開銷與排程干擾),但顯著改善了輕量推論與開發測試場景的成本效率 [NVIDIA MIG 技術文件,2023]。

有效算力轉化鏈

從牆鍾 GPU 小時到實際有效算力產出,存在一條多環節損耗鏈。其簡化模型可表示為:

原始 GPU 小時 (牆鍾)
→ 剔除閒置等待 (資料載入 I/O、通訊同步 barrier、拓撲擁堵)
→ 有效計算週期 (SM/Tensor Core 活躍率)
→ 有效浮點運算 (指令排程效率、資料型別匹配度)
→ 實際模型產出 (受功耗牆降頻、視訊記憶體頻寬瓶頸制約)

每一環節均產生效率損失。大型模型訓練實測中,模型浮點利用率(Model FLOPs Utilization, MFU)通常僅 35%–50%(以 Meta Llama 系列、DeepSeek 等公開技術報告為參考區間),意味著每消耗 100 個 GPU 小時,僅有 35–50 小時等價於理論峰值算力的有效產出。剩餘時間消耗在通訊同步、資料搬運、容錯檢查點與架構開銷中。

關鍵引數

衡量 GPU 小時的經濟性與技術效率,以下引數構成核心評估維度:

引數定義典型參考值 (2024)資料來源
GPU 小時單價單張 GPU 執行 1 小時的租賃成本按需 H100: $2–5/h; 自有叢集折舊分攤: $1.5–$4/h雲端廠商定價頁面; NVIDIA TCO 估算模型
訓練總 GPU 小時完整訓練一個模型所消耗的 GPU 小時總量千億稠密模型: 50 萬–200 萬 H100 小時Meta Llama 3、DeepSeek-V2 等公開技術報告
MFU (模型浮點利用率)有效計算時間 ÷ 牆鍾 GPU 小時35%–50%(大型模型訓練)行業公開論文與工程分享彙總
推論吞吐/成本每元 GPU 小時可處理的輸出 tokens 數視模型規模與架構最佳化差距極大,公開資料未見統一基準
可用性 (Availability)GPU 例項在指定時間內可正常使用的機率按需例項 SLA 通常 ≥99.9%;競價例項無 SLA 保障各雲端廠商 SLA 協議
中斷率 (Preemption Rate)競價例項單位時間內被回收的機率視區域與時刻波動顯著,部分割槽域高峰時段中斷率可超 20%/h雲端廠商競價例項文件

上述引數並非孤立評價指標,需在“有效 GPU 小時成本”架構下綜合考量。例如,低 MFU 意味著為獲取單位有效算力需支付數倍 GPU 小時賬單,削弱低價 GPU 小時的表面優勢。

技術路線

不同 GPU 例項計費模式構成差異化的技術經濟路線,其本質是在成本、可用性、彈性和算力一致性之間做出權衡。

維度按需 GPU 小時預留/包年 GPU 小時競價/可搶佔 GPU 小時自有叢集 GPU 小時
單價 (相對指數)基準 1.00.5–0.70.2–0.4(瞬時)視規模:0.3–0.8
可用性保障高,即開即用合約期內保證無保障,隨時可被回收需自行維護,故障自愈
彈性擴縮分鐘級固定額度,可預先擴充套件依賴市場餘量,不確定有限,硬體採購週期數月
算力一致性同例項型別一致一致可能與按需一致或稍弱可定製最佳化,一致性最高
適用場景突發訓練、開發測試持續推論、週期性微調容錯批處理、彈性訓練高頻訓練、自研模型、合規隔離
長期總擁有成本最高較低最低(扣除重算損耗前)大規模下最低,但前期 capex 極高

核心結論:單純比較 GPU 小時名義價格具有誤導性。以競價例項為例,其單價可低至按需的 20%–40%,但分散式訓練中單節點被回收往往導致整個訓練步回滾,重算開銷與人工干預成本可使“有效 GPU 小時成本”反向高於預留例項 40% 以上 [雲端廠商內部估算,2024]。技術路線的選擇須匹配任務對中斷的容忍度、架構的彈性恢復能力與團隊運維成熟度。

上游

GPU 小時的供給成本由上游硬體產業鏈各環節共同決定,其產能波動與價格變化最終沿鏈條傳導至 GPU 小時基準定價。

  • GPU 晶片設計/IP:NVIDIA 佔據資料中心 GPU 市場主導份額(約 80%–90%,2024 年各第三方半導體研究機構估算),AMD MI300X 系列與 Intel Gaudi 3 正在形成替代供給。
  • 先進製程與封裝:台積電 CoWoS (Chip-on-Wafer-on-Substrate) 先進封裝為 H100/B200 等高階 GPU 的關鍵產能瓶頸。2024 年 CoWoS 產能持續緊缺,擴產節奏直接影響 GPU 出貨量與雲端市場 GPU 小時供給 [台積電 2024 年投資者會議揭露]。
  • HBM 高頻寬記憶體:SK 海力士、三星、美光三家主導 HBM3/HBM3E 供應。HBM 產能分配與價格的季度波動,直接影響高階 GPU 的物料成本與交付週期。
  • 網路互聯晶片:InfiniBand(NVIDIA/Mellanox)與乙太網路 RoCE 交換器晶片構成多卡互聯基礎,影響萬卡叢集的實際 MFU 與有效 GPU 小時產出比。
  • 伺服器 ODM/OEM:超微、廣達、鴻海等廠商的 AI 伺服器出貨週期與組裝產能,構成 GPU 整機供給的關鍵中游環節。
  • 資料中心基礎設施:電力容量、液冷部署、機架空間等成為新增約束。2024 年起,單機櫃 AI 算力密度已推升至 40–100kW,部分割槽域資料中心電力審批週期延長至 24 個月以上,對 GPU 小時供給彈性形成硬約束 [資料中心行業調研究報告告,2024]。

上述各環節疊加,使得高階 GPU 小時供給長期處於緊平衡。任何單點環節的產能波動或地緣貿易限制,均可能放大 GPU 小時價格的短期波動。

下游

GPU 小時的消費端覆蓋訓練、推論與傳統 HPC 三大場景,各場景的消耗特徵與增長驅動力差異顯著。

  • 模型訓練:單次大型模型訓練消耗 GPU 小時量級持續攀升。2020 年 GPT-3 訓練消耗約 3.64e3 Petaflop/s-day(摺合約數萬 V100 GPU 小時),至 2024 年千億稠密模型典型訓練消耗已達數十萬至百萬 H100 GPU 小時量級。混合專家架構 (MoE) 雖降低單次推論 FLOPs 需求,但訓練階段的門控網路與負載均衡引入額外通訊開銷,訓練 GPU 小時需求絕對值仍在上升——2024 年頭部 AI 實驗室年訓練 GPU 小時消耗年增率增速超 100% [多家 AI 實驗室公開技術報告與行業估算]。
  • 推論服務:生成式 AI 推論已躍升為 GPU 小時消耗的結構性最大增量。單次推論所需 GPU 時間極短(毫秒至秒級),但高併發下 GPU 例項需持續駐留,日累計 GPU 小時消耗可觀。部分頭部 AI 原生應用日耗數萬至十萬 GPU 小時 [公開資料未見精確揭露,系基於第三方流量估算與 API 呼叫量反向推算]。
  • 科學計算與渲染:傳統 HPC、分子動力學、氣象模擬、影視渲染等場景持續穩定消耗 GPU 小時,但增速遠低於 AI 場景。這部分需求對 GPU 型號的更新彈性較弱,偏向使用成熟且供給相對充裕的上代 GPU(如 A100/A6000),構成 GPU 小時的存量基本盤。

受益公司

從 GPU 小時價值鏈可劃分出四類核心參與主體,其受益邏輯各不相同:

  1. “房東型”雲端巨頭:AWS、Microsoft Azure、Google Cloud 三家合計佔有全球 AI 加速器雲端服務市場份額約 65% [第三方調研機構 2024 年估算]。GPU 小時營收計入其 IaaS/PaaS 營收,受益於 AI 算力需求的高增長與高粘性。2024 年各雲端廠商財報顯示,AI 相關營收正成為其增長最快的業務板塊。
  2. “GPU 即服務”專業算力雲端:CoreWeave、Lambda Labs 等專注 GPU 密集型工作負載的新型算力雲端,通過大規模預購 GPU、自建高速互聯叢集和靈活計費模式(包括算力合約、收益權融資),向客戶提供比傳統大雲端更具價效比的 GPU 小時產品,正在切取市場份額。
  3. “消費大戶”AI 實驗室:OpenAI、Anthropic、Meta、xAI、Google DeepMind 等——GPU 小時的全球最大消耗方,其年度訓練預算直接拉動上游 GPU 採購與雲端服務營收。各家用於模型訓練的 GPU 叢集規模與總 GPU 小時消耗量,已成為產業競爭的核心關注指標。
  4. “效率工具”提供商:vLLM、TensorRT-LLM、DeepSpeed、Megatron-LM 等架構/引擎的開發者組織——通過最佳化編譯與排程降低使用者的 GPU 小時消耗,其技術採納率間接影響整個市場的 GPU 小時需求彈性。擁有領先推論架構的廠商(如 NVIDIA 的 TensorRT-LLM 生態)正將“每 GPU 小時產出 tokens”作為差異化競爭的核心賣點。

市場規模

基於公開資料與第三方研究報告的定性及定量分析 [多家投行 2024–2025 年 AI 基礎設施報告綜合]:

  • 需求端:2024 年全球 AI 加速器雲端服務營收(包含訓練與推論)估約 300–500 億美元區間,核心驅動力為 GPU 小時消耗量年增率增長超 100%。訓練需求集中在少數超大規模客戶,呈“脈衝式、高集中度”特徵;推論需求則隨生成式 AI 應用滲透而持續斜率上升,結構更為分散。
  • 供給端:2024 年全年 H100 等效高階 GPU 全球出貨量估算約 150–250 萬張(各研究機構口徑不一),其中雲端廠商及大型實驗室採購佔比超 70%。新增供給仍無法完全滿足需求,頭部雲端廠商的 GPU 例項在多數區域維持排隊等候狀態。
  • 市場結構:AWS、Azure、GCP 三家合計約佔 65% 份額;CoreWeave、Lambda 等獨立算力雲端約佔 10%–15%;其餘為各區域本土雲端與私有部署。獨立算力雲端的份額正在以較快速度上升。
  • 長期趨勢:據第三方估算,2024–2028 年全球 AI 加速器雲端服務營收 CAGR 約為 30%–45%(口徑差異大,取決於是否包含推論與邊緣場景)。算力期貨、長期預留合同、多年度採購承諾正在興起,GPU 小時交易模式從“簡單販賣”向“算力金融化”演進。

玩家對比

選取雲端廠商與算力雲端兩個層次進行代表性橫向對比(以 2024 年公開資訊為基準):

維度AWSAzureGCPCoreWeave (參照)
GPU 例項豐富度最全 (P/G 系列,含 H100/B200 路線圖)較全 (NC 系列)聚焦 Nvidia 高階例項 (A3)深度聚焦 H100,例項型別較少
全球部署節點最多略次於 AWS第三相對有限(以北美為主)
GPU 小時按需單價偏高 (H100 ~$3–$5/h)相近區間相近區間通常低於大雲端 20%–30%
預留/批次折扣有 (1–3 年承諾)有長期算力合約
競價例項折扣約 60%–90%約 60%–90%約 60%–90%提供類似模式
生態與配套服務最完善 (SageMaker 等)完善 (Azure ML)完善 (Vertex AI)相對薄,專注裸算力

比較核心發現:傳統大雲端在生態完善度、全球節點覆蓋、混合雲端方案與合規認證上佔據絕對優勢;獨立算力雲端則在價格競爭力、高速互聯最佳化和柔性供應上建立差異化。企業需根據自身對配套服務、全球部署、資料合規與成本敏感度的權重做出選擇,而非單純比較單品 GPU 小時標價。

風險

GPU 小時作為 AI 產業的關鍵成本單元,面臨以下幾類顯著風險:

  • 供給約束與價格波動風險:高階 GPU 產能集中於少數供應商與代工廠(台積電 CoWoS、HBM 產能),地緣政策變化或單點供應鏈中斷可能導致 GPU 小時供給驟緊、價格暴漲。2023–2024 年 H100 全球供不應求即為前例。
  • 技術替代與資產貶值風險:GPU 代際效能躍升極快(H100 相對 A100 訓練效能提升約 2–4 倍,視精度與模型而定)。對於簽訂 3–5 年長期預留合同的買家,若新型號效能/能效比大幅領先,已鎖定的 GPU 小時可能面臨難以轉售與技術相對貶值的雙重壓力。
  • 需求錯判與產能過剩風險:若模型最佳化技術(蒸餾、量化、稀疏化等)使單位任務所需 GPU 小時大幅下降,或 AI 應用商業化低於預期導致推論需求增速放緩,GPU 小時可能從供不應求轉向過剩,雲端廠商預留合同公允價值將承壓。當前仍處於全球供給緊缺階段,但需持續追蹤 HBM 產能與先進封裝擴產節奏以判斷潛在拐點。
  • 競價例項的隱性成本風險:如誤讀糾偏部分所述,片面追求競價 GPU 小時低價,可能在賬面上削減成本的同時因頻繁中斷與重算帶來 40% 以上的有效成本反超。
  • 碳成本與合規風險:GPU 小時的消耗對應顯著的電力消耗與碳排放。2024 年各主要司法管轄區 ESG 揭露要求趨嚴,GPU 小時消耗領先企業面臨的碳合規成本與資訊揭露壓力持續上升。

誤讀糾偏

  • 誤讀一:“一個 GPU 小時就是一個 GPU 跑了一小時的計算”
    糾正:實際訓練與推論中,因資料 I/O 阻塞、多卡通訊同步、架構開銷與功耗牆降頻,大量牆鍾時間內 GPU 計算單元處於未滿載或閒置狀態。業界用 MFU 指標衡量有效算力佔比,大型模型訓練 MFU 通常僅 35%–50%。100 個賬單 GPU 小時,可能僅貢獻 35–50 個有效算力小時。評價 GPU 小時價值時,首先應區分“賬單 GPU 小時”與“有效 GPU 小時”。

  • 誤讀二:“GPU 小時價格越低越好,選最便宜的方案就對了”
    糾正:低價格 GPU 小時若伴隨高網路延遲、頻繁中斷回收、算力不一致(虛標/降頻卡),其實際有效訓練產出可能大幅低於預期。追求最低名義單價可能陷入“買得便宜、用起來貴”的困境。正確的評估架構是 “有效 GPU 小時成本” = 總 GPU 小時賬單 ÷ 實際完成的有效 FLOPs 產出。這個架構同等重視單價與利用率,是衡量真實經濟性的唯一合理視角。

  • 誤讀三:“自有叢集的 GPU 小時成本一定比雲端上便宜”
    糾正:自有叢集的單位 GPU 小時分攤成本在大規模且高利用率場景下確實低於雲端按需價格,但需計入前期 capex、運維人力、電力報裝週期、GPU 代際折舊等完整總擁有成本。對於 GPU 利用率低於 40%–50% 的團隊,雲端上按需或競價 GPU 小時可能在整體 TCO 上更具優勢。自有叢集的真正優勢在於高利用率基線下的長期總成本與定製化控制權,而非天然更便宜。

最新事件

  • 2024 年各雲端廠商 AI 營收加速:AWS、Azure、GCP 2024 年財報顯示 AI 相關營收季度年增率增速均超 100%,GPU 例項擴容為資本支出首要方向。以 Microsoft Azure 為例,其 FY2025 Q1(截至 2024 年 9 月)AI 服務貢獻的營收增速居各業務之首 [Microsoft 財報公開揭露]。
  • NVIDIA Blackwell 系列釋出:2024 年 GTC 釋出 B200/B100,宣稱訓練效能達 H100 的 2–3 倍,推論效能提升更高。新一代 GPU 小時的計算產出效率將再次重劃行業基準線,對前代 GPU 預留合約的價效比構成挑戰。
  • CoreWeave 等獨立算力雲端加速融資與擴張:2024 年 CoreWeave 完成多輪大額債務與股權融資,估值快速攀升,反映資本市場對 GPU 小時獨立供應模式的認可度提升 [CoreWeave 融資公開公告]。
  • 算力期貨與長期合約興起:多家雲端與算力供應商在 2024 年推出以 GPU 小時為標的單位的預留合同創新模式,包括可拆分、可交易的算力時間單位,算力“遠期合約”與“期權結構”開始被大型客戶採納用於鎖定預算。
  • 跨雲端 GPU 小時比價與排程平台湧現:第三方比價工具與多雲端算力排程中介軟體的出現,使 GPU 小時價格的資訊不對稱程度降低,推動市場效率提升。

追蹤指標

持續追蹤 GPU 小時產業趨勢,建議關注以下可觀測指標(均基於公開資料可得性):

  1. 主要雲端廠商 AI 營收與增速:AWS、Azure、GCP 季度財報中與 AI 例項/服務相關的營收揭露與增速展望。
  2. 頭部 GPU 出貨量與交付週期:台積電 CoWoS 月度產能及季度擴張進度(台積電投資者會議例行揭露);NVIDIA 資料中心業務季度營收與展望。
  3. 典型 GPU 小時價格走勢:以 H100/b200 按需、預留、競價三類例項在主要區域(美東/美西/歐洲/東南亞)的公開定價為取樣點,建置價格變化指數。
  4. 大型模型訓練 GPU 小時消耗:頭部 AI 實驗室(Meta、OpenAI、Anthropic 等)在技術報告中揭露的訓練總 GPU 小時、硬體數量與 MFU。
  5. 開放式模型社群的 GPU 需求訊號:Hugging Face 熱門模型下載量、推論 API 呼叫量增速,可作為推論 GPU 小時需求的滯後代理指標。
  6. AI 資料中心電力負荷:主要算力樞紐區域(如維吉尼亞、愛爾蘭、新加坡等)的電網負荷增量與新建資料中心審批情況。
  7. HBM 與先進封裝產能投資:SK 海力士、三星、台積電就 AI 儲存與封裝產線的資本支出展望,為 GPU 供給側的領先指標。

信源

  • NVIDIA 官方 GPU 雲端運算白皮書及 TCO 估算方法論(nvidia.com)
  • 各主要雲端廠商 GPU 例項公開定價頁面:AWS EC2 P/G 系列、Azure NC 系列、GCP A3 系列
  • Meta AI 技術報告:《Llama: Open and Efficient Foundation Language Models》《Llama 2》《Llama 3》及相關研究論文 (arxiv.org)
  • 《Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM》(arxiv.org)—— 分散式訓練 GPU 時間利用與效率分析
  • NVIDIA A100 MIG 技術文件與效能隔離測試報告(docs.nvidia.com)
  • SemiAnalysis、Tim Dettmers 等獨立技術分析與 GPU 評測系列
  • 台積電、SK 海力士、三星季度投資者會議材料與公開產能揭露
  • 瑞銀/高盛/摩根士丹利 2024–2025 年 AI 基礎設施與半導體行業研究報告(面向機構投資者公開發布版本)
  • CoreWeave、Lambda Labs 等獨立算力雲端官網公開定價與產品文件
  • 各雲端廠商季度財報與年度揭露(AWS/Azure/GCP AI 相關營收與資本支出,2023–2024)
  • 資料中心行業第三方報告:McKinsey、CBRE、JLL 等針對 AI 資料中心電力與空間趨勢的研究摘要
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型