升級率
3 秒看懂
升級率(Escalation Rate)是衡量AI計算硬體(GPU、加速卡、ASIC)在其完整生命週期內,僅通過軟體棧迭代、編譯器最佳化、演算法庫更新與系統級調優,就能不斷解鎖的等效算力增長率。它不是硬體規格的年際釋出節奏,更不是主頻或電晶體數量的變化,而是同一塊矽片的持續“增值”速度——令已經部署的存量資產在 TCO(總擁有成本)架構下變得一年比一年更具競爭力。這個指標直接決定了客戶的投資回報率(ROI)和硬體廠商的定價權與護城河深度。
3 分鐘產業解釋
在AI算力軍備競賽中,一次採購決策不只是比較“此刻哪張卡最強”,更是在對未來3–5年的價值衰減曲線下注。高升級率意味著:
-
對客戶(雲端廠商、企業、研究機構)
當前購買的硬體通過後續驅動、編譯器、數學庫和架構適配,能持續“免費”獲得更多有效吞吐。例如一張NVIDIA H100在大型模型訓練場景下,因其軟體棧在兩年內不斷最佳化(如引入 FlashAttention‑3、改進通訊庫 NCCL、融合運算元等),實際訓練效率可能比首發時提升 25%–40%。這 25%–40% 就是升級率的直觀體現,能夠延長硬體退役週期、降低單位 token 成本。 -
對廠商(NVIDIA、AMD、Intel 等)
將硬體銷售延伸為“硬體+持續軟體服務”的模式,升級率構成生態壁壘的核心。強大的軟體升級承諾允許廠商維持高階產品溢價,並防止客戶因“明年有更強的卡”而過度推遲採購——因為老卡本身也在顯著升值,等待的機會成本高昂。 -
對投資者與分析師
升級率是預判AI晶片公司經常性營收潛力與客戶粘性的先行指標。一家升級率曲線穩定而長尾的企業,其盈利模型更接近“算力訂閱制”,現金流量可預測性遠高於僅依賴硬體迭代頻率的公司。它會直接影響資料中心折舊政策、雲端服務定價和硬體毛利率的可持續性。
簡言之,升級率將“賣鐵”轉化為“賣算力服務”,是軟體定義硬體時代最重要的估值錨點之一。
技術原理
核心定義與建模
在技術層面,升級率主要反映軟體最佳化係數隨時間的變異。有效算力可近似表達為:
有效算力 = 理論峰值算力 × 硬體利用率 × 軟體最佳化係數
其中理論峰值算力由晶片設計、製程、頻率等硬體固定引數決定;硬體利用率受記憶體頻寬、片上網路、功耗牆等制約;軟體最佳化係數則是唯一能夠在硬體部署後持續提升的因子。升級率即該係數在生命週期內的增速。
軟體最佳化係數的四個來源
- 編譯時最佳化
智慧運算元融合(Kernel Fusion)將多個小運算元合併成單一核心,大幅減少全域性記憶體往返;迴圈展開、向量化、暫存器分塊等技術提升指令級並行度;資料版面配置重排則保證計算單元訪問模式對齊快取行,降低片外訪存壓力。 - 執行時最佳化
動態選擇並行策略(資料並行、張量並行、流水並行及其混合),配合記憶體池管理、預取策略和 MIG(多例項 GPU)切分,針對不同 batch size 或序列長度自適應配置執行計劃。 - 通訊與拓撲最佳化
在大規模分散式訓練場景中,AllReduce、All-to-All 等集合通訊操作往往是瓶頸。通過演算法改進(如 Ring、Tree、Recursive Halving‑Doubling 的自動選擇)、拓撲感知的 NCCL 通訊庫、以及 InfiniBand 或 NVLink Switch 的鏈路利用最佳化,可以將通訊等待時間充分隱藏,提升多卡叢集的線性加速比。 - 模型‑硬體協同設計
FlashAttention 系列、稀疏 Attention、混合精度(FP8、FP4)的硬體原生支援等演算法革新,直接“兌換”為硬體利用率提升。對於專用架構如 Transformer Engine(NVIDIA)或稀疏引擎(Graphcore、Cerebras),這部分的收益可能遠超原始硬體理論值的想像空間。
技術與金融的對應關係
升級率的本質是延遲最佳化帶來的資本性資產生產力提升。一筆購買 GPU 叢集的資本支出,在後續 3–4 年內,由於軟體最佳化係數不斷提高,其實際產出(訓練 tokens 數、推論 queries 數)持續上升,相當於同等硬體資產產生了更高的“營業營收”。當雲端廠商能夠將這部分生產力增量轉化為更高的例項定價或更低的運營成本時,升級率就對映為企業盈利的質量改善。
關鍵引數
-
軟體最佳化係數曲線
通常呈現“U 型”演化:硬體釋出初期由於生態適配尚未成熟,係數偏低;6–18 個月進入快速爬升期(主流架構完成適配、關鍵庫效能調優);生命週期後半段因挖掘邊緣最佳化而增速趨緩,但長尾依然存在。
行業定性觀察:NVIDIA 的 Ampere 架構(A100)在釋出 3 年內軟體最佳化係數累計提升約 50%–80%(來源:NVIDIA GTC 技術演講、MLPerf 結果跨版本比較,具體百分比因工作負載而異)。其他生態暫無同等層面的長期公開量化資料。 -
單位有效算力成本下降斜率
客戶視角:單位成本 = (硬體折舊 + 運維) / 有效產出。升級率越高,分母增速越快,TCO 斜率越陡峭。此指標對雲端廠商的競價決策和預留例項定價至關重要。 -
叢集利用率
在多節點訓練中,線性加速比是衡量軟體棧效能的終極標準。升級率體現在:相同叢集規模下,因通訊最佳化和運算元重排實現的吞吐上升,或相同吞吐下所需 GPU 時減少。例如,某千卡叢集在 NCCL 升級後 AllReduce 耗時下降 20%,整體訓練時間縮短,直接提升工程師生產力。 -
新模型適配速度
熱門開源模型(如 Llama 3、Mixtral、DeepSeek-V2 等)釋出後,在目標硬體上獲得官方最佳化支援的天數,是升級率“快慢”的領先訊號。極短的適配週期反映軟體團隊的敏捷性和生態號召力,能快速兌現升級率承諾。 -
軟體團隊規模與研發強度
公開資料顯示,NVIDIA 軟體工程師已超硬體工程師,2024 財年研發支出中軟體相關投入佔比持續擴大(NVIDIA 年報未單獨拆分軟體,但相關表述可佐證)。AMD 在 2023–2024 年大幅擴招 ROCm 團隊,人數年增率增長約 40%(來源:AMD 官方部落格及招聘公開資料)。軟體組織的體量是升級率未來的前置指標。
技術路線
不同硬體路線的升級率天花板和實現路徑截然不同,差異來源於軟體生態的厚度、開放性和垂直整合深度。
| 維度 | NVIDIA CUDA 生態 (H100, B200) | AMD ROCm 生態 (MI300X, MI250X) | 定製 ASIC (Google TPU v5p, AWS Trainium2) |
|---|---|---|---|
| 軟體驅動力 | 全棧垂直最佳化:從 CUDA、cuDNN、TensorRT 到 NCCL、Megatron‑LM,覆蓋訓練推論全鏈路。市場主導地位帶來海量使用者反饋閉環。 | 基於開源 ROCm 棧,通過 HIP 相容層轉化 CUDA 程式碼,逐步最佳化 MIOpen、rocBLAS 等關鍵庫。近年 PyTorch、Triton 的原生支援提速。 | 軟體棧針對單一架構極度最佳化,編譯器(XLA、Neuron)和架構(JAX、PyTorch/XLA)高度耦合。最佳化深度強但通用性受限。 |
| 升級率典型軌跡 | 架構釋出後持續 3–4 年,通過大版本 CUDA 和庫更新,累計軟體等效提升 50%–100%(行業估算,基於 MLPerf 排行榜歷史資料)。 | 追趕期,3 年內累計提升可能達 30%–60%,關鍵跳躍點依賴於 ROCm 大版本(如 ROCm 6.0)和官方容器對主流架構的深度適配。 | 雲端服務商內部緊密迭代,升級率不對外揭露,理論上單一負載可提升數倍(如 TPU 在特定 Google 模型),外部使用者難複製。 |
| 對客戶鎖定的意義 | 鎖定效應極強:遷移意味著放棄多年的預期升級價值,遷移成本遠超硬體差價。 | 鎖定較弱,但升級率的逐步建立正在改善客戶信心,推動混合雲端與多供應商戰略。 | 完全鎖定:客戶必須使用特定雲端和架構,升級率成為雲端服務溢價的一部分。 |
| 投資含義定性 | 確定性溢價,升級率支撐高階定價和 70% 左右的毛利率。 | 升級率是估值重估的催化劑,市場密切關注其兌現節奏。 | 升級率內化為雲端業務盈利能力,不單獨計價。 |
補充說明:Intel Gaudi 系列同樣依賴其 SynapseAI 軟體棧,2024 年 Gaudi 3 強調與 PyTorch 的整合深度,其升級率潛力正在建置中,但目前公開可比的長期效能增益資料有限,暫未列入詳細對比。
上游
升級率之所以能在硬體交付後持續提升,上游環節提供了“天花板”和“催化劑”:
-
EDA 工具與 IP 核
Cadence、Synopsys 等提供的先進設計工具,幫助晶片公司在物理設計階段模擬更優的儲存層次、匯流排拓撲,從而為後期的編譯最佳化預留更多“可玩空間”。例如,通過支援不同精度的靈活資料路徑,後期軟體可以動態選擇 FP8/INT8 計算,直接抬升軟體最佳化係數。但該環節對升級率的直接影響難以量化,更多是使能條件。 -
晶圓代工與先進封裝
台積電(TSMC)的 CoWoS、三星的 I-Cube 等 2.5D/3D 封裝技術,決定了 HBM 堆疊與計算單元的頻寬和能效。更高的片外頻寬意味著軟體層有更大余地通過預取、資料複用策略來隱藏延遲,從而放大升級率。NVIDIA 在 Blackwell 平台(2024 年釋出)整合更先進的封裝,配套軟體可進一步最佳化通訊與記憶體訪問模式。代工製程的演進(N4、N3)也提升了基礎能效,使得軟體調優的收益倍數更高。 -
互連與網路元件
NVLink、InfiniBand、乙太網路等高速互連晶片和交換器,構成了叢集升級率的管道。軟體最佳化集合通訊庫(如 NCCL)能夠利用底層互連拓撲,設計出更優的通訊模式。上游網路晶片設計公司(Broadcom、Marvell、NVIDIA 自研等)提供的底層能力越強,軟體升級獲益的幅度越大。
綜上,上游環節並不直接決定升級率數值,但其提供的硬體彈性邊界決定了軟體最佳化係數的上限。生態領導者往往自研互連和部分 IP,以打通硬體彈性和軟體最佳化的完整閉環。
下游
下游是升級率的受益方和最終驗證者,其行為模式又反向強化升級率的價值。
-
雲端服務提供商(CSP)
Microsoft Azure、AWS、Google Cloud、Oracle Cloud 等是 GPU/TPU 最大的單一買家。他們的採購決策中,預期升級率已嵌入折舊政策和例項定價模型。例如,2023 年微軟曾將伺服器和網路裝置預計使用年限從 4 年延長至 6 年(來源:微軟 2023 財年 10-K),側面反映硬體生命週期前期的軟體升級可能延長經濟壽命。同樣,Google 在 TPU 資源描述中強調“通過編譯器最佳化,TPU v5p 較上一代有效產出提升多倍”的說法,表明升級率影響其內部報價和雲端服務成本。 -
大型模型廠商與初創公司
OpenAI、Anthropic、Meta 等不僅在訓練階段需要大規模叢集,在推論部署中也高度依賴軟體最佳化來降低單次呼叫成本。他們常常參與共建升級率生態,例如 Meta 推動的 PyTorch 編譯棧(TorchInductor)、OpenAI 的 Triton 語言,本身就是升級率放大器。這些客戶對升級率的敏感度極高,他們會優先選擇軟體生態能承諾長期效能增長的硬體平台,並據此制定 multi‑year 資本支出計劃。 -
企業級使用者(金融、製藥、自動駕駛等)
這類客戶通常不具備深度編譯最佳化能力,直接依賴硬體廠商或雲端廠商的預編譯模型和容器。因此,打包後的“升級率即服務”至關重要。NVIDIA AI Enterprise、AMD ROCm 容器化方案等,本質上都是將軟體升級率封裝為訂閱或支援服務,直接出售給企業。下游企業通過延長硬體更換週期,將資本支出轉化為運營支出,升級率在此轉化為客戶留存率。
價值流轉回路:下游客戶為“未來的算力升級”付費 → 中游晶片廠商持續投入軟體兌現升級率 → 下游獲得更高 ROI → 迴圈強化生態。
受益公司
以下分析僅描述升級率驅動下的商業邏輯和受益機制,不構成任何投資建議或推薦。
-
NVIDIA
升級率商業模式的定義者和最大受益者。2024 財年資料中心營收達 475 億美元,年增率翻倍以上(來源:NVIDIA FY2024 10‑K),其 70%+ 的毛利率中,相當一部分溢價可解釋為“軟體預期升級價值”的預付。高升級率使客戶更願意接受 B200、H200 等新產品的較高訂單價格,因為整個平台的全生命週期價值被軟體放大。 -
AMD
通過 ROCm 開源棧和收購(如 Pensando、Nod.ai)快速縮小升級率差距。2023 年第四季度資料中心 GPU 營收超預期(AMD 財報未按型號單獨拆分 MI300 系列,但高層展望已上調),升級率的持續改善是客戶接納其硬體的重要理由。ROCm 6.0(2024 年初)全面支援 PyTorch 和多個主流大型模型,未來升級率的軌跡將直接決定其資料中心 GPU 營收的上限。 -
雲端廠商自研晶片(Google TPU, AWS Trainium/Inferentia, Microsoft Maia)
升級率內化於雲端服務的成本結構中,不獨立體現在晶片營收上。Google Cloud 的 TPU 服務通過 XLA 編譯器不斷最佳化,使客戶獲得相比購買通用 GPU 例項更低的總成本。類似地,Amazon 的 Neuron 軟體棧持續迭代,為 Trainium2 提供更具競爭力的升級率預期,鎖定 AWS 上的大型模型客戶。這些廠商通過提升雲端例項的價效比獲得市場份額,而非晶片毛利。 -
軟體棧與工具鏈公司(間接受益)
SambaNova、Cerebras、Graphcore 等非傳統架構的玩家,同樣極度依賴其專有軟體棧的升級率來講授 TCO 故事。如果其軟體能持續釋放超線性加速比,就有機會在特定垂直領域建置壁壘。此外,開源訓練架構及中介軟體(如 Triton、vLLM)的成熟度,也會放大所有硬體的升級率,從而間接推動硬體採用。
重申:以上僅從產業邏輯出發,不含有任何對股價、估值或買賣時機的判斷。
市場規模
“升級率”本身不是一個可獨立量化的市場類別,但其直接對映到幾項可統計的支出中:
-
AI 基礎設施軟體支出
根據 IDC 2023 年《Worldwide Semiannual Software Tracker》,人工智慧軟體平台(包括 AI 生命週期管理、AI 工程、AI 編排等)2022 年市場規模約 330 億美元,預計 2027 年超過 800 億美元。這一資料部分涵蓋了用於實現和交付升級率的工具鏈(模型最佳化、編譯器、推論引擎)。(來源:IDC 公開摘要,具體專案口徑為 AI Platforms Software) -
AI 訓練與推論服務市場
AI 在公有雲端中的支出是升級率最直接的變現渠道。Gartner 估算 2023 年全球公有雲端 AI 服務(AI 加速器即服務和 AI 平台即服務)市場規模約 340 億美元,2024 年預計增長 25%–30%(來源:Gartner 公開預測,無直接引用連結,基於其 2023–2024 釋出的《Forecast: Public Cloud Services, Worldwide》通用口徑)。升級率通過降低單位推論/訓練成本,支撐更高的雲端服務採納率,擴大市場總盤子。 -
晶片設計公司軟體研發投入
NVIDIA 2024 財年研發總費用為 86.8 億美元(來源:10‑K),市場分析師估算其中與軟體生態相關佔比超過 40%。AMD 2023 年研發費用約 59 億美元(來源:AMD 10‑K),其對 ROCm 和軟體生態的投入處於快速擴張中。這兩家研發支出之和中相當部分是在維持和提升升級率,構成“升級率投資市場”的核心部分。其餘 AI 晶片公司的軟體投入規模較小,公開資料未見彙總數字。 -
存量 GPU 資產中的升級率價值折算
這是一個隱性市場。假設 2023 年底全球部署了約 300 萬塊 A100 等效 GPU(基於 Omdia 和 IDC 資料中心加速器出貨量的粗略共識),若升級率在未來 2 年累計提供 50% 的有效算力增幅,按單卡 10,000 美元均價計算,相當於解鎖了近 150 億美元的額外生產力,無需新增硬體投資。這一部分雖不計入財報,但實質是升級率創造的“經濟價值”。
總體而言,升級率所依附的軟體生態和雲端服務市場已達數百億美元量級,且增速快於整體 IT 支出,凸顯其戰略重要性。
玩家對比
對比主要玩家的升級率策略、優勢與短板,進一步明確競爭格局。
-
NVIDIA
策略:全棧閉環,從 CUDA、庫、編譯器到系統軟體(DOCA、Magnum IO)均由內部掌控。優勢:生態飛輪極強,任何第三方效能最佳化最終都反饋到 NVIDIA 平台;訓練與推論的升級率確定性行業最高。短板:封閉性受到雲端廠商自研和開源生態的挑戰,客戶對鎖定成本日漸敏感,可能促使其在定價和開源上做出有限讓步。 -
AMD
策略:開源、開放,通過 ROCm 相容 CUDA(HIP 工具),並積極參與 PyTorch 上游貢獻,藉助開源社群力量稀釋 NVIDIA 鎖定。優勢:客戶可降低遷移風險,符合雲端廠商多源採購趨勢;升級率增長潛力大,若能在每代硬體上與 PyTorch/Triton 同步最佳化,可能形成差異化。短板:生態成熟度仍落後一代,部分重要庫(如 cuDNN 對應的 MIOpen)效能最佳化不夠全面,長期升級率曲線缺乏 3 年以上公開驗證。 -
Google(TPU)
策略:完全垂直整合,TPU 硬體+ XLA 編譯器+ JAX/TensorFlow 架構,僅面向 Google Cloud 客戶。優勢:對特定負載(尤其是 Google 內部大型模型)升級率可做到極致;不受通用性束縛,可激進採用新技術(如稀疏核、隨機計算)。短板:外部通用性差,生態封閉,升級率紅利對外部客戶不透明且不可遷移,存在供應商鎖定風險。 -
AWS(Trainium/Inferentia)
策略:依託 Neuron SDK 和 PyTorch/XLA 後端,吸引開發者使用自有晶片的差異化高性價比。優勢:與 AWS 服務深度整合,成本優勢顯著,通過內部迭代實現升級率。短板:軟體生態年輕,支援的模型和運算元種類不及 CUDA,升級率的廣度受限,目前主要覆蓋推論和部分訓練。 -
Intel(Gaudi 系列)
策略:通過 Habana Labs 提供 Gaudi 加速器,SynapseAI 軟體棧強調與 PyTorch 的即插即用。優勢:成本競爭力,整合網路加速,對某些模型(如視覺)價效比較好。短板:軟體生態與 CUDA 相比極為單薄,升級率的長期持續性和幅度缺乏實證,市場份額小,反饋迴圈弱。
通過這些對比可以看出,升級率競爭的實質是軟體生態廣度 × 最佳化深度的持久戰,領先者可以憑藉升級率獲得長期的規模經濟,而挑戰者必須在特定細分場景(如大型模型推論、特定雲端環境)首先證明升級率的可信度。
風險
升級率預期並非無風險,其脆弱性來自多個層面:
-
軟體研發產出不及預期
升級率依賴於持續、高質量的軟體迭代。若關鍵架構師流失、團隊重組、或技術路線出現錯誤轉向(如押注錯誤的 MLIR 方言推廣),可能導致某一代硬體在生命週期中後期升級率顯著低於預期,引發客戶不滿和減值。例如,對 FP8 或稀疏性的軟體支援延遲,會直接壓縮效能提升空間。 -
開源社群分裂與碎片化
對於 AMD 等依賴開源生態拉近差距的廠商,如果 PyTorch、Triton 等核心社群出現分支或不再優先支援其後端,將延遲升級率的兌現。開源生態的貢獻者競爭激烈,任何硬體廠商若在社群治理中失勢,其升級率曲線可能被對手“劫持”。 -
硬體架構跳變帶來的不連續風險
當硬體廠商引入激進的新架構(如從標準 GPU 轉向大規模張量核心陣列),原有軟體棧的積累不能全盤繼承,升級率可能出現“重置”。雖然長期可重新爬坡,但客戶可能在架構切換期面臨預期升級率中斷,導致採購延遲或流失。NVIDIA 從 Volta 到 Ampere 再到 Blackwell 的過渡雖然平滑,但若未來引入存算一體或光學互聯等顛覆式改變,平滑度可能受到挑戰。 -
客戶議價能力與折舊政策變更
雲端廠商等大客戶正在通過各種方式要求硬體廠商“證明”升級率,並可能在合約談判中要求將部分軟體溢價剝離。同時,如果經濟環境變化導致雲端廠商縮短伺服器折舊年限,硬體生命週期變短,則升級率的累積價值無法完全實現,廠商的溢價邏輯可能遭到削弱。 -
監管與供應安全風險
潛在的出口管制、獲得先進製程的限制,可能降低特定廠商的硬體基礎。軟體升級雖能部分彌補硬體劣勢,但天花板顯著降低,升級率的敘事將打折扣。
這些風險提示,升級率既是護城河,也是必須持續證明的承諾。
誤讀糾偏
-
誤讀:“升級率等於硬體釋出節奏,釋出越快升級率越高。”
糾偏:過快釋出了新型號會侵蝕存量硬體的升級率預期與客戶回報。硬體平台的生命週期過短(如少於 2 年),則軟體團隊來不及充分挖掘其潛力,客戶也會由於頻繁換代而持幣觀望。最健康的模式是硬體平台保持穩定 3–4 年,用軟體持續注入升級價值。 -
誤讀:“升級率是免費的午餐,任何廠商喊出軟體最佳化就能實現。”
糾偏:升級率是極度高壁壘的能力。它建立在龐大的軟體工程師團隊、使用者體量形成的正反饋迴圈、數十年的指令集和編譯器積累之上。沒有龐大裝機量,就沒有足夠多樣的 workload 來驅動最佳化,升級率也就無從談起。這是生態戰的核心,新進入者很難在短期內複製。 -
誤讀:“升級率完全是軟體的事,跟硬體設計無關。”
糾偏:硬體設計為升級率預留彈性至關重要。可重構的計算單元、靈活的精度支援、高效的通訊原語等,是軟體最佳化的空間來源。軟硬協同不僅依賴軟體,也需要硬體架構師在定義產品時就理解未來 3 年的軟體最佳化趨勢,這是一種“面向升級率的設計哲學”。
最新事件
-
NVIDIA Blackwell 平台釋出(2024 年 3 月 GTC)
NVIDIA 釋出了 Blackwell 架構的 B200 GPU 和 GB200 超級晶片,第二代 Transformer Engine 支援 FP4 精度,可帶來比 H100 高達數倍的推論效能。CEO 黃仁勳強調,通過軟體持續最佳化,Blackwell 平台在生命週期內將實現額外的“免費效能提升”。(來源:NVIDIA 官方新聞室、GTC 2024 主題演講) -
AMD ROCm 6.0 全面釋放 MI300X 能力(2024 年 4 月)
AMD 釋出 ROCm 6.0,增加了對 PyTorch、TensorFlow、JAX 等架構的更全面支援,並針對 MI300X 的 AI 推論和訓練進行了大幅最佳化。AMD 表示,新版本軟體棧使 MI300X 在大語言模型推論中的效能提升了高達 30%。(來源:AMD 官方部落格,題為“AMD ROCm 6.0 Unlocks New Levels of Performance for Instinct MI300X”) -
MLPerf Inference v4.0 結果凸顯軟體最佳化價值(2024 年 3 月)
在 MLCommons 公佈的 Inference v4.0 排行榜中,NVIDIA H200 和 AMD MI300X 等新硬體亮相,同時部分提交項通過軟體更新(TensorRT‑LLM、NVIDIA Triton 推論伺服器)在同一硬體上實現比上輪分數顯著提升,直接印證了升級率。例如,在 Llama 2 70B 場景中,軟體最佳化帶來額外 15%–25% 的效能增益。(來源:MLCommons 官網結果頁面) -
雲端廠商延長伺服器折舊期限趨勢延續
2023 年微軟延長裝置使用年限後,2024 年 AWS 在財報電話會中提及,其資料中心硬體的有效使用壽命因軟體最佳化和更高效的冷卻技術而延長,暗示升級率正向影響其折舊模型。(來源:AWS 2024 Q1 盈利電話會議記錄)
以上事件均表明,升級率已從幕後概念走向臺前,成為產品釋出、基準測試和財務溝通中的常見敘事。
追蹤指標
跟進升級率變化,以下可觀測指標能提供高訊雜比的訊號:
-
MLPerf 跨輪次結果
關注同一硬體在連續兩輪 MLPerf Training/Inference 提交中的效能變化。若分數提升且提交者註明源自軟體最佳化(而非更大叢集),即可直接量化升級率。MLCommons 官網每輪發布詳細 result pages。 -
官方技術部落格釋出的效能增益資料
NVIDIA 的 Developer Blog、AMD 的 Community Blogs 等定期發表“使用 CUDA 12.x / ROCm 6.x 在 LLM 推論中獲得 X% 提升”類文章。這些白盒案例是升級率訊號的最佳來源。 -
主要架構的釋出說明與 CHANGELOG
PyTorch、TensorFlow、JAX 每個版本針對不同後端的最佳化項,特別是針對特定 GPU 架構的 kernel 改進。GitHub 上的 CHANGELOG 和效能報告可以反映升級率落地的步伐。 -
雲端廠商例項效能與定價變化
雲端廠商不時更新 GPU 例項的效能規格或降低按需價格,背後往往是底層軟體最佳化釋放更多有效吞吐,從而允許他們調低單價或推出更高效能例項。監控 AWS p5/trn1、Azure ND H100 v5、GCP TPU v5p 的例項規格變化和 pricing 頁面,可以間接觀察升級率的商業化。 -
廠商財報提及的軟體投入與客戶留存指標
重點觀察 NVIDIA、AMD 研發費用中軟體佔比的變化趨勢;詢問大客戶(CSP)在財報電話會中對硬體生命週期的評論、折舊政策改變、以及他們公開表述的“軟體提升效率”案例。 -
開源庫的星標、貢獻者活躍度與相容性支援速度
例如 vLLM、TensorRT‑LLM、llama.cpp 等推論架構對新 GPU 架構的適配速度和效能報告,能反映生態升級率的末端滲透情況。
持續追蹤上述指標,可以在不依賴於內部資料的情況下,建置出對升級率趨勢的相對客觀判斷。
信源
- NVIDIA 開發者資源:CUDA Toolkit 發行說明、TensorRT 文件、GTC 主題演講(nvidia.com/gtc)、NVIDIA 技術部落格(developer.nvidia.com/blog)
- AMD 開發者資源:ROCm 文件(rocm.docs.amd.com)、AMD Community Blogs(community.amd.com)
- MLCommons:MLPerf Training & Inference 結果(mlcommons.org/benchmarks)
- 雲端廠商技術部落格:AWS Machine Learning Blog、Azure AI Blog、Google Cloud AI Blog
- 半導體與雲端財務檔案:NVIDIA、AMD、Intel 的 10‑K/10‑Q 年報季報;微軟、亞馬遜、Google的財報和電話會議記錄(SEC EDGAR 系統或公司投資者關係頁面)
- 第三方分析報告:IDC《Worldwide Semiannual Software Tracker》、Gartner 公有雲端服務預測、Omdia 資料中心加速器出貨追蹤(均可在官方網站獲得摘要,詳細資料需訂閱)
- 重要開源專案倉庫:PyTorch(github.com/pytorch/pytorch)、vLLM(github.com/vllm-project/vllm)、Triton(github.com/openai/triton)的釋出說明與效能報告
宣告:所有量化估算若無特別標註年份和來源,均為基於行業公開資訊的定性概括或“根據公開資料未見”的情形。具體精確數值應查閱上述核心信源的最新揭露,本概念頁不構成任何投資建議或薦股行為。