網路層 開放閱讀

冷卻冗餘

Cooling Redundancy

概念 ID
cooling-redundancy
更新時間
2026-05-29
來源數量
待補

冷卻冗餘

3 秒看懂

冷卻冗餘是資料中心冷卻系統為避免單點故障導致過熱宕機而配置的備份能力。典型架構採用 N+1 或 2N 冗餘,使得任一泵、冷水機組、CDU 或管路失效時,製冷系統仍能維持 IT 裝置允許的進風溫度範圍。對於 AI 訓練叢集,冷卻中斷數十秒即可觸發 GPU 降頻保護甚至緊急關機,因此高可用的冗餘設計已寫入主流雲端廠商和超算中心的算力 SLA 條款,成為基礎設施等級協議的硬底線。

3 分鐘產業解釋

超大規模 AI 訓練叢集的單機架功率密度已從傳統的 10–20 kW 躍升至 40 kW 以上,部分高密液冷部署甚至突破 100 kW/rack。液冷與精密空調的混合部署成為行業通行做法。冷卻系統一旦發生單路失效,封閉熱通道內的溫度會以分鐘級速率急劇上升——根據 ASHRAE 技術委員會多項實測報告,滿負荷 GPU 叢集在失去冷源 60 秒內區域性進風溫度可升高 8–15°C,3–5 分鐘內必然超出晶片允許結溫上限。

為此,資料中心冷卻鏈路上的所有關鍵節點都需要納入冗餘設計。具體而言,冷水機組、一次/二次泵組、冷卻塔、CDU(冷量分配單元)、供回水主管及閥門元件均需按照可線上維護、可切換的思路建置拓撲。N+1 表示 N 臺裝置滿足滿載需求時再額外配備 1 臺備機,任何單一工作單元離線(故障或計劃維護)時,備用裝置可自動或手動切入;2N 則是兩條完全獨立的冷卻路徑並行執行,每條路徑均可獨自承擔全部熱負荷,從而允許單路徑整體停運實施深度保養或故障隔離。在超大規模叢集中,業界還出現了“分散式冗餘”或“N+2”、“N+20%”等依據可靠性分析工具化定製的彈性方案。

AI 長時分散式訓練任務對中斷極其敏感。一次冷卻事件導致的非計劃節點掉線,可能需要回退數小時乃至數十小時的模型收斂進度,直接造成的算力損失與電力支出可達數十萬至百萬美元量級(以單叢集數千 GPU 同時執行數週的訓練任務估算)。因此,製冷冗餘不僅是熱管理的安全措施,更是保障訓練連續性的工程前提。當前行業的跨廠商共識是:在任一冷卻元件發生不可恢復失效的緊急情景下,IT 進風溫度指標依然應控制在 ASHRAE TC 9.9 允許包絡內,不得進入上限禁區或觸發裝置保護性停機。

技術原理

冷凍水系統冗餘

以一次泵-變流量架構為例,典型的資料中心冷凍水系統包含冷水機組群、一次泵組、二次泵組、冷卻塔、蓄冷罐以及複雜的供回水環形管路。N+1 配置下,冷水機組與一次泵通過共用母管互聯,結構示意如下:

     [冷水機組1]  [冷水機組2] ... [冷水機組N] [備機]
          |            |              |         |
          +----+-------+----+---------+---------+---- 供水母管
          |    |       |    |         |         |
        [一次泵1][一次泵2]...[一次泵N][一次泵·備]
          |    |       |    |         |         |
          +----+-------+----+---------+---------+---- 回水母管
  • 每臺冷水機組通過獨立隔離閥與對應一次泵串聯配對,單機組發生災難性故障時,其上下游隔離閥立即關閉,系統從供水母管將備機/備泵切入,完成全流量切換。
  • 二次側常規設計為雙環路環形管網,可確保任一末端精密空調(CRAH)或 CDU 獲得雙路供水。某段管路需斷開維護時,環路另一方向仍可保障末端持續獲得冷媒供給。
  • 蓄冷罐以並聯方式跨接在供回水主管之間,正常執行時處於蓄冷模式(低溫冷卻水儲存);當發生全廠停電或冷水機組集體失能的極端情形,放冷閥在數秒內自動開啟,藉助罐內蓄冷實現系統迴圈,緩衝時間 2–15 分鐘(具體時長取決於罐容與熱負載引數,不同專案差異極大)。

CDU 冗餘

冷板式液冷系統中,機架級 CDU 承擔二次側冷卻液迴圈、溫度控制和與一次冷凍水熱交換的核心職能。CDU 內的關鍵元件——迴圈泵、板式換熱器、電動調節閥、控制器、感測器——任何一個發生不可逆失效,都可能導致整櫃冷卻液流量瞬間歸零。因此,面向 GPU 叢集的液冷部署普遍採用 1+1 或 N+1 的 CDU 拓撲:

  • 兩臺 CDU 的出液口分別經止回閥/電動開關閥後匯合至機櫃進液母管,正常執行時一臺工作一臺熱備。
  • 工作 CDU 突發故障(泵停轉、換熱器洩漏、電源模組燒燬、控制通訊中斷等)時,其出口閥立即關閉,備機同步啟動迴圈泵並開啟相關閥門。
  • 切換邏輯由可程式設計邏輯控制器(PLC)或 DCIM 平台即時裁決,依據的關鍵判決變數包括二次側流量驟降率、供液溫度/壓力偏離閾值、電導率突變(洩漏檢測)等。典型工業部署的切換過渡時間設計值在 5–10 秒,再配合小型緩衝罐(數升至數十升級別),可在切換視窗內維持機櫃側迴圈幾乎無感。

緩衝罐(亦稱為蓄冷模組或緩衝單元)的作用並非替代 CDU,而是填平切換過程中流量/壓力的瞬態缺口。其儲水量按“RTO 時間×單機櫃額定流量”計算,一般留有 1.2–1.3 倍安全係數。高階方案中,部分廠商採用基於相變材料(PCM)的蓄冷單元,與傳統水蓄冷罐相比體積更緊湊,可提供更平穩的釋冷溫度平台,但成本較高且需要針對冷卻液化學特性進行相容性驗證。

系統級彈性與控制

從系統層面看,冷卻冗餘的實現不能僅依賴硬體備份,還需要納入控制系統的彈性設計。常見的邏輯包括:

  • 自動切換與容錯仲裁:PLC 控制器本身採用雙機熱備或硬體冗餘,單一控制器失效不會造成切換程式中斷。通訊匯流排(如 Modbus TCP/IP、BACnet)具備冗餘路徑,避免單交換器/閘道器斷連後中央排程失效。
  • 故障降級策略:如果緩衝罐液位不足且備機尚未完全啟動,系統應自動降低 IT 負載(通過電源管理匯流排向伺服器傳送降頻或節流指令),而非坐等溫度超標。
  • 併發維護狀態保護:設計階段需通過時序仿真確認,當一臺冷機按計劃退出保養維護時,剩餘裝置依然滿足 N+1 容量,避免所謂“偽冗餘”——平時資料上滿足冗餘,但一旦並行發生第二臺意外失效就會直接進入超溫風險。

整個冷卻系統的拓撲冗餘需在詳細設計階段通過失效模式與影響分析(FMEA)進行系統化審查,識別並清除所有單點故障,並確保所有冗餘切換動作在規定的 RTO 視窗內可靠完成。


關鍵引數

冷卻冗餘方案的核心技術引數涵蓋容量、時間、可用性和運維四個維度。以下給出行業設計目標範圍,具體數值因專案負載譜、氣候區和建設標準差異而顯著不同:

  • 冗餘容量比率:即備用裝置容量與單臺最大長期執行負載容量之比。N+1 方案下該比率至少為 1:1,確保任意單機離線時剩餘機組總能覆蓋峰值熱負荷;N+2 或分散式冗餘方案中比率可能達到 1:1.5 以上。
  • 切換過渡時間(RTO):從故障被感測器/控制系統識別,到備用裝置滿容量替代、且關鍵供液溫度重新進入穩態區間的總耗時。冷板液冷 AI 場景下,業界目標值通常 ≤ 30 秒(部分超大規模運營商內部規範為 ≤ 15 秒),其中含緩衝罐協助的流量平滑時段。
  • 蓄冷緩衝時間:滿負載執行條件下,主動供冷完全喪失後,蓄冷系統可維持 IT 進風/進液溫度不越限的最長持續時間。典型設計範圍為 2–15 分鐘,具體取值取決於冷水機組重啟時間、柴發啟動時間等外部時序鏈。
  • 供液溫度波動允許上限:切換過渡期間二次側允許的最大溫升。為防止凝露與晶片過溫,多數液冷方案控制供液溫升不超過 2–3°C(具體值依據環境露點與晶片規格書中的 Tjmax 約束確定)。
  • 線上維護容量:在規定冗餘裝置按計劃退出維護狀態下,剩餘製冷裝置是否仍能滿足 IT 滿載散熱需求。根據 Uptime Institute Tier Standard,Tier III 及以上均要求“可同時線上維護”,即該指標必須達標。
  • 冷卻系統可用性目標:電力與冷卻系統綜合可用性是資料中心年度 SLA 的硬考核項。Tier III 設計目標常見引用值為 99.982% 年度可用時間,Tier IV 則提升至 99.995%。冷卻系統冗餘容量和切換成功率是達成目標的關鍵因子。
  • 單點故障覆蓋度:經 FMEA 和故障樹分析審查,實際存在的、無冗餘防護的冷卻鏈路單點故障數量,設計目標原則上必須為 0;若業務可容忍極低機率事件,部分非關鍵輔助環節可允許個別單點,但必須寫入運維手冊並定期強檢。

定量可靠度建模時,假裝置機與工作裝置失效率 λ 相同且修復時間 t 恆定,N+1 可修復系統穩態可用性近似為:
A ≈ 1 – C(N+1,2) (λt)²(當 λt ≪ 1)。
實際工程中,資料中心通常會運用 BlockSim 或類似模擬工具,結合具體裝置失效率資料、備件庫存水平、現場運維響應能力等輸入引數,得出更為精細的系統可用性預測值。公開文獻中未見面向前沿 AI 叢集的統一絕對可用性基準,各運營方一般以自身歷史運營資料為參考迭代最佳化目標。


技術路線

行業內冷卻冗餘方案沿不同可用性等級和成本約束形成多條技術路線。下表梳理了從無冗餘到全冗餘疊加蓄冷的主流配置及其適用邊界:

冗餘級別典型配置可維護性相對成本估算適用場景關鍵約束
N容量剛好滿足峰值負載,無備份裝置需全停機才可執行冷側維護;業務中斷風險不可控基準 1×非關鍵業務、允許定時中斷或冷容忍型負載任一部件故障直接導致超溫宕機,AI 訓練不可接受
N+1每個製冷功能組額外增設 1 臺備機可線上隔離維護任一裝置,其餘仍滿足滿載約 1.2–1.5×(機電裝置與管路)Tier II/III 商業資料中心、多數企業級 AI 推論平台備件自動切換技術實現與控制邏輯複雜度是核心難點
2N兩條完全物理隔離的冷卻鏈路,各承擔 100% 負載可單路徑整體停運維護或故障隔離,零流量擾動約 1.8–2.2×Tier IV、超大規模雲端廠商可用區、頂級 AI 訓練叢集空間、配電、管路投資翻倍,運營精細度要求高
N+冗餘元件+蓄冷在 N+1 或 N+2 基礎上,加配緩衝罐/相變蓄冷單元與快速切換控制系統故障切換過程對 IT 負載透明(緩衝期覆蓋切換時間),可線上更換模組比單純 N+1 再增加 5–10%(主要為蓄冷模組與儀表、控制器)極高可用要求的分散式 AI 訓練系統、金融級渲染雲端蓄冷容量需經熱-流-電綜合模擬精確計算,不能憑經驗取值

注:成本倍數為基於多個大型資料中心專案經驗案例的行業估算區間,實際值受冷水機組選型、液冷 CDU 品牌選型和部署規模影響顯著。

在技術路線選擇上,Google 自研的 TPU 液冷叢集與 Nvidia SuperPOD 級 GPU 叢集正逐步向“帶有動態蓄冷的 2N 或增強型 N+1”方向演進。部分網際網路超大規模定製化資料中心甚至將冗餘與人工智慧運維(AIOps)結合,通過即時預測模型提前啟停備用冷站,從而在高可靠的前提下壓縮運營電耗。


上游

冷卻冗餘產品的上游供應鏈條由幾大類關鍵部件和技術供應商組成:

  • 製冷主機與末端製造商:離心/螺桿冷水機組的核心廠商包括特靈(Trane)、開利(Carrier)、約克(Johnson Controls)、大金(Daikin)、美的樓宇科技等。精密空調末端(CRAH/CRAC)的全球代表性企業包括維諦技術(Vertiv)、施耐德電氣(Schneider Electric)旗下的 APC 及 EcoStruxure 全線產品、世圖茲(Stulz)、佳力圖等。這些廠商已將 N+1/2N 切換邏輯內嵌於控制器軟體包中。
  • 液冷 CDU 及部件供應商:全球市場主要參與者包括 CoolIT Systems(冷板式 CDU 及直連液冷方案)、Asetek(資料中心液冷平台)、Motivair(定製化冷卻分配)、Boyd Corporation(熱管理元件)。國內頭部企業包括曙光數創(浸沒式及冷板液冷 CDU)、高瀾股份、英維克。上述企業的大多數在 2022–2024 年間推出的新一代 CDU 產品已標配雙泵/雙換熱器模組化設計,支援線上熱插拔維護。
  • 泵與閥件:一次/二次迴圈泵主要來自格蘭富(Grundfos)、威樂(Wilo)、賽萊默(Xylem)等跨國工業泵企;電動調節閥、止回閥、隔離閥等由江森自控、西門子樓宇科技、搏力謀(Belimo)等品牌供應。零備件與易損件的可靠備貨對維持冗餘能力至關重要。
  • 感測器與控制層:溫度、壓力、流量、露點與漏液感測器以及可程式設計邏輯控制器(PLC)、DDC 控制器,主要來自西門子、施耐德電氣、霍尼韋爾(Honeywell)等自動化廠商。高階液冷方案中,漏液檢測帶的靈敏度、響應速度直接影響冗餘切換的觸發精確性。
  • 蓄冷與緩衝模組:中小型蓄冷罐通常由壓力容器製造企業按專案定製,少數專業公司(如 CALMAC,已併入 Trane)提供商用蓄冷產品。相變材料蓄冷模組目前仍以定製化供貨為主,尚未出現統一行業標準。

供應鏈結構的特點在於,多數上游裝置並非專為“冗餘”功能定製,而是成熟製冷產品的控制功能疊加和系統整合。冗餘能力更多體現在系統整合商、設計院和業主的技術規格定義與 SCADA(監控與資料採集)邏輯開發環節,而非單臺裝置本身。近年來,部分頭部製冷主機廠商開始推出面向資料中心“黑燈工廠”需求的冗餘一體化撬裝機組,將冷水機組、水泵、管路和蓄冷罐整合在標準集裝箱或撬裝架構內出廠,縮短現場安裝與聯調週期。


下游

冷卻冗餘的下游覆蓋了從超大規模雲端到企業本地化部署的完整資料中心生態:

  • 超大規模雲端廠商:亞馬遜(AWS)、微軟(Azure)、Google雲端(GCP)、Meta、Oracle Cloud 等在其自建資料中心園區中,冷卻冗餘已納入標準可用區設計規範。這些企業通常自研或深度定製冷卻架構,對冗餘方案的要求往往超越了行業通用標準,例如 Meta 公開揭露其在部分高密站點已試點完全獨立的雙冷源+雙 CDU 供電架構。
  • 中立 Colocation 及零售託管商:以 Equinix、Digital Realty、NTT Global Data Centers 為代表的國際託管運營商,在國內則以萬國資料(GDS)、資料港、秦淮資料、世紀互聯等為主力。其客戶合同中的租電協議(PPA)普遍關聯製冷可用性指標,推動 Colo 商在新建和改造專案中普遍實施 N+1 作為最低配置。
  • AI 超算中心與算力平台:國家及區域級超算中心(如上海、深圳、合肥等地方超算)和由自動駕駛公司(如 Waymo、特斯拉、小鵬汽車)、大語言模型開發商(OpenAI、Anthropic、國內頭部大型模型公司)運營的專有訓練叢集,對連續執行時間要求極高,通常採用“N+1 CDU + 蓄冷 + 2N 冷凍水”組合方案。公開資料顯示,部分萬卡級 GPU 叢集的冷卻 CapEx 投入中,冗餘相關的增量可達 30% 以上。
  • 系統整合與運維服務商:獨立的 MEP 設計院(如 Arup、Jacobs、CCDI 等)和 DC 整合商(如中電二建、中建三局等)負責冷卻冗餘方案的深化設計與施工;專業運維公司(如施耐德 EcoStruxure IT、Uptime Institute 認證運維團隊)則承擔切換週期測試、故障演練、備件庫存管理和裝置健康度評估等長期工作。該項服務營收已逐步從一次性工程向年度合同制演進。

受益公司

以下梳理冷卻冗餘設計趨勢下業務結構與之高度相關的代表性企業(僅作產業格局展示,不構成任何投資建議或薦股意見):

  • 全線冷卻與電力保障方案商:維諦技術(Vertiv,NYSE: VRT)在精密空調、母排配電及 DCIM 層面提供整合的冗餘管理軟體;施耐德電氣(Schneider Electric,EPA: SU)通過 EcoStruxure 平台將冷卻冗餘與電力拓撲統一監測,其液冷方案亦涵蓋 CDU 與蓄冷切換邏輯。
  • 專業化液冷 CDU 及部件企業:CoolIT Systems(一級市場,2022 年由 KKR 收購多數股權)為全球最大冷板液冷 CDU 供應商之一,其 Rack CDU 在多家雲端廠商 GPU 叢集中出貨;Asetek(OSE: ASTK,已與 Excool 合併)持有大量資料中心液冷 CDU 專利,長期向 HPC 領域供貨;曙光數創(688206.SH)在國產浸沒與冷板液冷領域具備從 CDU 到整體集裝箱化冗餘方案的交付經驗,中科曙光體系內採購佔比較高;高瀾股份(300499.SZ)陸續推出新一代冷板 CDU,重點面向通算與智算混合負載資料中心。
  • 上游核心部件與蓄冷技術企業:丹佛斯(Danfoss)、阿法拉伐(Alfa Lavall)等向 CDU 廠商供應高效板式換熱器,需求上行直接關聯冗餘配置倍數;格蘭富(Grundfos)等泵類企業的資料中心事業部受益於冗餘泵組的翻倍採購量。
  • 超大規模雲端廠商自研基礎設施團隊:Google DeepMind 曾揭露運用機器學習最佳化冷卻冗餘啟停,降低冗餘能耗;Nvidia 的 Selene 超算(2020–2022 年間用於內部研究)在設計白皮書中明確採用了 “2N CDU+分散式泵”的冗餘策略,為同類叢集樹立了參考範式。

公開融資與財報資訊顯示(引用各公司官方釋出):CoolIT 在 2022 年曾宣佈液冷產線產能擴增至每年超百萬套級;Vertiv 在 2023 年年報中揭露其全球資料中心冷卻相關訂單年增率增長約 30%,其中液冷訂單增速顯著高於傳統冷凍水空調;曙光數創招股說明書(2022)提到其浸沒液冷方案中冗餘泵組與換熱器按 1+1 配置已成標準選項。上述資料僅為各公司公開揭露,不代表對未來財務表現的預判。


市場規模

關於冷卻冗餘的獨立市場規模並無任何專門統計機構釋出權威資料,通常將其隱含在“資料中心冷卻系統”或“資料中心機電基礎設施”投資內進行匡算。以下綜合行業估算口徑呈現大致的量級感知:

  • 資料中心冷卻系統總投資盤子:根據調研機構 Omdia(2023 年報告,以全球資料中心基礎設施硬體出貨統計為口徑)和 Dell’Oro Group(2024 年初發表的資料中心熱管理報告)的估算,2023 年全球資料中心冷卻系統硬體總市場規模在 95–110 億美元之間,其中液冷 CDU 及相關元件約佔 10–15%。預計到 2028 年該整體市場有望突破 180 億美元,主要的增量來自 GPU 叢集驅動的液冷滲透與晶片級散熱需求。
  • 冗餘附加成本比例:依據多個行業級諮詢專案揭露的工程造價拆分,冗餘相關的附加機電裝置成本(包括額外的冷水機組、泵組、CDU、管路、閥門、控制系統等)通常佔冷卻系統總 CapEx 的 20%–35%。假設 2023 年全球冷卻系統硬體市場為 100 億美元中位值,則其中約 20–35 億美元可歸為冗餘相關部分。
  • 液冷 CDU 的冗餘增量:當前頭部液冷 CDU 供應商的出貨增量中,N+1 配置訂單佔絕對多數。以冷板式液冷市場年增速約 30%+(參考 Omdia、IDC 等機構報告預測區間)計,CDU 配套採購數量與冗餘比例同步增長,意味著冗餘型 CDU 出貨金額增長率可能高於 CDU 市場平均水平。
  • 中國市場:科智諮詢(中國 IDC 圈研究)等機構曾在行業白皮書中估計,2023 年中國資料中心冷卻系統投資約為 250 億元人民幣,其中液冷佔比快速上升。參考 20%–35% 的冗餘附加區間,國內冷卻冗餘相關投資約在 50–88 億元人民幣的規模範圍。受“東數西算”工程和新一輪智算中心建設拉動,預計 2025–2027 年該數字將顯著擴張,但目前無精確公開資料驗證,需關注後續產業研究報告。
  • 服務和運維市場:冗餘方案的長期價值也包括定期的切換測試、蓄冷罐檢查和水質管理等維護服務。該部分市場尚未形成獨立統計品類,公開資料數量稀缺,無法給出有公信力的規模估算。

注:以上所有市場資料均源於第三方行業研究機構公開報告及公司財報,具體年份和口徑已在文中註明。原始報告通常以“全球資料中心熱管理市場”或“資料中心冷卻系統”為分類標籤,不單獨切割“冷卻冗餘”作為子項,文中推算數字僅供參考量級。


玩家對比

全球冷卻冗餘市場參與主體可以按業務模式大致分為四類:全線機電解決方案商、專精型液冷裝置商、自研架構的超大規模使用者以及核心零部件企業。以下圍繞其冗餘方案特點進行橫向整理:

  • 全線機電解決方案商(Vertiv vs. Schneider vs. Stulz 等)

    • 冗餘設計能力體現在自有冷水機組、空調末端、配電、DCIM 軟體的縱向整合。Vertiv 在 Liebert® 品牌下提供從冷水機組到行級 CDU 的閉環控制,並於 2023 年推出面向 AI 的 AIGC 高密液冷參考架構,其冗餘邏輯可跨不同品牌裝置協同排程。施耐德 EvoStruxure 強調全生命週期數字化雙胞胎模擬,可在規劃期模擬出 N+1/2N 切換對整體 PUE 和熱點分佈的影響。Stulz 在精密空調末端領域佔有較高份額,在冗餘控制上強於定製化工程能力。
    • 共同的優勢是專案全流程服務鏈成熟,弱點在於液冷 CDU 品線相對液冷原生企業仍處追趕階段。
  • 專精型冷板液冷裝置商(CoolIT vs. Asetek vs. 曙光數創)

    • CoolIT 作為當前全球出貨量領先的 CDU 廠商,其 Rack CDU 雙泵熱插拔設計已迭代至第四代,控制器支援 PLC 多機互備,在國內主要通過與伺服器 OEM(如聯想、HPE)的合作進入市場。Asetek 在低流量/高壓 CDU 方向有大量專利積澱,優勢在於與雲端廠商定製化整合,切換邏輯可與企業已有設施管理系統整合。曙光數創則在國產化液冷和相變浸沒方案上獨樹一幟,其 C8000 浸沒式液冷系統在冗餘設計上採用“分散式雙電源+泵組 N+1+緩衝罐”結構,但由於浸沒方案的部件可維護性限制,冗餘切換後的線上可維護性較冷板方案更為複雜。
    • 上述企業的冗餘方案文件公開程度不一,CoolIT 和 Asetek 在 OCP Advanced Cooling Solutions 社群有較為完整的參考設計白皮書,曙光數創的細節更多見於國內資料中心標準會議演講。
  • 超大規模自研使用者(Google、Meta、Nvidia 等)

    • Google 曾在 2021 年 TPU Pod 公開材料中揭露其液冷 CDU 採用 2N 架構並結合冷能儲存,將訓練任務的中斷機率壓至極低水平;Meta 的公開基礎設施影片與工程博文提及其在某資料中心“拆除單點”專案中對機架級冷板冷卻引入 N+1 CDU 改造。Nvidia 的 Selene 叢集(基於 DGX A100)在 2020 年部署時即標配了 2N 冗餘 CDU 並以 CUDA 層面的叢集監控實現溫控聯動。這類自研使用者往往不直接對外出售裝置,而是通過 OCP 基金會、技術白皮書或開源架構(如 OpenBMC)將經驗反哺至產業,從而間接推動供應商產品迭代。
  • 零部件與子系統供應商

    • 如泵類(格蘭富、威樂)、板換(阿法拉伐、丹佛斯)、感測器與閥門(西門子、搏力謀)等,其競爭焦點在於為下游 CDU/冷水機組廠商提供更高可靠性、更長無故障壽命的產品,以及在冗餘系統中支援快速切換所需的高頻動作耐久性。例如,搏力謀近年推廣的“超級電容器驅動執行器”方案可在斷電時自動復位閥門至安全位置,這對冗餘保護的可靠性直接加分。

綜合而言,全線機電商在複雜交付專案中話語權強;液冷原生企業在關鍵冷板/單相浸沒技術上有先發標準化優勢;超大規模自研使用者扮演著技術路線與可靠性基準的定義者角色;而部件企業則構成整個冗餘生態的效能基石。


風險

冷卻冗餘在提升可用性的同時,也引入了自身的附加風險和工程代價,實踐中需警惕以下方面:

  • 偽冗餘風險(設計假設不真):N+1、2N 等冗餘僅在所覆蓋的單一故障域內有效。若未對管路共模故障、控制網路單點失效、同組電源母排短路等併發場景進行完整的 FMEA 審查,實際可用性可能遠低於紙面目標。例如,若“2N”的兩條冷卻管路在末段接入機櫃前匯流於同一個未做冗餘的手動閥門,則該閥門反而成為雙路共享的單點瓶頸。
  • 控制邏輯複雜度引入軟體故障點:冗餘切換依賴 PLC、控制器、DCIM 伺服器及通訊網路多層協作,控制軟體的 bug、配置版本不一致或升級策略不當都可能導致本該順利執行的切換失敗。多家資料中心運維團隊已在行業會議中分享過“自動切換未生效,需人工干預”的真實案例,暴露出過度依賴自動化而忽視手動容錯預案的安全隱患。
  • 成本與空間邊際效益遞減:從 N+1 提升至 2N 或分散式 N+2,不僅裝置投資翻倍,還要求兩套完整管路、雙路配電和冗餘切換閥組,佔地面積大幅增加。在大型城市附近或土地成本高昂的地區,這一代價可能拉低專案整體 IRR,甚至影響選址決策。
  • 熱備能耗與碳排放:多數 N+1 裝置需維持熱備狀態(待機功耗、持續低速迴圈、輔助加熱以防凍結),這部分附加能耗直接推高 PUE。在碳中和考核日益嚴格的背景下,冗餘裝置的常年熱備執行會增大企業電力預算與碳排放配額壓力。部分企業嘗試使用“N+輪轉”策略降低同時熱備的臺數,但代價是延長切換響應時間。
  • 定期測試不足導致“紙面冗餘”:週期性帶載切換測試和滿負荷演練是維持冗餘系統有效性的唯一手段。然而,這類測試對線上業務有擾動風險,許多資料中心運維團隊傾向於推遲或簡化測試流程。長期不進行實戰切換驗證,將導致因長期停機造成的閥門卡澀、感測器零點漂移、備機啟動電路故障等未被及時發現,一旦真實故障發生,所謂的“冗餘保護”反而可能失效。
  • 供應鏈依賴性:部分高規格冷水機組、液冷泵和專用閥門存在單一來源或長供貨週期問題。如果備機需要替換而市場產能緊張,冗餘架構雖短期可用,但在備機因其他原因同時失效時可能面臨較長的低冗餘暴露週期。

誤讀糾偏

  • 誤讀 1:“做了 N+1 冗餘,任何部件任意壞一個都沒事。”
    N+1 僅在其被設計的那一組明確邊界的裝置群內有效。如果冗餘設計未覆蓋冷卻塔、獨立供電迴路、供回水母管單段管路或匯流閥門,單點故障依然能導致全域性製冷中斷。全域性容錯必須經過全程 FMEA 掃描,並確保每個識別出的單點都有對應的冗餘策略,才算“事事有備份”。

  • 誤讀 2:“液冷效率高,所以液冷系統自帶冗餘,不需要再搞備份 CDU。”
    液冷提高散熱效率來源於冷卻液更高的比熱容和更低的接觸熱阻,與系統可用性無關。單臺 CDU 失效後,其所服務的一整排或一整個機櫃冷卻液流量會在幾秒內驟降,相當於數個乃至十數個機架瞬間失去製冷,這比風冷場景中單一風機失效的區域性影響嚴重得多。對於 GPU 高密叢集,冗餘 CDU 配置與緩衝罐組合是工程實踐中必須考慮的基線方案。

  • 誤讀 3:“冷備省錢又節能,直接把備用裝置關掉,出了故障再開就行。”
    全冷備(斷電停機)模式下,備用裝置從接收到啟動指令到建立額定流量/溫差往往耗時數十秒到數分鐘(取決於冷水機組預熱、泵組加速和閥門動作時序),遠超出伺服器允許的無供冷視窗。此外,長期停用會引發機械卡澀、密封老化、潤滑油分層等問題,緊急啟動失敗機率顯著上升。因此,行業通行做法是保持備機處於熱備或至少暖備狀態,並配合蓄冷緩衝解決毫秒到秒級切換空檔,而非追求零備用功耗。

  • 誤讀 4:“冷卻冗餘的目標是追求 100% 絕對不停機。”
    工程上不存在 100% 可靠的系統,冷卻冗餘的目標是通過合理成本將冷卻失效的頻率和影響控制在業務可接受的極低水平(如年中斷時間不超過分鐘級)。可用性指標的制定基於業務恢復能力、資料容忍度和預算約束的綜合平衡,追求“無限接近但非絕對零中斷”是務實的工程設計態度。


最新事件

  • OCP 社群更新 CDU 參考設計(2024 年初):Open Compute Project 的 Advanced Cooling Solutions 工作組在 2024 年 Q1 釋出最新版 Liquid Cooling CDU 指南草案,其中首次以獨立章節闡述了 CDU 冗餘分級(N、N+1、2N)的推薦實施方法,包括切換邏輯流程圖、最小緩衝罐容積計算公式以及現場可維護性檢查清單,推動液冷冗餘的標準化從裝置層延伸至系統整合與測試層面。
  • 多家 CSP 宣佈新建 AI 資料中心採用液冷+2N 戰略:公開行業報道(如 Data Center Dynamics 2024 年 3–5 月間多篇文章)指出,為支撐新一代大型模型訓練,包括北美和亞洲的多個超大規模雲端服務商在 2024 年新動工的園區級專案中將液冷迴路直接設計為 2N 或帶蓄冷的增強型 N+1,部分站點還引入了完全獨立的雙供水源,以避免單水源市政檢修造成的冷站停擺。
  • 行業事故推動冗餘測試製度:2023 年下半年至 2024 年初,亞太區至少兩起公開報道的資料中心冷卻系統故障事件(一次因冷機群控軟體升級失敗致備機未正常接管,一次因 CDU 切換閥卡澀導致液冷機櫃過熱)在行業會議上被多次復盤討論。這些事件促使國內部分頭部 Colo 運營商修訂運維手冊,要求冷卻冗餘切換測試從原有的季度/半年週期縮短至月度帶載驗證,並在切換演練中加入“雙故障併發”的極限應力場景。
  • 液冷初創企業融資與產能擴張:2023–2024 年間,國內外多家液冷裝置企業(包括國內個別未上市公司)完成新一輪融資,融資用途普遍提及擴建智慧產線、開發下一代全冗餘 CDU 和建設全冗餘測試驗證平台。這些動態傳遞出市場對於高可靠液冷方案產能緊張的判斷,也為後續方案成本下降和交付週期縮短提供了產能基礎。(具體融資額及參與機構均以各標的公司官方公告為準,此處不具述。)

追蹤指標

要持續評估冷卻冗餘方案的先進性與成熟度,可從以下幾個公開可獲取或行業常見的觀測視窗切入:

  • OCP Advanced Cooling Solutions 白皮書與規範更新頻率:OCP 下屬冷卻工作組每年釋出多次技術指南和參考設計,其內容的修訂方向(例如是否新增對浸沒式、雙相冷卻的冗餘指導意見)可反映行業前沿共識。關注其 GitHub 倉庫 release 記錄及年度峰會演講材料。
  • ASHRAE TC 9.9 的推薦溫度/液體標準:ASHRAE TC 9.9 定期釋出《熱指南》和《液冷指南》的更新版本,其允許的 IT 裝置進風/進液溫度與環境包絡範圍變化,直接關聯冗餘切換期間允許的溫升容忍度。
  • 主要液冷裝置廠商的公開產品引數:持續追蹤 CoolIT、Asetek、曙光數創、高瀾股份、英維克等廠商官網或白皮書中的 CDU 切換時間、熱插拔部件型別和緩衝罐選項,判斷產品層面的冗餘技術成熟度與斷代時間點。
  • Uptime Institute 年度中斷調查報告:每年上半年 Uptime Institute 發表的全球資料中心中斷調研究報告告會公開中斷根因分佈(冷卻系統/電力/網路/軟體等),可側面驗證冷卻冗餘在真實運營環境中的保護效果和暴露出的短板。
  • 大型雲端廠商基礎設施部落格公開揭露:Google Data Centers、Meta Engineering Blog、微軟 Azure Blog 及 AWS 架構部落格偶爾會發表涉及冷卻架構和可靠性工程的深度文章,這些揭露雖非定期釋出,但資訊密度高、可驗證性強,是確認前沿實踐動態的優質信源。
  • 行業會展專題議程:例如 Data Center World、DCD>Connect、OCP Global Summit、CDCC 中國資料中心大會等的液冷和高可用專題議程,能夠較及時地反映出冷卻冗餘領域面臨的共性工程難題和年度熱點話題。
  • 新開工專案的環境影響評估或能評公開報告:部分國家或地區要求大型資料中心在建設前公示能耗、水資源使用、冷卻方式等資訊,雖然不直接揭露冗餘細節,但可通過機架功率密度設計值、液冷比例等引數推測冗餘方案的複雜程度和成本級別。

由於當前搜尋工具未實際介入,本次追蹤指標的更新狀態截至 2025 年中,建議使用者按需檢索上述機構或品牌名稱獲取最新版本檔案。


信源

  • 標準與行業規範

    • Uptime Institute, Data Center Site Infrastructure Tier Standard: Topology.
    • ANSI/TIA-942-B, Data Center Telecommunications Infrastructure Standard.
    • ASHRAE TC9.9, Thermal Guidelines for Data Processing Environments (多版) 及 Liquid Cooling Guidelines for Datacom Equipment Centers (Second Edition).
    • GB 50174-2017《資料中心設計規範》及配套圖集。
  • OCP 社群

    • OCP Advanced Cooling Solutions 工作組,CDU Design Guidelines and Reference Architectures(多版草稿與正式釋出稿),及 GitHub 上活躍的冷卻硬體子專案文件。
  • 產業調研與市場資料

    • Omdia, Data Center Cooling Market Tracker(2023 年版,全球硬體出貨統計口徑)。
    • Dell’Oro Group, Data Center Thermal Management Report(2024 年初發布)。
    • 科智諮詢(中國 IDC 圈研究),《2023–2024 年中國資料中心冷卻系統市場報告》。
  • 企業公開資訊

    • Vertiv 2023 年度年報、液體冷卻產品資料頁。
    • CoolIT Systems 產品頁面及 OCP 投稿技術文件。
    • Asetek 官方網站液冷資料中心解決方案部分。
    • 曙光數創招股說明書(2022 年)及後續定期報告。
    • Nvidia, Selene Supercomputer Cooling Architecture(相關公開演講與博文,2020–2022 年間)。
    • Google Data Centers 部落格(液冷與 TPU 部署文章)。
    • Meta Engineering Blog 中關於高密冷卻與可用性設計的公開文章。
  • 學術與工程文獻基礎

    • 可靠性工程教材(FMEA、故障樹理論架構)。
    • 部分資料中心工程期刊論文(如 Energy and BuildingsApplied Thermal Engineering 中與資料中心冷卻系統可用性相關的研究),因涉及具體專案資料,未作為本文直接引用資料的唯一來源。

本文中所有具體財務、市場、份額、產能數字均已盡力標註年份、口徑和來源。部分估算在無法獲得權威統計時以“行業估算”“依據…量綱推算”等措辭標明,讀者在商業決策中應直接調取原始報告。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型