電池備份單元(BBU)
3 秒看懂
一句話: BBU 是部署在伺服器/機架級別的”分散式微型 UPS”,用鋰離子電池在市電中斷時提供數分鐘至十餘分鐘的直流後備電力,保護 AI 訓練任務不因瞬間斷電而丟失數小時的 checkpoint。
關鍵詞: 分散式備電 → 替代集中式 UPS → AI 機架功耗飆升催生剛需
3 分鐘產業解釋
為什麼 AI 時代 BBU 突然火了?
傳統資料中心靠機房級別的大型 UPS(不間斷電源)集中保護所有機架。但 AI 伺服器的單機架功耗從傳統伺服器的 5–8 kW 飆升至 30–120 kW(NVIDIA DGX 級別),集中式 UPS 面臨三個問題:
- 容量匹配困難: 一個萬卡叢集機房可能需要數十 MW 級別的 UPS,投資巨大且效率下降。
- 效率瓶頸: 集中式 UPS 在低負載率下效率不佳,而 AI 訓練負載高度集中。
- 擴容靈活性差: AI 算力需求爆發式增長,集中式供電架構擴建週期長。
BBU 化(BBU化) 的思路是:將備電功能從機房級”下沉”到機架級甚至伺服器級,每個 BBU 模組只負責自己所在的機架或數臺伺服器,形成分散式備電網。這帶來:
- 按需部署: 增加一個 AI 機架就配一組 BBU,無需重新規劃機房級 UPS。
- 更高效率: 直流配電減少 AC-DC-AC 轉換環節,系統級效率可提升 3–5 個百分點 [行業共識,具體效率增益因架構而異]。
- 空間節約: 將電池分散嵌入機架底部或側面,不佔用獨立 UPS 機房空間。
核心價值鏈
鋰電電芯 → BMS(電池管理系統) → DC-DC 變換 → 機械結構/外殼 → 系統整合 → 資料中心/伺服器 OEM
15 分鐘專家深入
BBU 在 AI 供電架構中的位置
現代 AI 伺服器的供電路徑正在從傳統 AC 架構向 48V 直流 架構演進。BBU 通常掛接在 48V(或 51.2V LFP)直流母線上:
市電 AC ──→ AC-DC PSU ──→ 48V DC 母線 ──→ 伺服器板載 DC-DC ──→ GPU/CPU
↑
BBU 模組
(電池 + BMS + DC-DC)
正常模式: AC-DC PSU 向 48V 母線供電,同時通過充電電路維持 BBU 電池處於滿充(或目標 SOC)狀態。
備電模式: 市電中斷 → BBU 在毫秒級內切入放電,向 48V 母線持續供電 → 為伺服器爭取 5–15 分鐘視窗(足夠完成 checkpoint 儲存或啟動柴油發電機)。
單個 BBU 模組的典型構成
| 子模組 | 功能 | 關鍵技術要點 |
|---|---|---|
| 電芯組 | 儲能 | 圓柱(18650/21700)或方形鋁殼;NMC 或 LFP 體系 |
| BMS | 電芯管理 | 電壓/溫度/電流取樣;SOC/SOH 估算;均衡控制;通訊上報(PMBus/CAN) |
| DC-DC | 電壓匹配 | 升/降壓變換,匹配母線電壓;備電切換時需快速響應 |
| 保護/切換 | 故障隔離 | 過流/過溫保護;備電 MOSFET 或繼電器切換(<10 ms 級) |
| 結構件 | 物理整合 | 1U/2U 機架式或嵌入式設計;熱管理;熱插拔能力 |
功率與容量——為什麼 AI 場景需求不同於傳統
傳統伺服器 BBU 功率通常在 數百瓦到 1–2 kW,對應的是低功耗儲存/計算節點。而 AI 機架:
- 單臺 NVIDIA DGX H100 系統整機功耗約 10.2 kW [NVIDIA 官方規格];
- 一個標準 42U 機架可容納多臺 HGX/DGX 模組,整櫃功耗可達 40–120 kW [供應鏈估算,取決於具體配置];
- 因此,AI 級 BBU 模組的單體功率需求顯著高於傳統——行業正在向 3–6 kW/模組 甚至更高功率密度演進 [行業趨勢定性描述]。
技術原理
備電切換時序(關鍵機制)
這是 BBU 的核心價值所在——切換速度和無縫性:
時間軸 ──────────────────────────────────────→
市電正常 │ 市電中斷 │ BBU 放電 │ 恢復/關機
────────────┤──────────┤───────────────────────────┤──────
│ │ │
PSU 輸出: ████████████__ │
│ 掉電 │ │
BBU 檢測: ────────────┤← 檢測到母線電壓跌落 │
│ │ │
BBU 切入: ────────────┤←── 1–10 ms 級切入 ────────→│
│ │ ████████████████████████ │
│ │ 48V 母線由 BBU 維持 │
│ │ │
伺服器側: ██████████████████████████████████████████│
│ │ 感知不到斷電(母線無跌落) │
關鍵技術指標:
- 切換時間(Transfer Time): 從市電中斷到 BBU 完全接管母線的時間,通常要求在 10 ms 以內。部分高階設計可做到 < 5 ms。這決定了母線上是否需要大容量電容”holdup”來填補切換間隙。
- 備電持續時間(Backup Duration): 取決於 BBU 容量(kWh)與負載功率(kW),AI 場景下通常設計為 5–15 分鐘 [行業常見配置範圍,非精確值]。
- 放電倍率(C-rate): AI 場景下 BBU 需要在高倍率下放電(大電流短時間),這對電芯的功率型特性提出要求,與儲能電池的能量型特性有本質區別。
BMS 關鍵演算法
┌──────────────────────────────────────────┐
│ BMS 主控 │
│ │
│ ┌─────────┐ ┌─────────┐ ┌──────────┐ │
│ │ SOC 估算 │ │ SOH 管理 │ │ 均衡控制 │ │
│ │(卡爾曼濾波│ │(迴圈計數/ │ │(被動/主動) │ │
│ │ /安時積分)│ │ 內阻追蹤) │ │ │ │
│ └────┬────┘ └────┬────┘ └────┬─────┘ │
│ │ │ │ │
│ ┌────┴─────────────┴────────────┴─────┐ │
│ │ 充放電狀態機 │ │
│ │ IDLE → CHARGING → READY → BACKUP │ │
│ └─────────────────────────────────────┘ │
│ │
│ 通訊介面: PMBus / I²C / CAN → 上報主機 │
└──────────────────────────────────────────┘
SOC 估算: 在高倍率放電工況下,開路電壓法誤差大,通常採用 擴充套件卡爾曼濾波(EKF) 或 無跡卡爾曼濾波(UKF) 融合安時積分與電壓模型。精度要求一般在 ±3–5% 以內 [行業通用要求]。
SOH 管理: 追蹤電芯內阻增長與容量衰減。當 SOH 降至一定閾值(如 80%),BMS 上報告警要求更換。對 AI 資料中心而言,BBU 的可用性直接關聯訓練任務安全,SOH 管理必須保守。
技術演進史
| 階段 | 時間段 | 特徵 | 代表形態 |
|---|---|---|---|
| 1.0 鉛酸時代 | 2000s | 傳統 UPS 內建鉛酸電池組,機房集中式 | 大型 UPS 櫃(鉛酸 VRLA) |
| 2.0 鋰電化 | 2010s | 鋰離子電池替代鉛酸,能量密度提升,開始出現機架級 BBU | 1U/2U 鋰電 BBU 模組進入儲存/網路裝置 |
| 3.0 高功率化 | 2020– | AI 伺服器功耗飆升,單 BBU 模組功率從 1–2 kW 向 3–6+ kW 演進;48V 母線架構推動直流配電 | 面向 AI 機架的高功率 BBU,支援熱插拔 |
| **4.0 智慧化(進行中) | 2024– | BMS 與資料中心基礎設施管理(DCIM)深度聯動;預測性維護;與儲能/電網互動(V2G 思路延伸) | 軟體定義 BBU,雲端端 SOH 管理 |
關鍵轉折點: 2023 年以來,隨著 ChatGPT 引爆大型模型訓練需求,萬卡乃至十萬卡叢集成為標配,單機架功耗突破 50 kW 成為常態。傳統 UPS 方案在擴容速度、效率、空間上的劣勢集中暴露,BBU 化 成為新建 AI 資料中心的重要供電架構選擇。
技術路線對比
電芯體系對比
| 維度 | NMC(鎳錳鈷) | LFP(磷酸鐵鋰) | 備註 |
|---|---|---|---|
| 能量密度 | 較高(~150–250 Wh/kg [電芯級,範圍取決於具體產品代際]) | 中等(~120–180 Wh/kg [電芯級]) | 同體積下 NMC 可存更多能量 |
| 功率密度 | 較好 | 良好 | 兩者在 BBU 高倍率放電場景均可勝任 |
| 迴圈壽命 | 中等(~500–1500 次 [取決於具體化學體系與工況]) | 優秀(~2000–5000+ 次 [取決於工況]) | LFP 在長壽命場景有優勢 |
| 安全性 | 需更嚴格的熱管理 | 熱穩定性更優(分解溫度更高) | 資料中心對安全性極為敏感 |
| 成本趨勢 | 受鈷/鎳價格波動影響 | 不含鈷,成本更可控 | LFP 在中國市場佔比持續提升 |
| BBU 適用性 | 對體積敏感的場景 | 對壽命/安全/成本敏感的場景 | 趨勢:LFP 在資料中心 BBU 中佔比上升 [行業觀察] |
集中式 UPS vs 分散式 BBU 架構對比
| 維度 | 集中式 UPS | 分散式 BBU |
|---|---|---|
| 部署粒度 | 機房級(MW 級) | 機架級(kW 級) |
| 擴容靈活性 | 低(需提前規劃) | 高(隨 AI 機架增量部署) |
| 系統效率 | 較低(多次 AC/DC 轉換) | 較高(直流配電減少轉換級數) |
| 佔地面積 | 大(獨立 UPS 機房) | 小(嵌入機架) |
| 維護複雜度 | 集中維護方便,但故障影響範圍大 | 分散維護工作量大,但故障影響範圍小 |
| 初始投資 | 高(需一次性配齊) | 可分期投入 |
| 備電時長 | 通常可配較長(15–30 分鐘) | 通常較短(5–15 分鐘) |
注: 實際中兩者並非完全替代關係,很多新建 AI 資料中心採用”BBU + 柴發”架構,BBU 負責短時過渡(等待柴發啟動,通常 < 10 秒),柴發負責長時備電。
上下游
產業鏈全景
上游 中游 下游
──────────────────────────────────────────────────────
鋰電電芯 BBU 模組/系統 資料中心運營商
·電芯材料 ·BMS 晶片/方案 ·雲端廠商(自建 DC)
(正極/負極/ ·DC-DC 模組 ·Colo 服務商
電解液/隔膜) ·結構件/熱管理 ·企業自建
·系統整合 AI 機房
伺服器 OEM 電力基礎設施
·整機整合 BBU ·柴發機組
·PDU/配電
上游關鍵環節
- 電芯: 這是 BBU 最核心的物料,成本佔比高(通常 50–70% [供應鏈估算])。供應商包括三星 SDI、LG 新能源、寧德時代、億緯鋰能、比亞迪等。
- BMS 晶片: 高精度 ADC + 低功耗 MCU。代表供應商包括 TI(BQ 系列)、ADI(ADBMS 系列)、NXP 等。國產替代程序中。
- DC-DC 晶片: 高效率同步升/降壓控制器。代表供應商包括 MPS、TI、Vicor 等。
下游關鍵客戶
- NVIDIA 生態: DGX/HGX 平台的 OEM/ODM(如 Supermicro、Dell、HPE、聯想等)在整機中整合或配套 BBU。
- 雲端廠商: 微軟 Azure、Google Cloud、AWS 以及國內阿里雲端、字節跳動、百度等在自建 AI 資料中心中大量採購。
- Colo/IDC 服務商: 萬國資料、世紀互聯、Equinix 等在新建 AI 機房中採用 BBU 方案。
關鍵指標
BBU 選型必須關注的技術引數
| 指標 | 含義 | AI 場景典型要求 [行業共識範圍] |
|---|---|---|
| 額定功率(kW) | 最大持續放電功率 | 3–6 kW/模組(趨勢向上) |
| 儲能容量(kWh) | 總可用電量 | 0.5–3 kWh/模組(取決於備電時長要求) |
| 備電時長(min) | 滿載下持續供電時間 | 5–15 分鐘 |
| 切換時間(ms) | 從市電中斷到 BBU 完全接管 | < 10 ms(越短越好) |
| 母線電壓(V) | BBU 接入的直流母線電壓 | 48V(主流);51.2V(LFP 標稱) |
| 迴圈壽命(次) | 額定工況下充放電迴圈次數 | ≥ 1000 次(LFP 可達 3000+) |
| 浮充壽命(年) | 長期待機狀態下的可用年限 | ≥ 5 年(高階可達 8–10 年) |
| 工作溫度範圍 | 正常工作的環境溫度 | 通常 0–45°C 或更寬 |
| 熱插拔 | 是否支援線上更換 | AI 場景通常要求支援 |
| 通訊介面 | 與伺服器/管理系統的通訊 | PMBus / SMBus / CAN / Redfish |
| SOH 監測精度 | 健康狀態估算誤差 | ±5% 以內 |
| 功率密度(W/L 或 W/kg) | 單位體積/重量的功率輸出 | 越高越好,直接影響機架空間佔用 |
供需與市場資料
市場規模
⚠️ 以下為基於公開行業報告與分析師估算的定性/範圍性資料,非精確定值。
- 全球資料中心 BBU 市場: 2023 年估計在 數十億美元 量級,受 AI 基建拉動,2024–2028 年 CAGR 預期在 15–25% 範圍 [綜合多家券商/諮詢報告估算,口徑不一]。
- 中國市場: 受國產 AI 晶片生態(華為昇騰等)及資料中心建設熱潮驅動,增速可能高於全球平均。
供需格局
需求側驅動力:
- AI 訓練叢集爆發: 全球主要雲端廠商資本支出中 AI 基礎設施佔比持續提升(2024 年多家頭部廠商 AI Capex 佔比超 50% [財報揭露])。
- BBU 化滲透率提升: 新建 AI 資料中心採用 BBU 方案的比例正在快速上升。
- 替換需求: 鋰電 BBU 替代老舊鉛酸 UPS 電池。
供給側瓶頸:
- 高倍率電芯產能: BBU 需要功率型電芯(與儲能的能量型電芯有所區別),產能切換需要時間。
- BMS 定製化: 不同伺服器平台對 BBU 介面、尺寸、通訊協議要求各異,增加系統整合商工作量。
- 認證週期: 資料中心級產品需要 UL/IEC 等安全認證,週期較長。
代表公司與資本對映
產業鏈公司圖譜(非窮舉,不構成投資建議)
| 環節 | 代表公司 | 簡要說明 |
|---|---|---|
| 電芯供應 | 三星 SDI、LG 新能源、寧德時代(300750.SZ)、億緯鋰能(300014.SZ)、比亞迪(002594.SZ) | 提供鋰離子電芯 |
| BMS 晶片 | TI、ADI、NXP、中穎電子(300327.SZ) | 提供 BMS 主控與 AFE 晶片 |
| 系統整合 | 光寶科技(Lite-On, 2301.TW)、臺達電子(Delta, 2308.TW)、Artesyn(隸屬 Advanced Energy)等 | BBU 模組整機設計與製造 |
| 伺服器 OEM | Supermicro(SMCI)、Dell(DELL)、HPE(HPE)、浪潮資訊(000977.SZ)、新華三/紫光股份(000938.SZ) | 將 BBU 整合入 AI 伺服器/機架 |
| 資料中心 | 萬國資料(GDS)、世紀互聯(VNET)、Equinix(EQIX)、資料港(603881.SH) | BBU 的終端使用者 |
資本對映邏輯:
- 最直接受益:BBU 系統整合商(訂單量直接反映 AI 建設節奏)。
- 彈性較大:電芯供應商中具備高功率電芯產線的公司。
- 間接受益:BMS 晶片國產替代標的。
投資邏輯
看多邏輯
- AI 基建確定性高增長: 全球主要雲端廠商 AI Capex 持續上調,BBU 作為 AI 機架標配部件,需求彈性大。
- BBU 化滲透率提升: 從傳統 UPS 向分散式 BBU 的架構遷移處於早期階段,滲透率每提升 1%,對應顯著增量。
- 單位價值量提升: AI 機架功耗遠高於傳統伺服器,單機架所需 BBU 功率/容量更大,單個 BBU 模組價值量上升。
- 替換週期: 鋰電 BBU 有明確的壽命週期(通常 5–8 年),存量替換提供持續性需求。
- 產業鏈國產化: 中國企業在電芯、BMS、系統整合環節均具備全球競爭力。
看空/風險因素
- 技術路線不確定性: 固態電池、超級電容等替代備電方案可能在遠期構成威脅。
- 集中度與議價能力: BBU 系統整合商可能面臨下游大型雲端廠商的壓價。
- 產能過剩風險: 若鋰電行業產能過剩蔓延至 BBU 電芯環節,可能壓縮獲利率。
- 資料中心電力架構變革: 如液冷、高壓直流(380V HVDC)等新架構對 BBU 形態提出新要求,現有產品可能需要重新設計。
常見誤讀糾偏
誤讀 1:“BBU 就是小型 UPS,技術含量低”
糾偏: BBU 雖然在功能上與 UPS 部分重疊,但技術挑戰完全不同:
- 功率密度要求極高: BBU 需要在 1U/2U 的有限空間內實現數千瓦的持續放電功率,對電芯選型、熱管理、DC-DC 效率的要求遠高於同容量的大型 UPS。
- 切換速度要求嚴苛: 集中式 UPS 通常有較大的電池組和較長的母線電容 holdup 時間,而 BBU 在緊湊空間內需要做到同等甚至更快的切換。
- 與伺服器深度整合: BBU 需要通過 PMBus/Redfish 等協議與伺服器 BMC 聯動,報告 SOC/SOH/告警,這不是簡單”接上電就行”的事。
- 可靠性要求極端: BBU 是保護數百萬美元級 AI 訓練任務的”最後一道防線”,其可靠性設計(冗餘、熱插拔、故障隔離)要求極高。
誤讀 2:“BBU 容量越大越好,可以替代柴油發電機”
糾偏: BBU 和柴發在備電體系中扮演不同角色,不是替代關係:
- BBU 負責”秒到分鐘級”過渡: 典型設計 5–15 分鐘,目的是等待柴發啟動(通常 10–30 秒內啟動,但穩定供電需更長時間)或完成關鍵 checkpoint 儲存。
- 柴發負責”小時級”長時備電: 在電網長時間中斷時維持資料中心執行。
- 盲目增大 BBU 容量 會導致成本、重量、安全風險成倍增加,經濟性遠不如柴發。正確的設計思路是 BBU 夠用即可,將投資放在柴發和電網冗餘上。
誤讀 3:“LFP 電池不適合做 BBU,能量密度太低”
糾偏: 這是對”能量密度”的片面理解。
- BBU 場景的核心需求是 功率密度(快速大電流放電能力)和 迴圈/浮充壽命,而非”儲存儘可能多的能量”。
- LFP 在功率密度、迴圈壽命、安全性方面均表現優秀,且成本更可控。在空間不是極端約束的場景下,LFP 是 BBU 的優秀選擇。
- 實際上,行業趨勢是 LFP 在資料中心 BBU 中的滲透率正在上升 [行業觀察]。
誤讀 4:“BBU 只在斷電時才工作,平時沒價值”
糾偏: 現代 BBU 在正常執行時持續發揮 電能質量調節 作用——通過與 PSU 協同工作,平滑母線電壓波動、吸收瞬態衝擊。此外,先進架構中的 BBU 還可參與 需求響應(Demand Response),在電網高峰時段向母線放電以降低市電負荷,幫助資料中心最佳化電費。這一功能與儲能系統的 V2G 思路類似,是 BBU 價值的延伸。
學習路徑
入門(0→1)
- 理解資料中心供電架構: 學習從高壓市電到伺服器晶片的完整配電路徑(中壓 → 變壓器 → 低壓配電 → PSU → 母線 → 板級 VRM)。
- 學習 UPS 基本原理: 瞭解線上式、後備式、線上互動式 UPS 的工作原理,理解 BBU 是”後備式 UPS”思想在伺服器級的延伸。
- 瞭解鋰離子電池基礎: NMC vs LFP 的化學特性、充放電曲線、SOC/SOH 概念。
進階(1→10)
- 研讀 BBU 規格書: 從主流伺服器廠商(Supermicro、Dell)的產品文件中找到 BBU 模組的 datasheet,理解其指標定義。
- 學習 BMS 設計: 研讀 TI BQ76952 或 ADI ADBMS6830 等典型 BMS AFE 的 datasheet,理解電壓/電流取樣、均衡、保護邏輯。
- 研究 48V 機架供電架構: Google 早在 2016 年即倡導 48V 機架(OCP 規範),理解 48V 母線相比 12V 的優勢。
專家(10→100)
- 關注行業標準: UL 1973(電池安全)、IEC 62619(工業鋰電安全)、OCP/Open19 機架規範。
- 追蹤頭部廠商技術路線: 關注光寶、臺達等 BBU 整合商的產品迭代;關注寧德時代、億緯等電芯廠在高功率電芯方面的進展。
- 參與行業會議/報告: 資料中心世界(Data Center World)、OCP Summit、以及券商/諮詢機構的專題報告。
一句話總結
BBU 是 AI 算力基礎設施中”看不見的安全氣囊”——它在市電中斷的數秒內接管供電,保護數百萬美元級別的 GPU 訓練任務不因一次意外斷電而歸零,是 AI 資料中心從集中式 UPS 向分散式直流配電架構遷移的核心使能元件。
延伸閱讀與來源
| 來源 | 說明 |
|---|---|
| NVIDIA DGX H100 規格書 | 瞭解 AI 伺服器功耗與電源架構 [NVIDIA 官網] |
| Open Compute Project (OCP) - Open Rack v3 規範 | 48V 機架標準,BBU 介面定義 [OCP 官網] |
| TI 應用筆記:48V Server Power Architecture | BBU 在 48V 母線中的設計思路 [TI 官網] |
| UL 1973 標準 | 固定式儲能/備電電池安全標準 |
| 億緯鋰能/寧德時代投資者交流紀要 | 電芯廠商對 BBU 市場的展望 [上市公司公告] |
| 各券商 AI 基建專題報告 | BBU 市場空間測算與競爭格局分析 [券商研究報告平台] |
| 各伺服器 OEM 產品頁面 | Supermicro/Dell/HPE 的 BBU 配件規格 [廠商官網] |
免責宣告: 本頁內容為技術概念學習用途,所涉公司、產品、資料僅供說明,不構成任何投資建議。具體技術規格以各廠商官方文件為準。市場資料基於公開資訊與行業估算,可能存在偏差。