網路層 開放閱讀

Shared Buffer

Shared Buffer

概念 ID
shared-buffer
更新時間
2026-05-29
來源數量
待補

Shared Buffer

⚠️ 資料可信度宣告:本次聯網檢索全部失敗(HTTP 403),以下內容基於公開技術文獻、學術論文及行業共識整理。涉及具體數字時已標註來源口徑,無據則採用定性描述或標註[估算]。如需機構級決策,請交叉驗證供應鏈資料。

3 秒看懂

Shared Buffer(共享緩衝區) = 多個埠/計算單元共用一個大的緩衝池,而非各自獨立緩衝。

類比:獨立緩衝像每戶有獨立水箱,共享緩衝像小區共用蓄水池——動態調配、利用率高、抗突發能力強。

為什麼AI從業者要關注:AI叢集網路交換晶片的核心架構選型 + GPU片上協作計算的基石 + 大型模型推論KV Cache的工程最佳化方向,三重場景都繞不開。

3 分鐘產業解釋

核心問題:緩衝區為什麼要”共享”?

在AI訓練叢集中,數千張GPU通過高速網路互聯。交換器的緩衝區架構直接決定了:

  • 突發流量能否被吸收(AllReduce梯度同步的incast場景)
  • 公平性(避免單個流佔滿緩衝區導致其他流餓死)
  • 時延抖動(影響訓練迭代時間的穩定性)

三類主流緩衝區架構

架構型別全稱核心特徵典型應用
OQOutput Queued每個輸出埠獨立佇列早期低速交換器
IQInput Queued每個輸入埠獨立佇列廉價交換方案
Shared Buffer共享緩衝區所有埠共享一個大緩衝池高階交換晶片、GPU共享記憶體

產業價值:Shared Buffer架構能在相同矽面積下提供更高的有效頻寬利用率,這是AI叢集網路追求高吞吐、低丟包的關鍵技術選擇。

三個關鍵應用場景

┌─────────────────────────────────────────────────────────┐
│                    Shared Buffer                         │
├─────────────────┬─────────────────┬─────────────────────┤
│  網路交換晶片    │   GPU/加速器     │    推論服務系統      │
│                 │                 │                     │
│  交換器共享      │   SM內Shared    │   KV Cache          │
│  緩衝區架構      │   Memory        │   共享池/Paged       │
│                 │                 │   Attention          │
│  場景:AI叢集    │   場景:運算元內   │   場景:LLM服務     │
│  AllReduce      │   執行緒協作      │   多請求併發         │
└─────────────────┴─────────────────┴─────────────────────┘

15 分鐘專家深入

場景一:網路交換晶片的Shared Buffer

這是AI叢集網路基礎設施的核心技術選型。

為什麼incast場景是噩夢?

大型模型訓練中的AllReduce、All-to-All通訊模式,會導致多對一的流量匯聚(incast):

     GPU 0 ──┐
     GPU 1 ──┼──→ 交換器 ──→ GPU 7  (N:1 流量匯聚)
     GPU 2 ──┘

如果緩衝區容量不足或分配不公,高頻寬鏈路瞬間擁塞,導致:

  • 丟包 → 重傳 → 延遲激增
  • 訓練吞吐下降

Shared Buffer的核心機制

┌──────────────────────────────────────────────┐
│              Shared Buffer Pool               │
│  ┌───┬───┬───┬───┬───┬───┬───┬───┐           │
│  │ P0│ P1│ P2│ P3│ P4│ P5│ P6│ P7│ ...       │
│  └───┴───┴───┴───┴───┴───┴───┴───┘           │
│     ↑     ↑         ↑                         │
│     │     │         │                         │
│  Port 0  Port 1   Port N                      │
│  (動態分配/搶佔/預留)                           │
└──────────────────────────────────────────────┘
  • 動態分配:空閒埠的緩衝區配額可被擁塞埠臨時借用
  • 公平性保障:通過加權公平佇列(WFQ)或類似機制,防止單流霸佔
  • 流量吸收:在微突發(microburst)期間暫時儲存,避免直接丟包

關鍵引數(無精確資料,定性描述)

引數Shared Buffer 優勢說明
有效容量利用率高(各埠動態共享)vs. 獨立緩衝的利用率通常<50%[估算]
突發吸收能力瞬時頻寬可借調其他埠配額
實現複雜度需要高頻寬儲存介質 + 複雜排程邏輯
矽面積成本通常需要片上大容量SRAM

硬體實現挑戰

共享緩衝區需要同時服務所有埠的讀寫,對儲存介質頻寬要求極高。由於交換晶片緩衝區要求納秒級低延遲隨機訪問,HBM延遲遠高於SRAM,無法滿足線速交換需求,實際從未用於交換晶片共享緩衝區,僅可使用片上SRAM。片上SRAM速度快,但容量有限(通常MB級[估算]),矽面積成本高。

⚠️ 具體交換晶片的緩衝區容量、頻寬規格等資料因廠商未充分公開揭露,無法確認。博通、輝達等廠商的交換晶片架構細節通常不在公開文件中。

場景二:GPU Shared Memory

這是GPU計算架構中最直接的”Shared Buffer”概念。

架構定位

┌─────────────────────────────────────────┐
│                 GPU SM                   │
│                                         │
│  ┌─────────────────────────────────┐    │
│  │     L1 Cache / Shared Memory    │    │
│  │     (可配置配比)                  │    │
│  └─────────────────────────────────┘    │
│         ↑       ↑       ↑               │
│     Warp 0  Warp 1  Warp N             │
│                                         │
│  ┌─────────────────────────────────┐    │
│  │        Register File            │    │
│  └─────────────────────────────────┘    │
└─────────────────────────────────────────┘
         ↕ 通過SM內互連
┌─────────────────────────────────────────┐
│           L2 Cache (跨SM共享)           │
└─────────────────────────────────────────┘

┌─────────────────────────────────────────┐
│              HBM / 視訊記憶體                  │
└─────────────────────────────────────────┘

核心機制

  • Block級共享:一個Thread Block內的所有執行緒可訪問同一塊Shared Memory
  • Bank衝突:Shared Memory被劃分為多個bank(通常32個),同一bank的併發訪問會序列化
  • 容量有限:每個SM的Shared Memory通常為幾十KB到百KB量級(具體取決於架構世代和L1/Shared配置比)

為什麼對AI重要?

  • 矩陣分塊計算:GEMM等核心運算元通過將大矩陣切分為小塊載入到Shared Memory,實現資料複用,減少全域性記憶體訪問
  • Warp級協作:同一Warp的執行緒通過Shared Memory交換中間結果

⚠️ 各代GPU(A100/H100/B100)的Shared Memory具體容量、bank數等因廠商未充分公開完整技術規格,無法確認精確數值。

場景三:推論服務中的KV Cache管理

大型模型推論中的KV Cache共享是近年來的重要工程最佳化方向。

問題背景

大型模型自迴歸解碼時,每個token的生成需要訪問歷史所有token的Key-Value狀態。多請求併發時,KV Cache成為視訊記憶體瓶頸。

共享緩衝區思路

技術核心思想來源
PagedAttention將KV Cache分頁管理,類似作業系統虛擬記憶體vLLM專案[公開論文]
KV Cache共享prefix相同的請求複用同一份KV Cache多個推論架構實現[公開資訊]
連續批處理動態排程不同進度的請求共享計算資源多篇公開論文

工程價值:在相同GPU數量下,提升推論服務的吞吐量(QPS)和降低單請求延遲。


技術原理

1. 網路交換晶片Shared Buffer架構

核心設計思想

在傳統Output Queued(OQ)交換器中,每個輸出埠有獨立的緩衝區。問題在於:

  • 交換器內部需要以N倍線速向輸出緩衝區寫入(N=埠數),硬體難以實現
  • 各埠緩衝區相互隔離,利用率低

Shared Buffer架構的核心創新:

傳統OQ:                          Shared Buffer:
┌────┐  ┌────┐  ┌────┐           ┌───────────────────┐
│Port│  │Port│  │Port│           │                   │
│ 0  │  │ 1  │  │ 2  │           │  Shared Buffer    │
│Buf │  │Buf │  │Buf │           │      Pool         │
└────┘  └────┘  └────┘           │                   │
  互不相通                         └───────────────────┘
                                    ↕ ↕ ↕
                                Port 0  1  2
                                (共享訪問)

關鍵機制:動態配額分配

緩衝區分配策略示意(概念性):

總容量 = 100 units(假設值)

┌─────────────────────────────────────────┐
│  Reserved (每埠最低保障)               │
│  Port0: 5  Port1: 5  ...  Port7: 5     │
│  = 40 units                             │
├─────────────────────────────────────────┤
│  Shared Pool (動態分配) = 60 units      │
│                                         │
│  分配邏輯:                             │
│  if (Port_i擁塞 && Port_j空閒):         │
│      Port_i可借用Port_j的配額            │
│                                         │
│  if (所有埠擁塞):                      │
│      按權重公平分配                       │
└─────────────────────────────────────────┘

排程演算法要點

  1. 入隊策略:新到達的資料包如何選擇緩衝區位置
  2. 出隊策略:多個埠競爭讀取時的優先順序
  3. 丟棄策略:緩衝區滿時的Tail Drop/WRED等機制

2. GPU Shared Memory機制

記憶體層次中的位置

頻寬 ↑
     │  ┌──────┐
     │  │Reg   │  ~TB/s級別(最快,最小)
     │  ├──────┤
     │  │SMEM  │  ~TB/s級別(片上,Block共享)
     │  ├──────┤
     │  │L2    │  數TB/s(跨SM共享)
     │  ├──────┤
     │  │HBM   │  數TB/s(全域性,容量最大)
     │  └──────┘
     └──────────────────→ 容量

Bank衝突原理

Shared Memory = 32 個 Bank(典型值,未精確確認)

Bank版面配置(概念性):
Bank 0: [addr 0, 128, 256, ...]
Bank 1: [addr 4, 132, 260, ...]
Bank 2: [addr 8, 136, 264, ...]
...
Bank 31: [addr 124, 252, 380, ...]

無衝突:32個執行緒訪問32個不同Bank → 1個週期完成
有衝突:多個執行緒訪問同一Bank → 序列化,延遲增加

3. 推論KV Cache共享機制

PagedAttention核心思想

傳統KV Cache:
┌─────────────────────────────────┐
│  Request A: [KV0|KV1|KV2|...|KVn]  → 連續記憶體分配,有內部碎片
│  Request B: [KV0|KV1|...|KVm]      → 長度不一,浪費嚴重
└─────────────────────────────────┘

PagedAttention:
┌──────────────────────────────────────────────┐
│  物理KV塊池                                   │
│  ┌───┬───┬───┬───┬───┬───┬───┬───┬───┐      │
│  │ B0│ B1│ B2│ B3│ B4│ B5│ B6│ B7│...│      │
│  └───┴───┴───┴───┴───┴───┴───┴───┴───┘      │
│      ↑       ↑       ↑                       │
│  Page Table A: [B0, B2, B5]                   │
│  Page Table B: [B1, B4, B7]                   │
│  (可共享): 若A/B有相同prefix → 指向相同物理塊  │
└──────────────────────────────────────────────┘

關鍵優勢

  • 消除內部碎片
  • 支援Copy-on-Write式的prefix共享
  • 物理塊可跨請求複用

技術演進史

網路交換緩衝區架構演進

年代階段關鍵變化
1990sOQ為主每埠獨立緩衝,低速場景可行
2000sIQ興起降低成本,但HOL阻塞問題
2000s-2010sShared Buffer成熟片上SRAM容量增長,高階交換晶片標配
2020sAI叢集驅動InfiniBand/RoCE高效能交換,Shared Buffer成為剛需

GPU Shared Memory演進

架構世代變化趨勢說明
Kepler/Maxwell基礎Shared Memory容量有限,獨立於L1
Pascal/VoltaL1/SMEM可配靈活分配比例
Ampere容量增長更大SMEM支援更復雜運算元
Hopper進一步增強支援更大Shared Memory配置(具體容量[未充分揭露])

⚠️ 各世代具體容量資料因廠商規格書未完全公開,無法確認精確數值。

推論KV Cache最佳化演進

階段技術解決問題
早期固定長度KV Cache分配簡單但浪費嚴重
2023PagedAttention(vLLM)分頁管理,消除碎片
2024+Prefix Caching / 多級快取進一步複用,降低成本

技術路線對比

網路緩衝區架構對比

維度Output QueuedInput QueuedShared Buffer
有效頻寬需N倍線速,硬體限制大存在HOL阻塞高,動態共享
突發吸收各埠獨立,容量受限各埠獨立,容量受限強,可借用
公平性隔離好但利用率低可能不公平需要排程演算法保障
實現複雜度
成本高(需要大容量高速緩衝)
AI叢集適用性

GPU片上儲存對比

儲存型別容量量級頻寬量級共享範圍典型用途
Register每SM數百KB最高單執行緒變數、臨時計算
Shared Memory每SM幾十~百KB級極高Block內執行緒資料複用、協作
L2 Cache數十MB級跨SM熱資料快取
HBM數十GB級數TB/s全域性模型引數、資料

上下游

上游:儲存介質與製造

環節關鍵要素代表玩家
SRAM IP高速片上儲存設計Synopsys, Cadence
HBM高頻寬儲存晶片SK海力士, 三星, 美光
先進製程支援大容量片上SRAM台積電, 三星

中游:晶片設計與系統整合

環節關鍵要素代表玩家
交換晶片Shared Buffer架構設計博通, 輝達(Mellanox), 思科
GPU/加速器Shared Memory設計輝達, AMD
推論引擎KV Cache管理實現vLLM, TensorRT-LLM, SGLang

下游:AI基礎設施

環節關鍵要素代表玩家
雲端廠商AI叢集部署AWS, Azure, GCP, 各大型模型公司
推論服務高效推論部署各AI服務提供商

關鍵指標

網路交換Shared Buffer

指標重要性說明
緩衝區總容量★★★★★決定突發吸收能力,單位通常為MB級(高階晶片)
每埠可用緩衝★★★★單埠可借用的最大容量
緩衝區頻寬★★★★需要支撐所有埠的併發讀寫
排程演算法效率★★★★影響公平性和延遲
丟包率★★★★★AI訓練對丟包極其敏感

GPU Shared Memory

指標重要性說明
每SM容量★★★★★決定可載入的資料塊大小
頻寬★★★★★需要匹配計算吞吐
Bank數★★★★影響衝突機率
L1/SMEM配比★★★需要根據運算元特性調整

推論KV Cache

指標重要性說明
KV Cache命中率★★★★★Prefix共享的複用效率
視訊記憶體利用率★★★★★消除碎片後的實際可用容量
支援併發請求數★★★★★直接影響服務吞吐
Copy-on-Write開銷★★★共享後修改時的額外成本

供需與市場資料

市場規模(估算/定性)

⚠️ 以下為定性判斷,非精確資料。

細分市場規模趨勢驅動因素
高階交換晶片快速增長AI叢集組網需求激增
GPU/加速器快速增長大型模型訓練+推論需求
推論最佳化軟體快速增長推論成本壓力

供需格局

供給端

  • 高階交換晶片:博通佔據主導地位,輝達(Mellanox)在InfiniBand領域強勢
  • GPU共享記憶體:輝達引領,AMD緊追
  • 推論最佳化:開源社群活躍(vLLM, SGLang),商業公司跟進

需求端

  • 萬卡級AI訓練叢集:對網路Shared Buffer效能要求極高
  • 大型模型推論:對KV Cache管理效率要求持續提升

代表公司與資本對映

網路交換領域

公司角色Shared Buffer相關上市程式碼
博通 (Broadcom)交換晶片龍頭Memory Switch架構AVGO (NASDAQ)
輝達 (NVIDIA)AI全棧InfiniBand交換、Spectrum-XNVDA (NASDAQ)
思科 (Cisco)傳統網路高階交換平台CSCO (NASDAQ)

GPU/加速器領域

公司角色Shared Memory相關上市程式碼
輝達 (NVIDIA)GPU霸主CUDA Shared Memory生態NVDA (NASDAQ)
AMDGPU追趕者ROCm Shared MemoryAMD (NASDAQ)
寒武紀國產AI晶片片上快取架構688256 (科創板)

推論最佳化領域

公司/專案角色技術貢獻
vLLM (UC Berkeley)開源推論引擎PagedAttention首創者
SGLang推論架構RadixAttention等最佳化
各雲端廠商自研推論引擎定製化KV Cache管理

投資邏輯

核心驅動力

  1. AI叢集規模擴張 → 網路交換晶片需求激增 → Shared Buffer架構成為高階晶片標配
  2. 大型模型引數量增長 → 對GPU片上儲存(Shared Memory)的容量和效率要求提升
  3. 推論成本壓力 → KV Cache管理最佳化成為降本關鍵 → 相關技術和公司受關注

受益鏈條

AI算力需求增長

    ├──→ 網路基礎設施 ──→ 高階交換晶片(Shared Buffer架構)
    │         │
    │         └──→ 受益:博通、輝達(網路業務)

    ├──→ GPU/加速器 ──→ 片上Shared Memory最佳化
    │         │
    │         └──→ 受益:輝達、AMD、國產AI晶片

    └──→ 推論服務 ──→ KV Cache管理最佳化

              └──→ 受益:推論引擎公司、雲端廠商

風險點

  • 技術迭代風險:新的架構可能替代現有方案
  • 競爭格局變化:開源方案可能削弱商業公司護城河
  • 宏觀需求波動:AI投資週期性

常見誤讀糾偏

誤讀1:Shared Buffer = 簡單的記憶體共享

糾偏:Shared Buffer在不同場景下有完全不同的技術含義:

  • 網路交換:指交換晶片的緩衝區架構設計,核心是多埠動態共享一個物理緩衝池,涉及複雜的排程和公平性演算法
  • GPU:指SM內可供Block內執行緒協作訪問的片上SRAM,有bank衝突等特定約束
  • 推論:指KV Cache等狀態的邏輯共享,涉及分頁、Copy-on-Write等機制

關鍵:不能將一個領域的理解直接套用到另一個領域。

誤讀2:Shared Buffer容量越大越好

糾偏:容量只是引數之一,還需要考慮:

  • 頻寬:Shared Buffer需要同時服務多個埠/執行緒,頻寬不足會成為瓶頸
  • 訪問延遲:容量增大往往意味著延遲增加
  • 成本/面積:片上SRAM的矽面積成本極高
  • 排程演算法:容量再大,排程不當也會導致不公平或低利用率

關鍵:需要根據應用場景做容量/頻寬/延遲/成本的綜合權衡。

誤讀3:PagedAttention解決了所有KV Cache問題

糾偏:PagedAttention是重要創新,但仍有侷限:

  • 分頁開銷:Page Table查詢增加了延遲
  • 碎片化管理:分頁本身引入了頁面管理的複雜性
  • 不適合所有場景:短序列、低併發場景可能不需要
  • Copy-on-Write成本:共享後修改時需要額外複製

關鍵:需要根據具體工作負載特徵選擇合適的最佳化策略。


學習路徑

入門級(建立概念)

  1. 瞭解緩衝區基礎:作業系統中的緩衝區概念(生產者-消費者、環形緩衝區)
  2. GPU程式設計基礎:學習CUDA Shared Memory的基本用法(NVIDIA官方教程)
  3. 交換器基礎:瞭解乙太網路交換器的基本工作原理

進階級(理解機制)

  1. 交換架構論文:閱讀Shared Buffer交換器的經典論文(搜尋”shared buffer switch architecture”)
  2. CUDA最佳化:學習Shared Memory的bank衝突、分塊矩陣乘法等最佳化技巧
  3. vLLM論文:閱讀PagedAttention原始論文(“Efficient Memory Management for Large Language Model Serving with PagedAttention”)

專家級(深入設計)

  1. 交換晶片架構:研究高階交換晶片的緩衝區設計權衡
  2. GPU微架構:深入理解不同代GPU的Shared Memory特性
  3. 推論系統最佳化:追蹤KV Cache管理的最新研究進展

推薦資源

資源型別適用階段
NVIDIA CUDA Programming Guide官方文件入門+進階
vLLM: Efficient Memory Management…論文進階
High Performance Switches and Routers (書籍)學術書籍進階+專家
Hot Chips / ISSCC 會議論文學術會議專家

一句話總結

Shared Buffer的核心價值是”動態共享、按需分配”——在網路交換、GPU計算、推論服務三個AI關鍵場景中,通過消除資源隔離帶來的浪費,顯著提升系統效率和吞吐能力。


延伸閱讀與來源

技術文獻

  1. PagedAttention原始論文:Kwon et al., “Efficient Memory Management for Large Language Model Serving with PagedAttention”, SOSP 2023
  2. Shared Buffer交換器經典研究:搜尋關鍵詞 “shared buffer switch architecture”, “memory bandwidth efficient switch”
  3. NVIDIA CUDA文件:https://docs.nvidia.com/cuda/

行業資源

  1. Hot Chips 會議:高階晶片架構的年度盛會
  2. OCP (Open Compute Project):資料中心硬體開源設計
  3. 各交換晶片廠商技術白皮書

資料來源說明

  • 本文中所有精確技術規格(製程、容量、頻寬等)因聯網檢索失敗,未引用廠商官方資料
  • 涉及具體數字的內容已標註[估算]或[未充分揭露]
  • 投資相關資訊不構成任何投資建議

本頁最後更新:基於公開技術文獻和行業共識整理,具體技術規格請以廠商官方釋出為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型