网络层 开放阅读

存储服务器

Storage Server

概念 ID
storage-server
更新时间
2026-05-29
来源数量
待补

存储服务器(Storage Server)

3 秒看懂

存储服务器 = 为”存数据、读数据”而生的专用服务器。 它的 CPU/内存不是主角,硬盘(HDD/SSD)的密度、I/O 带宽和数据可靠性才是核心。AI 时代每训练一个大模型就需要 PB 级原始语料,存储服务器正从”后台仓库”变成 AI 基础设施的关键瓶颈。

3 分钟产业解释

存储服务器 vs 通用计算服务器

维度通用计算服务器存储服务器
核心优化目标CPU/GPU 算力存储容量 × I/O 吞吐
典型盘位数2–8 个12–100+ 个(4U 高密度可达 60–90 盘位)
CPU 角色主角管理调度(存储控制器)
内存需求高(配合计算)中等(主要做缓存/元数据)
网络侧重计算互联存储协议(NFS/SMB/iSCSI/NVMe-oF)
关键附加GPU/加速卡RAID 控制器/HBA、冗余电源、热插拔背板

为什么要单独做存储服务器?

  1. 成本效率:数据存储用 HDD 的每 TB 成本远低于 SSD(约为 SSD 的 1/5–1/8,具体随市场波动),但 HDD 需要更多盘位和机械振动隔离设计,通用机箱做不好。
  2. 可靠性设计:存储服务器在热插拔、冗余控制器、双活路径、数据校验(RAID/纠删码)方面有专门设计。
  3. I/O 拓扑:存储服务器的 PCIe 通道优先分配给 HBA/网卡而非 GPU,背板走线专为大量硬盘优化。

AI 时代的角色变化

  • 训练数据池:大模型训练数据集动辄数十 TB 到 PB 级(如 Common Crawl、LAION 等公开数据集),需要高吞吐顺序读取。
  • 检查点(Checkpoint)落盘:万卡集群一次 checkpoint 可达数十 GB,落盘速度影响训练效率。
  • 推理阶段 RAG:检索增强生成(RAG)需要海量向量数据库 → 向量数据库底层仍是存储服务器。
  • 冷热分层:热数据用 NVMe SSD,温数据用 SATA SSD,冷数据用大容量 HDD,存储服务器是承载这种分层的物理载体。

15 分钟专家深入

存储服务器的典型架构

┌─────────────────────────────────────────────────┐
│              存储服务器 (4U 机架式典型)              │
│                                                   │
│  ┌──────────┐   ┌──────────────────────────────┐ │
│  │  CPU ×2   │   │      存储驱动器舱 (Drive Bay)  │ │
│  │(低功耗型)  │   │                              │ │
│  │          │   │  [HDD][HDD][HDD][HDD][HDD]   │ │
│  └────┬─────┘   │  [HDD][HDD][HDD][HDD][HDD]   │ │
│       │         │  [SSD][SSD][SSD][SSD] (缓存层) │ │
│  ┌────┴─────┐   └────────────┬─────────────────┘ │
│  │ DDR 内存  │                │                    │
│  │(缓存/元数据)│        ┌─────┴──────┐             │
│  └──────────┘        │  背板/Expander│             │
│                      │  (SAS/SATA/NVMe)           │
│  ┌──────────┐        └─────┬──────┘               │
│  │ RAID/HBA │              │                      │
│  │ 控制器    │       ┌─────┴──────┐               │
│  └──────────┘       │  NVMe SSD  │               │
│                      │  (热数据层) │               │
│  ┌──────────┐        └────────────┘               │
│  │ 网络接口  │                                      │
│  │25/100GbE │  ← 通过 NFS/SMB/iSCSI/NVMe-oF      │
│  │或 FC 16G/32G│    对外提供存储服务                 │
│  └──────────┘                                      │
└─────────────────────────────────────────────────┘

存储协议栈

层次协议典型场景延迟量级
块存储iSCSI / FC / NVMe-oF数据库、虚拟化NVMe-oF: 低数十 μs 级;FC: 百 μs 级
文件存储NFS (v3/v4) / SMB共享文件、AI 数据集读取百 μs 级
对象存储S3 兼容 API数据湖、备份、冷数据ms 级

AI 场景偏好

  • 训练数据加载:顺序大文件读取,NFS/S3 均可,瓶颈在网络带宽(25–100 GbE)。
  • Checkpoint 落盘:大块顺序写,NVMe SSD + 高速网络最理想。
  • 向量数据库(RAG):随机小块读取,对 IOPS 敏感,NVMe SSD 有明显优势。

存储介质对比(定性)

指标HDD(近线)SATA SSDNVMe SSD
容量/盘单盘可达 20–24 TB 级 [厂商公开规格]4–8 TB 级 [厂商公开规格]4–30 TB 级(U.2/E1.S) [厂商公开规格]
顺序读带宽~200–270 MB/s~500–560 MB/s数 GB/s 级
随机读 IOPS数百数万数十万–百万级
每 TB 成本最低 [供应链估算: ~$10–15/TB]中等最高
适用层冷/温存储温存储/缓存热数据/元数据

⚠️ 具体价格随 NAND/DRAM 周期剧烈波动,以上为 2024 年大体量级估算 [供应链估算],不构成精确报价。

高密度存储服务器关键设计要点

  1. 振动管理:60+ 块 HDD 密集排列时,相邻磁头的振动相互干扰会降低性能。高端存储服务器采用减震托架、交错启动(spin-up stagger)等设计。
  2. 散热:高密度 HDD 集群功耗可观(单块近线 HDD ~5–8W),4U 机箱可能整体功耗 500–1500W 级 [估算],需要精心风道设计。
  3. 背板拓扑
    • SAS Expander 级联:用少量 HBA 端口通过 SAS expander 芯片扇出到 60+ 盘位。
    • NVMe 直连:通过 PCIe switch/retimer 连接,延迟更低但 PCIe 通道数受限。
  4. 双控制器(Active-Active):企业级存储服务器常见双控设计,任一控制器故障自动切换,保证数据可用性。

技术原理

RAID 与纠删码(Erasure Coding)

存储服务器通过冗余编码保护数据:

RAID 5 示例 (条带化 + 单校验):
┌─────────┬─────────┬─────────┬──────────┐
│ Disk 0  │ Disk 1  │ Disk 2  │ Disk 3   │
│  D0     │  D1     │  D2     │  P(0-2)  │  ← P = XOR 校验
│  D3     │  D4     │  P(3-5) │  D5      │
│  D6     │  P(6-8) │  D7     │  D8      │
└─────────┴─────────┴─────────┴──────────┘

纠删码 (Erasure Coding) 示例 (4+2 编码):
原始数据: D0 D1 D2 D3
编码块:   C0 = f(D0..D3), C1 = g(D0..D3)
任意 4 块可恢复全部数据 → 容忍 2 块故障
方法冗余开销容错能力典型场景
RAID 1 (镜像)100%1 盘故障高性能小容量
RAID 5~33% (N+1)1 盘中端通用
RAID 6~25% (N+2)2 盘大容量 HDD 阵列
纠删码 (EC)30–50% 可配可配(如 4+2, 8+3)对象存储/大数据

存储分层架构

应用层 (AI 训练框架 / 数据库 / 应用)
       │
       ▼
┌──────────────────┐
│  存储虚拟化/调度   │  ← 自动数据分层 (tiering)
│  (如 Ceph, 元数据) │
└──────┬───────────┘
       │
  ┌────┴────┬──────────┐
  ▼         ▼          ▼
 热层       温层        冷层
NVMe SSD   SATA SSD    HDD
(高IOPS)   (均衡)     (高容量)

NVMe-oF(NVMe over Fabrics)——远程直连存储的关键

传统 SAN(存储区域网络)走 FC(光纤通道),延迟在百 μs 级。NVMe-oF 通过 RDMA(RoCEv2 或 InfiniBand)将 NVMe 命令封装在网络中传输,端到端延迟可降至低数十 μs 级,接近本地 NVMe 直连。

传统: 应用 → NVMe → 本地SSD
NVMe-oF: 应用 → NVMe命令 → 网络(RDMA) → 远端存储服务器NVMe SSD

意义:让 AI 集群可以实现计算与存储分离——GPU 节点无盘化,数据全在存储服务器,按需通过高速网络访问。这正是大型云/AI 厂商越来越普遍的架构。


技术演进史

时代关键技术存储服务器形态
1990sSCSI HDD、RAID 0/1/5DAS(直连存储),服务器本地挂盘
2000sSAS/SATA、FC SAN、NAS(NFS/SMB)独立存储服务器/存储阵列(NetApp、EMC 时代)
2010sSSD (SATA→NVMe)、分布式存储(Ceph)、对象存储(S3)软件定义存储 (SDS) 崛起,存储与硬件解耦;JBOD + 软件层成为互联网公司标配
2018–2022NVMe-oF、QLC SSD、20TB+ HDD、ZNS SSD计算-存储分离成为主流;冷存储大容量 HDD 服务器 + 热存储全闪存阵列分层
2023–CXL 内存扩展、E1.S/E3.S 新规格、大模型数据需求爆发存储服务器开始集成 CXL 内存池化能力;面向 AI 的高吞吐存储集群成为独立赛道

关键转折点

  • 2015 年左右:AWS S3 等对象存储标准化,存储从”阵列”范式转向”分布式+软件定义”。
  • 2020 年左右:NVMe-oF 成熟,计算存储分离架构在超大规模数据中心落地。
  • 2023 年至今:AI 训练数据需求指数增长,存储带宽(而非单纯容量)成为新瓶颈。

技术路线对比

维度传统 SAN/NAS 阵列软件定义存储 (SDS)分布式对象存储AI-optimized 存储集群
代表产品/方案NetApp AFF/ONTAP, Dell PowerStore, 华为 OceanStorCeph, MinIO, TrueNASAWS S3, MinIO, Ceph RGWDDN EXAScaler (Lustre), WEKA, VAST Data
扩展性纵向扩展为主横向扩展海量横向扩展横向扩展,面向吞吐优化
延迟亚 ms(SSD 后端)亚 ms–ms 级ms–数十 ms 级亚 ms(NVMe 后端)
典型 IOPS数十万数万–数十万数十万–百万级
适用场景企业核心数据库混合负载、虚拟化数据湖、备份、冷数据AI 训练/推理、HPC
硬件依赖专用硬件通用硬件 + 软件通用硬件通用硬件 + 高速网络
成本结构高(硬件+许可)中(软件+运维)低(规模化后)高(NVMe+高速网络)
中国市场代表华为、新华三、DellSmartX、杉岩、大道云行青云、XSKY (星辰天合)同有科技、宏杉科技、华为

AI-optimized 存储 是当前增长最快的细分,核心诉求:高带宽顺序读(训练数据加载)+ 低延迟随机写(Checkpoint)+ POSIX 兼容(对接 PyTorch/TensorFlow DataLoader)。


上下游

上游供应链

组件主要供应商关键风险点
HDD 磁头/盘片Seagate、Western Digital、Toshiba(全球 HDD 市场为三厂商格局)[公开信息]寡头格局,产能集中
NAND FlashSamsung、SK Hynix、Micron、Kioxia、Western Digital、YMTC(长江存储)NAND 价格周期性波动剧烈;地缘政治影响供应链
SSD 控制器Marvell、Broadcom (LSI)、Phison(群联)、Silicon Motion(慧荣)高端企业级 SSD 控制器被 Broadcom/Marvell 主导
HBA/RAID 控制器Broadcom (原 LSI)、Microchip (原 Adaptec)Broadcom 市占率极高,供应链集中
SAS ExpanderBroadcom、Microchip同上
网络芯片Broadcom、Marvell、Intel高速网卡(25/100GbE)芯片供应商有限
CPUIntel (Xeon)、AMD (EPYC)存储服务器对 CPU 需求较低,但控制器仍需 x86 或 ARM
内存 (DRAM)Samsung、SK Hynix、Micron用于写缓存/元数据,需求量相对计算服务器少
连接器/背板Amphenol、TE Connectivity高密度连接器设计门槛

下游客户

客户类型采购模式代表
超大规模云厂商 (Hyperscaler)ODM/JDM 定制AWS、Google、Meta、Microsoft Azure、阿里云、字节跳动
电信运营商标准化采购中国移动/电信/联通
企业客户品牌服务器厂商金融、医疗、制造等行业
AI 公司 / AI 基础设施高吞吐存储集群大模型训练公司、智算中心

关键指标

选型决策看哪些参数

指标含义典型范围
原始容量 (Raw Capacity)所有盘位满载后的总容量从数十 TB 到数 PB(高密度 4U JBOD 可达 1.5PB+ 级) [估算]
可用容量 (Usable)扣除冗余/校验后实际可用取决于 RAID/EC 配置,通常为原始的 50–80%
顺序带宽 (Throughput)顺序读/写速度 (GB/s)全 NVMe: 数十 GB/s 级;HDD 阵列: 数 GB/s 级 [估算]
随机 IOPS每秒随机读写次数NVMe: 百万级;HDD: 数千级
延迟 (Latency)单次 I/O 响应时间NVMe 本地: ~10–100 μs;经网络: +数十–百 μs
盘位数 (Drive Bays)支持安装的硬盘数量1U: 4–12; 2U: 12–24; 4U: 60–90+
网络带宽上行网络接口速率10/25/100/200 GbE, FC 16/32G
MTBF平均无故障时间企业级 HDD: ~200 万小时 [厂商数据]; NVMe SSD: ~200 万小时+ [厂商数据]
数据服务快照、克隆、复制、压缩、去重企业级 SDS 通常内建
功耗整机功耗4U 高密度: 500–2000W 级 [估算]

AI 训练场景的特殊要求

关键瓶颈排序 (大模型训练数据加载场景):

1. 网络带宽 (25GbE→100GbE→400GbE) ← 最容易成为瓶颈
2. 存储顺序带宽 (聚合 GB/s)
3. 元数据性能 (海量小文件的 inode 操作)
4. 容量 (PB 级数据集)
5. IOPS (checkpoint 场景才重要)

供需与市场数据

市场规模(定性)

  • 全球企业存储市场:整体规模在数百亿美元级别 [多家行业分析机构口径不同],其中外部存储系统(含存储服务器、存储阵列)占主要份额。
  • AI 驱动的存储增长:多家行业分析机构指出,AI 相关存储需求是未来 3–5 年存储市场增长最快的细分,年复合增速预计 20%+ [行业报告综合估算],高于传统存储的低个位数增长。
  • 中国市场:受信创(信息技术应用创新)政策推动,国产存储服务器替代加速,华为、新华三、浪潮等厂商在政府/金融/电信市场份额持续提升 [行业估算]。

供需格局

维度现状
HDD 供给Seagate + WD + Toshiba 三厂商格局,产能集中,2023–2024 年经历减产后逐步恢复
NAND 供给2023 年经历严重下行周期后价格反弹;三星/海力士/美光控产保价;YMTC 受出口管制影响产能受限
NVMe SSD 需求企业级 NVMe SSD 需求旺盛,AI 训练集群拉动高带宽 SSD 需求
存储服务器整机Hyperscaler 采购占整体服务器出货量的较大比例(通常超过 50%)且持续增长;品牌厂商(Dell/HPE/华为)主导企业市场;ODM 主导云市场

⚠️ 具体市场份额数字各机构口径差异较大,此处不引用单一来源数字,建议参考 IDC、Gartner、TrendForce 等机构最新季报。


代表公司与资本映射

全球存储服务器生态

环节代表公司备注
品牌存储服务器/阵列Dell Technologies (NYSE:DELL), HPE (NYSE:HPE), NetApp (NASDAQ:NTAP), Pure Storage (NYSE:PSTG)全球前四大存储厂商
中国品牌华为 (非上市), 新华三 (紫光集团体系), 浪潮信息 (SZ:000977), 中科曙光 (SH:603019)信创核心受益标的
存储软件/SDSNutanix (NASDAQ:NTNX), VAST Data (非上市), WEKA (非上市), MinIO (非上市)软件定义存储/AI 存储新势力
HDD 制造Seagate (NASDAQ:STX), Western Digital (NASDAQ:WDC), Toshiba (TYO:6502)全球三大 HDD 厂商
NAND/SSDSamsung (KRX:005930), SK Hynix (KRX:000660), Micron (NASDAQ:MU), Kioxia (非上市)上游存储芯片核心
存储控制器/芯片Broadcom (NASDAQ:AVGO), Marvell (NASDAQ:MRVL), Phison (TWSE:8299)HBA/RAID/SSD 控制器
中国存储芯片长江存储 (YMTC, 非上市), 兆易创新 (SH:603986), 澜起科技 (SH:688008)国产替代方向
AI 存储集群DDN (非上市), VAST Data (非上市)大模型训练存储领域领先

投资逻辑

核心驱动力

  1. AI 训练数据指数增长:模型参数量增长推动数据集规模增长,存储需求与算力需求同步扩张。每增加 1 万张 GPU 的算力,配套存储投入约为算力成本的 5–15% [行业估算]。
  2. 计算-存储分离趋势:传统”本地盘”模式正被”远端存储服务器+高速网络”取代,独立存储服务器的采购量因此增长。
  3. 信创/国产替代:中国市场的存储基础设施面临国产化要求,利好国内存储厂商。
  4. 数据合规/数据主权:各国数据本地化法规推动企业建设本地存储基础设施,而非完全依赖公有云。

风险与挑战

  1. 存储周期性:NAND/DRAM 价格周期性波动,影响 SSD 成本和厂商利润率。
  2. 云厂商自研:Hyperscaler 越来越多采用 ODM/JDM 自研存储方案,压缩品牌厂商市场。
  3. CXL 技术冲击:CXL(Compute Express Link)内存池化可能模糊计算服务器和存储服务器的边界,长期可能改变架构。
  4. 存储压缩/去重技术:软件层面的数据效率提升可能降低物理存储需求增速。

产业链受益逻辑

AI 算力扩张
    │
    ├── GPU/算力芯片 ── (Nvidia/AMD/寒武纪等,最直接)
    │
    ├── 服务器整机 ── (浪潮/超微/Dell 等)
    │
    ├── 网络设备 ── (交换机/高速网卡)
    │
    ├── ★ 存储基础设施 ★ ← 你在这里
    │       ├── 存储服务器整机 (Dell/华为/浪潮)
    │       ├── SSD/HDD (三星/SK Hynix/Seagate)
    │       ├── 存储软件 (VAST/WEKA/MinIO)
    │       └── 存储控制器芯片 (Broadcom/Marvell)
    │
    └── 电力/散热/基建

常见误读纠偏

❌ 误读 1:“存储服务器就是普通服务器多插几块硬盘”

纠偏:存储服务器在背板设计、振动管理、I/O 拓扑、冗余控制器、存储协议栈、数据保护(RAID/EC) 等方面有大量专用设计。简单在通用服务器上多装硬盘,在 60+ 盘位密度下会面临振动干扰、散热不足、PCIe 通道不够等问题。“能用”和”好用/可靠”是两回事。

❌ 误读 2:“AI 时代全用 SSD,HDD 会被淘汰”

纠偏:HDD 在每 TB 成本上仍显著低于 SSD(约 5–8 倍差距 [供应链估算])。对于 PB–EB 级冷数据存储(历史日志、训练数据归档、合规数据保留),HDD 仍然是经济性最优解。Seagate 和 WD 的大容量近线 HDD(20TB+)出货量在 AI 时代反而因数据总量增长而保持稳定甚至增长。真正的趋势是分层存储,而非 HDD 被完全替代。

❌ 误读 3:“存储服务器不涉及 AI,不是 AI 产业链的一部分”

纠偏:这是对 AI 基础设施理解不完整。AI 训练集群是”算力-网络-存储”三位一体的系统。没有高吞吐存储,GPU 只能”饿着等数据”(I/O bound)。业内有句行话:“训练集群的瓶颈不一定是 GPU,也可能是最后一个读完数据的节点。” 存储服务器是 AI 基础设施中不可或缺的一环。

❌ 误读 4:“有了公有云,企业不需要自建存储服务器了”

纠偏:公有云的存储服务(如 S3、OSS)底层仍然需要物理存储服务器。此外,出于数据合规、延迟敏感、成本可控(长期大规模使用时云存储成本可能高于自建) 等考量,许多企业仍需自建或混合部署。AI 训练场景尤其如此——将海量训练数据在公有云上反复读取的网络成本和时间成本,往往促使企业自建本地存储集群。


学习路径

入门级(0–1 个月)

  1. 概念理解:阅读本文 + NetApp/Dell 官方白皮书中的存储基础部分。
  2. 动手体验:用 TrueNAS(免费开源存储操作系统)在旧 PC 上搭一个小型 NAS,理解 RAID、ZFS、NFS/SMB 的基本概念。
  3. 视频:YouTube/B 站搜索”存储服务器 vs 普通服务器区别”等入门科普。

进阶级(1–3 个月)

  1. 协议深入:学习 NVMe 规范基础、NVMe-oF 架构、RDMA/RoCEv2 原理。
  2. 分布式存储:阅读 Ceph 官方文档架构章节,理解 CRUSH 算法、RADOS、对象/块/文件存储统一架构。
  3. AI 存储:阅读 WEKA 或 VAST Data 的技术博客,了解 AI 训练场景下的存储优化思路(POSIX、小文件合并、分层策略)。

专家级(3 个月+)

  1. 存储芯片产业链:跟踪 Seagate/Western Digital/Samsung/Micron 财报,理解 NAND/HDD 供需周期。
  2. 新兴技术:关注 CXL 3.0 对存储架构的影响、ZNS (Zoned Namespace) SSD、SMR (Shingled Magnetic Recording) HDD。
  3. 行业报告:订阅 IDC、Gartner 的企业存储季度跟踪报告。
  4. 实际部署:参与或了解智算中心的存储方案选型过程(选型 RFP、POC 测试、性能基准测试)。

推荐阅读

  • 《Storage Systems: Organization, Performance, and Analysis》 — 存储系统经典教材
  • SNIA (Storage Networking Industry Association) — 存储行业标准组织,其网站有大量白皮书和规范文档
  • Lustre File System 官方文档 — HPC/AI 场景下最常用的并行文件系统之一

一句话总结

存储服务器是 AI 基础设施中”沉默的数据引擎”——GPU 跑得再快,数据喂不进去也白搭;在算力军备竞赛之外,谁掌握了 PB 级高效存储能力,谁才能真正释放 AI 的全部潜力。


延伸阅读与来源

  1. 厂商技术文档:NetApp ONTAP 文档库、Dell PowerScale 技术规格、华为 OceanStor 技术白皮书
  2. 行业标准:NVMe Express Base Specification(nvme.org)、SNIA CDMI 规范
  3. AI 存储专题:VAST Data 博客 (vastdata.com/blog)、WEKA 技术白皮书、DDN AI 参考架构文档
  4. 行业分析:IDC Worldwide Enterprise Storage Systems Tracker、Gartner Magic Quadrant for Primary Storage
  5. 供应链数据:TrendForce/DRAMeXchange NAND/DRAM 季度报价、Seagate/WD 季度财报
  6. 学术/开源:Ceph 官方文档 (docs.ceph.com)、Lustre Wiki、Open Compute Project (OCP) 存储子项目

⚠️ 免责说明:本文中未标注具体来源的数字为基于行业公开信息的定性估算,仅供概念理解,不构成投资建议。市场数据请以各分析机构最新发布为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型