状态空间模型 (State Space Model) ·
定位:AI 基础模型架构层(链:算力芯片 → 模型架构 → 云/端服务) 标签:#序列建模 #Transformer替代方案 #高效推理 #长上下文
1 3秒看懂
一句话定义:状态空间模型是一类借用经典控制理论数学框架、用微分方程描述序列演化的 AI 模型架构。它面对长序列输入时,计算复杂度呈线性增长,从根本上绕开了 Transformer 注意力机制的平方级瓶颈,因此被视为大模型走向高效推理和超长上下文的关键技术路线之一。
一句话产业位置:处于 AI 产业链的模型架构层。上游是 GPU/TPU 算力硬件与并行计算基础软件;下游是长文档理解、DNA 序列分析、工业传感器流、边缘设备语音助手等场景。SSM 不是独立产品,而是一套正在快速扩张的技术方案族,目前仍在从学术前沿向工程落地迁移。
一句话判断价值:SSM 是 Transformer 之后,首次在语言建模基准上逼近同等性能且保持线性复杂度的方法。它提供了工程上可落地的替代方案,并促使产业界重新思考“大模型是否必须依赖注意力机制”这一底层命题。
三句话补全认知:
- 当前主流架构 Transformer 的自注意力机制,在处理 10 万 token 以上长上下文时,内存与算力成本急剧上升,SSM 直面这一痛点。
- Mamba 系列模型在 2023–2024 年将 SSM 带入大规模语言建模,并验证了选择性状态空间在保持效率同时提升建模能力的可行性。
- 产业界普遍将 SSM 视为 Transformer 的重要补充而非全面替代,但混合架构(SSM + 注意力)正在成为模型设计的新常态。
2 3分钟产业解释
2.1 从 Transformer 的痛点说起
Transformer 通过“自注意力”为每个 token 与序列中所有其他 token 计算关联,从而获得优秀的上下文建模能力,但代价是计算和内存复杂度均为 O(N²)。当序列长度从几千扩展到几十万甚至百万级时,成本会增长到现有硬件难以承受的程度。工程上针对这一问题演化出 FlashAttention、KV-cache 压缩、稀疏注意力等优化,但都无法从根本上将复杂度压低到 O(N)。
状态空间模型从数学源头出发,放弃了“让每个 token 看所有 token”的思路,转而定义一条随时间演化的隐状态轨迹。状态随新 token 输入而递推更新,决策所需的上下文信息压缩在这个固定容量的状态向量里。由于每一步计算只依赖当前输入和上一步状态,复杂度和存储开销与序列长度 N 成线性关系,推理过程在理想条件下可逼近 O(1)。
2.2 产业图谱:一条正在形成的价值链
SSM 产业链可以用三环结构理解:
- 上游(算力与基础软件):SSM 的核心算子(如选择性扫描)需要高效实现,催生了针对 GPU 显存带宽定制的 CUDA kernel。上游玩家包括 NVIDIA(硬件 + CUDA 生态)、AMD(ROCm 生态)、以及 Triton/Cutlass 等中间层框架开发者。
- 中游(模型架构与预训练):以 S4、S5、H3、Mamba、Mamba-2 等为代表的一批递进式架构,形成了从学术原型到开源预训练模型的演进路径。中游的核心产出是开源模型权重、架构论文和配套代码库。
- 下游(应用与部署):下游场景覆盖云端 API(长文档分析、代码审查、生物序列解析)、边缘推理(低功耗语音助手、实时信号处理)和垂直行业(工业物联网、高频金融信号)。下游企业更多是 SSM 的使用者而非架构创新者。
2.3 为什么这个时点值得关注
2023 年 Mamba 的提出,是 SSM 从“长序列专项工具”升级为“通用语言模型候选架构”的转折点。Mamba 在同等参数量级(约 3B)下达到与强 Transformer 基线(如 LLaMA、Pythia)可比的语言困惑度,同时推理吞吐量提升数倍。此后不到一年,Mamba-2 通过状态空间对偶性将 SSM 形式化为结构化矩阵乘法,使得 SSM 训练可以在现有 Transformer 训练流水线中复用大量优化,极大降低了产业采纳门槛。
从时间轴来看,2020–2022 年是“SSM 证明方法论可行”的阶段,2023–2024 年则步入“SSM 证明可规模化”的阶段。目前大型科技公司与头部初创正密集探索 SSM 在万亿 token 级预训练、多模态和 agent 场景下的表现,产业格局远未固化。
3 技术原理
3.1 连续系统的离散化:从微分方程到深度学习
状态空间模型的数学本源是线性时不变系统理论。连续形式下,系统由两个方程定义:
h'(t) = A·h(t) + B·x(t) (状态方程)
y(t) = C·h(t) + D·x(t) (输出方程)
其中 h(t) 表示隐状态向量,维度通常为 d_state;x(t) 为输入信号(在语言模型中对应 token 嵌入);y(t) 为输出信号;A、B、C、D 为可学习或参数化的矩阵。
要在离散的计算机上运行,必须将连续微分方程转化为离散递推。常用的离散化方法包括双线性变换、**零阶保持(ZOH)**等。离散化时引入步长参数 Δ,由它决定状态更新的节奏。离散后的递推形式为:
h_t = Ā·h_{t-1} + B̄·x_t
y_t = C·h_t + D·x_t
其中 Ā 和 B̄ 由 A、B 与 Δ 通过特定公式计算得到。正是这个递推形式,定义了 SSM 的核心计算图:按序列方向逐步计算,每步代价恒定,完全不依赖其他 token。
3.2 从 S4 到 Mamba:结构化与选择性的演进
S4(2022) 的贡献在于首次让 SSM 在长距离依赖任务上达到实用水平。此前,朴素 SSM 无法捕获超过数百步的依赖关系。S4 通过将状态矩阵 A 初始化为 HiPPO 矩阵,配合结构化参数化方案,使模型能够在数万步序列上保持信号传递能力。S4 采用卷积形式进行高效并行训练,在长序列音频分类、Pixel-level 图像生成等任务上超越了 Transformer 性能。
S5(2023) 引入多输入多输出(MIMO)状态空间层,将多个独立 SISO 系统合并为一个 MIMO 系统,并通过并行扫描算法替换卷积实现。S5 的并行性更好,可在更大的序列维度上利用 GPU 并行度。
H3(2023) 探索在语言建模中将 SSM 层与门控注意力机制组合,得出“SSM 擅长记忆局部模式、注意力擅长检索遥远 token”的分工洞察。
Mamba(2023) 的关键创新是“选择性”。传统 SSM 的参数(A、B、Δ 等)对所有 token 固定不变,相当于模型对所有输入一视同仁。Mamba 令 B、C 和 Δ 由当前输入 x_t 经线性投影计算得到,实现输入依赖的参数选择。其底层直觉是:模型需要根据“看到什么”动态决定“记什么、忘什么”。这一点使 SSM 从“无上下文偏好的压缩器”进化为“有选择性的推理引擎”。
选择性机制的代价是:参数不再对序列共享,训练阶段无法继续用固定的卷积核,必须恢复为递归扫描。Mamba 设计了选择性扫描算法(selective scan),通过精心编排 GPU 的 SRAM 与 HBM 之间的数据流,在材料化状态的同时保持高吞吐。
Mamba-2(2024) 进一步揭示了 SSM 与结构化掩码注意力之间的理论对等性——即状态空间对偶(Structured State Space Duality, SSD)。SSD 允许将 SSM 等效表达为半可分离矩阵乘法,从而直接复用高度优化的 FlashAttention 风格算子。这一发现将 SSM 的性能实现在编译器层面大幅简化,训练速度显著提升。
3.3 计算复杂度与内存占用对比
| 指标 | Transformer (标准) | SSM (Mamba 类) |
|---|---|---|
| 训练复杂度(每层) | O(N²·d) | O(N·d·d_state) |
| 推理单步复杂度 | O(N·d·d_head) 依赖 KV-cache | O(d·d_state) 恒定 |
| 推理内存占用 | O(N·d·n_layers) KV-cache | O(d_state·d·n_layers) 固定 |
| 理论长序列瓶颈 | 显存墙(KV-cache 线性增长) | 隐状态容量(固定宽度) |
注:d 为模型维度,d_state 为状态维度,N 为序列长度。实际性能受硬件实现和并行策略影响,以上为渐近理论值。
3.4 SSM 与 RNN、卷积的异同
- vs RNN:SSM 的递推形式与 RNN 相似,但状态转移由连续系统理论保证长程稳定性,且训练可借助卷积/并行扫描实现并行化,避免了 RNN 沿时间反向传播的严格串行瓶颈。多数 RNN 的隐状态维度与模型维度相同,而 SSM 的状态维度 d_state 独立调节,可实现更高的信息压缩比。
- vs 卷积:基于离散 SSM 可看作具有特定参数化的深度可分离卷积(核尺寸等于序列长度)。但标准卷积核随序列长度线性增长,而 SSM 通过状态空间参数化将核压缩为少量参数。
- vs 线性注意力:两者都旨在将计算复杂度降为 O(N),但线性注意力通常固定核函数且记忆容量受限,SSM 通过结构化状态矩阵提供了更强的长程建模理论保证。
4 关键参数
4.1 架构层参数
模型维度 d_model:通常 512–8192,决定每层表示空间的宽度。d_model 越大,模型容量越高,但训练和推理计算量相应增长。当前公开的 Mamba 预训练模型覆盖 130M 到 2.8B 参数,对应的 d_model 范围在 768–2560 左右。
状态维度 d_state:独立的隐状态宽度,典型值 16–128。d_state 直接决定“记忆容量”——越大可压缩的信息越多,但每步计算量与 d_state 成正比。Mamba 论文中常用 d_state = 16(2.8B 模型约 64),在效率和性能间取得平衡。
状态空间阶数 N:在 S4 类模型中等价于状态维度;在 Mamba 类中被选择性机制部分替代,参数化自由度提升但 N 的显式作用减弱。
层数 n_layers:与 Transformer 类似,深度影响模型抽象层次。Mamba 预训练模型的层数分布与同等参数量 Transformer 大致相同(24–64 层)。
上下文长度:SSM 理论支持任意长序列,实际训练受限于 GPU 显存和批量大小约束。Mamba 论文中报告在 1M token 长度的 DNA 序列上完成训练和评估。当前主流开源模型多在 2k–8k 训练上下文上发布,长上下文微调属于下游适配阶段。
4.2 选择性参数
步长 Δ:调整离散化时间间隔,直接影响状态更新的快慢。Δ 取值为正实数,常见初始化范围为 10⁻⁴ 到 10⁻¹。Mamba 的选择性体现在 Δ 由输入经线性层 + softplus 生成,使模型能动态决定对每个 token 的信息保留比例。Δ 过大 → 模型快速遗忘历史;Δ 过小 → 模型过度平滑、忽略变化。
输入依赖投影:B 和 C 矩阵从与输入无关的全局参数,变为输入 x_t 的函数。B 决定输入如何影响状态更新;C 决定状态如何影响输出。选择性的代价是参数总数增加(B 和 C 从 [d_model, d_state] 变为 [N, d_model, d_state]),但通常增加的可忽略(约 1% 以内)。
4.3 性能指标
困惑度(Perplexity):语言模型的核心指标。Mamba 2.8B 在 Pile 数据集上的 perplexity 约为同等参数量 Pythia-2.8B 的 0.97–1.02 倍(越低越好,来源:Mamba 论文,2023)。在 The Pile 评测集上,Mamba-2.8B 的 zero-shot perplexity 为 8.14 左右,在同类规模模型中属第一梯队。
推理吞吐量:Mamba 论文报告,2.8B 模型在 1 台 A100-80G 上生成吞吐量可达 Transformer 同类模型的 5 倍(序列长度较长时,如 >4k token)。该数据来源于 Mamba 论文中的原生 CUDA 实现,在实际部署中受量化、批次、硬件差异影响。
长序列建模:在 LRA(Long Range Arena)基准上,S4 系列模型在 ListOps(4k)、文档检索(4k)、像素级图像分类(1k)等任务上全面超越 Transformer 基线。Mamba 在 DNA 序列建模(1M 长度)上的困惑度显著优于 HyenaDNA、Nucleotide Transformer 等专用模型。
训练时间:根据 Mamba-2 论文(2024),在 300B token 训练规模下,同等参数量的 Mamba-2 训练 wall-clock 时间约为 LLaMA 类 Transformer 的 0.7–0.8 倍。这一优势主要来源于每 token 的前向/反向计算量更低。
4.4 规模定律参数
仅有少量公开规模定律研究覆盖 SSM 架构。Mamba 论文中展示了参数量从 130M 到 2.8B 的规模定律曲线,loss 随计算量(FLOPs)的下降趋势与 Transformer 大致平行。公开文献未见大规模(>10B 参数、>1T token)SSM 的规模定律报告,这是产业界正在探索的前沿。
5 技术路线
5.1 S4 → S5 → H3:奠基与探索
- S4(ICLR 2022) 确立 SSM 在长序列建模上的可行性,采用 HiPPO 初始化 + 卷积训练范式。局限性包括:参数对序列全局共享,无法根据输入调整行为;在语言建模上明显落后于同等规模的 Transformer。
- S5(ICLR 2023) 通过 MIMO 和并行扫描提升训练效率,初步验证了扫描作为 SSM 训练基元的可行性。
- H3(ICLR 2023) 开始探索 SSM 与注意力机制的结合,提出“将 SSM 作为上下文记忆层、注意力作为检索层”的混合架构。H3 在语言模型上的表现首次接近 Transformer,但仍存在明显差距。
这一阶段的技术路线特征是:性能并未超过 Transformer,重点在于方法验证。
5.2 Mamba:选择性 + 高效实现
Mamba 的两大支柱:
- 选择性状态空间:让 B、C、Δ 由输入生成,赋予模型动态筛选信息的能力。这是算法层面的关键创新,直击“传统 SSM 无法按 token 调整记忆行为”的痛点。
- 软硬件联合优化:选择性扫描在 GPU 上的高效实现。通过 kernel fusion、重组数据流,避免了在 GPU 全局内存中材料化大张量。这一实现的性能直接影响 Mamba 的训练和推理可行性。
Mamba 的核心技术路线是简化而非叠加——相比 Transformer 的多头注意力、残差流、MLP、归一化层的复杂组合,Mamba 的每个 block 仅包含选择性 SSM + 门控扩展 + 残差连接,结构极简。
5.3 Mamba-2:状态空间对偶与结构化矩阵乘法
Mamba-2 的路线是理论深化与工程简化。SSD 框架证明,选择性 SSM 可以等价表达为半可分离矩阵与输入序列的乘法,而这个乘法可以通过块分解方式高效并行。基于这一洞见,Mamba-2 得以复用 FlashAttention 的核心技巧(分块计算、重材料化),训练速度相比 Mamba-1 提升 2–8 倍(取决于序列长度,来源:Mamba-2 论文,2024)。
这一路线的意义在于:SSM 不再需要“特殊”的硬件算子,可以融入通用注意力优化框架,降低了产业采纳的工程成本。
5.4 混合架构路线
业界普遍认识到,SSM 和注意力各有擅长。SSM 在长程依赖和高效推理上占优,注意力在精准信息检索和复杂推理上占优。混合架构试图结合两者。代表性方向:
- Jamba(AI21 Labs, 2024):将 Mamba 层与 Transformer 注意力层交错堆叠,并加入 MoE(混合专家),在 256k 上下文、52B 总参数(12B 活跃参数)规模上验证。来源:AI21 Labs 技术报告。
- Zamba(Zyphra, 2024):以 SSM 为主体,仅在关键层使用共享注意力,7B 模型在多数基准上匹配 LLaMA-2-7B,训练成本显著降低。
- Mamba-Transformer 混合:多团队在 arXiv 上提出不同混合比例和堆叠策略,目前尚无公认最优架构。
5.5 线性注意力、RWKV、RetNet 的并行路线
SSM 不是唯一试图取代注意力的方法。RWKV(Receptance Weighted Key Value)采用类线性注意力 + 时变衰减机制,已发布 7B/14B 开源模型,社区生态(微调工具、部署方案)相对成熟。RetNet(Microsoft, 2023)提出保持训练并行(分块注意力)和推理高效(递归)的双重形式,与 SSM 的思路类似但不源于状态空间理论。三条路线技术来源不同,但面向相近的市场空间(高效长序列建模),存在竞合关系。
6 上游
6.1 算力硬件
SSM 训练和推理主要依赖 GPU。与 Transformer 不同,SSM 的瓶颈往往不在计算吞吐(TFLOPs)而在显存带宽(GB/s),因为扫描类操作属 memory-bound。上游硬件层的关键角色包括:
- NVIDIA:绝对主导。H100、A100 的大显存带宽是 SSM 高性能实现的底层前提。NVIDIA 的 CUDA 生态直接支撑着选择性扫描等定制 kernel 的开发和部署。NVIDIA 自身未公开针对 SSM 的专用架构或算子库,其路线图公开资料未见特别的 SSM 倾斜。
- AMD:Instinct 系列 GPU 理论上可支撑 SSM,但 ROCm 生态下的算子优化尚需社区贡献。2024 年部分开源项目开始将 Mamba 的 CUDA kernel 迁移到 ROCm,但成熟度不及 NVIDIA。
- 专用 AI 芯片/Cerebras/Graphcore:理论上,SSM 的单步恒定计算特性有利于流式处理器架构,公开资料未见主流 AI 专用芯片厂商针对 SSM 发布的优化方案或 benchmark。
- 边缘芯片(高通、联发科、苹果):SSM 的恒定推理开销和低内存占用对手机/可穿戴设备极具吸引力。高通 2024 年在骁龙 8 Gen 3 的 AI Engine 宣传中提及支持高效 transformer 替代方案,但未单独点名 SSM。
6.2 基础软件与编译栈
- PyTorch:主流深度学习框架,SSM 的基础实现环境。
- Triton:OpenAI 开发的 GPU kernel 编写语言。Mamba 的选择性扫描 kernel 提供 Triton 版本,性能接近 CUDA 手写版,但更易移植。Triton 使得 SSM 研究可以更快地在 AMD GPU 和未来新硬件上落地。
- CUDA:NVIDIA 的 GPU 编程模型。Mamba 官方实现的核心 kernel 为 CUDA C++,是针对 A100/H100 显存层次手写优化的版本。
- JAX:Google 的 JAX/Flax 生态在 SSM 研究初期(S4/S5)被广泛使用,因其天然适配扫描和卷积。目前 Mamba 社区的 JAX 实现存在但活跃度低于 PyTorch。
6.3 上游上游:晶圆与制造
芯片代工(台积电、三星)和 HBM 内存(SK 海力士、三星、美光)是全球 AI 算力的基础瓶颈。SSM 降低了对算力的“浪费”,但并未降低对先进制程和 HBM 产能的需求——它只是让单位算力能处理更长的上下文。HBM3E 的供应紧张持续影响 GPU 出货,间接抬高 SSM 训练的硬件获取成本。
7 下游
7.1 云端 API 服务
部分 AI 平台和模型即服务(MaaS)提供商开始将 SSM 模型纳入 API 生态:
- Cartesia API:由 Mamba 作者之一创立的 Cartesia 提供基于 SSM 的实时语音合成和长文档处理 API。截至 2024 年底,专注语音和长上下文场景,未大规模推广通用文本 API。
- Together AI / Anyscale 等推理平台:部分推理服务商已将 Mamba 开源模型列入可部署清单,支持第三方基于其基础设施调优和上线,但公开披露的收入贡献比例未知。
- 国内云厂商:阿里云 PAI、腾讯云 TI 平台在模型市场或开发环境中支持 Mamba 架构的模型部署,但未见作为独立产品线推向市场(来源:各云厂商服务页面,截至 2024 年底)。
7.2 长文档理解与企业知识管理
这是 SSM 下游最“就绪”的场景。企业文档(合同、财报、内部知识库)的 token 长度经常超过 10k,Transformer 的处理速度和成本较高。SSM 的 O(N) 复杂度和 1M token 级理论支持,使其在长文档摘要、跨文档检索、代码库级分析等场景具备天然优势。用例:AI 代码助手可加载完整仓库上下文后进行一致性重构建议;投行分析可一次性处理数百页招股书全文。落地状态:处于实验性部署和产品原型阶段,尚未成为多数知识管理 SaaS 的默认架构。
7.3 生物信息学与基因组学
这是 SSM 最早证明价值的垂直领域之一。人类参考基因组长度超过 30 亿碱基对,蛋白质序列、RNA 序列均属于超长序列。SSM 的 O(N) 特性和长程依赖建模能力与基因组分析的需求高度契合。
- DNA 序列建模:Mamba 在 1M token 的 DNA 序列基准(GenomicBenchmarks)上显著优于 HyenaDNA、DNABERT 等专用模型(来源:Mamba 论文,2023)。
- 蛋白质序列分析:单条蛋白质序列可达数千氨基酸残基,结构预测和功能注释场景对长上下文有需求。部分研究将 SSM 用于蛋白质家族分类和突变效应预测,规模偏学术,产业化程度低。
- 药物发现流程:将 SSM 作为候选分子属性预测的组成部分,尚未见头部药企(如辉瑞、礼来、罗氏)在公开报告中明确披露采用 SSM 架构。
7.4 实时语音与音频处理
语音是天然的序列信号,采样率 16kHz 意味着每秒 16,000 个样本点,长对话的序列长度可以轻松达到几十万。SSM 的恒定推理延迟是实时语音应用的核心优势。
- Cartesia 基于 SSM 构建了实时 TTS 和 STT 模型,声称在低延迟场景下质量逼近甚至超越 Transformer 基线(来源:Cartesia 公司博客,2024)。
- 消费电子:智能手机、智能音箱的本地语音助手对功耗和延迟极度敏感。Mamba 的边缘侧推理潜力受到关注,但尚无主流消费品牌(苹果、三星、小米、华为)公开宣布在其量产设备的语音栈中引入 SSM。
7.5 工业物联网与时间序列异常检测
工业传感器每秒可采集海量数据点(振动、温度、压力),且需要实时分析。SSM 适用于多元时间序列的在线预测和异常检测。
- 挑战:工业场景的数据模态(多变量、非均匀采样、噪声)与语言模型差异显著,直接将语言 SSM 架构迁移到工业时序的有效性需要大量验证。公开资料未见西门子、通用电气等工业巨头的 SSM 部署案例。
8 受益公司
8.1 核心架构创新方(直接受益)
Cartesia AI:由 Mamba 作者 Albert Gu、Karan Goel 等创立。直接围绕 SSM 构建商业模型和产品线(语音、长文档)。获种子/ A 轮融资,投资方包括 Lightspeed 等(来源:Cartesia 公开信息,2024)。受益方式:技术壁垒 + 先发优势 + 社区认可。
Zyphra:开发了 Zamba 系列混合 SSM-Transformer 模型。2024 年开源 Zamba-7B,并公开了训练成本与性能数据。定位为高效模型提供商。受益方式:若混合架构成为主流,Zyphra 可获授权收入或并购价值。
Together AI:作为领先的开源模型推理平台,已将 Mamba 系列模型纳入优化部署管线。若 SSM 模型在开源生态中的采纳度持续上升,Together AI 可增加推理收入。公司 2024 年 B 轮融资估值约 12.5 亿美元(来源:PitchBook, 2024)。
8.2 大型科技公司(潜在受益)
Google:S4/S5 系列研究的早期推动者(Google Brain 时期)。Google 内部拥有完整的大模型矩阵(Gemini 系列),若将 SSM 或混合架构集成至 Gemini,有望降低长上下文推理成本。Google 未在公开发布中确认 Gemini 采用 SSM 架构(来源:DeepMind 博客,2024)。受益方式:降低自家产品推理成本 + 差异化能力(长上下文)。
Meta:开源大模型领域的核心玩家,LLaMA 系列广泛采用 Transformer 架构。Meta 的研究团队活跃于 SSM 与 Transformer 混合架构的探索(多篇 arXiv 论文署名包含 Meta AI 作者)。若 Meta 在 LLaMA 后续系列中加入 SSM 层,可进一步巩固开源生态主导地位。受益方式:开源领导力 + 内部应用降本。
Microsoft:直接受益路径包括:Azure 云服务中支持 SSM 模型高效部署;GitHub Copilot 等产品中利用 SSM 处理长代码上下文;通过 RetNet 等自身研究储备保持多路线卡位。截至 2024 年底,未见 Azure OpenAI Service 或 Copilot 公开展示 SSM 依赖。
NVIDIA:受益于任何 GPU 计算需求的增长,包括 SSM 带来的增量推理负载。但更关键的是,SSM 的记忆带宽瓶颈可能驱动客户升级到更高带宽的 HBM 系列产品,间接提升 NVIDIA 高端 GPU 的 ASP。选择性扫描等 operator 也有助于展示 CUDA 生态的不可替代性。
8.3 国内公司(关注动向)
华为:昇腾芯片的推理效率是构建国产 AI 生态的卖点之一。若 SSM 在边端推理的优势被验证,华为可能在昇腾平台推出针对 SSM 的算子优化,吸引相关模型开发商。公开资料未见相关宣布。
阿里云/腾讯云:作为国内 MaaS 的主要平台,已在模型广场中支持 Mamba 等开源模型的部署(来源:魔搭社区页面,2024),但未单独突出为商业产品。若 SSM 在国内实现规模化应用,两家云厂可从中获得推理收入增量。
尚未上市的创业公司:多家国内大模型创业公司(涵盖通用模型和行业模型方向)在公开技术分享中提及关注高效模型架构,但未见明确宣布基于 SSM 的主力产品路线。公开资料较少,不做具体列举。
生物医药领域:国内基因测序龙头(华大智造等)和 AI 制药初创公司可能从 SSM 的长序列建模能力中受益,用于基因组分析和蛋白序列设计。具体合作或采购记录未见公开披露。
9 市场规模
9.1 直接市场(SSM 专属)
SSM 作为新兴技术架构,尚未形成独立的、可量化的市场。无法给出 SSM 专属 TAM 的精确数字。其市场潜力目前隐含在以下两个市场中:
- 生成式 AI 模型市场:据 Bloomberg Intelligence 估计,2024 年全球生成式 AI 模型市场(包括 API 服务和模型授权)约 670 亿美元,预计 2032 年达 1.3 万亿美元(来源:Bloomberg Intelligence, 2024)。SSM 有望在未来分得其中一部分。
- 开源 AI 模型市场:SSM 当下主要以开源形式存在,其直接商业价值体现在托管推理、企业支持、微调服务等方面。开源 AI 模型服务市场在 2024 年估计约为 8–15 亿美元(多方估计区间,口径含推理 API 和专业服务),增长迅速。
9.2 关联市场(应用场景 TAM)
SSM 的下游应用场景可映射到几个已存在的 TAM:
- 长文档分析与知识管理软件市场:包括法律合同分析、财报自动摘要、企业搜索等。据 Grand View Research 2024 年估算,全球 NLP 市场(含文本分析)约 290 亿美元,2023–2030 CAGR 约 25%。SSM 可作为技术栈中的模型层参与其中。
- 基因测序数据分析市场:全球基因组学数据分析市场在 2023 年约 120 亿美元,预计 2030 年达 350 亿美元(来源:MarketsandMarkets, 2024)。SSM 在长序列分析上的效率优势在此领域最具潜力量化价值。
- 实时语音 AI 市场:含 TTS、STT、实时翻译。2024 年市场规模约 38 亿美元,CAGR 约 18%(来源:Grand View Research, 2024)。边缘侧低延迟场景是 SSM 的优势赛道。
- 工业物联网分析平台市场:2024 年约 150 亿美元(来源:Fortune Business Insights, 2024),实时性要求的提升可能为 SSM 打开增量空间。
9.3 开源源与潜在商业化
目前开源生态下的 SSM 模型直接货币化路径有限。Short-term 更可能的商业化模式:
- 提供 SSM 模型的微调/fine-tuning as a Service;
- 在垂直场景(生物信息学)提供基于 SSM 的 SaaS 分析工具;
- 通过混合架构降低现有产品的推理成本(降本即增收)。
大规模营收(年收入 >1 亿美元)的 SSM 商业化案例在 2024 年底公开资料未见。
10 玩家对比
10.1 开源模型层对比
| 模型/架构 | 开发者 | 参数量级 | 架构类型 | 最大上下文 | 核心优势 | 主要局限 |
|---|---|---|---|---|---|---|
| Mamba-1 | Gu & Dao | 130M–2.8B | 纯 SSM | 1M (DNA), 8k (语言) | 线性复杂度、高推理吞吐 | 极大规模验证不足、生态规模小 |
| Mamba-2 | Gu & Dao | 130M–2.8B | 纯 SSM (SSD) | 同 Mamba-1 | 训练更快、可复用 FlashAttention 优化 | 较新,社区积累更少 |
| Jamba | AI21 Labs | 52B (12B 活跃) | 混合 + MoE | 256k | 大容量、长上下文商用 | 闭源、推理成本仍高 |
| Zamba-7B | Zyphra | 7B | 混合 | 4k–32k | 开源、训练成本低 | 部分基准不及 LLaMA-2-7B |
| RWKV-v5/v6 | RWKV 社区 | 1.5B–14B | 线性注意力类 | 4k+ | 社区生态成熟、有微调工具链 | 非严格 SSM、长程效果待验证 |
| RetNet | Microsoft | 研究级 | 类 SSM 双重形式 | 研究级 | 训练推理双重高效 | 开源未规模化、生态薄弱 |
说明:参数对比截至 2024 年底公开信息。最大上下文指官方报告支持的长度,非所有任务均可有效利用。性能对比需参考各模型原文基准,不在此做横评排序。
10.2 商业服务层对比
Cartesia vs 大型云厂:Cartesia 在 SSM 领域有最深的原生专业度,产品化速度可能快于大厂,但资金和客户渠道处于劣势。大型云厂(Google Cloud、AWS、Azure)可利用现有客户基础和算力资源,通过支持 SSM 开源模型实现“防守型”部署。二者更多是生态位差异而非直接竞争。
开源平台(Hugging Face):已成为 SSM 模型分发和社区讨论的中心。Hugging Face 于 2024 年将 Mamba 架构完全集成至 Transformers 库(来源:Hugging Face 博客,2024 年 6 月),显著降低了 SSM 的使用门槛。
国内 vs 海外差距:SSM 底层架构创新仍以美国高校和创业团队为主力。国内在开源模型复用、应用适配方面积极跟进,魔搭、始智社区等均支持 Mamba 模型下载和简单推理,但在原创架构和系统实现层面的领先性成果公开报道较少。
11 风险
11.1 主要技术风险
规模定律的上限:Mamba 论文验证到 2.8B 参数、300B token 训练,但至今没有 10B+ 参数纯 SSM 模型的公开报告。SSM 的“隐式状态压缩”是否会在超大规模下出现信息瓶颈,从而在复杂推理和知识密集型任务上被 Transformer 拉开差距,是核心不确定性。目前只能等待更多大规模实验数据。
训练稳定性:选择性机制增加了训练动态的复杂度。社区有反馈在混合精度训练中,SSM 的 Δ 参数可能发生数值不稳定(来源:GitHub issue 讨论,2024),尤其在较长序列训练时。这一问题在大规模训练中可能放大。
架构固化 vs 快速迭代:从 S4 到 Mamba-2 仅两年多,仍在快速演进。现在投入工程资源做规模化训练的团队,面临被下一代架构(Mamba-3、新型混合架构)“覆盖”的风险。这与 Transformer 相对稳定的架构形态形成对比。
11.2 市场与生态风险
Transformer 生态惯性:Transformer 的工具链(推理引擎、量化、微调框架、硬件适配)已经经过数年打磨,数百万开发者习惯了其开发范式。SSM 虽然理论上更优,但生态成熟度至少落后 3–5 年。绝大多数企业应用不会为了 30% 的成本节省而放弃 Transformer 的确定性和社区支持。
商业化路径不成熟:2024 年底尚不存在年营收超 5000 万美元的纯 SSM 公司(来源:公开财务数据搜索)。投资回报周期不确定,可能面临“技术领先但变现困难”的典型深科技陷阱。
大厂的“吸收策略”:若 SSM 被验证为核心必需技术,大型科技公司可以选择直接将最好的 SSM 架构整合进自己的闭源模型(如 Google 的 Gemini、OpenAI 的 GPT 系列),而不在开源生态中单独构建 SSM 的商业价值。这会使纯粹依赖 SSM 的创业公司难以建立商业护城河。OpenAI 和 Anthropic 均在内部研究状态空间和线性注意力,公开披露有限。
11.3 特定领域风险
长上下文未必是“杀手应用”:检索增强生成(RAG)的普及,使许多应用不需要模型原生处理 100k+ token 的全量上下文。若 RAG 等工程方案性价比更高,SSM 的长上下文优势可能在多数商业场景中无法兑现为付费意愿。
硬件特化 vs 通用性:如果未来的 AI 训练芯片专门针对 Transformer 注意力计算进行特化(如 Google TPU 的某些注意力加速单元),则 SSM 的“通用 GPU 效率优势”可能在特化硬件上被抹平。当前 TPU 对注意力操作的优化程度高于对扫描操作的优化。
12 误读纠偏
12.1 “SSM 将取代 Transformer”
纠偏:这可能是最普遍的误读。SSM 并非在所有维度上都优于 Transformer,而是一种“性能差距缩小、效率大幅提升”的替代方案。SSM 在精确检索单一 token(如复制特定数字、代码片段精确回忆)任务上天然弱于注意力,因为注意力可以“直接索引”到历史中任意位置,而 SSM 必须通过压缩状态间接回忆。业界共识正在向“共存与融合”演变:Transformer 处理核心推理和知识检索,SSM 处理长上下文记忆与信息压缩。Jamba、Zamba 等混合架构正是这一认知的产物。
12.2 “SSM 就是更快的 RNN”
纠偏:虽然递推形式类似,但区别深远。传统 RNN(LSTM/GRU)的隐状态更新是非线性门控,没有长程稳定性理论保证,梯度沿时间步传播易消失/爆炸。SSM 的状态转移由连续时间和结构化矩阵理论指导,HiPPO 和选择性机制提供了明确的长程依赖保持能力。此外,SSM 训练可借助卷积/扫描实现全并行,而 RNN 的时间反向传播是串行的。把 SSM 简单地归为 RNN 忽视了其理论和工程基础的根本差异。
12.3 “常数推理开销意味着零延迟”
纠偏:O(1) 是渐近符号,表示不随序列长度增长,但每一步的实际计算量和延迟是恒定的非零值。SSM 的状态更新涉及矩阵乘法,若 d_state 和 d_model 取值较大,单步计算成本可能高于 Transformer 的“只读取 KV-cache 对应 token”的操作。实际延迟优势在序列超长(如 >8k token)时才会逐渐显现。在短序列场景下,优化充分的 Transformer 推理延迟可能并不逊于 SSM。
12.4 “Mamba 就是 SSM 的全部”
纠偏:Mamba 是目前最出圈的 SSM 实例,但 SSM 是一个更广义的数学框架和模型族。S4、S5、H3、Liquid-S4、SaShiMi 以及众多变体都属于 SSM 范畴。Mamba 的选择性创新建立在 SSM 的基础理论之上,不应将 SSM 窄化为某个具体实现。产业人员理解 SSM 时,宜掌握其基本原理,而非仅关注 Mamba 的 API 用法。
12.5 “开源 Mamba 模型可直接商用,无合规风险”
纠偏:Mamba 的模型权重以 Apache 2.0 许可证发布,源码也是开源的,确实在许可证层面提供了较高的商用自由度。但预训练数据集的合规性(是否包含受版权保护文本、个人信息)、模型输出的合规性(生成内容是否侵权)以及下游应用的行业监管要求(如医疗/法律场景的认证),与模型架构无关,风险依然存在。不能因为架构新颖而忽略标准的数据治理和应用合规流程。
12.6 “中国在 SSM 已与国际同步”
纠偏:在应用研究和算法跟进层面,中国高校和企业的反应速度确实很快(多篇 Mamba 的衍生改进论文来自国内团队)。但在核心架构创新(S4/Mamba-1/Mamba-2 级别)和底层系统实现(选择性扫描 kernel、SSD kernel)上,主要贡献仍来自海外团队。认识到差距有助于制定合理的追赶策略,而不是在宣传层面过度包装。
13 最新事件
2024 年 12 月(截至下旬):arXiv 上持续出现新的 SSM 变体和混合架构论文,包括对 Mamba-2 SSD 框架的进一步扩展。未出现新的现象级架构突破报道。
2024 年 6–8 月:
- Mamba-2 论文发布并开源,提出状态空间对偶 SSD,训练速度提升 2–8 倍。社区反响积极,快速产生第三方实现和扩展。
- Hugging Face 宣布将 Mamba 架构完全集成至 Transformers 库 v4.40+,可通过 AutoModel 直接加载 Mamba 模型,降低使用门槛。
- AI21 Labs 发布 Jamba 1.5 版本,在 256k 上下文基准上性能较 Jamba 初代提升,仍为 SSM-Transformer 混合 + MoE 架构。
2024 年 3–5 月:
- Jamba(初代)发布,成为第一个公开可用的 SSM-Transformer-MoE 混合商业模型,参数 52B/活跃 12B,上下文 256k。
- Zyphra 发布 Zamba-7B,以 50% 左右训练成本匹配 LLaMA-2-7B 性能,展示了混合架构的成本优势。
- Cartesia 获得新一轮融资并发布 SSM 驱动的语音 API beta 版。
2023 年 12 月:Mamba 论文发布并立即引发学术界和开源社区的高度关注。首周 GitHub stars 破万。
2022–2023 年:S4、S5、H3、Hyena 等 SSM 前体陆续在顶会亮相,奠定理论基础。
国内动态:2024 年下半年,多个国内 AI 社区和技术会议(如智源大会)将 SSM 列为专题讨论或分享主题。阿里魔搭社区上线 Mamba 系列模型体验。未见头部国产大模型厂商宣布采用 SSM 架构的主模型更新。
14 跟踪指标
14.1 技术进展指标
- 下一代 Mamba 发布(Mamba-3 或等效架构):关注参数量级(尤其是突破 10B+)、训练 token 规模