概念库 开放阅读

Mamba(选择性状态空间模型链)

概念库 · 开放阅读

概念 ID
mamba
更新时间
2026-06-03
来源数量
1

Mamba(选择性状态空间模型链)

1 三秒看懂

Mamba 是 2023 年底由 Albert Gu(卡内基梅隆大学)与 Tri Dao(普林斯顿大学/Together AI)联合提出的选择性状态空间模型,核心卖点是将长序列推理复杂度从 Transformer 的 O(n²) 压至 O(n),同时通过“选择性机制”让模型根据输入内容动态决定记忆或遗忘。其设计目标是在百万 token 级上下文中保持高效推理与恒定内存占用。2023 年 12 月论文发布即引发业界关注,被视为 Transformer 之外最具潜力的序列建模范式之一。

2 三分钟产业解释

Mamba 的本质是在状态空间模型(State Space Model, SSM)的数学框架上引入“内容感知”能力。传统状态空间模型(如 2021 年的 S4)假设系统参数是固定不变的——无论你喂给它“今天天气很好”还是“请分析这份 500 页合同”,模型处理方式完全一致。Mamba 则引入选择性(Selectivity),让关键参数(B、C 矩阵和离散化步长 Δ)成为输入的函数,使模型学会对关键信息“重点标记、长期保留”,对背景噪音“果断遗忘”,从而以线性复杂度实现近似注意力机制的内容感知能力。

从产业视角看,Mamba 承载着一个朴素期待:大模型不必总靠堆算力、烧钱来拉长上下文。Transformer 的注意力机制虽然在短序列场景效果拔群,但其 O(n²) 复杂度和随序列长度线性膨胀的 KV 缓存,使百万 token 上下文的推理成本高到难以规模化部署。Mamba 用 O(1) 推理复杂度(每 token 只需更新一个固定大小的状态向量)给出了一条替代路径。2024 年 5 月 Mamba-2 论文进一步提出 SSD 框架,从数学上揭示了 SSM 与注意力的深层等价关系,暗示两条路线可能殊途同归。

截至 2025 年 7 月(本文更新时),Mamba 生态呈现“学术活跃、产业试水”的状态:原研团队成立 Cartesia AI 推进 SSM 商业化;AI21 Labs 推出 Mamba-Transformer 混合模型 Jamba;Zyphra 开源 Zamba-7B;多家芯片厂商开始适配 SSM 专属算子。国内头部大厂内部研究团队有跟进,但尚无正式发布的 Mamba 路线大模型产品。

3 技术原理

3.1 状态空间模型的数学基础

状态空间模型来自控制论,核心是一组描述系统动态的线性微分方程。将序列建模任务转化为:是否存在一个隐藏状态,能根据外部输入驱动变化并映射到观测输出?

标准连续时间 SSM 的表达为:

h'(t) = A·h(t) + B·x(t)
y(t) = C·h(t)

其中 h(t) 是隐藏状态向量,x(t) 是输入信号,y(t) 是输出;A 是状态转移矩阵,B 控制输入如何影响状态,C 控制状态如何映射到输出。处理离散序列(文本 token、DNA 碱基等)时,需要将连续系统离散化,核心是引入一个步长参数 Δ 将连续动力学转为离散更新:

h_t = e^(ΔA)·h_{t-1} + (ΔA)⁻¹(e^(ΔA) - I)·ΔB·x_t
y_t = C·h_t

这看上去像一种精巧的 RNN:每个 token 根据上一步状态和当前输入更新状态,再输出结果。关键区别在于 A 矩阵的初始化方式——S4 用 HiPPO 理论设计 A,让状态能表示输入信号在不同时间尺度上的正交多项式投影,理论上解决了 RNN 的长程依赖难题。

3.2 S4 到 Mamba 的关键跨越

S4(Gu et al., 2021)验证了 SSM 在 Long Range Arena 评测中超越 Transformer 的潜力,但有一个结构性缺陷:系统是**线性时不变(LTI)**的,参数 A、B、C、Δ 对所有 token 完全一样。这意味着模型在处理一句话的第 10 个词和第 10000 个词时,信息选择策略完全相同——这显然不符合真实需求。让模型用同样的方式对待“人工智能”中的“智能”和“。\n\n附录二”中的“附”,是一种浪费。

Mamba 的核心创新(Gu & Dao, 2023.12)就是打破 LTI 限制:

参数S4(LTI)Mamba(选择性)
A固定(HiPPO 初始化)固定(保留 HiPPO)
B固定由输入 x 经线性投影生成
C固定由输入 x 经线性投影生成
Δ固定标量由输入 x 经激活函数生成

这意味着每一层的“记忆/遗忘”策略完全取决于当前 token 的内容。如果 token 承载关键信息,模型会让 Δ 变小(“慢下来仔细看”)并让 B 变大(“更多写入状态”);反之则让 Δ 变大(“快速掠过”)。这种内容感知的门控行为使 Mamba 兼具 SSM 的线性复杂度和类注意力机制的灵活表达能力。

3.3 Mamba 模块的完整计算流程

一个标准 Mamba 模块的前向传播流程:

输入 x(序列长度 L,维度 D)
  ↓
LayerNorm
  ↓
┌─────────────────┬─────────────────┐
│ 投影至 2×d_inner │ 投影至 d_inner × 2 │
│ [用于门控分支]    │ [用于 SSM 分支]    │
└────────┬────────┘       └────────┬────────┘
         ↓                          ↓
    SiLU 激活          1D 卷积(局部特征提取)
         ↓                          ↓
         │                 SiLU 激活 + 选择性 SSM
         │                          ↓
         └────────┬─────────────────┘
                  ↓
            逐元素乘法(门控)
                  ↓
            投影至 D(恢复维度)
                  ↓
              + 残差连接
                  ↓
              输出 y

关键算子分解:

组件功能实现细节
1D 卷积捕获局部 token 间短程依赖通常卷积核大小为 4,弥补 SSM 对局部模式捕捉偏弱的特性
选择性 SSM核心长程序列建模并行扫描算法实现,避免显式展开状态矩阵
SiLU 门控类似 LSTM/Transformer 的 gating让网络学习每条通道的保留/抑制比例
残差连接稳定深层训练与 Transformer 一致的设计原则

3.4 硬件感知的并行扫描算法

Mamba 的理论 FLOPs 确实是 O(n),但这依赖于一个高效实现前提:不能真的逐个 token 串行计算,否则会像传统 RNN 一样失去并行性。Mamba 的核心工程贡献是设计了一个硬件感知的并行扫描(parallel scan)算法。

扫描问题本质是计算一组有顺序依赖的前缀运算结果,理论上是串行的。但可以通过分段+并行处理的方式加速:将序列切分为多个 chunk,每个 chunk 内部并行执行;chunk 间串行传递初始状态。这种“分段并行、段间串行”的策略在 GPU SRAM 中高效利用内存带宽,避免了全局显存的反复读写。

原论文在 NVIDIA A100 上的基准测试(2023 年数据)显示:序列长度 32K 时,Mamba 的推理吞吐是同等尺寸 Transformer 的约 5 倍;训练吞吐在序列长度达到 8K 以上时开始反超。需要强调的是,这些数据是在特定硬件和模型配置下测得,后续第三方复现结果有浮动。

3.5 Mamba-2 与 SSD 框架

2024 年 5 月,Dao & Gu 发表 Mamba-2 论文《Transformers are SSMs》,提出 Structured State Space Duality(SSD) 框架。核心贡献是从数学上揭示了:结构化掩码注意力(Structured Masked Attention)是 SSM 的特例,两者可以通过一个统一的矩阵变换框架互相转化。

这一发现有两个重要推论:

推论含义
理论统一SSM 和注意力不是对立路线,而是一枚硬币的两面。选择使用哪种取决于工程偏好而非理论优劣
实现优化SSD 可以利用现有注意力优化基础设施(FlashAttention 等),降低 SSM 对专用算子的依赖

Mamba-2 同时引入了状态空间的对角化简化(对角 A 矩阵),大幅降低了理论推导和工程实现的门槛。2024 年末至 2025 年上半年,Mamba-2 逐渐成为 SSM 研究的默认基础架构。

3.6 与其他序列模型的复杂度对比

模型家族训练复杂度推理复杂度(每 token)推理所需内存(序列长度 n)典型代表
标准 TransformerO(n²d)O(n)O(n)(KV 缓存)GPT 系列
稀疏/线性注意力O(n·k·d)O(k)(k 为稀疏度)O(k)Longformer、RWKV
传统 RNNO(nd²)O(d²)O(d²)LSTM
Mamba(SSM)O(nd)O(1)O(d²)(状态矩阵大小恒定)Mamba 系列
Mamba-2(SSD)O(nd)O(1)O(d²)Mamba-2

注:d 为模型维度,n 为序列长度。以上为理论渐进复杂度,实际速度受工程优化影响较大。Transformer 在短序列场景因矩阵乘法高度优化仍可能更快。


4 关键参数

4.1 Mamba 架构的核心参数

参数Mamba-1.4BMamba-2.8BMamba-6.9B含义
参数量1.4B2.8B6.9B总可训练参数
层数486456Mamba 模块堆叠层数
隐藏维度(d_model)204825604096token 嵌入维度
内部维度(d_inner)409651208192SSM 内部处理维度,通常为 2×d_model
状态维度(d_state)1616128隐藏状态向量的维度,影响记忆容量
卷积核大小444局部特征提取的窗口
序列长度(预训练)20482048训练数据相关预训练时使用的最大上下文长度
词典大小502805028050280通常使用 GPT-NeoX 词典

4.2 关键设计权衡

  • d_state 的选择:Mamba-1 统一使用 d_state=16,旨在降低状态矩阵的内存开销。Mamba-2 的实验表明增大 d_state(至 128、256)在长上下文评估中有显著增益,但会成比例增加推理时延。
  • d_inner 膨胀比:Mamba 一般保持 d_inner/d_model=2,与 Transformer 的 FFN 膨胀比相当。作者认为这便于与 Transformer 做公平对比。
  • 卷积核≥4:实验表明去掉卷积或减小核尺寸会导致短序列 Perplexity 上升约 0.3-0.8(原论文消融实验数据,2023),证明局部结构对 SSM 模块是不可或缺的补充。

4.3 训练配置(预训练)

原论文 Mamba 系列模型训练使用的数据为 The Pile 数据集(约 300B token,2023 年口径)。优化器为 AdamW,学习率基于 cosine 衰减,梯度裁剪。具体超参数:

  • 学习率峰值:3×10⁻⁴(1.4B、2.8B),1.5×10⁻⁴(6.9B)
  • Batch size:约 0.5M token(序列级别调整至等 token 数)
  • 预训练 token 总数:300B(所有尺寸模型一致)
  • 硬件:NVIDIA A100-80GB × 64(1.4B 模型训练约 5 天,原论文数据,2023)

4.4 推理时的效率参数

指标Mamba-6.9B同等参数量 Transformer(估算对比)
1024 token 推理时延与 Transformer 接近
32K token 推理时延显著低于 Transformer约 0.2×(原论文数据,A100,2023)
128K token 推理内存约 4-6 GB(仅状态张量)KV 缓存可能超过 20 GB(同等配置)
状态内存恒定否(随序列线性增长)

来源:Mamba 原论文(2023.12)及社区基准测试(2024)。推理指标高度依赖硬件和推理框架优化,不同环境下的绝对数值可能差异显著。


5 技术路线

5.1 序列建模的技术树

当前处理长序列的技术路线主要分为以下支系:

         序列建模
            ├── Transformer 路线
            │     ├── 稀疏注意力(Longformer、BigBird)
            │     ├── 线性注意力(Performer、Linformer)
            │     ├── 层级/块滑窗(Mistral 滑动窗口注意力)
            │     ├── 压缩 KV 缓存(Multi-Query Attention、GQA)
            │     └── 外推位置编码(RoPE 扩展、NTK 感知缩放)
            │
            ├── RNN 路线
            │     ├── 线性 RNN(RWKV:WKV 注意力)
            │     ├── 并行化 RNN(LRU、S5)
            │     └── 门控卷积(Hyena)
            │
            ├── SSM 路线(本文焦点)
            │     ├── S4(Gu, 2021)——奠基
            │     ├── S4D/H3/S5 ——简化与改进
            │     ├── Mamba(Gu & Dao, 2023)——选择性 SSM
            │     ├── Mamba-2(Dao & Gu, 2024)——SSD 统一理论
            │     └── 混合架构(Jamba、Zamba、RecurrentGemma)
            │
            └── 其他
                  ├── 检索增强(RAG 分块,绕过长上下文需求)
                  └── 外部记忆(Memorizing Transformers)

5.2 Mamba 路线的内部演进

阶段时间代表工作核心贡献
理论奠基2021.09S4(Gu et al.)HiPPO 初始化 + 结构化状态空间,证明 SSM 可用于长序列
架构简化2022S4D、H3将 S4 的对角化近似推到极致,降低实现复杂度
并行化突破2023.06S5(Smith et al.)证明 SSM 可并行扫描,为 Mamba 硬件感知算法铺路
选择性革命2023.12Mamba(Gu & Dao)突破 LTI 限制,引入内容感知选择性机制
理论统一2024.05Mamba-2/SSD证明选择性能统一 SSM 与注意力
混合验证2024Jamba、Zamba证明 Mamba+Attention 混合架构在可控成本下兼容两种范式优势
规模化探索2024-2025实验性 Mamba-2 7B/13B验证大规模训练稳定性(更多细节公开资料有限)

5.3 两条路线的比较判断

维度                 纯 Mamba 路线              混合路线(Mamba+Attention)
效率                最高(全线性复杂度)         略损耗(注意力层有 O(n²) 块)
短序列表达能力       偏弱(需卷积/局部增强)      强(注意力天然擅长此)
长序列能力           极强(百万级理论可及)       强(由 Attention 层比例决定)
训练成熟度           低(缺少大规模验证)         中(可借助已有 Transformer 经验)
生态兼容性           弱(需自定义算子)           较强(借用已有 Attention 优化栈)

2024 年的产业实践表明:纯 Mamba 路线可能更适合极致长上下文极致效率场景;混合路线在通用任务上更稳健,是目前产品化更可能优先落地的形态。


6 上游

6.1 算力芯片

Mamba 的计算特征是:大量 scan 操作、较少的大型矩阵乘法、对 SRAM 带宽要求高。这与以矩阵乘法为中心的传统 GPU 优化方向存在错配。

芯片厂商产品线Mamba 适配进展(截至 2025 年中)
NVIDIAA100/H100/B200cuDNN 9.x 开始纳入并行 scan 原语支持;Triton 自定义 kernel 目前是主流方案。B200 的大容量 SRAM 有利于 scan 性能提升
AMDMI300X公开资料未见专用 SSM 算子库发布。Triton 对 AMD ROCm 的支持增加后,社区有初步移植尝试
IntelGaudi 3公开资料未见明确的 Mamba 适配信息
华为昇腾910B/910C公开资料未见明确 SSM 算子适配公告。CANN 框架的扫描原语理论上可支持,但实测数据缺乏
GroqLPU其确定性流式架构对 scan 天然友好,2024 年有 Demo 展示 Mamba 推理,具体性能数据公开有限
SambaNovaSN40L硅谷早期演示中展示了 SSM 推理,公开资料未见量产部署信息

关键瓶颈:scan 操作的并行化天然不如矩阵乘法,即使在 NVIDIA GPU 上,Mamba 模型的训练吞吐(同参数同序列长度)仍不及 Transformer。硬件端期待针对 scan+稀疏矩阵混合运算的架构设计,这是中期关键变量。

6.2 框架与编译器

Mamba 生态对框架层有较强依赖,因为高效 scan 实现需要在底层手动管理内存和并行策略。

工具角色Mamba 支持度
Triton(OpenAI)自定义 kernel 编译器Mamba 官方实现核心依赖。Triton 的 scan 原语在 3.0+ 版本得到优化
PyTorch深度学习框架主平台提供基础算子,但高效 scan 仍需自定义 kernel
JAX + S4Lib另一套 SSM 生态S4Lib 由 SSM 研究社区维护,对 JAX 用户友好。Haiku/Flax 模型实现
CUDA/CUTLASSNVIDIA 底层库手工 CUDA kernel 是极限性能路径,Mamba 社区有非官方实现
OpenAI kernel(S4 专用)原作者维护的状态空间算子Cartesia AI 团队内部有专有 kernel 库

6.3 训练数据

Mamba 对训练数据的需求与传统 Transformer 不完全相同:

  • 长文档占比要求更高:Mamba 的线性复杂度优势在长序列中才能更好发挥,因此预训练数据需要包含更高比例的长文本(单文档 >8K token)。The Pile 数据集中长文档占比有限(公开统计不到 10% 的单篇 >4K token),这可能限制了早期 Mamba 在长上下文基准上的表现。2024 年后续开源模型已开始使用经过筛选的长文本数据集(如 DCLM、FineWeb 的 long context 子集)进行持续预训练。
  • 数据去重和污染控制:与 Transformer 一致,但 Mamba 的长记忆能力使它对重复模式更敏感。消融实验(2024 年社区报告)表明,训练数据中重复片段会对选择性机制产生“固化偏好”的负面影响。
  • 中文训练数据:Mamba 原论文主要基于英文 The Pile 数据集。中文 Mamba 训练经验在公开文献中较少,缺乏成熟的中文 tokenizer 适配和预训练基准。

7 下游

7.1 应用场景与成熟度评估

应用场景Mamba 理论优势当前成熟度代表性探索
长文档理解(法律/金融合同)O(1) 推理实现百万 token 上下文,内存恒定早期探索学术原型,尚无商用 Mamba 长文档产品
基因组/蛋白质序列建模天然适配长线性序列,SSM 可捕捉跨外显子长程依赖学术验证中多篇预印本(2024)验证 HyenaDNA/MambaDNA 在基因组任务超过 Transformer
音频与语音处理SSM 对连续信号的离散化建模天然强初步成果Cartesia AI 专注于此方向,2024 年发布 SSM 音频模型原型
实时流处理(金融行情/日志分析)每 token O(1) 推理,延迟可控概念验证学术 Demo,缺少可靠生产部署报告
视频理解视频帧为天然长序列学术探索VideoMamba 等预印本(2024)探索时间序列注意力替换
边缘设备部署状态内存恒定,参数利用率高芯片适配中需要先在边缘 SoC 上完成 scan 算子优化
代码生成与理解代码文件通常较长,且结构嵌套早期探索开源社区有微调尝试,尚无明显超过 CodeLlama 的公开基准

7.2 落地路径推演

基于当前公开信息推演(非预测):

  1. 短期(2025-2026):最可能率先规模化的场景是“长上下文+低延迟”需求组合——例如实时客服系统需要完整记忆整个对话历史但不能承受 KV 缓存膨胀,或者生物信息学处理单条全基因组数据(约 3B 碱基对)。这类场景对 Mamba 的效率优势有刚性需求,对短序列通用能力的容忍度较高。
  2. 中期(2026-2028):如混合架构(Mamba+Attention)在通用评测中稳定进入一梯队,且硬件对 scan 的支持成熟,可能出现首批 Mamba-based 通用大模型产品。
  3. 长期:取决于理论路线竞争结果和芯片架构演进。若 Mamba-2/SSD 的统一框架被广泛接受,未来大模型可能同时支持注意力模式和 SSM 模式,根据任务动态切换。

8 受益公司

重要声明:以下仅为产业关联梳理,非投资分析。公司能否最终受益取决于技术路线演化和自身执行力,存在高度不确定性。

8.1 原研与核心推动方

主体Mamba 生态角色关键动态(截至 2025 年中)
Cartesia AIAlbert Gu 联合创立的商业化载体2024 年获种子轮融资,金额公开资料不同来源口径不一(有报道为约千万美元级别)。专注 SSM 在音频处理方向的商用落地;2025 年上半年有 SSM 语音模型 Demo 展示,具体产品尚未公开发布。
Together AITri Dao 联合创始人,推理基础设施通过 FlashAttention/FlashLinearAttention 积累高效 kernel 经验;对 Mamba 推理优化工程有直接贡献。2025 年完成新一轮融资(公开报道),估值未获官方披露。
AI21 LabsJamba 混合模型发布者2024 年 3 月发布 Jamba-52B(Mamba+Transformer 混合,256K 上下文),2024 年末有 Jamba-1.5 更新。Jamba 在长上下文评测中展现竞争力,但总体用户量级远小于同尺寸 Transformer 模型。
ZyphraZamba 系列发布者2024 年发布 Zamba-7B(开源),混合 Mamba 与共享注意力层,体量较小但开源可复现,属于生态活跃贡献方。

8.2 芯片产业链关联

环节潜在受益逻辑现实约束
GPU 厂商(NVIDIA 为首)若 Mamba 规模化,对 HBM 带宽的需求仍高,高端 GPU 需求不受损短期 Mamba 训练体量远小于 Transformer,增量拉动有限
AI 推理专用芯片(Groq、SambaNova、Graphcore 等)SSM 架构与确定性流式芯片的设计理念天然契合这些厂商整体体量较小,商业化验证尚不充分
国产芯片(昇腾、寒武纪等)若 Mamba 避免 Transformer 对矩阵乘法的绝对依赖,可能降低适配门槛公开资料未见明确适配进展

8.3 应用场景的间接关联

应用方向对 Mamba 的依赖逻辑相关公司(示例)
长文档处理/法律 AI百万 token 上下文可能改变文档审核、合同分析的产品形态法律 AI 公司、RAG 服务商
基因组学 AI基因组为天然长序列,Mamba 效率优势有应用空间生物信息学 AI 公司
语音/音频 AISSM 对连续信号建模的天然优势Cartesia AI、语音合成公司
实时 AI 交互O(1) 推理带来的延迟确定性对实时对话有价值对话式 AI 平台

以上场景的公开信息以“早期探索”和“Demo”为主,暂无规模化商业产品因 Mamba 而获得可量化的收入增长。


9 市场规模

9.1 与 Mamba 关联的 TAM/SAM 推算

需首先明确:Mamba 是一种模型架构,不是独立产品品类。其市场规模只能通过“受 SSM 架构影响的 AI 基础设施和应用市场规模”间接推算。以下数据为相关领域的间接市场估算,非 Mamba 专属份额。

市场规模与口径来源与年份Mamba 关联度
长上下文 AI 推理芯片市场公开资料未见独立统计若 Mamba 路线获得份额,可能催生“SSM 优化芯片”子品类
通用大模型推理服务市场约 150-250 亿美元(2027 年预测,综合多家研究机构,2024 年发布)多家分析机构(Gartner、IDC)估算口径有差异Mamba 可降低推理成本,可能扩大利润池而非创造独立收入
基因组学 AI 市场约 6-12 亿美元(2024 年口径)MarketsandMarkets, 2024SSM 在此场景有理论优势,Mamba 潜在受益
开源大模型算力消耗Mamba 路线尚处于训练体量远小于 Transformer 的阶段目前对算力总需求的影响可忽略

9.2 开源社区的间接指标

指标数据来源与口径
Mamba GitHub Star 数14K+(2025 年中)state-spaces/mamba 仓库,横截面数据
相关论文数(2024 全年)arxiv 上标题含 Mamba 或 Selective SSM 的论文约 200+ 篇arxiv 粗略统计,含预印本,非正式出版计数
HuggingFace 上 Mamba 模型数400+(2025 年中,含微调变体)HuggingFace 平台搜索
商业项目采用 Mamba 的比例公开资料未见可靠统计绝大多数商用模型仍基于 Transformer

9.3 关键判断

Mamba 当前仍处于“技术验证期”。截至 2025 年中,其在整体大模型训练算力消耗中的占比远低于 1%(基于已知训练信息估算,未获正式统计)。若按行业发展预判,Mamba 相关市场最先形成的可能是长上下文推理优化工具链基因组/音频等垂直场景的专用模型服务,但具体时间线和规模高度取决于技术演化和生态采纳速度。


10 玩家对比

10.1 同类序列建模方案对比

维度Mamba(SSM)Transformer(标准)RWKV(线性 RNN)Hyena(门控卷积)
提出时间2023.122017.062023.05(RWKV-4)2023.03
复杂度O(n)O(n²)O(n)O(n·logn)
核心机制选择性状态空间缩放点积注意力时间衰减 + 通道混合隐式长卷积 + 门控
推理内存恒定随序列线性增长恒定恒定
短序列性能接近 Transformer(原论文数据,2023)最优接近 Transformer略低于 Transformer
长序列性能显著超越 Transformer(n>8K)受 KV 缓存限制
训练成熟度低(少有大模型验证)极高
生态兼容性需自定义算子标准 CUDA 生态需自定义算子需自定义算子
可解释性中(有状态向量可分析)高(注意力权重可视化)
主要支持方Cartesia AI、学术界Google、OpenAI、Meta 等全行业社区驱动学术界(Hazy Research 等)

10.2 Mamba 混合架构对比

模型参数量上下文窗口公开时间混合策略开源
Jamba52B(MoE,实际激活约 12B)256K2024.03Mamba 层 + 注意力层交错权重公开
Jamba-1.552B/398B(MoE)256K2024.08(约)同上,优化注意力层比例权重公开
Zamba-7B7B未特别宣传长上下文2024.06每 6 个 Mamba 层后 1 个共享注意力层开源
RecurrentGemma2B/9B未特别宣传长上下文2024.09Griffin 架构(线性 RNN+局部注意力)开源
SambaNova SN40L 定制模型未公开据称可达 1M+2024纯 Mamba 路线 + 芯片协同设计未开源

注:Jamba 原始论文报告在同等成本下,256K 上下文推理的 Jamba 质量优于 Mamba 和 Transformer。但该结论来自 AI21 Labs 自身评估,缺乏独立第三方的同规模对比基准。

10.3 中国玩家的状态

机构/企业相关动态信息来源与可信度
清华大学Vision Mamba(Vim)相关预印本 2024 年发表,将 Mamba 用于视觉任务公开预印本
北京大学SSM 在 NLP 任务上的探索性论文公开预印本
中国科学院SSM 理论分析相关研究公开预印本
头部大厂(字节、阿里、腾讯、百度等)公开资料未见正式发布的 Mamba 架构模型内部研究动向未公开
创业公司公开资料未见聚焦 Mamba 方向的中国创业公司完成大额融资

中国在 Mamba 赛道目前以学术论文跟进为主,产业级探索信息极为有限。


11 风险

11.1 技术风险

风险项描述影响程度可信度
尚未实现大规模验证截至目前,尚无 100B+ 参数规模的 Mamba 模型完整训练报告。训练稳定性、Scaling Law 的适配性缺乏实证确认为事实
短序列场景无明显优势Mamba 论文自身数据显示,序列长度 <2K 时,同参数量 Mamba 与 Transformer 的 perplexity 基本持平,无统计学显著优势原论文数据(2023)
选择性机制的可解释性争议Mamba 去掉了注意力权重图这一直接可解释界面,状态向量中的信息难以直观解读,可能影响安全对齐和调试学术共识
训练稳定性与超参敏感社区反馈(2024 年多个开源复现报告)提到 Mamba 在大规模训练时对学习率、梯度裁剪和 Δ 参数初始化更敏感开源社区反馈,非系统性研究
并行扩展上限扫描操作的并行度理论极限低于矩阵乘法,可能限制在超大规模 GPU 集群上的线性加速效果理论分析,缺乏大规模实测数据

11.2 产业与生态风险

风险项描述严重程度
Transformer 生态惯性主流推理框架(vLLM、TGI、ollama 等)、微调工具(LoRA/QLoRA)、量化方案(GPTQ/AWQ)均为 Transformer 原生设计,Mamba 需要全新的工具链适配。生态迁移成本远高于技术本身⭐⭐⭐⭐⭐
硬件生态路径依赖NVIDIA 及所有 AI 芯片的硬件设计、编译器优化、算子库以矩阵乘法为中心。即使 Mamba 理论更优,专用硬件的“默认加速对象”仍是 Transformer⭐⭐⭐⭐
人才池极浅深入理解 SSM 理论的研究者全球可能不足百人级别。对比 Transformer 的人才储备是数量级差距。这限制了商业公司招募核心团队的能力⭐⭐⭐⭐
混合路线可能边缘化 SSM若 Jamba 等混合架构证明“少量注意力层+Mamba”是最优解,Mamba 的独立技术价值将被稀释为“注意力优化的一项技术组件”⭐⭐⭐
专利不确定性截至 2025 年中,公开资料未见 Cartesia AI 声明 Mamba 相关专利的明确许可策略。若未来出现商业化专利壁垒,可能影响生态开放度⭐⭐

11.3 合规与安全风险

维度现状与风险
模型安全对齐Mamba 架构的安全对齐(RLHF/DPO/红队测试)研究远少于 Transformer 系,缺乏针对 SSM 特有机制(如选择性门控被对抗样本诱导)的系统评估
可审计性去掉显式注意力权重后,模型“为什么生成了这段内容”的可追溯性降低,可能增加生成式 AI 合规审查的复杂度
中国监管适配中国的生成式 AI 备案制度对架构透明度和安全评估有要求。基于 Mamba 的模型备案时需补充 SSM 相关技术说明,但无架构歧视性限制
开源与出口管制Mamba 原始代码和权重以 Apache 2.0 许可开源,不构成出口管制敏感对象。但若未来出现国家级别的 Mamba 高性能模型,可能触发管控讨论

11.4 专家社区的核心分歧

议题乐观方观点保守方观点
取代还是补充Mamba-2 证明两套机制本质等价,未来模型必是大统一架构注意力权重对安全对齐、可解释性太重要,SSM 无法完全取代
时间线2026 年可能出现首个 100B+ Mamba 模型Transformer 还会统治至少 3-5 年,Mamba 在特定场景补充
硬件瓶颈新一代芯片可能原生支持 scan,扭转硬件劣势矩阵乘法是 AI 计算的通用语言,scan 专用优化投资回报存疑

12 误读纠偏

谬误 1:“Mamba 已经超越 Transformer 成为下一代架构标准”

事实矫正:Mamba 仅在特定条件(序列长度 ≥ 8K,同参数量,A100 单卡推理)下展现优势。原论文的评测基准(如 The Pile 上的 perplexity)仅测量语言建模这一项指标,不能泛化为“全面超越”。在通用 NLP 基准(如 MMLU、HellaSwag)、代码生成和多模态任务上,截至 2025 年中,尚无明显证据表明 Mamba 架构优于同等规模的 Transformer 模型。

谬误 2:“Mamba 不需要注意力,把注意力干掉了”

事实矫正:Mamba-2 的 SSD 框架从数学上证明了选择性 SSM 与结构化掩码注意力是等价关系,而非取代关系。Mamba 只是实现了另一种计算注意力的方式——可以类比为“用 scan 操作间接计算某些形式的注意力”,而非完全抛弃注意力原理。这更像是同一数学对象的不同工程实现路径。

谬误 3:“Mamba 推理内存恒定为 0,完全不用存储上下文”

事实矫正:Mamba 的状态向量大小恒定(≈ O(d²)),这是事实。但这不代表“上下文丢失”——状态向量压缩了之前所有 token 的信息。当序列长度 n 极大时,固定大小的状态向量必然有信息损失,理论上存在信息瓶颈。这与 Transformer 的 KV 缓存可以“按需精确回溯任意历史 token”有本质区别。对于需要精确逐字引用的任务,Mamba 的记忆模式可能存在劣势。

谬误 4:“Cartesia AI 已获数亿美元融资,Mamba 生态已高度成熟”

事实矫正:截至 2025 年中,Cartesia AI 公开披露的融资信息仅种子轮。虽然媒体报道中出现过不同金额版本,但无一来自公司官方或 SEC 文件,且均远未达到“数亿美元”的量级。其产品线仍处于早期阶段,不构成“高度成熟”的生态信号。

谬误 5:“Mamba 的训练速度比 Transformer 快 5 倍”

事实矫正:这是对原论文推理速度数据的误读或过度外推。论文仅报告在特定序列长度下推理吞吐的优势,训练吞吐在中等序列长度(≤ 2K)时 Mamba 反而不如 Transformer(因为 scan 的并行度低于矩阵乘法)。5× 的声称需要明确限定条件,否则构成误导。

谬误 6:“国内已经有公司推出了 Mamba 大模型产品”

事实矫正:截至 2025 年中,公开资料未见任何中国公司正式发布基于 Mamba 架构的商业化大模型产品。国内部分研究机构和公司可能进行了内部实验,但无公开产品线和评测基准可供验证。


13 最新事件

以下为截至 2025 年 7 月检索的最新公开信息,部分事件的后续发展可能已发生变化,请读者注意时效性。

时间事件性质来源与备注
2024.05Mamba-2 论文《Transformers are SSMs》发布,提出 SSD 框架理论突破Dao & Gu,发表于学术预印本。统一了 SSM 与注意力理论表述,为该领域 2024 年被引用最多的论文之一
2024.06Zyphra 发布 Zamba-7B,首个开源的 Mamba+Transformer 混合 7B 模型开源模型Zyphra 官方博客。权重公开,社区反馈长序列表现中上
2024.08AI21 Labs 发布 Jamba-1.5,MoE 激活参数提升,仍保持 256K 上下文模型更新AI21 Labs 官方公告
2024.09Google DeepMind 发布 RecurrentGemma(基于 Griffin 的线性 RNN),非 Mamba 但同属线性复杂度路线竞品发布Google DeepMind 官方博客。表明大厂也在探索注意力替代方案
2024.10(约)NVIDIA cuDNN 9.x 开始纳入扫描相关原语支持基础设施改善NVIDIA 技术文档。改善 Mamba 在 NVIDIA GPU 上的开箱体验,但仍需手工 kernel 才能极致优化
2024.12Cartesia AI 发布 SSM 音频模型 Demo,展示实时语音处理应用 DemoCartesia AI 官方渠道。未开放 API 或商用
2025.01(约)Mamba-2 成为 HuggingFace transformers 库中正式支持的架构生态里程碑HuggingFace GitHub repo,Mamba2Model 类已并入主线
2025.02清华大学等团队发布多篇 Vision Mamba 的扩展研究,将 Mamba 与视觉大模型结合学术进展多个预印本,涉及图像分类、分割、视频理解等
2025.03-2025.06多家中国大厂(字节、阿里等)被传在进行 Mamba/SSM 方向的研究(源自招聘 JD 分析、技术沙龙分享),但无正式模型发布传闻/间接信号公开资料未见正式产品。建议保持谨慎,不以此作为投资依据
2025.07(检索截止日)公开资料未见 Mamba 路线出现 100B+ 参数规模的大模型训练启动信息待观察
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型