Mamba(选择性状态空间模型链)
1 三秒看懂
Mamba 是 2023 年底由 Albert Gu(卡内基梅隆大学)与 Tri Dao(普林斯顿大学/Together AI)联合提出的选择性状态空间模型,核心卖点是将长序列推理复杂度从 Transformer 的 O(n²) 压至 O(n),同时通过“选择性机制”让模型根据输入内容动态决定记忆或遗忘。其设计目标是在百万 token 级上下文中保持高效推理与恒定内存占用。2023 年 12 月论文发布即引发业界关注,被视为 Transformer 之外最具潜力的序列建模范式之一。
2 三分钟产业解释
Mamba 的本质是在状态空间模型(State Space Model, SSM)的数学框架上引入“内容感知”能力。传统状态空间模型(如 2021 年的 S4)假设系统参数是固定不变的——无论你喂给它“今天天气很好”还是“请分析这份 500 页合同”,模型处理方式完全一致。Mamba 则引入选择性(Selectivity),让关键参数(B、C 矩阵和离散化步长 Δ)成为输入的函数,使模型学会对关键信息“重点标记、长期保留”,对背景噪音“果断遗忘”,从而以线性复杂度实现近似注意力机制的内容感知能力。
从产业视角看,Mamba 承载着一个朴素期待:大模型不必总靠堆算力、烧钱来拉长上下文。Transformer 的注意力机制虽然在短序列场景效果拔群,但其 O(n²) 复杂度和随序列长度线性膨胀的 KV 缓存,使百万 token 上下文的推理成本高到难以规模化部署。Mamba 用 O(1) 推理复杂度(每 token 只需更新一个固定大小的状态向量)给出了一条替代路径。2024 年 5 月 Mamba-2 论文进一步提出 SSD 框架,从数学上揭示了 SSM 与注意力的深层等价关系,暗示两条路线可能殊途同归。
截至 2025 年 7 月(本文更新时),Mamba 生态呈现“学术活跃、产业试水”的状态:原研团队成立 Cartesia AI 推进 SSM 商业化;AI21 Labs 推出 Mamba-Transformer 混合模型 Jamba;Zyphra 开源 Zamba-7B;多家芯片厂商开始适配 SSM 专属算子。国内头部大厂内部研究团队有跟进,但尚无正式发布的 Mamba 路线大模型产品。
3 技术原理
3.1 状态空间模型的数学基础
状态空间模型来自控制论,核心是一组描述系统动态的线性微分方程。将序列建模任务转化为:是否存在一个隐藏状态,能根据外部输入驱动变化并映射到观测输出?
标准连续时间 SSM 的表达为:
h'(t) = A·h(t) + B·x(t)
y(t) = C·h(t)
其中 h(t) 是隐藏状态向量,x(t) 是输入信号,y(t) 是输出;A 是状态转移矩阵,B 控制输入如何影响状态,C 控制状态如何映射到输出。处理离散序列(文本 token、DNA 碱基等)时,需要将连续系统离散化,核心是引入一个步长参数 Δ 将连续动力学转为离散更新:
h_t = e^(ΔA)·h_{t-1} + (ΔA)⁻¹(e^(ΔA) - I)·ΔB·x_t
y_t = C·h_t
这看上去像一种精巧的 RNN:每个 token 根据上一步状态和当前输入更新状态,再输出结果。关键区别在于 A 矩阵的初始化方式——S4 用 HiPPO 理论设计 A,让状态能表示输入信号在不同时间尺度上的正交多项式投影,理论上解决了 RNN 的长程依赖难题。
3.2 S4 到 Mamba 的关键跨越
S4(Gu et al., 2021)验证了 SSM 在 Long Range Arena 评测中超越 Transformer 的潜力,但有一个结构性缺陷:系统是**线性时不变(LTI)**的,参数 A、B、C、Δ 对所有 token 完全一样。这意味着模型在处理一句话的第 10 个词和第 10000 个词时,信息选择策略完全相同——这显然不符合真实需求。让模型用同样的方式对待“人工智能”中的“智能”和“。\n\n附录二”中的“附”,是一种浪费。
Mamba 的核心创新(Gu & Dao, 2023.12)就是打破 LTI 限制:
| 参数 | S4(LTI) | Mamba(选择性) |
|---|---|---|
| A | 固定(HiPPO 初始化) | 固定(保留 HiPPO) |
| B | 固定 | 由输入 x 经线性投影生成 |
| C | 固定 | 由输入 x 经线性投影生成 |
| Δ | 固定标量 | 由输入 x 经激活函数生成 |
这意味着每一层的“记忆/遗忘”策略完全取决于当前 token 的内容。如果 token 承载关键信息,模型会让 Δ 变小(“慢下来仔细看”)并让 B 变大(“更多写入状态”);反之则让 Δ 变大(“快速掠过”)。这种内容感知的门控行为使 Mamba 兼具 SSM 的线性复杂度和类注意力机制的灵活表达能力。
3.3 Mamba 模块的完整计算流程
一个标准 Mamba 模块的前向传播流程:
输入 x(序列长度 L,维度 D)
↓
LayerNorm
↓
┌─────────────────┬─────────────────┐
│ 投影至 2×d_inner │ 投影至 d_inner × 2 │
│ [用于门控分支] │ [用于 SSM 分支] │
└────────┬────────┘ └────────┬────────┘
↓ ↓
SiLU 激活 1D 卷积(局部特征提取)
↓ ↓
│ SiLU 激活 + 选择性 SSM
│ ↓
└────────┬─────────────────┘
↓
逐元素乘法(门控)
↓
投影至 D(恢复维度)
↓
+ 残差连接
↓
输出 y
关键算子分解:
| 组件 | 功能 | 实现细节 |
|---|---|---|
| 1D 卷积 | 捕获局部 token 间短程依赖 | 通常卷积核大小为 4,弥补 SSM 对局部模式捕捉偏弱的特性 |
| 选择性 SSM | 核心长程序列建模 | 并行扫描算法实现,避免显式展开状态矩阵 |
| SiLU 门控 | 类似 LSTM/Transformer 的 gating | 让网络学习每条通道的保留/抑制比例 |
| 残差连接 | 稳定深层训练 | 与 Transformer 一致的设计原则 |
3.4 硬件感知的并行扫描算法
Mamba 的理论 FLOPs 确实是 O(n),但这依赖于一个高效实现前提:不能真的逐个 token 串行计算,否则会像传统 RNN 一样失去并行性。Mamba 的核心工程贡献是设计了一个硬件感知的并行扫描(parallel scan)算法。
扫描问题本质是计算一组有顺序依赖的前缀运算结果,理论上是串行的。但可以通过分段+并行处理的方式加速:将序列切分为多个 chunk,每个 chunk 内部并行执行;chunk 间串行传递初始状态。这种“分段并行、段间串行”的策略在 GPU SRAM 中高效利用内存带宽,避免了全局显存的反复读写。
原论文在 NVIDIA A100 上的基准测试(2023 年数据)显示:序列长度 32K 时,Mamba 的推理吞吐是同等尺寸 Transformer 的约 5 倍;训练吞吐在序列长度达到 8K 以上时开始反超。需要强调的是,这些数据是在特定硬件和模型配置下测得,后续第三方复现结果有浮动。
3.5 Mamba-2 与 SSD 框架
2024 年 5 月,Dao & Gu 发表 Mamba-2 论文《Transformers are SSMs》,提出 Structured State Space Duality(SSD) 框架。核心贡献是从数学上揭示了:结构化掩码注意力(Structured Masked Attention)是 SSM 的特例,两者可以通过一个统一的矩阵变换框架互相转化。
这一发现有两个重要推论:
| 推论 | 含义 |
|---|---|
| 理论统一 | SSM 和注意力不是对立路线,而是一枚硬币的两面。选择使用哪种取决于工程偏好而非理论优劣 |
| 实现优化 | SSD 可以利用现有注意力优化基础设施(FlashAttention 等),降低 SSM 对专用算子的依赖 |
Mamba-2 同时引入了状态空间的对角化简化(对角 A 矩阵),大幅降低了理论推导和工程实现的门槛。2024 年末至 2025 年上半年,Mamba-2 逐渐成为 SSM 研究的默认基础架构。
3.6 与其他序列模型的复杂度对比
| 模型家族 | 训练复杂度 | 推理复杂度(每 token) | 推理所需内存(序列长度 n) | 典型代表 |
|---|---|---|---|---|
| 标准 Transformer | O(n²d) | O(n) | O(n)(KV 缓存) | GPT 系列 |
| 稀疏/线性注意力 | O(n·k·d) | O(k)(k 为稀疏度) | O(k) | Longformer、RWKV |
| 传统 RNN | O(nd²) | O(d²) | O(d²) | LSTM |
| Mamba(SSM) | O(nd) | O(1) | O(d²)(状态矩阵大小恒定) | Mamba 系列 |
| Mamba-2(SSD) | O(nd) | O(1) | O(d²) | Mamba-2 |
注:d 为模型维度,n 为序列长度。以上为理论渐进复杂度,实际速度受工程优化影响较大。Transformer 在短序列场景因矩阵乘法高度优化仍可能更快。
4 关键参数
4.1 Mamba 架构的核心参数
| 参数 | Mamba-1.4B | Mamba-2.8B | Mamba-6.9B | 含义 |
|---|---|---|---|---|
| 参数量 | 1.4B | 2.8B | 6.9B | 总可训练参数 |
| 层数 | 48 | 64 | 56 | Mamba 模块堆叠层数 |
| 隐藏维度(d_model) | 2048 | 2560 | 4096 | token 嵌入维度 |
| 内部维度(d_inner) | 4096 | 5120 | 8192 | SSM 内部处理维度,通常为 2×d_model |
| 状态维度(d_state) | 16 | 16 | 128 | 隐藏状态向量的维度,影响记忆容量 |
| 卷积核大小 | 4 | 4 | 4 | 局部特征提取的窗口 |
| 序列长度(预训练) | 2048 | 2048 | 训练数据相关 | 预训练时使用的最大上下文长度 |
| 词典大小 | 50280 | 50280 | 50280 | 通常使用 GPT-NeoX 词典 |
4.2 关键设计权衡
- d_state 的选择:Mamba-1 统一使用 d_state=16,旨在降低状态矩阵的内存开销。Mamba-2 的实验表明增大 d_state(至 128、256)在长上下文评估中有显著增益,但会成比例增加推理时延。
- d_inner 膨胀比:Mamba 一般保持 d_inner/d_model=2,与 Transformer 的 FFN 膨胀比相当。作者认为这便于与 Transformer 做公平对比。
- 卷积核≥4:实验表明去掉卷积或减小核尺寸会导致短序列 Perplexity 上升约 0.3-0.8(原论文消融实验数据,2023),证明局部结构对 SSM 模块是不可或缺的补充。
4.3 训练配置(预训练)
原论文 Mamba 系列模型训练使用的数据为 The Pile 数据集(约 300B token,2023 年口径)。优化器为 AdamW,学习率基于 cosine 衰减,梯度裁剪。具体超参数:
- 学习率峰值:3×10⁻⁴(1.4B、2.8B),1.5×10⁻⁴(6.9B)
- Batch size:约 0.5M token(序列级别调整至等 token 数)
- 预训练 token 总数:300B(所有尺寸模型一致)
- 硬件:NVIDIA A100-80GB × 64(1.4B 模型训练约 5 天,原论文数据,2023)
4.4 推理时的效率参数
| 指标 | Mamba-6.9B | 同等参数量 Transformer(估算对比) |
|---|---|---|
| 1024 token 推理时延 | 与 Transformer 接近 | — |
| 32K token 推理时延 | 显著低于 Transformer | 约 0.2×(原论文数据,A100,2023) |
| 128K token 推理内存 | 约 4-6 GB(仅状态张量) | KV 缓存可能超过 20 GB(同等配置) |
| 状态内存恒定 | 是 | 否(随序列线性增长) |
来源:Mamba 原论文(2023.12)及社区基准测试(2024)。推理指标高度依赖硬件和推理框架优化,不同环境下的绝对数值可能差异显著。
5 技术路线
5.1 序列建模的技术树
当前处理长序列的技术路线主要分为以下支系:
序列建模
├── Transformer 路线
│ ├── 稀疏注意力(Longformer、BigBird)
│ ├── 线性注意力(Performer、Linformer)
│ ├── 层级/块滑窗(Mistral 滑动窗口注意力)
│ ├── 压缩 KV 缓存(Multi-Query Attention、GQA)
│ └── 外推位置编码(RoPE 扩展、NTK 感知缩放)
│
├── RNN 路线
│ ├── 线性 RNN(RWKV:WKV 注意力)
│ ├── 并行化 RNN(LRU、S5)
│ └── 门控卷积(Hyena)
│
├── SSM 路线(本文焦点)
│ ├── S4(Gu, 2021)——奠基
│ ├── S4D/H3/S5 ——简化与改进
│ ├── Mamba(Gu & Dao, 2023)——选择性 SSM
│ ├── Mamba-2(Dao & Gu, 2024)——SSD 统一理论
│ └── 混合架构(Jamba、Zamba、RecurrentGemma)
│
└── 其他
├── 检索增强(RAG 分块,绕过长上下文需求)
└── 外部记忆(Memorizing Transformers)
5.2 Mamba 路线的内部演进
| 阶段 | 时间 | 代表工作 | 核心贡献 |
|---|---|---|---|
| 理论奠基 | 2021.09 | S4(Gu et al.) | HiPPO 初始化 + 结构化状态空间,证明 SSM 可用于长序列 |
| 架构简化 | 2022 | S4D、H3 | 将 S4 的对角化近似推到极致,降低实现复杂度 |
| 并行化突破 | 2023.06 | S5(Smith et al.) | 证明 SSM 可并行扫描,为 Mamba 硬件感知算法铺路 |
| 选择性革命 | 2023.12 | Mamba(Gu & Dao) | 突破 LTI 限制,引入内容感知选择性机制 |
| 理论统一 | 2024.05 | Mamba-2/SSD | 证明选择性能统一 SSM 与注意力 |
| 混合验证 | 2024 | Jamba、Zamba | 证明 Mamba+Attention 混合架构在可控成本下兼容两种范式优势 |
| 规模化探索 | 2024-2025 | 实验性 Mamba-2 7B/13B | 验证大规模训练稳定性(更多细节公开资料有限) |
5.3 两条路线的比较判断
维度 纯 Mamba 路线 混合路线(Mamba+Attention)
效率 最高(全线性复杂度) 略损耗(注意力层有 O(n²) 块)
短序列表达能力 偏弱(需卷积/局部增强) 强(注意力天然擅长此)
长序列能力 极强(百万级理论可及) 强(由 Attention 层比例决定)
训练成熟度 低(缺少大规模验证) 中(可借助已有 Transformer 经验)
生态兼容性 弱(需自定义算子) 较强(借用已有 Attention 优化栈)
2024 年的产业实践表明:纯 Mamba 路线可能更适合极致长上下文和极致效率场景;混合路线在通用任务上更稳健,是目前产品化更可能优先落地的形态。
6 上游
6.1 算力芯片
Mamba 的计算特征是:大量 scan 操作、较少的大型矩阵乘法、对 SRAM 带宽要求高。这与以矩阵乘法为中心的传统 GPU 优化方向存在错配。
| 芯片厂商 | 产品线 | Mamba 适配进展(截至 2025 年中) |
|---|---|---|
| NVIDIA | A100/H100/B200 | cuDNN 9.x 开始纳入并行 scan 原语支持;Triton 自定义 kernel 目前是主流方案。B200 的大容量 SRAM 有利于 scan 性能提升 |
| AMD | MI300X | 公开资料未见专用 SSM 算子库发布。Triton 对 AMD ROCm 的支持增加后,社区有初步移植尝试 |
| Intel | Gaudi 3 | 公开资料未见明确的 Mamba 适配信息 |
| 华为昇腾 | 910B/910C | 公开资料未见明确 SSM 算子适配公告。CANN 框架的扫描原语理论上可支持,但实测数据缺乏 |
| Groq | LPU | 其确定性流式架构对 scan 天然友好,2024 年有 Demo 展示 Mamba 推理,具体性能数据公开有限 |
| SambaNova | SN40L | 硅谷早期演示中展示了 SSM 推理,公开资料未见量产部署信息 |
关键瓶颈:scan 操作的并行化天然不如矩阵乘法,即使在 NVIDIA GPU 上,Mamba 模型的训练吞吐(同参数同序列长度)仍不及 Transformer。硬件端期待针对 scan+稀疏矩阵混合运算的架构设计,这是中期关键变量。
6.2 框架与编译器
Mamba 生态对框架层有较强依赖,因为高效 scan 实现需要在底层手动管理内存和并行策略。
| 工具 | 角色 | Mamba 支持度 |
|---|---|---|
| Triton(OpenAI) | 自定义 kernel 编译器 | Mamba 官方实现核心依赖。Triton 的 scan 原语在 3.0+ 版本得到优化 |
| PyTorch | 深度学习框架主平台 | 提供基础算子,但高效 scan 仍需自定义 kernel |
| JAX + S4Lib | 另一套 SSM 生态 | S4Lib 由 SSM 研究社区维护,对 JAX 用户友好。Haiku/Flax 模型实现 |
| CUDA/CUTLASS | NVIDIA 底层库 | 手工 CUDA kernel 是极限性能路径,Mamba 社区有非官方实现 |
| OpenAI kernel(S4 专用) | 原作者维护的状态空间算子 | Cartesia AI 团队内部有专有 kernel 库 |
6.3 训练数据
Mamba 对训练数据的需求与传统 Transformer 不完全相同:
- 长文档占比要求更高:Mamba 的线性复杂度优势在长序列中才能更好发挥,因此预训练数据需要包含更高比例的长文本(单文档 >8K token)。The Pile 数据集中长文档占比有限(公开统计不到 10% 的单篇 >4K token),这可能限制了早期 Mamba 在长上下文基准上的表现。2024 年后续开源模型已开始使用经过筛选的长文本数据集(如 DCLM、FineWeb 的 long context 子集)进行持续预训练。
- 数据去重和污染控制:与 Transformer 一致,但 Mamba 的长记忆能力使它对重复模式更敏感。消融实验(2024 年社区报告)表明,训练数据中重复片段会对选择性机制产生“固化偏好”的负面影响。
- 中文训练数据:Mamba 原论文主要基于英文 The Pile 数据集。中文 Mamba 训练经验在公开文献中较少,缺乏成熟的中文 tokenizer 适配和预训练基准。
7 下游
7.1 应用场景与成熟度评估
| 应用场景 | Mamba 理论优势 | 当前成熟度 | 代表性探索 |
|---|---|---|---|
| 长文档理解(法律/金融合同) | O(1) 推理实现百万 token 上下文,内存恒定 | 早期探索 | 学术原型,尚无商用 Mamba 长文档产品 |
| 基因组/蛋白质序列建模 | 天然适配长线性序列,SSM 可捕捉跨外显子长程依赖 | 学术验证中 | 多篇预印本(2024)验证 HyenaDNA/MambaDNA 在基因组任务超过 Transformer |
| 音频与语音处理 | SSM 对连续信号的离散化建模天然强 | 初步成果 | Cartesia AI 专注于此方向,2024 年发布 SSM 音频模型原型 |
| 实时流处理(金融行情/日志分析) | 每 token O(1) 推理,延迟可控 | 概念验证 | 学术 Demo,缺少可靠生产部署报告 |
| 视频理解 | 视频帧为天然长序列 | 学术探索 | VideoMamba 等预印本(2024)探索时间序列注意力替换 |
| 边缘设备部署 | 状态内存恒定,参数利用率高 | 芯片适配中 | 需要先在边缘 SoC 上完成 scan 算子优化 |
| 代码生成与理解 | 代码文件通常较长,且结构嵌套 | 早期探索 | 开源社区有微调尝试,尚无明显超过 CodeLlama 的公开基准 |
7.2 落地路径推演
基于当前公开信息推演(非预测):
- 短期(2025-2026):最可能率先规模化的场景是“长上下文+低延迟”需求组合——例如实时客服系统需要完整记忆整个对话历史但不能承受 KV 缓存膨胀,或者生物信息学处理单条全基因组数据(约 3B 碱基对)。这类场景对 Mamba 的效率优势有刚性需求,对短序列通用能力的容忍度较高。
- 中期(2026-2028):如混合架构(Mamba+Attention)在通用评测中稳定进入一梯队,且硬件对 scan 的支持成熟,可能出现首批 Mamba-based 通用大模型产品。
- 长期:取决于理论路线竞争结果和芯片架构演进。若 Mamba-2/SSD 的统一框架被广泛接受,未来大模型可能同时支持注意力模式和 SSM 模式,根据任务动态切换。
8 受益公司
重要声明:以下仅为产业关联梳理,非投资分析。公司能否最终受益取决于技术路线演化和自身执行力,存在高度不确定性。
8.1 原研与核心推动方
| 主体 | Mamba 生态角色 | 关键动态(截至 2025 年中) |
|---|---|---|
| Cartesia AI | Albert Gu 联合创立的商业化载体 | 2024 年获种子轮融资,金额公开资料不同来源口径不一(有报道为约千万美元级别)。专注 SSM 在音频处理方向的商用落地;2025 年上半年有 SSM 语音模型 Demo 展示,具体产品尚未公开发布。 |
| Together AI | Tri Dao 联合创始人,推理基础设施 | 通过 FlashAttention/FlashLinearAttention 积累高效 kernel 经验;对 Mamba 推理优化工程有直接贡献。2025 年完成新一轮融资(公开报道),估值未获官方披露。 |
| AI21 Labs | Jamba 混合模型发布者 | 2024 年 3 月发布 Jamba-52B(Mamba+Transformer 混合,256K 上下文),2024 年末有 Jamba-1.5 更新。Jamba 在长上下文评测中展现竞争力,但总体用户量级远小于同尺寸 Transformer 模型。 |
| Zyphra | Zamba 系列发布者 | 2024 年发布 Zamba-7B(开源),混合 Mamba 与共享注意力层,体量较小但开源可复现,属于生态活跃贡献方。 |
8.2 芯片产业链关联
| 环节 | 潜在受益逻辑 | 现实约束 |
|---|---|---|
| GPU 厂商(NVIDIA 为首) | 若 Mamba 规模化,对 HBM 带宽的需求仍高,高端 GPU 需求不受损 | 短期 Mamba 训练体量远小于 Transformer,增量拉动有限 |
| AI 推理专用芯片(Groq、SambaNova、Graphcore 等) | SSM 架构与确定性流式芯片的设计理念天然契合 | 这些厂商整体体量较小,商业化验证尚不充分 |
| 国产芯片(昇腾、寒武纪等) | 若 Mamba 避免 Transformer 对矩阵乘法的绝对依赖,可能降低适配门槛 | 公开资料未见明确适配进展 |
8.3 应用场景的间接关联
| 应用方向 | 对 Mamba 的依赖逻辑 | 相关公司(示例) |
|---|---|---|
| 长文档处理/法律 AI | 百万 token 上下文可能改变文档审核、合同分析的产品形态 | 法律 AI 公司、RAG 服务商 |
| 基因组学 AI | 基因组为天然长序列,Mamba 效率优势有应用空间 | 生物信息学 AI 公司 |
| 语音/音频 AI | SSM 对连续信号建模的天然优势 | Cartesia AI、语音合成公司 |
| 实时 AI 交互 | O(1) 推理带来的延迟确定性对实时对话有价值 | 对话式 AI 平台 |
以上场景的公开信息以“早期探索”和“Demo”为主,暂无规模化商业产品因 Mamba 而获得可量化的收入增长。
9 市场规模
9.1 与 Mamba 关联的 TAM/SAM 推算
需首先明确:Mamba 是一种模型架构,不是独立产品品类。其市场规模只能通过“受 SSM 架构影响的 AI 基础设施和应用市场规模”间接推算。以下数据为相关领域的间接市场估算,非 Mamba 专属份额。
| 市场 | 规模与口径 | 来源与年份 | Mamba 关联度 |
|---|---|---|---|
| 长上下文 AI 推理芯片市场 | 公开资料未见独立统计 | — | 若 Mamba 路线获得份额,可能催生“SSM 优化芯片”子品类 |
| 通用大模型推理服务市场 | 约 150-250 亿美元(2027 年预测,综合多家研究机构,2024 年发布) | 多家分析机构(Gartner、IDC)估算口径有差异 | Mamba 可降低推理成本,可能扩大利润池而非创造独立收入 |
| 基因组学 AI 市场 | 约 6-12 亿美元(2024 年口径) | MarketsandMarkets, 2024 | SSM 在此场景有理论优势,Mamba 潜在受益 |
| 开源大模型算力消耗 | Mamba 路线尚处于训练体量远小于 Transformer 的阶段 | — | 目前对算力总需求的影响可忽略 |
9.2 开源社区的间接指标
| 指标 | 数据 | 来源与口径 |
|---|---|---|
| Mamba GitHub Star 数 | 14K+(2025 年中) | state-spaces/mamba 仓库,横截面数据 |
| 相关论文数(2024 全年) | arxiv 上标题含 Mamba 或 Selective SSM 的论文约 200+ 篇 | arxiv 粗略统计,含预印本,非正式出版计数 |
| HuggingFace 上 Mamba 模型数 | 400+(2025 年中,含微调变体) | HuggingFace 平台搜索 |
| 商业项目采用 Mamba 的比例 | 公开资料未见可靠统计 | 绝大多数商用模型仍基于 Transformer |
9.3 关键判断
Mamba 当前仍处于“技术验证期”。截至 2025 年中,其在整体大模型训练算力消耗中的占比远低于 1%(基于已知训练信息估算,未获正式统计)。若按行业发展预判,Mamba 相关市场最先形成的可能是长上下文推理优化工具链和基因组/音频等垂直场景的专用模型服务,但具体时间线和规模高度取决于技术演化和生态采纳速度。
10 玩家对比
10.1 同类序列建模方案对比
| 维度 | Mamba(SSM) | Transformer(标准) | RWKV(线性 RNN) | Hyena(门控卷积) |
|---|---|---|---|---|
| 提出时间 | 2023.12 | 2017.06 | 2023.05(RWKV-4) | 2023.03 |
| 复杂度 | O(n) | O(n²) | O(n) | O(n·logn) |
| 核心机制 | 选择性状态空间 | 缩放点积注意力 | 时间衰减 + 通道混合 | 隐式长卷积 + 门控 |
| 推理内存 | 恒定 | 随序列线性增长 | 恒定 | 恒定 |
| 短序列性能 | 接近 Transformer(原论文数据,2023) | 最优 | 接近 Transformer | 略低于 Transformer |
| 长序列性能 | 显著超越 Transformer(n>8K) | 受 KV 缓存限制 | 强 | 强 |
| 训练成熟度 | 低(少有大模型验证) | 极高 | 中 | 低 |
| 生态兼容性 | 需自定义算子 | 标准 CUDA 生态 | 需自定义算子 | 需自定义算子 |
| 可解释性 | 中(有状态向量可分析) | 高(注意力权重可视化) | 中 | 低 |
| 主要支持方 | Cartesia AI、学术界 | Google、OpenAI、Meta 等全行业 | 社区驱动 | 学术界(Hazy Research 等) |
10.2 Mamba 混合架构对比
| 模型 | 参数量 | 上下文窗口 | 公开时间 | 混合策略 | 开源 |
|---|---|---|---|---|---|
| Jamba | 52B(MoE,实际激活约 12B) | 256K | 2024.03 | Mamba 层 + 注意力层交错 | 权重公开 |
| Jamba-1.5 | 52B/398B(MoE) | 256K | 2024.08(约) | 同上,优化注意力层比例 | 权重公开 |
| Zamba-7B | 7B | 未特别宣传长上下文 | 2024.06 | 每 6 个 Mamba 层后 1 个共享注意力层 | 开源 |
| RecurrentGemma | 2B/9B | 未特别宣传长上下文 | 2024.09 | Griffin 架构(线性 RNN+局部注意力) | 开源 |
| SambaNova SN40L 定制模型 | 未公开 | 据称可达 1M+ | 2024 | 纯 Mamba 路线 + 芯片协同设计 | 未开源 |
注:Jamba 原始论文报告在同等成本下,256K 上下文推理的 Jamba 质量优于 Mamba 和 Transformer。但该结论来自 AI21 Labs 自身评估,缺乏独立第三方的同规模对比基准。
10.3 中国玩家的状态
| 机构/企业 | 相关动态 | 信息来源与可信度 |
|---|---|---|
| 清华大学 | Vision Mamba(Vim)相关预印本 2024 年发表,将 Mamba 用于视觉任务 | 公开预印本 |
| 北京大学 | SSM 在 NLP 任务上的探索性论文 | 公开预印本 |
| 中国科学院 | SSM 理论分析相关研究 | 公开预印本 |
| 头部大厂(字节、阿里、腾讯、百度等) | 公开资料未见正式发布的 Mamba 架构模型 | 内部研究动向未公开 |
| 创业公司 | 公开资料未见聚焦 Mamba 方向的中国创业公司完成大额融资 | — |
中国在 Mamba 赛道目前以学术论文跟进为主,产业级探索信息极为有限。
11 风险
11.1 技术风险
| 风险项 | 描述 | 影响程度 | 可信度 |
|---|---|---|---|
| 尚未实现大规模验证 | 截至目前,尚无 100B+ 参数规模的 Mamba 模型完整训练报告。训练稳定性、Scaling Law 的适配性缺乏实证 | 高 | 确认为事实 |
| 短序列场景无明显优势 | Mamba 论文自身数据显示,序列长度 <2K 时,同参数量 Mamba 与 Transformer 的 perplexity 基本持平,无统计学显著优势 | 中 | 原论文数据(2023) |
| 选择性机制的可解释性争议 | Mamba 去掉了注意力权重图这一直接可解释界面,状态向量中的信息难以直观解读,可能影响安全对齐和调试 | 中 | 学术共识 |
| 训练稳定性与超参敏感 | 社区反馈(2024 年多个开源复现报告)提到 Mamba 在大规模训练时对学习率、梯度裁剪和 Δ 参数初始化更敏感 | 中 | 开源社区反馈,非系统性研究 |
| 并行扩展上限 | 扫描操作的并行度理论极限低于矩阵乘法,可能限制在超大规模 GPU 集群上的线性加速效果 | 中 | 理论分析,缺乏大规模实测数据 |
11.2 产业与生态风险
| 风险项 | 描述 | 严重程度 |
|---|---|---|
| Transformer 生态惯性 | 主流推理框架(vLLM、TGI、ollama 等)、微调工具(LoRA/QLoRA)、量化方案(GPTQ/AWQ)均为 Transformer 原生设计,Mamba 需要全新的工具链适配。生态迁移成本远高于技术本身 | ⭐⭐⭐⭐⭐ |
| 硬件生态路径依赖 | NVIDIA 及所有 AI 芯片的硬件设计、编译器优化、算子库以矩阵乘法为中心。即使 Mamba 理论更优,专用硬件的“默认加速对象”仍是 Transformer | ⭐⭐⭐⭐ |
| 人才池极浅 | 深入理解 SSM 理论的研究者全球可能不足百人级别。对比 Transformer 的人才储备是数量级差距。这限制了商业公司招募核心团队的能力 | ⭐⭐⭐⭐ |
| 混合路线可能边缘化 SSM | 若 Jamba 等混合架构证明“少量注意力层+Mamba”是最优解,Mamba 的独立技术价值将被稀释为“注意力优化的一项技术组件” | ⭐⭐⭐ |
| 专利不确定性 | 截至 2025 年中,公开资料未见 Cartesia AI 声明 Mamba 相关专利的明确许可策略。若未来出现商业化专利壁垒,可能影响生态开放度 | ⭐⭐ |
11.3 合规与安全风险
| 维度 | 现状与风险 |
|---|---|
| 模型安全对齐 | Mamba 架构的安全对齐(RLHF/DPO/红队测试)研究远少于 Transformer 系,缺乏针对 SSM 特有机制(如选择性门控被对抗样本诱导)的系统评估 |
| 可审计性 | 去掉显式注意力权重后,模型“为什么生成了这段内容”的可追溯性降低,可能增加生成式 AI 合规审查的复杂度 |
| 中国监管适配 | 中国的生成式 AI 备案制度对架构透明度和安全评估有要求。基于 Mamba 的模型备案时需补充 SSM 相关技术说明,但无架构歧视性限制 |
| 开源与出口管制 | Mamba 原始代码和权重以 Apache 2.0 许可开源,不构成出口管制敏感对象。但若未来出现国家级别的 Mamba 高性能模型,可能触发管控讨论 |
11.4 专家社区的核心分歧
| 议题 | 乐观方观点 | 保守方观点 |
|---|---|---|
| 取代还是补充 | Mamba-2 证明两套机制本质等价,未来模型必是大统一架构 | 注意力权重对安全对齐、可解释性太重要,SSM 无法完全取代 |
| 时间线 | 2026 年可能出现首个 100B+ Mamba 模型 | Transformer 还会统治至少 3-5 年,Mamba 在特定场景补充 |
| 硬件瓶颈 | 新一代芯片可能原生支持 scan,扭转硬件劣势 | 矩阵乘法是 AI 计算的通用语言,scan 专用优化投资回报存疑 |
12 误读纠偏
谬误 1:“Mamba 已经超越 Transformer 成为下一代架构标准”
事实矫正:Mamba 仅在特定条件(序列长度 ≥ 8K,同参数量,A100 单卡推理)下展现优势。原论文的评测基准(如 The Pile 上的 perplexity)仅测量语言建模这一项指标,不能泛化为“全面超越”。在通用 NLP 基准(如 MMLU、HellaSwag)、代码生成和多模态任务上,截至 2025 年中,尚无明显证据表明 Mamba 架构优于同等规模的 Transformer 模型。
谬误 2:“Mamba 不需要注意力,把注意力干掉了”
事实矫正:Mamba-2 的 SSD 框架从数学上证明了选择性 SSM 与结构化掩码注意力是等价关系,而非取代关系。Mamba 只是实现了另一种计算注意力的方式——可以类比为“用 scan 操作间接计算某些形式的注意力”,而非完全抛弃注意力原理。这更像是同一数学对象的不同工程实现路径。
谬误 3:“Mamba 推理内存恒定为 0,完全不用存储上下文”
事实矫正:Mamba 的状态向量大小恒定(≈ O(d²)),这是事实。但这不代表“上下文丢失”——状态向量压缩了之前所有 token 的信息。当序列长度 n 极大时,固定大小的状态向量必然有信息损失,理论上存在信息瓶颈。这与 Transformer 的 KV 缓存可以“按需精确回溯任意历史 token”有本质区别。对于需要精确逐字引用的任务,Mamba 的记忆模式可能存在劣势。
谬误 4:“Cartesia AI 已获数亿美元融资,Mamba 生态已高度成熟”
事实矫正:截至 2025 年中,Cartesia AI 公开披露的融资信息仅种子轮。虽然媒体报道中出现过不同金额版本,但无一来自公司官方或 SEC 文件,且均远未达到“数亿美元”的量级。其产品线仍处于早期阶段,不构成“高度成熟”的生态信号。
谬误 5:“Mamba 的训练速度比 Transformer 快 5 倍”
事实矫正:这是对原论文推理速度数据的误读或过度外推。论文仅报告在特定序列长度下推理吞吐的优势,训练吞吐在中等序列长度(≤ 2K)时 Mamba 反而不如 Transformer(因为 scan 的并行度低于矩阵乘法)。5× 的声称需要明确限定条件,否则构成误导。
谬误 6:“国内已经有公司推出了 Mamba 大模型产品”
事实矫正:截至 2025 年中,公开资料未见任何中国公司正式发布基于 Mamba 架构的商业化大模型产品。国内部分研究机构和公司可能进行了内部实验,但无公开产品线和评测基准可供验证。
13 最新事件
以下为截至 2025 年 7 月检索的最新公开信息,部分事件的后续发展可能已发生变化,请读者注意时效性。
| 时间 | 事件 | 性质 | 来源与备注 |
|---|---|---|---|
| 2024.05 | Mamba-2 论文《Transformers are SSMs》发布,提出 SSD 框架 | 理论突破 | Dao & Gu,发表于学术预印本。统一了 SSM 与注意力理论表述,为该领域 2024 年被引用最多的论文之一 |
| 2024.06 | Zyphra 发布 Zamba-7B,首个开源的 Mamba+Transformer 混合 7B 模型 | 开源模型 | Zyphra 官方博客。权重公开,社区反馈长序列表现中上 |
| 2024.08 | AI21 Labs 发布 Jamba-1.5,MoE 激活参数提升,仍保持 256K 上下文 | 模型更新 | AI21 Labs 官方公告 |
| 2024.09 | Google DeepMind 发布 RecurrentGemma(基于 Griffin 的线性 RNN),非 Mamba 但同属线性复杂度路线 | 竞品发布 | Google DeepMind 官方博客。表明大厂也在探索注意力替代方案 |
| 2024.10(约) | NVIDIA cuDNN 9.x 开始纳入扫描相关原语支持 | 基础设施改善 | NVIDIA 技术文档。改善 Mamba 在 NVIDIA GPU 上的开箱体验,但仍需手工 kernel 才能极致优化 |
| 2024.12 | Cartesia AI 发布 SSM 音频模型 Demo,展示实时语音处理 | 应用 Demo | Cartesia AI 官方渠道。未开放 API 或商用 |
| 2025.01(约) | Mamba-2 成为 HuggingFace transformers 库中正式支持的架构 | 生态里程碑 | HuggingFace GitHub repo,Mamba2Model 类已并入主线 |
| 2025.02 | 清华大学等团队发布多篇 Vision Mamba 的扩展研究,将 Mamba 与视觉大模型结合 | 学术进展 | 多个预印本,涉及图像分类、分割、视频理解等 |
| 2025.03-2025.06 | 多家中国大厂(字节、阿里等)被传在进行 Mamba/SSM 方向的研究(源自招聘 JD 分析、技术沙龙分享),但无正式模型发布 | 传闻/间接信号 | 公开资料未见正式产品。建议保持谨慎,不以此作为投资依据 |
| 2025.07(检索截止日) | 公开资料未见 Mamba 路线出现 100B+ 参数规模的大模型训练启动信息 | 待观察 | — |