Mamba(選擇性狀態空間模型鏈)
1 三秒看懂
Mamba 是 2023 年底由 Albert Gu(卡內基梅隆大學)與 Tri Dao(普林斯頓大學/Together AI)聯合提出的選擇性狀態空間模型,核心賣點是將長序列推論複雜度從 Transformer 的 O(n²) 壓至 O(n),同時通過“選擇性機制”讓模型根據輸入內容動態決定記憶或遺忘。其設計目標是在百萬 token 級上下文中保持高效推論與恆定記憶體佔用。2023 年 12 月論文釋出即引發業界關注,被視為 Transformer 之外最具潛力的序列建模範式之一。
2 三分鐘產業解釋
Mamba 的本質是在狀態空間模型(State Space Model, SSM)的數學架構上引入“內容感知”能力。傳統狀態空間模型(如 2021 年的 S4)假設系統引數是固定不變的——無論你餵給它“今天天氣很好”還是“請分析這份 500 頁合同”,模型處理方式完全一致。Mamba 則引入選擇性(Selectivity),讓關鍵引數(B、C 矩陣和離散化步長 Δ)成為輸入的函式,使模型學會對關鍵資訊“重點標記、長期保留”,對背景噪音“果斷遺忘”,從而以線性複雜度實現近似注意力機制的內容感知能力。
從產業視角看,Mamba 承載著一個樸素期待:大型模型不必總靠堆算力、燒錢來拉長上下文。Transformer 的注意力機制雖然在短序列場景效果拔群,但其 O(n²) 複雜度和隨序列長度線性膨脹的 KV 快取,使百萬 token 上下文的推論成本高到難以規模化部署。Mamba 用 O(1) 推論複雜度(每 token 只需更新一個固定大小的狀態向量)給出了一條替代路徑。2024 年 5 月 Mamba-2 論文進一步提出 SSD 架構,從數學上揭示了 SSM 與注意力的深層等價關係,暗示兩條路線可能殊途同歸。
截至 2025 年 7 月(本文更新時),Mamba 生態呈現“學術活躍、產業試水”的狀態:原研團隊成立 Cartesia AI 推進 SSM 商業化;AI21 Labs 推出 Mamba-Transformer 混合模型 Jamba;Zyphra 開源 Zamba-7B;多家晶片廠商開始適配 SSM 專屬運算元。國內頭部大廠內部研究團隊有跟進,但尚無正式釋出的 Mamba 路線大型模型產品。
3 技術原理
3.1 狀態空間模型的數學基礎
狀態空間模型來自控制論,核心是一組描述系統動態的線性微分方程。將序列建模任務轉化為:是否存在一個隱藏狀態,能根據外部輸入驅動變化並對映到觀測輸出?
標準連續時間 SSM 的表達為:
h'(t) = A·h(t) + B·x(t)
y(t) = C·h(t)
其中 h(t) 是隱藏狀態向量,x(t) 是輸入訊號,y(t) 是輸出;A 是狀態轉移矩陣,B 控制輸入如何影響狀態,C 控制狀態如何對映到輸出。處理離散序列(文本 token、DNA 鹼基等)時,需要將連續系統離散化,核心是引入一個步長引數 Δ 將連續動力學轉為離散更新:
h_t = e^(ΔA)·h_{t-1} + (ΔA)⁻¹(e^(ΔA) - I)·ΔB·x_t
y_t = C·h_t
這看上去像一種精巧的 RNN:每個 token 根據上一步狀態和當前輸入更新狀態,再輸出結果。關鍵區別在於 A 矩陣的初始化方式——S4 用 HiPPO 理論設計 A,讓狀態能表示輸入訊號在不同時間尺度上的正交多項式投影,理論上解決了 RNN 的長程依賴難題。
3.2 S4 到 Mamba 的關鍵跨越
S4(Gu et al., 2021)驗證了 SSM 在 Long Range Arena 評測中超越 Transformer 的潛力,但有一個結構性缺陷:系統是**線性時不變(LTI)**的,引數 A、B、C、Δ 對所有 token 完全一樣。這意味著模型在處理一句話的第 10 個詞和第 10000 個詞時,資訊選擇策略完全相同——這顯然不符合真實需求。讓模型用同樣的方式對待“人工智慧”中的“智慧”和“。\n\n附錄二”中的“附”,是一種浪費。
Mamba 的核心創新(Gu & Dao, 2023.12)就是打破 LTI 限制:
| 引數 | S4(LTI) | Mamba(選擇性) |
|---|---|---|
| A | 固定(HiPPO 初始化) | 固定(保留 HiPPO) |
| B | 固定 | 由輸入 x 經線性投影生成 |
| C | 固定 | 由輸入 x 經線性投影生成 |
| Δ | 固定標量 | 由輸入 x 經啟用函式生成 |
這意味著每一層的“記憶/遺忘”策略完全取決於當前 token 的內容。如果 token 承載關鍵資訊,模型會讓 Δ 變小(“慢下來仔細看”)並讓 B 變大(“更多寫入狀態”);反之則讓 Δ 變大(“快速掠過”)。這種內容感知的門控行為使 Mamba 兼具 SSM 的線性複雜度和類注意力機制的靈活表達能力。
3.3 Mamba 模組的完整計算流程
一個標準 Mamba 模組的前向傳播流程:
輸入 x(序列長度 L,維度 D)
↓
LayerNorm
↓
┌─────────────────┬─────────────────┐
│ 投影至 2×d_inner │ 投影至 d_inner × 2 │
│ [用於門控分支] │ [用於 SSM 分支] │
└────────┬────────┘ └────────┬────────┘
↓ ↓
SiLU 啟用 1D 卷積(區域性特徵提取)
↓ ↓
│ SiLU 啟用 + 選擇性 SSM
│ ↓
└────────┬─────────────────┘
↓
逐元素乘法(門控)
↓
投影至 D(恢復維度)
↓
+ 殘差連線
↓
輸出 y
關鍵運算元分解:
| 元件 | 功能 | 實現細節 |
|---|---|---|
| 1D 卷積 | 捕獲區域性 token 間短程依賴 | 通常卷積核大小為 4,彌補 SSM 對區域性模式捕捉偏弱的特性 |
| 選擇性 SSM | 核心長程式列建模 | 並行掃描演算法實現,避免顯式展開狀態矩陣 |
| SiLU 門控 | 類似 LSTM/Transformer 的 gating | 讓網路學習每條通道的保留/抑制比例 |
| 殘差連線 | 穩定深層訓練 | 與 Transformer 一致的設計原則 |
3.4 硬體感知的並行掃描演算法
Mamba 的理論 FLOPs 確實是 O(n),但這依賴於一個高效實現前提:不能真的逐個 token 序列計算,否則會像傳統 RNN 一樣失去並行性。Mamba 的核心工程貢獻是設計了一個硬體感知的並行掃描(parallel scan)演算法。
掃描問題本質是計算一組有順序依賴的字首運算結果,理論上是序列的。但可以通過分段+並行處理的方式加速:將序列切分為多個 chunk,每個 chunk 內部並行執行;chunk 間序列傳遞初始狀態。這種“分段並行、段間序列”的策略在 GPU SRAM 中高效利用記憶體頻寬,避免了全域性視訊記憶體的反覆讀寫。
原論文在 NVIDIA A100 上的基準測試(2023 年資料)顯示:序列長度 32K 時,Mamba 的推論吞吐是同等尺寸 Transformer 的約 5 倍;訓練吞吐在序列長度達到 8K 以上時開始反超。需要強調的是,這些資料是在特定硬體和模型配置下測得,後續第三方復現結果有浮動。
3.5 Mamba-2 與 SSD 架構
2024 年 5 月,Dao & Gu 發表 Mamba-2 論文《Transformers are SSMs》,提出 Structured State Space Duality(SSD) 架構。核心貢獻是從數學上揭示了:結構化掩碼注意力(Structured Masked Attention)是 SSM 的特例,兩者可以通過一個統一的矩陣變換架構互相轉化。
這一發現有兩個重要推論:
| 推論 | 含義 |
|---|---|
| 理論統一 | SSM 和注意力不是對立路線,而是一枚硬幣的兩面。選擇使用哪種取決於工程偏好而非理論優劣 |
| 實現最佳化 | SSD 可以利用現有注意力最佳化基礎設施(FlashAttention 等),降低 SSM 對專用運算元的依賴 |
Mamba-2 同時引入了狀態空間的對角化簡化(對角 A 矩陣),大幅降低了理論推導和工程實現的門檻。2024 年末至 2025 年上半年,Mamba-2 逐漸成為 SSM 研究的預設基礎架構。
3.6 與其他序列模型的複雜度對比
| 模型家族 | 訓練複雜度 | 推論複雜度(每 token) | 推論所需記憶體(序列長度 n) | 典型代表 |
|---|---|---|---|---|
| 標準 Transformer | O(n²d) | O(n) | O(n)(KV 快取) | GPT 系列 |
| 稀疏/線性注意力 | O(n·k·d) | O(k)(k 為稀疏度) | O(k) | Longformer、RWKV |
| 傳統 RNN | O(nd²) | O(d²) | O(d²) | LSTM |
| Mamba(SSM) | O(nd) | O(1) | O(d²)(狀態矩陣大小恆定) | Mamba 系列 |
| Mamba-2(SSD) | O(nd) | O(1) | O(d²) | Mamba-2 |
注:d 為模型維度,n 為序列長度。以上為理論漸進複雜度,實際速度受工程最佳化影響較大。Transformer 在短序列場景因矩陣乘法高度最佳化仍可能更快。
4 關鍵引數
4.1 Mamba 架構的核心引數
| 引數 | Mamba-1.4B | Mamba-2.8B | Mamba-6.9B | 含義 |
|---|---|---|---|---|
| 引數量 | 1.4B | 2.8B | 6.9B | 總可訓練引數 |
| 層數 | 48 | 64 | 56 | Mamba 模組堆疊層數 |
| 隱藏維度(d_model) | 2048 | 2560 | 4096 | token 嵌入維度 |
| 內部維度(d_inner) | 4096 | 5120 | 8192 | SSM 內部處理維度,通常為 2×d_model |
| 狀態維度(d_state) | 16 | 16 | 128 | 隱藏狀態向量的維度,影響記憶容量 |
| 卷積核大小 | 4 | 4 | 4 | 區域性特徵提取的視窗 |
| 序列長度(預訓練) | 2048 | 2048 | 訓練資料相關 | 預訓練時使用的最大上下文長度 |
| 詞典大小 | 50280 | 50280 | 50280 | 通常使用 GPT-NeoX 詞典 |
4.2 關鍵設計權衡
- d_state 的選擇:Mamba-1 統一使用 d_state=16,旨在降低狀態矩陣的記憶體開銷。Mamba-2 的實驗表明增大 d_state(至 128、256)在長上下文評估中有顯著增益,但會成比例增加推論時延。
- d_inner 膨脹比:Mamba 一般保持 d_inner/d_model=2,與 Transformer 的 FFN 膨脹比相當。作者認為這便於與 Transformer 做公平對比。
- 卷積核≥4:實驗表明去掉卷積或減小核尺寸會導致短序列 Perplexity 上升約 0.3-0.8(原論文消融實驗資料,2023),證明區域性結構對 SSM 模組是不可或缺的補充。
4.3 訓練配置(預訓練)
原論文 Mamba 系列模型訓練使用的資料為 The Pile 資料集(約 300B token,2023 年口徑)。最佳化器為 AdamW,學習率基於 cosine 衰減,梯度裁剪。具體超引數:
- 學習率峰值:3×10⁻⁴(1.4B、2.8B),1.5×10⁻⁴(6.9B)
- Batch size:約 0.5M token(序列級別調整至等 token 數)
- 預訓練 token 總數:300B(所有尺寸模型一致)
- 硬體:NVIDIA A100-80GB × 64(1.4B 模型訓練約 5 天,原論文資料,2023)
4.4 推論時的效率引數
| 指標 | Mamba-6.9B | 同等引數量 Transformer(估算對比) |
|---|---|---|
| 1024 token 推論時延 | 與 Transformer 接近 | — |
| 32K token 推論時延 | 顯著低於 Transformer | 約 0.2×(原論文資料,A100,2023) |
| 128K token 推論記憶體 | 約 4-6 GB(僅狀態張量) | KV 快取可能超過 20 GB(同等配置) |
| 狀態記憶體恆定 | 是 | 否(隨序列線性增長) |
來源:Mamba 原論文(2023.12)及社群基準測試(2024)。推論指標高度依賴硬體和推論架構最佳化,不同環境下的絕對數值可能差異顯著。
5 技術路線
5.1 序列建模的技術樹
當前處理長序列的技術路線主要分為以下支系:
序列建模
├── Transformer 路線
│ ├── 稀疏注意力(Longformer、BigBird)
│ ├── 線性注意力(Performer、Linformer)
│ ├── 層級/塊滑窗(Mistral 滑動視窗注意力)
│ ├── 壓縮 KV 快取(Multi-Query Attention、GQA)
│ └── 外推位置編碼(RoPE 擴充套件、NTK 感知縮放)
│
├── RNN 路線
│ ├── 線性 RNN(RWKV:WKV 注意力)
│ ├── 並行化 RNN(LRU、S5)
│ └── 門控捲積(Hyena)
│
├── SSM 路線(本文焦點)
│ ├── S4(Gu, 2021)——奠基
│ ├── S4D/H3/S5 ——簡化與改進
│ ├── Mamba(Gu & Dao, 2023)——選擇性 SSM
│ ├── Mamba-2(Dao & Gu, 2024)——SSD 統一理論
│ └── 混合架構(Jamba、Zamba、RecurrentGemma)
│
└── 其他
├── 檢索增強(RAG 分塊,繞過長上下文需求)
└── 外部記憶(Memorizing Transformers)
5.2 Mamba 路線的內部演進
| 階段 | 時間 | 代表工作 | 核心貢獻 |
|---|---|---|---|
| 理論奠基 | 2021.09 | S4(Gu et al.) | HiPPO 初始化 + 結構化狀態空間,證明 SSM 可用於長序列 |
| 架構簡化 | 2022 | S4D、H3 | 將 S4 的對角化近似推到極致,降低實現複雜度 |
| 並行化突破 | 2023.06 | S5(Smith et al.) | 證明 SSM 可並行掃描,為 Mamba 硬體感知演算法鋪路 |
| 選擇性革命 | 2023.12 | Mamba(Gu & Dao) | 突破 LTI 限制,引入內容感知選擇性機制 |
| 理論統一 | 2024.05 | Mamba-2/SSD | 證明選擇效能統一 SSM 與注意力 |
| 混合驗證 | 2024 | Jamba、Zamba | 證明 Mamba+Attention 混合架構在可控成本下相容兩種範式優勢 |
| 規模化探索 | 2024-2025 | 實驗性 Mamba-2 7B/13B | 驗證大規模訓練穩定性(更多細節公開資料有限) |
5.3 兩條路線的比較判斷
維度 純 Mamba 路線 混合路線(Mamba+Attention)
效率 最高(全線性複雜度) 略損耗(注意力層有 O(n²) 塊)
短序列表達能力 偏弱(需卷積/區域性增強) 強(注意力天然擅長此)
長序列能力 極強(百萬級理論可及) 強(由 Attention 層比例決定)
訓練成熟度 低(缺少大規模驗證) 中(可藉助已有 Transformer 經驗)
生態相容性 弱(需自定義運算元) 較強(借用已有 Attention 最佳化棧)
2024 年的產業實踐表明:純 Mamba 路線可能更適合極致長上下文和極致效率場景;混合路線在通用任務上更穩健,是目前產品化更可能優先落地的形態。
6 上游
6.1 算力晶片
Mamba 的計算特徵是:大量 scan 操作、較少的大型矩陣乘法、對 SRAM 頻寬要求高。這與以矩陣乘法為中心的傳統 GPU 最佳化方向存在錯配。
| 晶片廠商 | 產品線 | Mamba 適配進展(截至 2025 年中) |
|---|---|---|
| NVIDIA | A100/H100/B200 | cuDNN 9.x 開始納入並行 scan 原語支援;Triton 自定義 kernel 目前是主流方案。B200 的大容量 SRAM 有利於 scan 效能提升 |
| AMD | MI300X | 公開資料未見專用 SSM 運算元庫釋出。Triton 對 AMD ROCm 的支援增加後,社群有初步移植嘗試 |
| Intel | Gaudi 3 | 公開資料未見明確的 Mamba 適配資訊 |
| 華為昇騰 | 910B/910C | 公開資料未見明確 SSM 運算元適配公告。CANN 架構的掃描原語理論上可支援,但實測資料缺乏 |
| Groq | LPU | 其確定性流式架構對 scan 天然友好,2024 年有 Demo 展示 Mamba 推論,具體效能資料公開有限 |
| SambaNova | SN40L | 矽谷早期演示中展示了 SSM 推論,公開資料未見量產部署資訊 |
關鍵瓶頸:scan 操作的並行化天然不如矩陣乘法,即使在 NVIDIA GPU 上,Mamba 模型的訓練吞吐(同參數同序列長度)仍不及 Transformer。硬體端期待針對 scan+稀疏矩陣混合運算的架構設計,這是中期關鍵變數。
6.2 架構與編譯器
Mamba 生態對架構層有較強依賴,因為高效 scan 實現需要在底層手動管理記憶體和並行策略。
| 工具 | 角色 | Mamba 支援度 |
|---|---|---|
| Triton(OpenAI) | 自定義 kernel 編譯器 | Mamba 官方實現核心依賴。Triton 的 scan 原語在 3.0+ 版本得到最佳化 |
| PyTorch | 深度學習架構主平台 | 提供基礎運算元,但高效 scan 仍需自定義 kernel |
| JAX + S4Lib | 另一套 SSM 生態 | S4Lib 由 SSM 研究社群維護,對 JAX 使用者友好。Haiku/Flax 模型實現 |
| CUDA/CUTLASS | NVIDIA 底層庫 | 手工 CUDA kernel 是極限效能路徑,Mamba 社群有非官方實現 |
| OpenAI kernel(S4 專用) | 原作者維護的狀態空間運算元 | Cartesia AI 團隊內部有專有 kernel 庫 |
6.3 訓練資料
Mamba 對訓練資料的需求與傳統 Transformer 不完全相同:
- 長文件佔比要求更高:Mamba 的線性複雜度優勢在長序列中才能更好發揮,因此預訓練資料需要包含更高比例的長文本(單文件 >8K token)。The Pile 資料集中長文件佔比有限(公開統計不到 10% 的單篇 >4K token),這可能限制了早期 Mamba 在長上下文基準上的表現。2024 年後續開源模型已開始使用經過篩選的長文本資料集(如 DCLM、FineWeb 的 long context 子集)進行持續預訓練。
- 資料去重和汙染控制:與 Transformer 一致,但 Mamba 的長記憶能力使它對重複模式更敏感。消融實驗(2024 年社群報告)表明,訓練資料中重複片段會對選擇性機制產生“固化偏好”的負面影響。
- 中文訓練資料:Mamba 原論文主要基於英文 The Pile 資料集。中文 Mamba 訓練經驗在公開文獻中較少,缺乏成熟的中文 tokenizer 適配和預訓練基準。
7 下游
7.1 應用場景與成熟度評估
| 應用場景 | Mamba 理論優勢 | 當前成熟度 | 代表性探索 |
|---|---|---|---|
| 長文件理解(法律/金融合同) | O(1) 推論實現百萬 token 上下文,記憶體恆定 | 早期探索 | 學術原型,尚無商用 Mamba 長文件產品 |
| 基因組/蛋白質序列建模 | 天然適配長線性序列,SSM 可捕捉跨外顯子長程依賴 | 學術驗證中 | 多篇預印本(2024)驗證 HyenaDNA/MambaDNA 在基因組任務超過 Transformer |
| 音訊與語音處理 | SSM 對連續訊號的離散化建模天然強 | 初步成果 | Cartesia AI 專注於此方向,2024 年釋出 SSM 音訊模型原型 |
| 即時流處理(金融行情/日誌分析) | 每 token O(1) 推論,延遲可控 | 概念驗證 | 學術 Demo,缺少可靠生產部署報告 |
| 影片理解 | 影片幀為天然長序列 | 學術探索 | VideoMamba 等預印本(2024)探索時間序列注意力替換 |
| 邊緣裝置部署 | 狀態記憶體恆定,引數利用率高 | 晶片適配中 | 需要先在邊緣 SoC 上完成 scan 運算元最佳化 |
| 程式碼生成與理解 | 程式碼檔案通常較長,且結構巢狀 | 早期探索 | 開源社群有微調嘗試,尚無明顯超過 CodeLlama 的公開基準 |
7.2 落地路徑推演
基於當前公開資訊推演(非預測):
- 短期(2025-2026):最可能率先規模化的場景是“長上下文+低延遲”需求組合——例如即時客服系統需要完整記憶整個對話歷史但不能承受 KV 快取膨脹,或者生物資訊學處理單條全基因組資料(約 3B 鹼基對)。這類場景對 Mamba 的效率優勢有剛性需求,對短序列通用能力的容忍度較高。
- 中期(2026-2028):如混合架構(Mamba+Attention)在通用評測中穩定進入一梯隊,且硬體對 scan 的支援成熟,可能出現首批 Mamba-based 通用大型模型產品。
- 長期:取決於理論路線競爭結果和晶片架構演進。若 Mamba-2/SSD 的統一架構被廣泛接受,未來大型模型可能同時支援注意力模式和 SSM 模式,根據任務動態切換。
8 受益公司
重要宣告:以下僅為產業關聯梳理,非投資分析。公司能否最終受益取決於技術路線演化和自身執行力,存在高度不確定性。
8.1 原研與核心推動方
| 主體 | Mamba 生態角色 | 關鍵動態(截至 2025 年中) |
|---|---|---|
| Cartesia AI | Albert Gu 聯合創立的商業化載體 | 2024 年獲種子輪融資,金額公開資料不同來源口徑不一(有報道為約千萬美元級別)。專注 SSM 在音訊處理方向的商用落地;2025 年上半年有 SSM 語音模型 Demo 展示,具體產品尚未公開發布。 |
| Together AI | Tri Dao 聯合創始人,推論基礎設施 | 通過 FlashAttention/FlashLinearAttention 積累高效 kernel 經驗;對 Mamba 推論最佳化工程有直接貢獻。2025 年完成新一輪融資(公開報道),估值未獲官方揭露。 |
| AI21 Labs | Jamba 混合模型釋出者 | 2024 年 3 月釋出 Jamba-52B(Mamba+Transformer 混合,256K 上下文),2024 年末有 Jamba-1.5 更新。Jamba 在長上下文評測中展現競爭力,但總體使用者量級遠小於同尺寸 Transformer 模型。 |
| Zyphra | Zamba 系列釋出者 | 2024 年釋出 Zamba-7B(開源),混合 Mamba 與共享注意力層,體量較小但開源可復現,屬於生態活躍貢獻方。 |
8.2 晶片產業鏈關聯
| 環節 | 潛在受益邏輯 | 現實約束 |
|---|---|---|
| GPU 廠商(NVIDIA 為首) | 若 Mamba 規模化,對 HBM 頻寬的需求仍高,高階 GPU 需求不受損 | 短期 Mamba 訓練體量遠小於 Transformer,增量拉動有限 |
| AI 推論專用晶片(Groq、SambaNova、Graphcore 等) | SSM 架構與確定性流式晶片的設計理念天然契合 | 這些廠商整體體量較小,商業化驗證尚不充分 |
| 國產晶片(昇騰、寒武紀等) | 若 Mamba 避免 Transformer 對矩陣乘法的絕對依賴,可能降低適配門檻 | 公開資料未見明確適配進展 |
8.3 應用場景的間接關聯
| 應用方向 | 對 Mamba 的依賴邏輯 | 相關公司(示例) |
|---|---|---|
| 長文件處理/法律 AI | 百萬 token 上下文可能改變文件稽核、合同分析的產品形態 | 法律 AI 公司、RAG 服務商 |
| 基因組學 AI | 基因組為天然長序列,Mamba 效率優勢有應用空間 | 生物資訊學 AI 公司 |
| 語音/音訊 AI | SSM 對連續訊號建模的天然優勢 | Cartesia AI、語音合成公司 |
| 即時 AI 互動 | O(1) 推論帶來的延遲確定性對即時對話有價值 | 對話式 AI 平台 |
以上場景的公開資訊以“早期探索”和“Demo”為主,暫無規模化商業產品因 Mamba 而獲得可量化的營收增長。
9 市場規模
9.1 與 Mamba 關聯的 TAM/SAM 推算
需首先明確:Mamba 是一種模型架構,不是獨立產品品類。其市場規模只能通過“受 SSM 架構影響的 AI 基礎設施和應用市場規模”間接推算。以下資料為相關領域的間接市場估算,非 Mamba 專屬份額。
| 市場 | 規模與口徑 | 來源與年份 | Mamba 關聯度 |
|---|---|---|---|
| 長上下文 AI 推論晶片市場 | 公開資料未見獨立統計 | — | 若 Mamba 路線獲得份額,可能催生“SSM 最佳化晶片”子品類 |
| 通用大型模型推論服務市場 | 約 150-250 億美元(2027 年預測,綜合多家研究機構,2024 年釋出) | 多家分析機構(Gartner、IDC)估算口徑有差異 | Mamba 可降低推論成本,可能擴大獲利池而非創造獨立營收 |
| 基因組學 AI 市場 | 約 6-12 億美元(2024 年口徑) | MarketsandMarkets, 2024 | SSM 在此場景有理論優勢,Mamba 潛在受益 |
| 開源大型模型算力消耗 | Mamba 路線尚處於訓練體量遠小於 Transformer 的階段 | — | 目前對算力總需求的影響可忽略 |
9.2 開源社群的間接指標
| 指標 | 資料 | 來源與口徑 |
|---|---|---|
| Mamba GitHub Star 數 | 14K+(2025 年中) | state-spaces/mamba 倉庫,橫截面資料 |
| 相關論文數(2024 全年) | arxiv 上標題含 Mamba 或 Selective SSM 的論文約 200+ 篇 | arxiv 粗略統計,含預印本,非正式出版計數 |
| HuggingFace 上 Mamba 模型數 | 400+(2025 年中,含微調變體) | HuggingFace 平台搜尋 |
| 商業專案採用 Mamba 的比例 | 公開資料未見可靠統計 | 絕大多數商用模型仍基於 Transformer |
9.3 關鍵判斷
Mamba 當前仍處於“技術驗證期”。截至 2025 年中,其在整體大型模型訓練算力消耗中的佔比遠低於 1%(基於已知訓練資訊估算,未獲正式統計)。若按行業發展預判,Mamba 相關市場最先形成的可能是長上下文推論最佳化工具鏈和基因組/音訊等垂直場景的專用模型服務,但具體時間線和規模高度取決於技術演化和生態採納速度。
10 玩家對比
10.1 同類序列建模方案對比
| 維度 | Mamba(SSM) | Transformer(標準) | RWKV(線性 RNN) | Hyena(門控捲積) |
|---|---|---|---|---|
| 提出時間 | 2023.12 | 2017.06 | 2023.05(RWKV-4) | 2023.03 |
| 複雜度 | O(n) | O(n²) | O(n) | O(n·logn) |
| 核心機制 | 選擇性狀態空間 | 縮放點積注意力 | 時間衰減 + 通道混合 | 隱式長卷積 + 門控 |
| 推論記憶體 | 恆定 | 隨序列線性增長 | 恆定 | 恆定 |
| 短序列效能 | 接近 Transformer(原論文資料,2023) | 最優 | 接近 Transformer | 略低於 Transformer |
| 長序列效能 | 顯著超越 Transformer(n>8K) | 受 KV 快取限制 | 強 | 強 |
| 訓練成熟度 | 低(少有大型模型驗證) | 極高 | 中 | 低 |
| 生態相容性 | 需自定義運算元 | 標準 CUDA 生態 | 需自定義運算元 | 需自定義運算元 |
| 可解釋性 | 中(有狀態向量可分析) | 高(注意力權重視覺化) | 中 | 低 |
| 主要支援方 | Cartesia AI、學術界 | Google、OpenAI、Meta 等全行業 | 社群驅動 | 學術界(Hazy Research 等) |
10.2 Mamba 混合架構對比
| 模型 | 引數量 | 上下文視窗 | 公開時間 | 混合策略 | 開源 |
|---|---|---|---|---|---|
| Jamba | 52B(MoE,實際啟用約 12B) | 256K | 2024.03 | Mamba 層 + 注意力層交錯 | 權重公開 |
| Jamba-1.5 | 52B/398B(MoE) | 256K | 2024.08(約) | 同上,最佳化注意力層比例 | 權重公開 |
| Zamba-7B | 7B | 未特別宣傳長上下文 | 2024.06 | 每 6 個 Mamba 層後 1 個共享注意力層 | 開源 |
| RecurrentGemma | 2B/9B | 未特別宣傳長上下文 | 2024.09 | Griffin 架構(線性 RNN+區域性注意力) | 開源 |
| SambaNova SN40L 定製模型 | 未公開 | 據稱可達 1M+ | 2024 | 純 Mamba 路線 + 晶片協同設計 | 未開源 |
注:Jamba 原始論文報告在同等成本下,256K 上下文推論的 Jamba 質量優於 Mamba 和 Transformer。但該結論來自 AI21 Labs 自身評估,缺乏獨立第三方的同規模對比基準。
10.3 中國玩家的狀態
| 機構/企業 | 相關動態 | 資訊來源與可信度 |
|---|---|---|
| 清華大學 | Vision Mamba(Vim)相關預印本 2024 年發表,將 Mamba 用於視覺任務 | 公開預印本 |
| 北京大學 | SSM 在 NLP 任務上的探索性論文 | 公開預印本 |
| 中國科學院 | SSM 理論分析相關研究 | 公開預印本 |
| 頭部大廠(位元組、阿里、騰訊、百度等) | 公開資料未見正式釋出的 Mamba 架構模型 | 內部研究動向未公開 |
| 創業公司 | 公開資料未見聚焦 Mamba 方向的中國創業公司完成大額融資 | — |
中國在 Mamba 賽道目前以學術論文跟進為主,產業級探索資訊極為有限。
11 風險
11.1 技術風險
| 風險項 | 描述 | 影響程度 | 可信度 |
|---|---|---|---|
| 尚未實現大規模驗證 | 截至目前,尚無 100B+ 引數規模的 Mamba 模型完整訓練報告。訓練穩定性、Scaling Law 的適配性缺乏實證 | 高 | 確認為事實 |
| 短序列場景無明顯優勢 | Mamba 論文自身資料顯示,序列長度 <2K 時,同參數量 Mamba 與 Transformer 的 perplexity 基本持平,無統計學顯著優勢 | 中 | 原論文資料(2023) |
| 選擇性機制的可解釋性爭議 | Mamba 去掉了注意力權重圖這一直接可解釋介面,狀態向量中的資訊難以直觀解讀,可能影響安全對齊和除錯 | 中 | 學術共識 |
| 訓練穩定性與超參敏感 | 社群反饋(2024 年多個開源復現報告)提到 Mamba 在大規模訓練時對學習率、梯度裁剪和 Δ 引數初始化更敏感 | 中 | 開源社群反饋,非系統性研究 |
| 並行擴充套件上限 | 掃描操作的並行度理論極限低於矩陣乘法,可能限制在超大規模 GPU 叢集上的線性加速效果 | 中 | 理論分析,缺乏大規模實測資料 |
11.2 產業與生態風險
| 風險項 | 描述 | 嚴重程度 |
|---|---|---|
| Transformer 生態慣性 | 主流推論架構(vLLM、TGI、ollama 等)、微調工具(LoRA/QLoRA)、量化方案(GPTQ/AWQ)均為 Transformer 原生設計,Mamba 需要全新的工具鏈適配。生態遷移成本遠高於技術本身 | ⭐⭐⭐⭐⭐ |
| 硬體生態路徑依賴 | NVIDIA 及所有 AI 晶片的硬體設計、編譯器最佳化、運算元庫以矩陣乘法為中心。即使 Mamba 理論更優,專用硬體的“預設加速物件”仍是 Transformer | ⭐⭐⭐⭐ |
| 人才池極淺 | 深入理解 SSM 理論的研究者全球可能不足百人級別。對比 Transformer 的人才儲備是數量級差距。這限制了商業公司招募核心團隊的能力 | ⭐⭐⭐⭐ |
| 混合路線可能邊緣化 SSM | 若 Jamba 等混合架構證明“少量注意力層+Mamba”是最優解,Mamba 的獨立技術價值將被稀釋為“注意力最佳化的一項技術元件” | ⭐⭐⭐ |
| 專利不確定性 | 截至 2025 年中,公開資料未見 Cartesia AI 宣告 Mamba 相關專利的明確許可策略。若未來出現商業化專利壁壘,可能影響生態開放度 | ⭐⭐ |
11.3 合規與安全風險
| 維度 | 現狀與風險 |
|---|---|
| 模型安全對齊 | Mamba 架構的安全對齊(RLHF/DPO/紅隊測試)研究遠少於 Transformer 系,缺乏針對 SSM 特有機制(如選擇性門控被對抗樣本誘導)的系統評估 |
| 可審計性 | 去掉顯式注意力權重後,模型“為什麼生成了這段內容”的可追溯性降低,可能增加生成式 AI 合規審查的複雜度 |
| 中國監管適配 | 中國的生成式 AI 備案制度對架構透明度和安全評估有要求。基於 Mamba 的模型備案時需補充 SSM 相關技術說明,但無架構歧視性限制 |
| 開源與出口管制 | Mamba 原始程式碼和權重以 Apache 2.0 許可開源,不構成出口管制敏感物件。但若未來出現國家級別的 Mamba 高效能模型,可能觸發管控討論 |
11.4 專家社群的核心分歧
| 議題 | 樂觀方觀點 | 保守方觀點 |
|---|---|---|
| 取代還是補充 | Mamba-2 證明兩套機制本質等價,未來模型必是大統一架構 | 注意力權重對安全對齊、可解釋性太重要,SSM 無法完全取代 |
| 時間線 | 2026 年可能出現首個 100B+ Mamba 模型 | Transformer 還會統治至少 3-5 年,Mamba 在特定場景補充 |
| 硬體瓶頸 | 新一代晶片可能原生支援 scan,扭轉硬體劣勢 | 矩陣乘法是 AI 計算的通用語言,scan 專用最佳化投資回報存疑 |
12 誤讀糾偏
謬誤 1:“Mamba 已經超越 Transformer 成為下一代架構標準”
事實矯正:Mamba 僅在特定條件(序列長度 ≥ 8K,同參數量,A100 單卡推論)下展現優勢。原論文的評測基準(如 The Pile 上的 perplexity)僅測量語言建模這一項指標,不能泛化為“全面超越”。在通用 NLP 基準(如 MMLU、HellaSwag)、程式碼生成和多模態任務上,截至 2025 年中,尚無明顯證據表明 Mamba 架構優於同等規模的 Transformer 模型。
謬誤 2:“Mamba 不需要注意力,把注意力幹掉了”
事實矯正:Mamba-2 的 SSD 架構從數學上證明了選擇性 SSM 與結構化掩碼注意力是等價關係,而非取代關係。Mamba 只是實現了另一種計算注意力的方式——可以類比為“用 scan 操作間接計算某些形式的注意力”,而非完全拋棄注意力原理。這更像是同一數學物件的不同工程實現路徑。
謬誤 3:“Mamba 推論記憶體恆定為 0,完全不用儲存上下文”
事實矯正:Mamba 的狀態向量大小恆定(≈ O(d²)),這是事實。但這不代表“上下文丟失”——狀態向量壓縮了之前所有 token 的資訊。當序列長度 n 極大時,固定大小的狀態向量必然有資訊損失,理論上存在資訊瓶頸。這與 Transformer 的 KV 快取可以“按需精確回溯任意歷史 token”有本質區別。對於需要精確逐字引用的任務,Mamba 的記憶模式可能存在劣勢。
謬誤 4:“Cartesia AI 已獲數億美元融資,Mamba 生態已高度成熟”
事實矯正:截至 2025 年中,Cartesia AI 公開揭露的融資資訊僅種子輪。雖然媒體報道中出現過不同金額版本,但無一來自公司官方或 SEC 檔案,且均遠未達到“數億美元”的量級。其產品線仍處於早期階段,不構成“高度成熟”的生態訊號。
謬誤 5:“Mamba 的訓練速度比 Transformer 快 5 倍”
事實矯正:這是對原論文推論速度資料的誤讀或過度外推。論文僅報告在特定序列長度下推論吞吐的優勢,訓練吞吐在中等序列長度(≤ 2K)時 Mamba 反而不如 Transformer(因為 scan 的並行度低於矩陣乘法)。5× 的聲稱需要明確限定條件,否則構成誤導。
謬誤 6:“國內已經有公司推出了 Mamba 大型模型產品”
事實矯正:截至 2025 年中,公開資料未見任何中國公司正式釋出基於 Mamba 架構的商業化大型模型產品。國內部分研究機構和公司可能進行了內部實驗,但無公開產品線和評測基準可供驗證。
13 最新事件
以下為截至 2025 年 7 月檢索的最新公開資訊,部分事件的後續發展可能已發生變化,請讀者注意時效性。
| 時間 | 事件 | 性質 | 來源與備註 |
|---|---|---|---|
| 2024.05 | Mamba-2 論文《Transformers are SSMs》釋出,提出 SSD 架構 | 理論突破 | Dao & Gu,發表於學術預印本。統一了 SSM 與注意力理論表述,為該領域 2024 年被引用最多的論文之一 |
| 2024.06 | Zyphra 釋出 Zamba-7B,首個開源的 Mamba+Transformer 混合 7B 模型 | 開源模型 | Zyphra 官方部落格。權重公開,社群反饋長序列表現中上 |
| 2024.08 | AI21 Labs 釋出 Jamba-1.5,MoE 啟用引數提升,仍保持 256K 上下文 | 模型更新 | AI21 Labs 官方公告 |
| 2024.09 | Google DeepMind 釋出 RecurrentGemma(基於 Griffin 的線性 RNN),非 Mamba 但同屬線性複雜度路線 | 競品釋出 | Google DeepMind 官方部落格。表明大廠也在探索注意力替代方案 |
| 2024.10(約) | NVIDIA cuDNN 9.x 開始納入掃描相關原語支援 | 基礎設施改善 | NVIDIA 技術文件。改善 Mamba 在 NVIDIA GPU 上的開箱體驗,但仍需手工 kernel 才能極致最佳化 |
| 2024.12 | Cartesia AI 釋出 SSM 音訊模型 Demo,展示即時語音處理 | 應用 Demo | Cartesia AI 官方渠道。未開放 API 或商用 |
| 2025.01(約) | Mamba-2 成為 HuggingFace transformers 庫中正式支援的架構 | 生態里程碑 | HuggingFace GitHub repo,Mamba2Model 類已併入主線 |
| 2025.02 | 清華大學等團隊釋出多篇 Vision Mamba 的擴充套件研究,將 Mamba 與視覺大型模型結合 | 學術進展 | 多個預印本,涉及影像分類、分割、影片理解等 |
| 2025.03-2025.06 | 多家中國大廠(位元組、阿里等)被傳在進行 Mamba/SSM 方向的研究(源自招聘 JD 分析、技術沙龍分享),但無正式模型釋出 | 傳聞/間接訊號 | 公開資料未見正式產品。建議保持謹慎,不以此作為投資依據 |
| 2025.07(檢索截止日) | 公開資料未見 Mamba 路線出現 100B+ 引數規模的大型模型訓練啟動資訊 | 待觀察 | — |