概念庫 開放閱讀

Mamba(選擇性狀態空間模型鏈)

概念庫 · 開放閱讀

概念 ID
mamba
更新時間
2026-06-03
來源數量
1

Mamba(選擇性狀態空間模型鏈)

1 三秒看懂

Mamba 是 2023 年底由 Albert Gu(卡內基梅隆大學)與 Tri Dao(普林斯頓大學/Together AI)聯合提出的選擇性狀態空間模型,核心賣點是將長序列推論複雜度從 Transformer 的 O(n²) 壓至 O(n),同時通過“選擇性機制”讓模型根據輸入內容動態決定記憶或遺忘。其設計目標是在百萬 token 級上下文中保持高效推論與恆定記憶體佔用。2023 年 12 月論文釋出即引發業界關注,被視為 Transformer 之外最具潛力的序列建模範式之一。

2 三分鐘產業解釋

Mamba 的本質是在狀態空間模型(State Space Model, SSM)的數學架構上引入“內容感知”能力。傳統狀態空間模型(如 2021 年的 S4)假設系統引數是固定不變的——無論你餵給它“今天天氣很好”還是“請分析這份 500 頁合同”,模型處理方式完全一致。Mamba 則引入選擇性(Selectivity),讓關鍵引數(B、C 矩陣和離散化步長 Δ)成為輸入的函式,使模型學會對關鍵資訊“重點標記、長期保留”,對背景噪音“果斷遺忘”,從而以線性複雜度實現近似注意力機制的內容感知能力。

從產業視角看,Mamba 承載著一個樸素期待:大型模型不必總靠堆算力、燒錢來拉長上下文。Transformer 的注意力機制雖然在短序列場景效果拔群,但其 O(n²) 複雜度和隨序列長度線性膨脹的 KV 快取,使百萬 token 上下文的推論成本高到難以規模化部署。Mamba 用 O(1) 推論複雜度(每 token 只需更新一個固定大小的狀態向量)給出了一條替代路徑。2024 年 5 月 Mamba-2 論文進一步提出 SSD 架構,從數學上揭示了 SSM 與注意力的深層等價關係,暗示兩條路線可能殊途同歸。

截至 2025 年 7 月(本文更新時),Mamba 生態呈現“學術活躍、產業試水”的狀態:原研團隊成立 Cartesia AI 推進 SSM 商業化;AI21 Labs 推出 Mamba-Transformer 混合模型 Jamba;Zyphra 開源 Zamba-7B;多家晶片廠商開始適配 SSM 專屬運算元。國內頭部大廠內部研究團隊有跟進,但尚無正式釋出的 Mamba 路線大型模型產品。

3 技術原理

3.1 狀態空間模型的數學基礎

狀態空間模型來自控制論,核心是一組描述系統動態的線性微分方程。將序列建模任務轉化為:是否存在一個隱藏狀態,能根據外部輸入驅動變化並對映到觀測輸出?

標準連續時間 SSM 的表達為:

h'(t) = A·h(t) + B·x(t)
y(t) = C·h(t)

其中 h(t) 是隱藏狀態向量,x(t) 是輸入訊號,y(t) 是輸出;A 是狀態轉移矩陣,B 控制輸入如何影響狀態,C 控制狀態如何對映到輸出。處理離散序列(文本 token、DNA 鹼基等)時,需要將連續系統離散化,核心是引入一個步長引數 Δ 將連續動力學轉為離散更新:

h_t = e^(ΔA)·h_{t-1} + (ΔA)⁻¹(e^(ΔA) - I)·ΔB·x_t
y_t = C·h_t

這看上去像一種精巧的 RNN:每個 token 根據上一步狀態和當前輸入更新狀態,再輸出結果。關鍵區別在於 A 矩陣的初始化方式——S4 用 HiPPO 理論設計 A,讓狀態能表示輸入訊號在不同時間尺度上的正交多項式投影,理論上解決了 RNN 的長程依賴難題。

3.2 S4 到 Mamba 的關鍵跨越

S4(Gu et al., 2021)驗證了 SSM 在 Long Range Arena 評測中超越 Transformer 的潛力,但有一個結構性缺陷:系統是**線性時不變(LTI)**的,引數 A、B、C、Δ 對所有 token 完全一樣。這意味著模型在處理一句話的第 10 個詞和第 10000 個詞時,資訊選擇策略完全相同——這顯然不符合真實需求。讓模型用同樣的方式對待“人工智慧”中的“智慧”和“。\n\n附錄二”中的“附”,是一種浪費。

Mamba 的核心創新(Gu & Dao, 2023.12)就是打破 LTI 限制:

引數S4(LTI)Mamba(選擇性)
A固定(HiPPO 初始化)固定(保留 HiPPO)
B固定由輸入 x 經線性投影生成
C固定由輸入 x 經線性投影生成
Δ固定標量由輸入 x 經啟用函式生成

這意味著每一層的“記憶/遺忘”策略完全取決於當前 token 的內容。如果 token 承載關鍵資訊,模型會讓 Δ 變小(“慢下來仔細看”)並讓 B 變大(“更多寫入狀態”);反之則讓 Δ 變大(“快速掠過”)。這種內容感知的門控行為使 Mamba 兼具 SSM 的線性複雜度和類注意力機制的靈活表達能力。

3.3 Mamba 模組的完整計算流程

一個標準 Mamba 模組的前向傳播流程:

輸入 x(序列長度 L,維度 D)

LayerNorm

┌─────────────────┬─────────────────┐
│ 投影至 2×d_inner │ 投影至 d_inner × 2 │
│ [用於門控分支]    │ [用於 SSM 分支]    │
└────────┬────────┘       └────────┬────────┘
         ↓                          ↓
    SiLU 啟用          1D 卷積(區域性特徵提取)
         ↓                          ↓
         │                 SiLU 啟用 + 選擇性 SSM
         │                          ↓
         └────────┬─────────────────┘

            逐元素乘法(門控)

            投影至 D(恢復維度)

              + 殘差連線

              輸出 y

關鍵運算元分解:

元件功能實現細節
1D 卷積捕獲區域性 token 間短程依賴通常卷積核大小為 4,彌補 SSM 對區域性模式捕捉偏弱的特性
選擇性 SSM核心長程式列建模並行掃描演算法實現,避免顯式展開狀態矩陣
SiLU 門控類似 LSTM/Transformer 的 gating讓網路學習每條通道的保留/抑制比例
殘差連線穩定深層訓練與 Transformer 一致的設計原則

3.4 硬體感知的並行掃描演算法

Mamba 的理論 FLOPs 確實是 O(n),但這依賴於一個高效實現前提:不能真的逐個 token 序列計算,否則會像傳統 RNN 一樣失去並行性。Mamba 的核心工程貢獻是設計了一個硬體感知的並行掃描(parallel scan)演算法。

掃描問題本質是計算一組有順序依賴的字首運算結果,理論上是序列的。但可以通過分段+並行處理的方式加速:將序列切分為多個 chunk,每個 chunk 內部並行執行;chunk 間序列傳遞初始狀態。這種“分段並行、段間序列”的策略在 GPU SRAM 中高效利用記憶體頻寬,避免了全域性視訊記憶體的反覆讀寫。

原論文在 NVIDIA A100 上的基準測試(2023 年資料)顯示:序列長度 32K 時,Mamba 的推論吞吐是同等尺寸 Transformer 的約 5 倍;訓練吞吐在序列長度達到 8K 以上時開始反超。需要強調的是,這些資料是在特定硬體和模型配置下測得,後續第三方復現結果有浮動。

3.5 Mamba-2 與 SSD 架構

2024 年 5 月,Dao & Gu 發表 Mamba-2 論文《Transformers are SSMs》,提出 Structured State Space Duality(SSD) 架構。核心貢獻是從數學上揭示了:結構化掩碼注意力(Structured Masked Attention)是 SSM 的特例,兩者可以通過一個統一的矩陣變換架構互相轉化。

這一發現有兩個重要推論:

推論含義
理論統一SSM 和注意力不是對立路線,而是一枚硬幣的兩面。選擇使用哪種取決於工程偏好而非理論優劣
實現最佳化SSD 可以利用現有注意力最佳化基礎設施(FlashAttention 等),降低 SSM 對專用運算元的依賴

Mamba-2 同時引入了狀態空間的對角化簡化(對角 A 矩陣),大幅降低了理論推導和工程實現的門檻。2024 年末至 2025 年上半年,Mamba-2 逐漸成為 SSM 研究的預設基礎架構。

3.6 與其他序列模型的複雜度對比

模型家族訓練複雜度推論複雜度(每 token)推論所需記憶體(序列長度 n)典型代表
標準 TransformerO(n²d)O(n)O(n)(KV 快取)GPT 系列
稀疏/線性注意力O(n·k·d)O(k)(k 為稀疏度)O(k)Longformer、RWKV
傳統 RNNO(nd²)O(d²)O(d²)LSTM
Mamba(SSM)O(nd)O(1)O(d²)(狀態矩陣大小恆定)Mamba 系列
Mamba-2(SSD)O(nd)O(1)O(d²)Mamba-2

注:d 為模型維度,n 為序列長度。以上為理論漸進複雜度,實際速度受工程最佳化影響較大。Transformer 在短序列場景因矩陣乘法高度最佳化仍可能更快。


4 關鍵引數

4.1 Mamba 架構的核心引數

引數Mamba-1.4BMamba-2.8BMamba-6.9B含義
引數量1.4B2.8B6.9B總可訓練引數
層數486456Mamba 模組堆疊層數
隱藏維度(d_model)204825604096token 嵌入維度
內部維度(d_inner)409651208192SSM 內部處理維度,通常為 2×d_model
狀態維度(d_state)1616128隱藏狀態向量的維度,影響記憶容量
卷積核大小444區域性特徵提取的視窗
序列長度(預訓練)20482048訓練資料相關預訓練時使用的最大上下文長度
詞典大小502805028050280通常使用 GPT-NeoX 詞典

4.2 關鍵設計權衡

  • d_state 的選擇:Mamba-1 統一使用 d_state=16,旨在降低狀態矩陣的記憶體開銷。Mamba-2 的實驗表明增大 d_state(至 128、256)在長上下文評估中有顯著增益,但會成比例增加推論時延。
  • d_inner 膨脹比:Mamba 一般保持 d_inner/d_model=2,與 Transformer 的 FFN 膨脹比相當。作者認為這便於與 Transformer 做公平對比。
  • 卷積核≥4:實驗表明去掉卷積或減小核尺寸會導致短序列 Perplexity 上升約 0.3-0.8(原論文消融實驗資料,2023),證明區域性結構對 SSM 模組是不可或缺的補充。

4.3 訓練配置(預訓練)

原論文 Mamba 系列模型訓練使用的資料為 The Pile 資料集(約 300B token,2023 年口徑)。最佳化器為 AdamW,學習率基於 cosine 衰減,梯度裁剪。具體超引數:

  • 學習率峰值:3×10⁻⁴(1.4B、2.8B),1.5×10⁻⁴(6.9B)
  • Batch size:約 0.5M token(序列級別調整至等 token 數)
  • 預訓練 token 總數:300B(所有尺寸模型一致)
  • 硬體:NVIDIA A100-80GB × 64(1.4B 模型訓練約 5 天,原論文資料,2023)

4.4 推論時的效率引數

指標Mamba-6.9B同等引數量 Transformer(估算對比)
1024 token 推論時延與 Transformer 接近
32K token 推論時延顯著低於 Transformer約 0.2×(原論文資料,A100,2023)
128K token 推論記憶體約 4-6 GB(僅狀態張量)KV 快取可能超過 20 GB(同等配置)
狀態記憶體恆定否(隨序列線性增長)

來源:Mamba 原論文(2023.12)及社群基準測試(2024)。推論指標高度依賴硬體和推論架構最佳化,不同環境下的絕對數值可能差異顯著。


5 技術路線

5.1 序列建模的技術樹

當前處理長序列的技術路線主要分為以下支系:

         序列建模
            ├── Transformer 路線
            │     ├── 稀疏注意力(Longformer、BigBird)
            │     ├── 線性注意力(Performer、Linformer)
            │     ├── 層級/塊滑窗(Mistral 滑動視窗注意力)
            │     ├── 壓縮 KV 快取(Multi-Query Attention、GQA)
            │     └── 外推位置編碼(RoPE 擴充套件、NTK 感知縮放)

            ├── RNN 路線
            │     ├── 線性 RNN(RWKV:WKV 注意力)
            │     ├── 並行化 RNN(LRU、S5)
            │     └── 門控捲積(Hyena)

            ├── SSM 路線(本文焦點)
            │     ├── S4(Gu, 2021)——奠基
            │     ├── S4D/H3/S5 ——簡化與改進
            │     ├── Mamba(Gu & Dao, 2023)——選擇性 SSM
            │     ├── Mamba-2(Dao & Gu, 2024)——SSD 統一理論
            │     └── 混合架構(Jamba、Zamba、RecurrentGemma)

            └── 其他
                  ├── 檢索增強(RAG 分塊,繞過長上下文需求)
                  └── 外部記憶(Memorizing Transformers)

5.2 Mamba 路線的內部演進

階段時間代表工作核心貢獻
理論奠基2021.09S4(Gu et al.)HiPPO 初始化 + 結構化狀態空間,證明 SSM 可用於長序列
架構簡化2022S4D、H3將 S4 的對角化近似推到極致,降低實現複雜度
並行化突破2023.06S5(Smith et al.)證明 SSM 可並行掃描,為 Mamba 硬體感知演算法鋪路
選擇性革命2023.12Mamba(Gu & Dao)突破 LTI 限制,引入內容感知選擇性機制
理論統一2024.05Mamba-2/SSD證明選擇效能統一 SSM 與注意力
混合驗證2024Jamba、Zamba證明 Mamba+Attention 混合架構在可控成本下相容兩種範式優勢
規模化探索2024-2025實驗性 Mamba-2 7B/13B驗證大規模訓練穩定性(更多細節公開資料有限)

5.3 兩條路線的比較判斷

維度                 純 Mamba 路線              混合路線(Mamba+Attention)
效率                最高(全線性複雜度)         略損耗(注意力層有 O(n²) 塊)
短序列表達能力       偏弱(需卷積/區域性增強)      強(注意力天然擅長此)
長序列能力           極強(百萬級理論可及)       強(由 Attention 層比例決定)
訓練成熟度           低(缺少大規模驗證)         中(可藉助已有 Transformer 經驗)
生態相容性           弱(需自定義運算元)           較強(借用已有 Attention 最佳化棧)

2024 年的產業實踐表明:純 Mamba 路線可能更適合極致長上下文極致效率場景;混合路線在通用任務上更穩健,是目前產品化更可能優先落地的形態。


6 上游

6.1 算力晶片

Mamba 的計算特徵是:大量 scan 操作、較少的大型矩陣乘法、對 SRAM 頻寬要求高。這與以矩陣乘法為中心的傳統 GPU 最佳化方向存在錯配。

晶片廠商產品線Mamba 適配進展(截至 2025 年中)
NVIDIAA100/H100/B200cuDNN 9.x 開始納入並行 scan 原語支援;Triton 自定義 kernel 目前是主流方案。B200 的大容量 SRAM 有利於 scan 效能提升
AMDMI300X公開資料未見專用 SSM 運算元庫釋出。Triton 對 AMD ROCm 的支援增加後,社群有初步移植嘗試
IntelGaudi 3公開資料未見明確的 Mamba 適配資訊
華為昇騰910B/910C公開資料未見明確 SSM 運算元適配公告。CANN 架構的掃描原語理論上可支援,但實測資料缺乏
GroqLPU其確定性流式架構對 scan 天然友好,2024 年有 Demo 展示 Mamba 推論,具體效能資料公開有限
SambaNovaSN40L矽谷早期演示中展示了 SSM 推論,公開資料未見量產部署資訊

關鍵瓶頸:scan 操作的並行化天然不如矩陣乘法,即使在 NVIDIA GPU 上,Mamba 模型的訓練吞吐(同參數同序列長度)仍不及 Transformer。硬體端期待針對 scan+稀疏矩陣混合運算的架構設計,這是中期關鍵變數。

6.2 架構與編譯器

Mamba 生態對架構層有較強依賴,因為高效 scan 實現需要在底層手動管理記憶體和並行策略。

工具角色Mamba 支援度
Triton(OpenAI)自定義 kernel 編譯器Mamba 官方實現核心依賴。Triton 的 scan 原語在 3.0+ 版本得到最佳化
PyTorch深度學習架構主平台提供基礎運算元,但高效 scan 仍需自定義 kernel
JAX + S4Lib另一套 SSM 生態S4Lib 由 SSM 研究社群維護,對 JAX 使用者友好。Haiku/Flax 模型實現
CUDA/CUTLASSNVIDIA 底層庫手工 CUDA kernel 是極限效能路徑,Mamba 社群有非官方實現
OpenAI kernel(S4 專用)原作者維護的狀態空間運算元Cartesia AI 團隊內部有專有 kernel 庫

6.3 訓練資料

Mamba 對訓練資料的需求與傳統 Transformer 不完全相同:

  • 長文件佔比要求更高:Mamba 的線性複雜度優勢在長序列中才能更好發揮,因此預訓練資料需要包含更高比例的長文本(單文件 >8K token)。The Pile 資料集中長文件佔比有限(公開統計不到 10% 的單篇 >4K token),這可能限制了早期 Mamba 在長上下文基準上的表現。2024 年後續開源模型已開始使用經過篩選的長文本資料集(如 DCLM、FineWeb 的 long context 子集)進行持續預訓練。
  • 資料去重和汙染控制:與 Transformer 一致,但 Mamba 的長記憶能力使它對重複模式更敏感。消融實驗(2024 年社群報告)表明,訓練資料中重複片段會對選擇性機制產生“固化偏好”的負面影響。
  • 中文訓練資料:Mamba 原論文主要基於英文 The Pile 資料集。中文 Mamba 訓練經驗在公開文獻中較少,缺乏成熟的中文 tokenizer 適配和預訓練基準。

7 下游

7.1 應用場景與成熟度評估

應用場景Mamba 理論優勢當前成熟度代表性探索
長文件理解(法律/金融合同)O(1) 推論實現百萬 token 上下文,記憶體恆定早期探索學術原型,尚無商用 Mamba 長文件產品
基因組/蛋白質序列建模天然適配長線性序列,SSM 可捕捉跨外顯子長程依賴學術驗證中多篇預印本(2024)驗證 HyenaDNA/MambaDNA 在基因組任務超過 Transformer
音訊與語音處理SSM 對連續訊號的離散化建模天然強初步成果Cartesia AI 專注於此方向,2024 年釋出 SSM 音訊模型原型
即時流處理(金融行情/日誌分析)每 token O(1) 推論,延遲可控概念驗證學術 Demo,缺少可靠生產部署報告
影片理解影片幀為天然長序列學術探索VideoMamba 等預印本(2024)探索時間序列注意力替換
邊緣裝置部署狀態記憶體恆定,引數利用率高晶片適配中需要先在邊緣 SoC 上完成 scan 運算元最佳化
程式碼生成與理解程式碼檔案通常較長,且結構巢狀早期探索開源社群有微調嘗試,尚無明顯超過 CodeLlama 的公開基準

7.2 落地路徑推演

基於當前公開資訊推演(非預測):

  1. 短期(2025-2026):最可能率先規模化的場景是“長上下文+低延遲”需求組合——例如即時客服系統需要完整記憶整個對話歷史但不能承受 KV 快取膨脹,或者生物資訊學處理單條全基因組資料(約 3B 鹼基對)。這類場景對 Mamba 的效率優勢有剛性需求,對短序列通用能力的容忍度較高。
  2. 中期(2026-2028):如混合架構(Mamba+Attention)在通用評測中穩定進入一梯隊,且硬體對 scan 的支援成熟,可能出現首批 Mamba-based 通用大型模型產品。
  3. 長期:取決於理論路線競爭結果和晶片架構演進。若 Mamba-2/SSD 的統一架構被廣泛接受,未來大型模型可能同時支援注意力模式和 SSM 模式,根據任務動態切換。

8 受益公司

重要宣告:以下僅為產業關聯梳理,非投資分析。公司能否最終受益取決於技術路線演化和自身執行力,存在高度不確定性。

8.1 原研與核心推動方

主體Mamba 生態角色關鍵動態(截至 2025 年中)
Cartesia AIAlbert Gu 聯合創立的商業化載體2024 年獲種子輪融資,金額公開資料不同來源口徑不一(有報道為約千萬美元級別)。專注 SSM 在音訊處理方向的商用落地;2025 年上半年有 SSM 語音模型 Demo 展示,具體產品尚未公開發布。
Together AITri Dao 聯合創始人,推論基礎設施通過 FlashAttention/FlashLinearAttention 積累高效 kernel 經驗;對 Mamba 推論最佳化工程有直接貢獻。2025 年完成新一輪融資(公開報道),估值未獲官方揭露。
AI21 LabsJamba 混合模型釋出者2024 年 3 月釋出 Jamba-52B(Mamba+Transformer 混合,256K 上下文),2024 年末有 Jamba-1.5 更新。Jamba 在長上下文評測中展現競爭力,但總體使用者量級遠小於同尺寸 Transformer 模型。
ZyphraZamba 系列釋出者2024 年釋出 Zamba-7B(開源),混合 Mamba 與共享注意力層,體量較小但開源可復現,屬於生態活躍貢獻方。

8.2 晶片產業鏈關聯

環節潛在受益邏輯現實約束
GPU 廠商(NVIDIA 為首)若 Mamba 規模化,對 HBM 頻寬的需求仍高,高階 GPU 需求不受損短期 Mamba 訓練體量遠小於 Transformer,增量拉動有限
AI 推論專用晶片(Groq、SambaNova、Graphcore 等)SSM 架構與確定性流式晶片的設計理念天然契合這些廠商整體體量較小,商業化驗證尚不充分
國產晶片(昇騰、寒武紀等)若 Mamba 避免 Transformer 對矩陣乘法的絕對依賴,可能降低適配門檻公開資料未見明確適配進展

8.3 應用場景的間接關聯

應用方向對 Mamba 的依賴邏輯相關公司(示例)
長文件處理/法律 AI百萬 token 上下文可能改變文件稽核、合同分析的產品形態法律 AI 公司、RAG 服務商
基因組學 AI基因組為天然長序列,Mamba 效率優勢有應用空間生物資訊學 AI 公司
語音/音訊 AISSM 對連續訊號建模的天然優勢Cartesia AI、語音合成公司
即時 AI 互動O(1) 推論帶來的延遲確定性對即時對話有價值對話式 AI 平台

以上場景的公開資訊以“早期探索”和“Demo”為主,暫無規模化商業產品因 Mamba 而獲得可量化的營收增長。


9 市場規模

9.1 與 Mamba 關聯的 TAM/SAM 推算

需首先明確:Mamba 是一種模型架構,不是獨立產品品類。其市場規模只能通過“受 SSM 架構影響的 AI 基礎設施和應用市場規模”間接推算。以下資料為相關領域的間接市場估算,非 Mamba 專屬份額。

市場規模與口徑來源與年份Mamba 關聯度
長上下文 AI 推論晶片市場公開資料未見獨立統計若 Mamba 路線獲得份額,可能催生“SSM 最佳化晶片”子品類
通用大型模型推論服務市場約 150-250 億美元(2027 年預測,綜合多家研究機構,2024 年釋出)多家分析機構(Gartner、IDC)估算口徑有差異Mamba 可降低推論成本,可能擴大獲利池而非創造獨立營收
基因組學 AI 市場約 6-12 億美元(2024 年口徑)MarketsandMarkets, 2024SSM 在此場景有理論優勢,Mamba 潛在受益
開源大型模型算力消耗Mamba 路線尚處於訓練體量遠小於 Transformer 的階段目前對算力總需求的影響可忽略

9.2 開源社群的間接指標

指標資料來源與口徑
Mamba GitHub Star 數14K+(2025 年中)state-spaces/mamba 倉庫,橫截面資料
相關論文數(2024 全年)arxiv 上標題含 Mamba 或 Selective SSM 的論文約 200+ 篇arxiv 粗略統計,含預印本,非正式出版計數
HuggingFace 上 Mamba 模型數400+(2025 年中,含微調變體)HuggingFace 平台搜尋
商業專案採用 Mamba 的比例公開資料未見可靠統計絕大多數商用模型仍基於 Transformer

9.3 關鍵判斷

Mamba 當前仍處於“技術驗證期”。截至 2025 年中,其在整體大型模型訓練算力消耗中的佔比遠低於 1%(基於已知訓練資訊估算,未獲正式統計)。若按行業發展預判,Mamba 相關市場最先形成的可能是長上下文推論最佳化工具鏈基因組/音訊等垂直場景的專用模型服務,但具體時間線和規模高度取決於技術演化和生態採納速度。


10 玩家對比

10.1 同類序列建模方案對比

維度Mamba(SSM)Transformer(標準)RWKV(線性 RNN)Hyena(門控捲積)
提出時間2023.122017.062023.05(RWKV-4)2023.03
複雜度O(n)O(n²)O(n)O(n·logn)
核心機制選擇性狀態空間縮放點積注意力時間衰減 + 通道混合隱式長卷積 + 門控
推論記憶體恆定隨序列線性增長恆定恆定
短序列效能接近 Transformer(原論文資料,2023)最優接近 Transformer略低於 Transformer
長序列效能顯著超越 Transformer(n>8K)受 KV 快取限制
訓練成熟度低(少有大型模型驗證)極高
生態相容性需自定義運算元標準 CUDA 生態需自定義運算元需自定義運算元
可解釋性中(有狀態向量可分析)高(注意力權重視覺化)
主要支援方Cartesia AI、學術界Google、OpenAI、Meta 等全行業社群驅動學術界(Hazy Research 等)

10.2 Mamba 混合架構對比

模型引數量上下文視窗公開時間混合策略開源
Jamba52B(MoE,實際啟用約 12B)256K2024.03Mamba 層 + 注意力層交錯權重公開
Jamba-1.552B/398B(MoE)256K2024.08(約)同上,最佳化注意力層比例權重公開
Zamba-7B7B未特別宣傳長上下文2024.06每 6 個 Mamba 層後 1 個共享注意力層開源
RecurrentGemma2B/9B未特別宣傳長上下文2024.09Griffin 架構(線性 RNN+區域性注意力)開源
SambaNova SN40L 定製模型未公開據稱可達 1M+2024純 Mamba 路線 + 晶片協同設計未開源

注:Jamba 原始論文報告在同等成本下,256K 上下文推論的 Jamba 質量優於 Mamba 和 Transformer。但該結論來自 AI21 Labs 自身評估,缺乏獨立第三方的同規模對比基準。

10.3 中國玩家的狀態

機構/企業相關動態資訊來源與可信度
清華大學Vision Mamba(Vim)相關預印本 2024 年發表,將 Mamba 用於視覺任務公開預印本
北京大學SSM 在 NLP 任務上的探索性論文公開預印本
中國科學院SSM 理論分析相關研究公開預印本
頭部大廠(位元組、阿里、騰訊、百度等)公開資料未見正式釋出的 Mamba 架構模型內部研究動向未公開
創業公司公開資料未見聚焦 Mamba 方向的中國創業公司完成大額融資

中國在 Mamba 賽道目前以學術論文跟進為主,產業級探索資訊極為有限。


11 風險

11.1 技術風險

風險項描述影響程度可信度
尚未實現大規模驗證截至目前,尚無 100B+ 引數規模的 Mamba 模型完整訓練報告。訓練穩定性、Scaling Law 的適配性缺乏實證確認為事實
短序列場景無明顯優勢Mamba 論文自身資料顯示,序列長度 <2K 時,同參數量 Mamba 與 Transformer 的 perplexity 基本持平,無統計學顯著優勢原論文資料(2023)
選擇性機制的可解釋性爭議Mamba 去掉了注意力權重圖這一直接可解釋介面,狀態向量中的資訊難以直觀解讀,可能影響安全對齊和除錯學術共識
訓練穩定性與超參敏感社群反饋(2024 年多個開源復現報告)提到 Mamba 在大規模訓練時對學習率、梯度裁剪和 Δ 引數初始化更敏感開源社群反饋,非系統性研究
並行擴充套件上限掃描操作的並行度理論極限低於矩陣乘法,可能限制在超大規模 GPU 叢集上的線性加速效果理論分析,缺乏大規模實測資料

11.2 產業與生態風險

風險項描述嚴重程度
Transformer 生態慣性主流推論架構(vLLM、TGI、ollama 等)、微調工具(LoRA/QLoRA)、量化方案(GPTQ/AWQ)均為 Transformer 原生設計,Mamba 需要全新的工具鏈適配。生態遷移成本遠高於技術本身⭐⭐⭐⭐⭐
硬體生態路徑依賴NVIDIA 及所有 AI 晶片的硬體設計、編譯器最佳化、運算元庫以矩陣乘法為中心。即使 Mamba 理論更優,專用硬體的“預設加速物件”仍是 Transformer⭐⭐⭐⭐
人才池極淺深入理解 SSM 理論的研究者全球可能不足百人級別。對比 Transformer 的人才儲備是數量級差距。這限制了商業公司招募核心團隊的能力⭐⭐⭐⭐
混合路線可能邊緣化 SSM若 Jamba 等混合架構證明“少量注意力層+Mamba”是最優解,Mamba 的獨立技術價值將被稀釋為“注意力最佳化的一項技術元件”⭐⭐⭐
專利不確定性截至 2025 年中,公開資料未見 Cartesia AI 宣告 Mamba 相關專利的明確許可策略。若未來出現商業化專利壁壘,可能影響生態開放度⭐⭐

11.3 合規與安全風險

維度現狀與風險
模型安全對齊Mamba 架構的安全對齊(RLHF/DPO/紅隊測試)研究遠少於 Transformer 系,缺乏針對 SSM 特有機制(如選擇性門控被對抗樣本誘導)的系統評估
可審計性去掉顯式注意力權重後,模型“為什麼生成了這段內容”的可追溯性降低,可能增加生成式 AI 合規審查的複雜度
中國監管適配中國的生成式 AI 備案制度對架構透明度和安全評估有要求。基於 Mamba 的模型備案時需補充 SSM 相關技術說明,但無架構歧視性限制
開源與出口管制Mamba 原始程式碼和權重以 Apache 2.0 許可開源,不構成出口管制敏感物件。但若未來出現國家級別的 Mamba 高效能模型,可能觸發管控討論

11.4 專家社群的核心分歧

議題樂觀方觀點保守方觀點
取代還是補充Mamba-2 證明兩套機制本質等價,未來模型必是大統一架構注意力權重對安全對齊、可解釋性太重要,SSM 無法完全取代
時間線2026 年可能出現首個 100B+ Mamba 模型Transformer 還會統治至少 3-5 年,Mamba 在特定場景補充
硬體瓶頸新一代晶片可能原生支援 scan,扭轉硬體劣勢矩陣乘法是 AI 計算的通用語言,scan 專用最佳化投資回報存疑

12 誤讀糾偏

謬誤 1:“Mamba 已經超越 Transformer 成為下一代架構標準”

事實矯正:Mamba 僅在特定條件(序列長度 ≥ 8K,同參數量,A100 單卡推論)下展現優勢。原論文的評測基準(如 The Pile 上的 perplexity)僅測量語言建模這一項指標,不能泛化為“全面超越”。在通用 NLP 基準(如 MMLU、HellaSwag)、程式碼生成和多模態任務上,截至 2025 年中,尚無明顯證據表明 Mamba 架構優於同等規模的 Transformer 模型。

謬誤 2:“Mamba 不需要注意力,把注意力幹掉了”

事實矯正:Mamba-2 的 SSD 架構從數學上證明了選擇性 SSM 與結構化掩碼注意力是等價關係,而非取代關係。Mamba 只是實現了另一種計算注意力的方式——可以類比為“用 scan 操作間接計算某些形式的注意力”,而非完全拋棄注意力原理。這更像是同一數學物件的不同工程實現路徑。

謬誤 3:“Mamba 推論記憶體恆定為 0,完全不用儲存上下文”

事實矯正:Mamba 的狀態向量大小恆定(≈ O(d²)),這是事實。但這不代表“上下文丟失”——狀態向量壓縮了之前所有 token 的資訊。當序列長度 n 極大時,固定大小的狀態向量必然有資訊損失,理論上存在資訊瓶頸。這與 Transformer 的 KV 快取可以“按需精確回溯任意歷史 token”有本質區別。對於需要精確逐字引用的任務,Mamba 的記憶模式可能存在劣勢。

謬誤 4:“Cartesia AI 已獲數億美元融資,Mamba 生態已高度成熟”

事實矯正:截至 2025 年中,Cartesia AI 公開揭露的融資資訊僅種子輪。雖然媒體報道中出現過不同金額版本,但無一來自公司官方或 SEC 檔案,且均遠未達到“數億美元”的量級。其產品線仍處於早期階段,不構成“高度成熟”的生態訊號。

謬誤 5:“Mamba 的訓練速度比 Transformer 快 5 倍”

事實矯正:這是對原論文推論速度資料的誤讀或過度外推。論文僅報告在特定序列長度下推論吞吐的優勢,訓練吞吐在中等序列長度(≤ 2K)時 Mamba 反而不如 Transformer(因為 scan 的並行度低於矩陣乘法)。5× 的聲稱需要明確限定條件,否則構成誤導。

謬誤 6:“國內已經有公司推出了 Mamba 大型模型產品”

事實矯正:截至 2025 年中,公開資料未見任何中國公司正式釋出基於 Mamba 架構的商業化大型模型產品。國內部分研究機構和公司可能進行了內部實驗,但無公開產品線和評測基準可供驗證。


13 最新事件

以下為截至 2025 年 7 月檢索的最新公開資訊,部分事件的後續發展可能已發生變化,請讀者注意時效性。

時間事件性質來源與備註
2024.05Mamba-2 論文《Transformers are SSMs》釋出,提出 SSD 架構理論突破Dao & Gu,發表於學術預印本。統一了 SSM 與注意力理論表述,為該領域 2024 年被引用最多的論文之一
2024.06Zyphra 釋出 Zamba-7B,首個開源的 Mamba+Transformer 混合 7B 模型開源模型Zyphra 官方部落格。權重公開,社群反饋長序列表現中上
2024.08AI21 Labs 釋出 Jamba-1.5,MoE 啟用引數提升,仍保持 256K 上下文模型更新AI21 Labs 官方公告
2024.09Google DeepMind 釋出 RecurrentGemma(基於 Griffin 的線性 RNN),非 Mamba 但同屬線性複雜度路線競品釋出Google DeepMind 官方部落格。表明大廠也在探索注意力替代方案
2024.10(約)NVIDIA cuDNN 9.x 開始納入掃描相關原語支援基礎設施改善NVIDIA 技術文件。改善 Mamba 在 NVIDIA GPU 上的開箱體驗,但仍需手工 kernel 才能極致最佳化
2024.12Cartesia AI 釋出 SSM 音訊模型 Demo,展示即時語音處理應用 DemoCartesia AI 官方渠道。未開放 API 或商用
2025.01(約)Mamba-2 成為 HuggingFace transformers 庫中正式支援的架構生態里程碑HuggingFace GitHub repo,Mamba2Model 類已併入主線
2025.02清華大學等團隊釋出多篇 Vision Mamba 的擴充套件研究,將 Mamba 與視覺大型模型結合學術進展多個預印本,涉及影像分類、分割、影片理解等
2025.03-2025.06多家中國大廠(位元組、阿里等)被傳在進行 Mamba/SSM 方向的研究(源自招聘 JD 分析、技術沙龍分享),但無正式模型釋出傳聞/間接訊號公開資料未見正式產品。建議保持謹慎,不以此作為投資依據
2025.07(檢索截止日)公開資料未見 Mamba 路線出現 100B+ 引數規模的大型模型訓練啟動資訊待觀察
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型