概念庫 開放閱讀

狀態空間模型 (State Space Model) ·

概念庫 · 開放閱讀

概念 ID
state-space-model-ssm
更新時間
2026-06-03
來源數量
1

狀態空間模型 (State Space Model) ·

定位:AI 基礎模型架構層(鏈:算力晶片 → 模型架構 → 雲端/端服務) 標籤:#序列建模 #Transformer替代方案 #高效推論 #長上下文

1 3秒看懂

一句話定義:狀態空間模型是一類借用經典控制理論數學架構、用微分方程描述序列演化的 AI 模型架構。它面對長序列輸入時,計算複雜度呈線性增長,從根本上繞開了 Transformer 注意力機制的平方級瓶頸,因此被視為大型模型走向高效推論和超長上下文的關鍵技術路線之一。

一句話產業位置:處於 AI 產業鏈的模型架構層。上游是 GPU/TPU 算力硬體與平行計算基礎軟體;下游是長文件理解、DNA 序列分析、工業感測器流、邊緣裝置語音助手等場景。SSM 不是獨立產品,而是一套正在快速擴張的技術方案族,目前仍在從學術前沿向工程落地遷移。

一句話判斷價值:SSM 是 Transformer 之後,首次在語言建模基準上逼近同等效能且保持線性複雜度的方法。它提供了工程上可落地的替代方案,並促使產業界重新思考“大型模型是否必須依賴注意力機制”這一底層命題。

三句話補全認知

  • 當前主流架構 Transformer 的自注意力機制,在處理 10 萬 token 以上長上下文時,記憶體與算力成本急劇上升,SSM 直面這一痛點。
  • Mamba 系列模型在 2023–2024 年將 SSM 帶入大規模語言建模,並驗證了選擇性狀態空間在保持效率同時提升建模能力的可行性。
  • 產業界普遍將 SSM 視為 Transformer 的重要補充而非全面替代,但混合架構(SSM + 注意力)正在成為模型設計的新常態。

2 3分鐘產業解釋

2.1 從 Transformer 的痛點說起

Transformer 通過“自注意力”為每個 token 與序列中所有其他 token 計算關聯,從而獲得優秀的上下文建模能力,但代價是計算和記憶體複雜度均為 O(N²)。當序列長度從幾千擴充套件到幾十萬甚至百萬級時,成本會增長到現有硬體難以承受的程度。工程上針對這一問題演化出 FlashAttention、KV-cache 壓縮、稀疏注意力等最佳化,但都無法從根本上將複雜度壓低到 O(N)。

狀態空間模型從數學源頭出發,放棄了“讓每個 token 看所有 token”的思路,轉而定義一條隨時間演化的隱狀態軌跡。狀態隨新 token 輸入而遞推更新,決策所需的上下文資訊壓縮在這個固定容量的狀態向量裡。由於每一步計算只依賴當前輸入和上一步狀態,複雜度和儲存開銷與序列長度 N 成線性關係,推論過程在理想條件下可逼近 O(1)。

2.2 產業圖譜:一條正在形成的價值鏈

SSM 產業鏈可以用三環結構理解:

  • 上游(算力與基礎軟體):SSM 的核心運算元(如選擇性掃描)需要高效實現,催生了針對 GPU 視訊記憶體頻寬定製的 CUDA kernel。上游玩家包括 NVIDIA(硬體 + CUDA 生態)、AMD(ROCm 生態)、以及 Triton/Cutlass 等中間層架構開發者。
  • 中游(模型架構與預訓練):以 S4、S5、H3、Mamba、Mamba-2 等為代表的一批遞進式架構,形成了從學術原型到開源預訓練模型的演進路徑。中游的核心產出是開源模型權重、架構論文和配套程式碼庫。
  • 下游(應用與部署):下游場景覆蓋雲端端 API(長文件分析、程式碼審查、生物序列解析)、邊緣推論(低功耗語音助手、即時訊號處理)和垂直行業(工業物聯網、高頻金融訊號)。下游企業更多是 SSM 的使用者而非架構創新者。

2.3 為什麼這個時點值得關注

2023 年 Mamba 的提出,是 SSM 從“長序列專項工具”升級為“通用語言模型候選架構”的轉折點。Mamba 在同等引數量級(約 3B)下達到與強 Transformer 基線(如 LLaMA、Pythia)可比的語言困惑度,同時推論吞吐量提升數倍。此後不到一年,Mamba-2 通過狀態空間對偶性將 SSM 形式化為結構化矩陣乘法,使得 SSM 訓練可以在現有 Transformer 訓練流水線中複用大量最佳化,極大降低了產業採納門檻。

從時間軸來看,2020–2022 年是“SSM 證明方法論可行”的階段,2023–2024 年則步入“SSM 證明可規模化”的階段。目前大型科技公司與頭部初創正密集探索 SSM 在萬億 token 級預訓練、多模態和 agent 場景下的表現,產業格局遠未固化。


3 技術原理

3.1 連續系統的離散化:從微分方程到深度學習

狀態空間模型的數學本源是線性時不變系統理論。連續形式下,系統由兩個方程定義:

h'(t) = A·h(t) + B·x(t)   (狀態方程)
y(t)  = C·h(t) + D·x(t)   (輸出方程)

其中 h(t) 表示隱狀態向量,維度通常為 d_state;x(t) 為輸入訊號(在語言模型中對應 token 嵌入);y(t) 為輸出訊號;A、B、C、D 為可學習或引數化的矩陣。

要在離散的計算機上執行,必須將連續微分方程轉化為離散遞推。常用的離散化方法包括雙線性變換、**零階保持(ZOH)**等。離散化時引入步長引數 Δ,由它決定狀態更新的節奏。離散後的遞推形式為:

h_t = Ā·h_{t-1} + B̄·x_t
y_t = C·h_t + D·x_t

其中 Ā 和 B̄ 由 A、B 與 Δ 通過特定公式計算得到。正是這個遞推形式,定義了 SSM 的核心計算圖:按序列方向逐步計算,每步代價恆定,完全不依賴其他 token。

3.2 從 S4 到 Mamba:結構化與選擇性的演進

S4(2022) 的貢獻在於首次讓 SSM 在長距離依賴任務上達到實用水平。此前,樸素 SSM 無法捕獲超過數百步的依賴關係。S4 通過將狀態矩陣 A 初始化為 HiPPO 矩陣,配合結構化引數化方案,使模型能夠在數萬步序列上保持訊號傳遞能力。S4 採用卷積形式進行高效並行訓練,在長序列音訊分類、Pixel-level 影像生成等任務上超越了 Transformer 效能。

S5(2023) 引入多輸入多輸出(MIMO)狀態空間層,將多個獨立 SISO 系統合併為一個 MIMO 系統,並通過並行掃描演算法替換卷積實現。S5 的並行性更好,可在更大的序列維度上利用 GPU 並行度。

H3(2023) 探索在語言建模中將 SSM 層與門控注意力機制組合,得出“SSM 擅長記憶區域性模式、注意力擅長檢索遙遠 token”的分工洞察。

Mamba(2023) 的關鍵創新是“選擇性”。傳統 SSM 的引數(A、B、Δ 等)對所有 token 固定不變,相當於模型對所有輸入一視同仁。Mamba 令 B、C 和 Δ 由當前輸入 x_t 經線性投影計算得到,實現輸入依賴的引數選擇。其底層直覺是:模型需要根據“看到什麼”動態決定“記什麼、忘什麼”。這一點使 SSM 從“無上下文偏好的壓縮器”進化為“有選擇性的推論引擎”。

選擇性機制的代價是:引數不再對序列共享,訓練階段無法繼續用固定的卷積核,必須恢復為遞迴掃描。Mamba 設計了選擇性掃描演算法(selective scan),通過精心編排 GPU 的 SRAM 與 HBM 之間的資料流,在材料化狀態的同時保持高吞吐。

Mamba-2(2024) 進一步揭示了 SSM 與結構化掩碼注意力之間的理論對等性——即狀態空間對偶(Structured State Space Duality, SSD)。SSD 允許將 SSM 等效表達為半可分離矩陣乘法,從而直接複用高度最佳化的 FlashAttention 風格運算元。這一發現將 SSM 的效能實現在編譯器層面大幅簡化,訓練速度顯著提升。

3.3 計算複雜度與記憶體佔用對比

指標Transformer (標準)SSM (Mamba 類)
訓練複雜度(每層)O(N²·d)O(N·d·d_state)
推論單步複雜度O(N·d·d_head) 依賴 KV-cacheO(d·d_state) 恆定
推論記憶體佔用O(N·d·n_layers) KV-cacheO(d_state·d·n_layers) 固定
理論長序列瓶頸視訊記憶體牆(KV-cache 線性增長)隱狀態容量(固定寬度)

注:d 為模型維度,d_state 為狀態維度,N 為序列長度。實際效能受硬體實現和並行策略影響,以上為漸近理論值。

3.4 SSM 與 RNN、卷積的異同

  • vs RNN:SSM 的遞推形式與 RNN 相似,但狀態轉移由連續系統理論保證長程穩定性,且訓練可藉助卷積/並行掃描實現並行化,避免了 RNN 沿時間反向傳播的嚴格序列瓶頸。多數 RNN 的隱狀態維度與模型維度相同,而 SSM 的狀態維度 d_state 獨立調節,可實現更高的資訊壓縮比。
  • vs 卷積:基於離散 SSM 可看作具有特定引數化的深度可分離卷積(核尺寸等於序列長度)。但標準卷積核隨序列長度線性增長,而 SSM 通過狀態空間引數化將核壓縮為少量引數。
  • vs 線性注意力:兩者都旨在將計算複雜度降為 O(N),但線性注意力通常固定核函式且記憶容量受限,SSM 通過結構化狀態矩陣提供了更強的長程建模理論保證。

4 關鍵引數

4.1 架構層引數

模型維度 d_model:通常 512–8192,決定每層表示空間的寬度。d_model 越大,模型容量越高,但訓練和推論計算量相應增長。當前公開的 Mamba 預訓練模型覆蓋 130M 到 2.8B 引數,對應的 d_model 範圍在 768–2560 左右。

狀態維度 d_state:獨立的隱狀態寬度,典型值 16–128。d_state 直接決定“記憶容量”——越大可壓縮的資訊越多,但每步計算量與 d_state 成正比。Mamba 論文中常用 d_state = 16(2.8B 模型約 64),在效率和效能間取得平衡。

狀態空間階數 N:在 S4 類模型中等價於狀態維度;在 Mamba 類中被選擇性機制部分替代,引數化自由度提升但 N 的顯式作用減弱。

層數 n_layers:與 Transformer 類似,深度影響模型抽象層次。Mamba 預訓練模型的層數分佈與同等引數量 Transformer 大致相同(24–64 層)。

上下文長度:SSM 理論支援任意長序列,實際訓練受限於 GPU 視訊記憶體和批次大小約束。Mamba 論文中報告在 1M token 長度的 DNA 序列上完成訓練和評估。當前主流開源模型多在 2k–8k 訓練上下文上釋出,長上下文微調屬於下游適配階段。

4.2 選擇性引數

步長 Δ:調整離散化時間間隔,直接影響狀態更新的快慢。Δ 取值為正實數,常見初始化範圍為 10⁻⁴ 到 10⁻¹。Mamba 的選擇性體現在 Δ 由輸入經線性層 + softplus 生成,使模型能動態決定對每個 token 的資訊保留比例。Δ 過大 → 模型快速遺忘歷史;Δ 過小 → 模型過度平滑、忽略變化。

輸入依賴投影:B 和 C 矩陣從與輸入無關的全域性引數,變為輸入 x_t 的函式。B 決定輸入如何影響狀態更新;C 決定狀態如何影響輸出。選擇性的代價是引數總數增加(B 和 C 從 [d_model, d_state] 變為 [N, d_model, d_state]),但通常增加的可忽略(約 1% 以內)。

4.3 效能指標

困惑度(Perplexity):語言模型的核心指標。Mamba 2.8B 在 Pile 資料集上的 perplexity 約為同等引數量 Pythia-2.8B 的 0.97–1.02 倍(越低越好,來源:Mamba 論文,2023)。在 The Pile 評測集上,Mamba-2.8B 的 zero-shot perplexity 為 8.14 左右,在同類規模模型中屬第一梯隊。

推論吞吐量:Mamba 論文報告,2.8B 模型在 1 臺 A100-80G 上生成吞吐量可達 Transformer 同類模型的 5 倍(序列長度較長時,如 >4k token)。該資料來源於 Mamba 論文中的原生 CUDA 實現,在實際部署中受量化、批次、硬體差異影響。

長序列建模:在 LRA(Long Range Arena)基準上,S4 系列模型在 ListOps(4k)、文件檢索(4k)、畫素級影像分類(1k)等任務上全面超越 Transformer 基線。Mamba 在 DNA 序列建模(1M 長度)上的困惑度顯著優於 HyenaDNA、Nucleotide Transformer 等專用模型。

訓練時間:根據 Mamba-2 論文(2024),在 300B token 訓練規模下,同等引數量的 Mamba-2 訓練 wall-clock 時間約為 LLaMA 類 Transformer 的 0.7–0.8 倍。這一優勢主要來源於每 token 的前向/反向計算量更低。

4.4 規模定律引數

僅有少量公開規模定律研究覆蓋 SSM 架構。Mamba 論文中展示了引數量從 130M 到 2.8B 的規模定律曲線,loss 隨計算量(FLOPs)的下降趨勢與 Transformer 大致平行。公開文獻未見大規模(>10B 引數、>1T token)SSM 的規模定律報告,這是產業界正在探索的前沿。


5 技術路線

5.1 S4 → S5 → H3:奠基與探索

  • S4(ICLR 2022) 確立 SSM 在長序列建模上的可行性,採用 HiPPO 初始化 + 卷積訓練範式。侷限性包括:引數對序列全域性共享,無法根據輸入調整行為;在語言建模上明顯落後於同等規模的 Transformer。
  • S5(ICLR 2023) 通過 MIMO 和並行掃描提升訓練效率,初步驗證了掃描作為 SSM 訓練基元的可行性。
  • H3(ICLR 2023) 開始探索 SSM 與注意力機制的結合,提出“將 SSM 作為上下文記憶層、注意力作為檢索層”的混合架構。H3 在語言模型上的表現首次接近 Transformer,但仍存在明顯差距。

這一階段的技術路線特徵是:效能並未超過 Transformer,重點在於方法驗證

5.2 Mamba:選擇性 + 高效實現

Mamba 的兩大支柱:

  1. 選擇性狀態空間:讓 B、C、Δ 由輸入生成,賦予模型動態篩選資訊的能力。這是演算法層面的關鍵創新,直擊“傳統 SSM 無法按 token 調整記憶行為”的痛點。
  2. 軟硬體聯合最佳化:選擇性掃描在 GPU 上的高效實現。通過 kernel fusion、重組資料流,避免了在 GPU 全域性記憶體中材料化大張量。這一實現的效能直接影響 Mamba 的訓練和推論可行性。

Mamba 的核心技術路線是簡化而非疊加——相比 Transformer 的多頭注意力、殘差流、MLP、歸一化層的複雜組合,Mamba 的每個 block 僅包含選擇性 SSM + 門控擴充套件 + 殘差連線,結構極簡。

5.3 Mamba-2:狀態空間對偶與結構化矩陣乘法

Mamba-2 的路線是理論深化與工程簡化。SSD 架構證明,選擇性 SSM 可以等價表達為半可分離矩陣與輸入序列的乘法,而這個乘法可以通過塊分解方式高效並行。基於這一洞見,Mamba-2 得以複用 FlashAttention 的核心技巧(分塊計算、重材料化),訓練速度相比 Mamba-1 提升 2–8 倍(取決於序列長度,來源:Mamba-2 論文,2024)。

這一路線的意義在於:SSM 不再需要“特殊”的硬體運算元,可以融入通用注意力最佳化架構,降低了產業採納的工程成本。

5.4 混合架構路線

業界普遍認識到,SSM 和注意力各有擅長。SSM 在長程依賴和高效推論上佔優,注意力在精準資訊檢索和複雜推論上佔優。混合架構試圖結合兩者。代表性方向:

  • Jamba(AI21 Labs, 2024):將 Mamba 層與 Transformer 注意力層交錯堆疊,並加入 MoE(混合專家),在 256k 上下文、52B 總引數(12B 活躍引數)規模上驗證。來源:AI21 Labs 技術報告。
  • Zamba(Zyphra, 2024):以 SSM 為主體,僅在關鍵層使用共享注意力,7B 模型在多數基準上匹配 LLaMA-2-7B,訓練成本顯著降低。
  • Mamba-Transformer 混合:多團隊在 arXiv 上提出不同混合比例和堆疊策略,目前尚無公認最優架構。

5.5 線性注意力、RWKV、RetNet 的並行路線

SSM 不是唯一試圖取代注意力的方法。RWKV(Receptance Weighted Key Value)採用類線性注意力 + 時變衰減機制,已釋出 7B/14B 開源模型,社群生態(微調工具、部署方案)相對成熟。RetNet(Microsoft, 2023)提出保持訓練並行(分塊注意力)和推論高效(遞迴)的雙重形式,與 SSM 的思路類似但不源於狀態空間理論。三條路線技術來源不同,但面向相近的市場空間(高效長序列建模),存在競合關係。


6 上游

6.1 算力硬體

SSM 訓練和推論主要依賴 GPU。與 Transformer 不同,SSM 的瓶頸往往不在計算吞吐(TFLOPs)而在視訊記憶體頻寬(GB/s),因為掃描類操作屬 memory-bound。上游硬體層的關鍵角色包括:

  • NVIDIA:絕對主導。H100、A100 的大視訊記憶體頻寬是 SSM 高效能實現的底層前提。NVIDIA 的 CUDA 生態直接支撐著選擇性掃描等定製 kernel 的開發和部署。NVIDIA 自身未公開針對 SSM 的專用架構或運算元庫,其路線圖公開資料未見特別的 SSM 傾斜。
  • AMD:Instinct 系列 GPU 理論上可支撐 SSM,但 ROCm 生態下的運算元最佳化尚需社群貢獻。2024 年部分開源專案開始將 Mamba 的 CUDA kernel 遷移到 ROCm,但成熟度不及 NVIDIA。
  • 專用 AI 晶片/Cerebras/Graphcore:理論上,SSM 的單步恆定計算特性有利於流式處理器架構,公開資料未見主流 AI 專用晶片廠商針對 SSM 釋出的最佳化方案或 benchmark。
  • 邊緣晶片(高通、聯發科、Apple):SSM 的恆定推論開銷和低記憶體佔用對手機/可穿戴裝置極具吸引力。高通 2024 年在驍龍 8 Gen 3 的 AI Engine 宣傳中提及支援高效 transformer 替代方案,但未單獨點名 SSM

6.2 基礎軟體與編譯棧

  • PyTorch:主流深度學習架構,SSM 的基礎實現環境。
  • Triton:OpenAI 開發的 GPU kernel 編寫語言。Mamba 的選擇性掃描 kernel 提供 Triton 版本,效能接近 CUDA 手寫版,但更易移植。Triton 使得 SSM 研究可以更快地在 AMD GPU 和未來新硬體上落地。
  • CUDA:NVIDIA 的 GPU 程式設計模型。Mamba 官方實現的核心 kernel 為 CUDA C++,是針對 A100/H100 視訊記憶體層次手寫最佳化的版本。
  • JAX:Google 的 JAX/Flax 生態在 SSM 研究初期(S4/S5)被廣泛使用,因其天然適配掃描和卷積。目前 Mamba 社群的 JAX 實現存在但活躍度低於 PyTorch。

6.3 上游上游:晶圓與製造

晶片代工(台積電、三星)和 HBM 記憶體(SK 海力士、三星、美光)是全球 AI 算力的基礎瓶頸。SSM 降低了對算力的“浪費”,但並未降低對先進製程和 HBM 產能的需求——它只是讓單位算力能處理更長的上下文。HBM3E 的供應緊張持續影響 GPU 出貨,間接抬高 SSM 訓練的硬體獲取成本。


7 下游

7.1 雲端端 API 服務

部分 AI 平台和模型即服務(MaaS)提供商開始將 SSM 模型納入 API 生態:

  • Cartesia API:由 Mamba 作者之一創立的 Cartesia 提供基於 SSM 的即時語音合成和長文件處理 API。截至 2024 年底,專注語音和長上下文場景,未大規模推廣通用文本 API。
  • Together AI / Anyscale 等推論平台:部分推論服務商已將 Mamba 開源模型列入可部署清單,支援第三方基於其基礎設施調優和上線,但公開揭露的營收貢獻比例未知
  • 國內雲端廠商:阿里雲端 PAI、騰訊雲端 TI 平台在模型市場或開發環境中支援 Mamba 架構的模型部署,但未見作為獨立產品線推向市場(來源:各雲端廠商服務頁面,截至 2024 年底)。

7.2 長文件理解與企業知識管理

這是 SSM 下游最“就緒”的場景。企業文件(合同、財報、內部知識庫)的 token 長度經常超過 10k,Transformer 的處理速度和成本較高。SSM 的 O(N) 複雜度和 1M token 級理論支援,使其在長文件摘要、跨文件檢索、程式碼庫級分析等場景具備天然優勢。用例:AI 程式碼助手可載入完整倉庫上下文後進行一致性重建置議;投行分析可一次性處理數百頁招股書全文。落地狀態:處於實驗性部署和產品原型階段,尚未成為多數知識管理 SaaS 的預設架構。

7.3 生物資訊學與基因組學

這是 SSM 最早證明價值的垂直領域之一。人類參考基因組長度超過 30 億鹼基對,蛋白質序列、RNA 序列均屬於超長序列。SSM 的 O(N) 特性和長程依賴建模能力與基因組分析的需求高度契合。

  • DNA 序列建模:Mamba 在 1M token 的 DNA 序列基準(GenomicBenchmarks)上顯著優於 HyenaDNA、DNABERT 等專用模型(來源:Mamba 論文,2023)。
  • 蛋白質序列分析:單條蛋白質序列可達數千胺基酸殘基,結構預測和功能註釋場景對長上下文有需求。部分研究將 SSM 用於蛋白質家族分類和突變效應預測,規模偏學術,產業化程度低
  • 藥物發現流程:將 SSM 作為候選分子屬性預測的組成部分,尚未見頭部藥企(如輝瑞、禮來、羅氏)在公開報告中明確揭露採用 SSM 架構

7.4 即時語音與音訊處理

語音是天然的序列訊號,取樣率 16kHz 意味著每秒 16,000 個樣本點,長對話的序列長度可以輕鬆達到幾十萬。SSM 的恆定推論延遲是即時語音應用的核心優勢。

  • Cartesia 基於 SSM 建置了即時 TTS 和 STT 模型,聲稱在低延遲場景下質量逼近甚至超越 Transformer 基線(來源:Cartesia 公司部落格,2024)。
  • 消費電子:智慧手機、智慧音箱的本地語音助手對功耗和延遲極度敏感。Mamba 的邊緣側推論潛力受到關注,但尚無主流消費品牌(Apple、三星、小米、華為)公開宣佈在其量產裝置的語音棧中引入 SSM

7.5 工業物聯網與時間序列異常檢測

工業感測器每秒可採集海量資料點(振動、溫度、壓力),且需要即時分析。SSM 適用於多元時間序列的線上預測和異常檢測。

  • 挑戰:工業場景的資料模態(多變數、非均勻取樣、噪聲)與語言模型差異顯著,直接將語言 SSM 架構遷移到工業時序的有效性需要大量驗證。公開資料未見西門子、通用電氣等工業巨頭的 SSM 部署案例。

8 受益公司

8.1 核心架構創新方(直接受益)

Cartesia AI:由 Mamba 作者 Albert Gu、Karan Goel 等創立。直接圍繞 SSM 建置商業模型和產品線(語音、長文件)。獲種子/ A 輪融資,投資方包括 Lightspeed 等(來源:Cartesia 公開資訊,2024)。受益方式:技術壁壘 + 先發優勢 + 社群認可。

Zyphra:開發了 Zamba 系列混合 SSM-Transformer 模型。2024 年開源 Zamba-7B,並公開了訓練成本與效能資料。定位為高效模型提供商。受益方式:若混合架構成為主流,Zyphra 可獲授權營收或併購價值。

Together AI:作為領先的開源模型推論平台,已將 Mamba 系列模型納入最佳化部署管線。若 SSM 模型在開源生態中的採納度持續上升,Together AI 可增加推論營收。公司 2024 年 B 輪融資估值約 12.5 億美元(來源:PitchBook, 2024)。

8.2 大型科技公司(潛在受益)

Google:S4/S5 系列研究的早期推動者(Google Brain 時期)。Google 內部擁有完整的大型模型矩陣(Gemini 系列),若將 SSM 或混合架構整合至 Gemini,有望降低長上下文推論成本。Google 未在公開發布中確認 Gemini 採用 SSM 架構(來源:DeepMind 部落格,2024)。受益方式:降低自家產品推論成本 + 差異化能力(長上下文)。

Meta:開源大型模型領域的核心玩家,LLaMA 系列廣泛採用 Transformer 架構。Meta 的研究團隊活躍於 SSM 與 Transformer 混合架構的探索(多篇 arXiv 論文署名包含 Meta AI 作者)。若 Meta 在 LLaMA 後續系列中加入 SSM 層,可進一步鞏固開源生態主導地位。受益方式:開源領導力 + 內部應用降本。

Microsoft:直接受益路徑包括:Azure 雲端服務中支援 SSM 模型高效部署;GitHub Copilot 等產品中利用 SSM 處理長程式碼上下文;通過 RetNet 等自身研究儲備保持多路線卡位。截至 2024 年底,未見 Azure OpenAI Service 或 Copilot 公開展示 SSM 依賴

NVIDIA:受益於任何 GPU 計算需求的增長,包括 SSM 帶來的增量推論負載。但更關鍵的是,SSM 的記憶頻寬瓶頸可能驅動客戶升級到更高頻寬的 HBM 系列產品,間接提升 NVIDIA 高階 GPU 的 ASP。選擇性掃描等 operator 也有助於展示 CUDA 生態的不可替代性。

8.3 國內公司(關注動向)

華為:昇騰晶片的推論效率是建置國產 AI 生態的賣點之一。若 SSM 在邊端推論的優勢被驗證,華為可能在昇騰平台推出針對 SSM 的運算元最佳化,吸引相關模型開發商。公開資料未見相關宣佈。

阿里雲端/騰訊雲端:作為國內 MaaS 的主要平台,已在模型廣場中支援 Mamba 等開源模型的部署(來源:魔搭社群頁面,2024),但未單獨突出為商業產品。若 SSM 在國內實現規模化應用,兩家雲端廠可從中獲得推論營收增量。

尚未上市的創業公司:多家國內大型模型創業公司(涵蓋通用模型和行業模型方向)在公開技術分享中提及關注高效模型架構,但未見明確宣佈基於 SSM 的主力產品路線。公開資料較少,不做具體列舉。

生物醫藥領域:國內基因測序龍頭(華大智造等)和 AI 製藥初創公司可能從 SSM 的長序列建模能力中受益,用於基因組分析和蛋白序列設計。具體合作或採購記錄未見公開揭露


9 市場規模

9.1 直接市場(SSM 專屬)

SSM 作為新興技術架構,尚未形成獨立的、可量化的市場。無法給出 SSM 專屬 TAM 的精確數字。其市場潛力目前隱含在以下兩個市場中:

  • 生成式 AI 模型市場:據 Bloomberg Intelligence 估計,2024 年全球生成式 AI 模型市場(包括 API 服務和模型授權)約 670 億美元,預計 2032 年達 1.3 萬億美元(來源:Bloomberg Intelligence, 2024)。SSM 有望在未來分得其中一部分。
  • 開源 AI 模型市場:SSM 當下主要以開源形式存在,其直接商業價值體現在託管推論、企業支援、微調服務等方面。開源 AI 模型服務市場在 2024 年估計約為 8–15 億美元(多方估計區間,口徑含推論 API 和專業服務),增長迅速。

9.2 關聯市場(應用場景 TAM)

SSM 的下游應用場景可對映到幾個已存在的 TAM:

  • 長文件分析與知識管理軟體市場:包括法律合同分析、財報自動摘要、企業搜尋等。據 Grand View Research 2024 年估算,全球 NLP 市場(含文本分析)約 290 億美元,2023–2030 CAGR 約 25%。SSM 可作為技術棧中的模型層參與其中。
  • 基因測序資料分析市場:全球基因組學資料分析市場在 2023 年約 120 億美元,預計 2030 年達 350 億美元(來源:MarketsandMarkets, 2024)。SSM 在長序列分析上的效率優勢在此領域最具潛力量化價值。
  • 即時語音 AI 市場:含 TTS、STT、即時翻譯。2024 年市場規模約 38 億美元,CAGR 約 18%(來源:Grand View Research, 2024)。邊緣側低延遲場景是 SSM 的優勢賽道。
  • 工業物聯網分析平台市場:2024 年約 150 億美元(來源:Fortune Business Insights, 2024),即時性要求的提升可能為 SSM 開啟增量空間。

9.3 開源源與潛在商業化

目前開源生態下的 SSM 模型直接貨幣化路徑有限。Short-term 更可能的商業化模式:

  • 提供 SSM 模型的微調/fine-tuning as a Service;
  • 在垂直場景(生物資訊學)提供基於 SSM 的 SaaS 分析工具;
  • 通過混合架構降低現有產品的推論成本(降本即增收)。

大規模營收(年營收 >1 億美元)的 SSM 商業化案例在 2024 年底公開資料未見


10 玩家對比

10.1 開源模型層對比

模型/架構開發者引數量級架構型別最大上下文核心優勢主要侷限
Mamba-1Gu & Dao130M–2.8B純 SSM1M (DNA), 8k (語言)線性複雜度、高推論吞吐極大規模驗證不足、生態規模小
Mamba-2Gu & Dao130M–2.8B純 SSM (SSD)同 Mamba-1訓練更快、可複用 FlashAttention 最佳化較新,社群積累更少
JambaAI21 Labs52B (12B 活躍)混合 + MoE256k大容量、長上下文商用閉源、推論成本仍高
Zamba-7BZyphra7B混合4k–32k開源、訓練成本低部分基準不及 LLaMA-2-7B
RWKV-v5/v6RWKV 社群1.5B–14B線性注意力類4k+社群生態成熟、有微調工具鏈非嚴格 SSM、長程效果待驗證
RetNetMicrosoft研究級類 SSM 雙重形式研究級訓練推論雙重高效開源未規模化、生態薄弱

說明:引數對比截至 2024 年底公開資訊。最大上下文指官方報告支援的長度,非所有任務均可有效利用。效能對比需參考各模型原文基準,不在此做橫評排序。

10.2 商業服務層對比

Cartesia vs 大型雲端廠:Cartesia 在 SSM 領域有最深的原生專業度,產品化速度可能快於大廠,但資金和客戶渠道處於劣勢。大型雲端廠(Google Cloud、AWS、Azure)可利用現有客戶基礎和算力資源,通過支援 SSM 開源模型實現“防守型”部署。二者更多是生態位差異而非直接競爭。

開源平台(Hugging Face):已成為 SSM 模型分發和社群討論的中心。Hugging Face 於 2024 年將 Mamba 架構完全整合至 Transformers 庫(來源:Hugging Face 部落格,2024 年 6 月),顯著降低了 SSM 的使用門檻。

國內 vs 海外差距:SSM 底層架構創新仍以美國高校和創業團隊為主力。國內在開源模型複用、應用適配方面積極跟進,魔搭、始智社群等均支援 Mamba 模型下載和簡單推論,但在原創架構和系統實現層面的領先性成果公開報道較少


11 風險

11.1 主要技術風險

規模定律的上限:Mamba 論文驗證到 2.8B 引數、300B token 訓練,但至今沒有 10B+ 引數純 SSM 模型的公開報告。SSM 的“隱式狀態壓縮”是否會在超大規模下出現資訊瓶頸,從而在複雜推論和知識密集型任務上被 Transformer 拉開差距,是核心不確定性。目前只能等待更多大規模實驗資料

訓練穩定性:選擇性機制增加了訓練動態的複雜度。社群有反饋在混合精度訓練中,SSM 的 Δ 引數可能發生數值不穩定(來源:GitHub issue 討論,2024),尤其在較長序列訓練時。這一問題在大規模訓練中可能放大。

架構固化 vs 快速迭代:從 S4 到 Mamba-2 僅兩年多,仍在快速演進。現在投入工程資源做規模化訓練的團隊,面臨被下一代架構(Mamba-3、新型混合架構)“覆蓋”的風險。這與 Transformer 相對穩定的架構形態形成對比。

11.2 市場與生態風險

Transformer 生態慣性:Transformer 的工具鏈(推論引擎、量化、微調架構、硬體適配)已經經過數年打磨,數百萬開發者習慣了其開發範式。SSM 雖然理論上更優,但生態成熟度至少落後 3–5 年。絕大多數企業應用不會為了 30% 的成本節省而放棄 Transformer 的確定性和社群支援。

商業化路徑不成熟:2024 年底尚不存在年營收超 5000 萬美元的純 SSM 公司(來源:公開財務資料搜尋)。投資回報週期不確定,可能面臨“技術領先但變現困難”的典型深科技陷阱。

大廠的“吸收策略”:若 SSM 被驗證為核心必需技術,大型科技公司可以選擇直接將最好的 SSM 架構整合進自己的閉源模型(如 Google 的 Gemini、OpenAI 的 GPT 系列),而不在開源生態中單獨建置 SSM 的商業價值。這會使純粹依賴 SSM 的創業公司難以建立商業護城河。OpenAI 和 Anthropic 均在內部研究狀態空間和線性注意力,公開揭露有限

11.3 特定領域風險

長上下文未必是“殺手應用”:檢索增強生成(RAG)的普及,使許多應用不需要模型原生處理 100k+ token 的全量上下文。若 RAG 等工程方案價效比更高,SSM 的長上下文優勢可能在多數商業場景中無法兌現為付費意願。

硬體特化 vs 通用性:如果未來的 AI 訓練晶片專門針對 Transformer 注意力計算進行特化(如 Google TPU 的某些注意力加速單元),則 SSM 的“通用 GPU 效率優勢”可能在特化硬體上被抹平。當前 TPU 對注意力操作的最佳化程度高於對掃描操作的最佳化。


12 誤讀糾偏

12.1 “SSM 將取代 Transformer”

糾偏:這可能是最普遍的誤讀。SSM 並非在所有維度上都優於 Transformer,而是一種“效能差距縮小、效率大幅提升”的替代方案。SSM 在精確檢索單一 token(如複製特定數字、程式碼片段精確回憶)任務上天然弱於注意力,因為注意力可以“直接索引”到歷史中任意位置,而 SSM 必須通過壓縮狀態間接回憶。業界共識正在向“共存與融合”演變:Transformer 處理核心推論和知識檢索,SSM 處理長上下文記憶與資訊壓縮。Jamba、Zamba 等混合架構正是這一認知的產物。

12.2 “SSM 就是更快的 RNN”

糾偏:雖然遞推形式類似,但區別深遠。傳統 RNN(LSTM/GRU)的隱狀態更新是非線性門控,沒有長程穩定性理論保證,梯度沿時間步傳播易消失/爆炸。SSM 的狀態轉移由連續時間和結構化矩陣理論指導,HiPPO 和選擇性機制提供了明確的長程依賴保持能力。此外,SSM 訓練可藉助卷積/掃描實現全並行,而 RNN 的時間反向傳播是序列的。把 SSM 簡單地歸為 RNN 忽視了其理論和工程基礎的根本差異。

12.3 “常數推論開銷意味著零延遲”

糾偏:O(1) 是漸近符號,表示不隨序列長度增長,但每一步的實際計算量和延遲是恆定的非零值。SSM 的狀態更新涉及矩陣乘法,若 d_state 和 d_model 取值較大,單步計算成本可能高於 Transformer 的“只讀取 KV-cache 對應 token”的操作。實際延遲優勢在序列超長(如 >8k token)時才會逐漸顯現。在短序列場景下,最佳化充分的 Transformer 推論延遲可能並不遜於 SSM。

12.4 “Mamba 就是 SSM 的全部”

糾偏:Mamba 是目前最出圈的 SSM 例項,但 SSM 是一個更廣義的數學架構和模型族。S4、S5、H3、Liquid-S4、SaShiMi 以及眾多變體都屬於 SSM 範疇。Mamba 的選擇性創新建立在 SSM 的基礎理論之上,不應將 SSM 窄化為某個具體實現。產業人員理解 SSM 時,宜掌握其基本原理,而非僅關注 Mamba 的 API 用法。

12.5 “開源 Mamba 模型可直接商用,無合規風險”

糾偏:Mamba 的模型權重以 Apache 2.0 許可證釋出,原始碼也是開源的,確實在許可證層面提供了較高的商用自由度。但預訓練資料集的合規性(是否包含受版權保護文本、個人資訊)、模型輸出的合規性(生成內容是否侵權)以及下游應用的行業監管要求(如醫療/法律場景的認證),與模型架構無關,風險依然存在。不能因為架構新穎而忽略標準的資料治理和應用合規流程。

12.6 “中國在 SSM 已與國際同步”

糾偏:在應用研究和演算法跟進層面,中國高校和企業的反應速度確實很快(多篇 Mamba 的衍生改進論文來自國內團隊)。但在核心架構創新(S4/Mamba-1/Mamba-2 級別)和底層系統實現(選擇性掃描 kernel、SSD kernel)上,主要貢獻仍來自海外團隊。認識到差距有助於制定合理的追趕策略,而不是在宣傳層面過度包裝。


13 最新事件

2024 年 12 月(截至下旬):arXiv 上持續出現新的 SSM 變體和混合架構論文,包括對 Mamba-2 SSD 架構的進一步擴充套件。未出現新的現象級架構突破報道

2024 年 6–8 月

  • Mamba-2 論文釋出並開源,提出狀態空間對偶 SSD,訓練速度提升 2–8 倍。社群反響積極,快速產生第三方實現和擴充套件。
  • Hugging Face 宣佈將 Mamba 架構完全整合至 Transformers 庫 v4.40+,可通過 AutoModel 直接載入 Mamba 模型,降低使用門檻。
  • AI21 Labs 釋出 Jamba 1.5 版本,在 256k 上下文基準上效能較 Jamba 初代提升,仍為 SSM-Transformer 混合 + MoE 架構。

2024 年 3–5 月

  • Jamba(初代)釋出,成為第一個公開可用的 SSM-Transformer-MoE 混合商業模型,引數 52B/活躍 12B,上下文 256k。
  • Zyphra 釋出 Zamba-7B,以 50% 左右訓練成本匹配 LLaMA-2-7B 效能,展示了混合架構的成本優勢。
  • Cartesia 獲得新一輪融資併發布 SSM 驅動的語音 API beta 版。

2023 年 12 月:Mamba 論文釋出並立即引發學術界和開源社群的高度關注。首周 GitHub stars 破萬。

2022–2023 年:S4、S5、H3、Hyena 等 SSM 前體陸續在頂會亮相,奠定理論基礎。

國內動態:2024 年下半年,多個國內 AI 社群和技術會議(如智源大會)將 SSM 列為專題討論或分享主題。阿里魔搭社群上線 Mamba 系列模型體驗。未見頭部國產大型模型廠商宣佈採用 SSM 架構的主模型更新


14 追蹤指標

14.1 技術進展指標

  • 下一代 Mamba 釋出(Mamba-3 或等效架構):關注引數量級(尤其是突破 10B+)、訓練 token 規模
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型