概念庫 開放閱讀

Hyena Hierarchy

概念庫 · 開放閱讀

概念 ID
hyena-hierarchy
更新時間
2026-06-03
來源數量
1

Hyena Hierarchy

⏱ 1. 3 秒看懂

Hyena 是 2023 年由斯坦福大學 Hazy Research 實驗室提出的一種亞二次時間複雜度的序列建模架構。它用隱式長卷積(Implicit Long Convolution)和逐元素門控(Element-wise Gating) 替代了 Transformer 中的自注意力機制,旨在解決超長序列(如 8K Token 以上)場景下推論成本過高的問題,是“後 Transformer 時代”探索高效率架構的關鍵方向之一。

⏱ 2. 3 分鐘產業解釋

2.1 核心定位

維度說明
關鍵論文Hyena Hierarchy: Towards Larger Convolutional Language Models(2023年3月,Stanford Hazy Research)
核心團隊Michael Poli, Stefano Massaroli, Eric Nguyen 等
產業痛點Transformer 自注意力的 O(n²) 計算複雜度導致長上下文推論時視訊記憶體佔用過高、延遲過大
技術路徑長卷積 + 元素級乘法門控,將複雜度降至 O(n log n),實現計算量與序列長度的亞二次增長關係

2.2 一句話原理

Hyena 通過在頻域中利用快速傅立葉變換(FFT)加速長卷積運算,並堆疊交替的門控與卷積層來捕捉序列的長程依賴。在 8K Token 以上的長序列基難測試中,其吞吐量可達同等引數規模 Transformer 的 2–3 倍(Stanford 2023 年論文 A100 基準測試資料)。

2.3 與 Transformer 的架構關係

Transformer:  輸入 → 多頭自注意力(QKV)→ 前饋網路 → 輸出
Hyena:        輸入 → 長卷積層 → 門控 → 長卷積層 → … → 輸出

兩者不屬於“替代”關係,而屬“互補”關係。Hyena 更適用於超長上下文、低延遲推論、高吞吐量場景;Transformer 在成熟生態和常規長度任務上仍具優勢。當前產業共識是將其視為“後 Transformer”技術池中的一個並行選項,而非唯一繼任者。

⏱ 3. 技術原理

3.1 Hyena 運算元組合結構

Hyena 的核心運算單元由長卷積與逐元素乘法門控交替堆疊構成,其對序列的處理流程如下:

輸入序列 u(t)


[長卷積層 H₁]     ← 使用 FFT 在頻域加速,複雜度 O(n log n)


[門控單元 v(t)]  ← u(t) 與一個門控訊號 g(t) 逐元素相乘


[長卷積層 H₂]


[重複 Hyena Block L 次]


輸出序列 y(t)

每一層 Hyena Block 可以理解為“長程資訊提取 + 非線性過濾”的組合疊加。

3.2 關鍵技術創新

技術點詳細說明
隱式長卷積核不顯式儲存 n×n 的卷積矩陣,而是通過一個引數規模小得多的 MLP 網路來生成卷積核,視訊記憶體佔用由 O(n²) 降到 O(n)
FFT 頻域加速將空間域的長卷積轉化為頻域的點乘操作,使單步計算複雜度由 O(n²) 降至 O(n log n)
門控機制借鑑 H3(Hungry Hungry Hippos)架構思路,利用逐元素乘法門控增強模型的非線性建模能力
多頭分解類似於 Transformer 的多頭注意力,Hyena 將卷積核分解為多個獨立“頭”並行運算,提升模型容量

3.3 理論複雜度對比

架構型別計算複雜度視訊記憶體佔用(忽略 Embedding)
標準 TransformerO(n²)O(n²)
稀疏/近似注意力O(n × k) 或 O(n log n)O(n) 至 O(n × k)
Hyena(長卷積)O(n log n)O(n)

口徑:本表複雜度為單層前向傳播的理論複雜度,“n”為序列長度,“k”為稀疏注意力視窗大小。實際執行開銷會受底層運算元最佳化和硬體適配影響。

3.4 長程依賴能力驗證

在 Stanford 實驗中,Hyena 在超長序列合成任務 “Path-X”(序列長度 16,384 Token)上取得 90.4% 的準確率,同等規模的 Transformer 模型完全無法訓練(梯度消失/記憶體溢位)。該結果表明 Hyena 的架構偏置更適合捕捉極長序列中的稀疏依賴訊號。


⏱ 4. 關鍵引數

4.1 論文核心實驗引數

引數項數值/配置來源說明
最大公開實驗引數量約 1.3B(13 億引數)Stanford 2023 論文最大規模實驗
序列長度基準測試區段2K – 64K Token論文長序列表實驗設定
隱藏維度768–2048視不同規模實驗調整
Hyena 層數 L12–32論文與開原始碼預設配置
卷積核寬度可擴充套件至序列全長(n)隱式引數化支援動態擴充套件
最佳化器AdamW論文訓練配置
關鍵硬體NVIDIA A100-80GB × 8論文訓練與基準測試環境
開原始碼許可Apache 2.0GitHub 倉庫 HazyResearch/safari

4.2 實際吞吐量指標(Stanford 2023 基準)

序列長度模型Batch Size吞吐量(Tokens/sec)
8KTransformer(同等引數量)1×1(基線)
8KHyena1約 ×2.1
16KTransformer1×1
16KHyena1約 ×2.7
32KTransformer1視訊記憶體溢位(OOM)
32KHyena1可正常執行

口徑:以上為 Stanford 2023 公開發布的相對吞吐量對比資料,非絕對數量值,具體 Tokens/sec 視硬體與運算元實現有所波動。

4.3 關鍵侷限

  • 大規模擴充套件驗證不足:1.3B 以上引數規模、百 B 級的訓練穩定性與收斂表現,公開資料未見系統報告。
  • 生態與工具鏈匱乏:Hugging Face Transformers、vLLM、TensorRT-LLM 等主流推論架構尚未對 Hyena 提供原生加速支援。
  • 混合精度訓練:FP16/BF16 下長卷積的數值穩定性仍待進一步驗證。

⏱ 5. 技術路線

5.1 純 Hyena 路線

由斯坦福 Hazy Research 主導,以原論文為藍圖,持續最佳化隱式卷積的生成演算法和門控機制,探索在 7B–13B 引數規模的下一階段驗證。

5.2 Hyena + Transformer 混合路線

將 Transformer 的部分自注意力層替換為 Hyena 塊,以保持短序列效能的同時降低長序列開銷。相關探索包括:

  • Hybrid-Hyena(概念階段):在底層保留區域性注意力,頂層替換為長卷積,以兼顧精度與效率。
  • 滑動視窗 + 長卷積:借鑑 Mistral 的滑動視窗思想進行混合設計。

5.3 SSM/Mamba 替代路線與 Hyena 的關係

Hyena 與狀態空間模型(SSM/Mamba)家族同屬“後 Transformer”技術方向,兩者存在交叉聯絡:

對比維度HyenaMamba(S6)
核心操作隱式長卷積選擇狀態空間模型
計算複雜度O(n log n)O(n)
引數化方式MLP 生成卷積核λ、B、C 等 SSM 矩陣直接引數化
目前主流關注度學術圈關注,產業跟進較慢學術與產業同步推進

國內在 Mamba/SSM 方向的跟進速度明顯快於 Hyena,清華、北大、上海 AI Lab 等已有 SSM 相關模型開源。

5.4 FlashAttention 與 Hyena 的競爭關聯

FlashAttention-2 的廣泛應用已將標準 Transformer 的長序列處理能力大幅提升。對 8K–16K 量級序列,最佳化後的 Transformer 在多數生產場景已達到可用水平,一定程度上壓低了產業界對 Hyena 等替代架構的遷移動力。


⏱ 6. 上游

6.1 核心算力層

環節相關產品/技術關聯說明
GPU/加速器NVIDIA A100/H100、AMD MI250X/300XFFT 和長卷積需高效能並行浮點算力
專用 FFT 加速庫cuFFT(NVIDIA)、FFTW(開源)、Intel MKLHyena 頻域加速極度依賴底層 FFT 庫最佳化
高頻寬視訊記憶體HBM2e/HBM3長序列場景對視訊記憶體頻寬要求高

6.2 架構與編譯層

環節技術棧說明
主流深度學習架構PyTorch論文實驗和開原始碼全基於 PyTorch
自定義運算元CUDA/C++ 擴充套件長卷積和門控組合需手寫 CUDA kernel 提升效率
編譯棧Triton(OpenAI)、JAX部分社群嘗試將 Hyena 運算元移植至 Triton/JAX

6.3 訓練平台

平台角色
學術雲端 GPU 叢集Stanford 使用 Lambda Labs 及自建 A100 叢集
商業雲端AWS p4d 例項系列、GCP A3 例項、Azure NDm A100 v4 系列
超算中心未公開見大規模 Hyena 模型依賴超算的報道

⏱ 7. 下游

7.1 潛在應用場景(全部處於研究驗證階段)

應用方向具體場景驗證狀態
長文本理解法律文件審閱、科研論文摘要、整本書分詞建模合成任務(LRA)驗證通過,真實場景公開資料未見
生命科學基因組序列(DNA/RNA)建模、蛋白質序列分析基因序列建模方向有初步探索,無公開產品
程式碼智慧超長程式碼倉庫級理解、跨檔案上下文搜尋Magic AI 等公司方向相近,但未明確採用 Hyena
音影片生成長音訊建模、高幀率影片預測學術概念探索,產業應用公開資料未見
金融時序超長高頻交易序列建模無公開驗證案例

7.2 規模化商業產品現狀

綜合評估:截至 2025 年初,直接使用 Hyena 架構的商業化產品公開資料未見。相關應用於論文的衍生專案(如結合 SSM 的 safari 庫)多數仍處於學術研究階段,未形成成熟的端側部署方案。


⏱ 8. 受益公司

8.1 直接受益

目前無明確僅依賴 Hyena 架構的上市公司或明確將 Hyena 作為主技術路線的商業實體。

8.2 間接受益

公司/實體關聯邏輯說明
NVIDIAGPU 推論硬體需求任何新架構的規模化訓練和推論均依賴於 GPU 採購
Together AI高效架構研究與平台服務核心團隊與 Hyena 作者有學術合作,重視高效長上下文推論
AI21 Labs長上下文模型探索推出 Jamba 等長序列模型,關注注意力替代技術方向
Magic AI超長程式碼上下文模型著重解決長程式碼序列建模,與 Hyena 技術目標重疊
Google DeepMind同賽道版面配置在 SSM/Mamba、H3 等亞二次架構領域進行顯著投入

8.3 中國關聯公司

  • 中國頭部大型模型廠商(百度、阿里、位元組、騰訊等)仍以最佳化後的 Transformer 為主路線,對 Hyena 的採用或跟進公開資料未見
  • 部分晶片廠商(如寒武紀、海光、壁仞等)在適配新運算元庫時可能會受益於長卷積類架構,但尚未見具體合作揭露。

⏱ 9. 市場規模

9.1 後 Transformer 架構相關市場(間接市場)

市場維度資料/預測年份與口徑
全球自然語言處理(NLP)市場約 240 億美元2023 年,MarketsandMarkets 口徑
NLP 市場預計規模約 1120 億美元2030 年預測,Grand View Research 口徑
全球生成式 AI 市場約 670 億美元2024 年,Bloomberg Intelligence 口徑
長上下文模型細分市場尚未形成獨立統計口徑多包含在基礎模型市場中

9.2 Hyena 直接市場規模

資料不可得:Hyena 作為一項架構創新,本身不直接構成獨立市場。其價值取決於該架構能否在特定場景中轉化為商業化產品。由於尚無量產級商業化案例,無法估算其直接對應的市場規模

9.3 關鍵驅動因素

  • 模型上下文視窗持續擴大的產業趨勢:Gemini 1.5 Pro(最高 1M Token)等產品對推論效率提出更高要求。
  • 端側與邊緣裝置部署需求:亞二次架構更為輕量,可能受益於 “AI 端側化” 趨勢。
  • 政策與資料合規:模型架構需適配《生成式人工智慧服務管理暫行辦法》等監管要求,雖不直接影響架構選擇,但會間接推高推論效率的需求優先順序。

⏱ 10. 玩家對比

10.1 核心競爭架構對比

架構提出方複雜度長序列優勢產業化程度
Transformer + FlashAttention各頭部廠商O(n²) 最佳化後有效降低中等極高(絕對主流)
HyenaStanfordO(n log n)極低(研究期)
Mamba/S6CMU & PrincetonO(n)很強低–中(快速上升)
RWKV獨立研究者彭博O(n)中等中(有落地案例)
RetNetMicrosoft ResearchO(n)低(學術探索)

10.2 競爭力優劣勢(Hyena 視角)

維度評價
長程依賴建模強項,Path-X 任務表現驗證
理論可擴充套件性中性,1.3B 以上規模驗證空白
生態與相容性明顯劣勢,未進入任何主流推論架構
易用性與社群劣勢,開源社群活躍度顯著低於 Mamba
混合架構潛力潛在優勢,與 Transformer 混合設計空間大

10.3 投資與關注度對比

架構主要投資/支援背景
Transformer 最佳化全行業持續投入
Mamba多輪種子輪融資,Cartesia AI
Hyena以學術基金支援為主,未見獨立商業融資

說明:Hyena 論文作者之一後續參與了 SSM/Mamba 方向的商業化專案,產業關注度亦主要由 SSM 路線吸納。


⏱ 11. 風險

11.1 技術風險

風險項詳細說明
規模化未經驗證當前公開最大實驗僅約 1.3B 引數,訓練 7B/13B 級別 Hyena 模型是否穩定收斂,公開資料未見
數值穩定性長卷積核在超長序列(>32K)下的頻域計算可能出現精度損失
動態場景適配自注意力天然支援動態位置編碼;長卷積如何處理動態變化的上下文仍有研究空白
推論軟體棧缺位無標準化的推論加速庫,實際部署效率可能遠低於理論計算

11.2 產業風險

風險項詳細說明
生態鎖定Transformer 生態成熟度極高(Hugging Face 生態、部署工具鏈、硬體適配),遷移成本巨大
競爭格局擁擠Mamba/SSM、RWKV、FlashAttention 等多種方案同步演進,Hyena 面臨被邊緣化風險
缺乏頭部廠商背書目前沒有 Meta、Google、OpenAI、Microsoft 等頭部 AI 公司公開採用或推廣 Hyena
資本預期偏差資本市場對“後 Transformer”賽道的追捧主要集中在 SSM 分支,Hyena 存在估值/關注度風險

11.3 合規風險

風險項詳細說明
資料合規長上下文場景很可能涉及更大量的非結構化敏感資料,需遵守《個人資訊保護法》和資料出境管理辦法
生成合規Hyena 作為底層架構的生成模型,其輸出仍需滿足《生成式人工智慧服務管理暫行辦法》關於內容安全的相關條款

⏱ 12. 誤讀糾偏

常見誤讀實際情況
❌ “Hyena 可以完全替代 Transformer”✅ Hyena 在常規短序列上未有明顯優勢,且生態欠缺;業界共識為“互補”,非“替代”
❌ “Hyena 已經可以商用部署”✅ 到 2025 年初仍處於學術研究階段,沒有已知的商業級部署案例
❌ “Hyena 與 Mamba 是相同技術”✅ 兩者同屬後 Transformer 賽道,但數學基礎不同:Hyena 是卷積+門控,Mamba 是選擇性狀態空間模型
❌ “Hyena 在長序列上全方位優於 Transformer”✅ 在 WikiText-103 等同引數量測試中,Hyena 困惑度約 17.5,與 Transformer 的 17.2 略有差距(Stanford 2023),並非全面碾壓
❌ “直接修改 HuggingFace 模型即可使用 Hyena”✅ 需專門實現隱式卷積和頻域運算,運算元尚未標準化,社群外掛不成熟

⏱ 13. 最新事件

13.1 時間線(2023–2025)

時間事件說明
2023.03Hyena 論文首次釋出釋出於 arXiv,提出亞二次替代架構
2023.10safari 開源庫釋出斯坦福 Hazy Research 將 Hyena/H3 等模型程式碼在 GitHub 上開源
2023.12Mamba 論文釋出Mamba 架構(選擇性 SSM)同期引發關注,部分分流 Hyena 熱度
2024.02Gemini 1.5 Pro 釋出Google 宣佈百萬 Token 上下文,強化長上下文推論效率競爭
2024.06FlashAttention-3 釋出進一步壓縮 Transformer 長序列成本,對替代架構形成最佳化競爭
2025.01大規模 Hyena 模型未見更新自 2023 年至今,未公開出現 1.3B 以上 Hyena 模型的顯著實驗結果

13.2 近期關注點

  • 是否有 7B+ 引數規模 Hyena 或混合模型出現(截至 2025 年初公開資料未見)。
  • Hazy Research 是否會將 Hyena 與 Mamba/SSM 合併為一個統一架構(相關討論存在於學術論壇,但尚未有正式釋出)。
  • 國內是否有機構系統性復現 Hyena(清華、北大等暫無明確公開專案)。

⏱ 14. 追蹤指標

14.1 核心指標

指標檢視方式意義
新發布論文或被引數Google Scholar/arXiv判斷學術活躍度和方向認可度
GitHub safari 倉庫 commits/StarsGitHub Insights觀測社群參與度與維護力度
7B+ 引數模型釋出arXiv、Hugging Face規模化驗證的關鍵訊號
與 HuggingFace / vLLM 等架構整合PyPI、GitHub Issues產業可用性標誌
大型 AI 公司引用或採用宣告技術部落格、財報電話會、開發者大會“頭部背書”訊號

14.2 間接指標

指標說明
Mamba/SSM 商業融資輪次同賽道資本的流向反映“後 Transformer”賽道的整體溫度
FlashAttention 版本迭代直接影響 Hyena 相對於最佳化後 Transformer 的優勢空間
長上下文模型基準(如 LongBench、LRA)新成績追蹤 Hyena 及其變體的實際效能進展

⏱ 15. 信源

信源說明
Poli et al., Hyena Hierarchy: Towards Larger Convolutional Language Models, arXiv:2302.10866, 2023Hyena 原論文,技術資料和基準實驗的核心來源
HazyResearch/safari, GitHub, Apache 2.0開源實現,包含 H3、Hyena 及相關混合架構程式碼
Stanford Hazy Research 官方網站及專案日誌團隊動向與最新研究進展
NVIDIA cuFFT 文件與白皮書底層 FFT 運算元實現與效能最佳化指南
MarketsandMarkets, Grand View ResearchNLP 與生成式 AI 市場預測資料(間接市場)
中國《生成式人工智慧服務管理暫行辦法》(2023)合規參考

說明:以上所有財務、市場、份額、產能資料均已標註年份、口徑與來源。未找到對應資料處,統一標註為“公開資料未見”。

最後更新:2025 年 Q1

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型