Hyena Hierarchy
⏱ 1. 3 秒看懂
Hyena 是 2023 年由斯坦福大學 Hazy Research 實驗室提出的一種亞二次時間複雜度的序列建模架構。它用隱式長卷積(Implicit Long Convolution)和逐元素門控(Element-wise Gating) 替代了 Transformer 中的自注意力機制,旨在解決超長序列(如 8K Token 以上)場景下推論成本過高的問題,是“後 Transformer 時代”探索高效率架構的關鍵方向之一。
⏱ 2. 3 分鐘產業解釋
2.1 核心定位
| 維度 | 說明 |
|---|
| 關鍵論文 | Hyena Hierarchy: Towards Larger Convolutional Language Models(2023年3月,Stanford Hazy Research) |
| 核心團隊 | Michael Poli, Stefano Massaroli, Eric Nguyen 等 |
| 產業痛點 | Transformer 自注意力的 O(n²) 計算複雜度導致長上下文推論時視訊記憶體佔用過高、延遲過大 |
| 技術路徑 | 長卷積 + 元素級乘法門控,將複雜度降至 O(n log n),實現計算量與序列長度的亞二次增長關係 |
2.2 一句話原理
Hyena 通過在頻域中利用快速傅立葉變換(FFT)加速長卷積運算,並堆疊交替的門控與卷積層來捕捉序列的長程依賴。在 8K Token 以上的長序列基難測試中,其吞吐量可達同等引數規模 Transformer 的 2–3 倍(Stanford 2023 年論文 A100 基準測試資料)。
Transformer: 輸入 → 多頭自注意力(QKV)→ 前饋網路 → 輸出
Hyena: 輸入 → 長卷積層 → 門控 → 長卷積層 → … → 輸出
兩者不屬於“替代”關係,而屬“互補”關係。Hyena 更適用於超長上下文、低延遲推論、高吞吐量場景;Transformer 在成熟生態和常規長度任務上仍具優勢。當前產業共識是將其視為“後 Transformer”技術池中的一個並行選項,而非唯一繼任者。
⏱ 3. 技術原理
3.1 Hyena 運算元組合結構
Hyena 的核心運算單元由長卷積與逐元素乘法門控交替堆疊構成,其對序列的處理流程如下:
輸入序列 u(t)
│
▼
[長卷積層 H₁] ← 使用 FFT 在頻域加速,複雜度 O(n log n)
│
▼
[門控單元 v(t)] ← u(t) 與一個門控訊號 g(t) 逐元素相乘
│
▼
[長卷積層 H₂]
│
▼
[重複 Hyena Block L 次]
│
▼
輸出序列 y(t)
每一層 Hyena Block 可以理解為“長程資訊提取 + 非線性過濾”的組合疊加。
3.2 關鍵技術創新
| 技術點 | 詳細說明 |
|---|
| 隱式長卷積核 | 不顯式儲存 n×n 的卷積矩陣,而是通過一個引數規模小得多的 MLP 網路來生成卷積核,視訊記憶體佔用由 O(n²) 降到 O(n) |
| FFT 頻域加速 | 將空間域的長卷積轉化為頻域的點乘操作,使單步計算複雜度由 O(n²) 降至 O(n log n) |
| 門控機制 | 借鑑 H3(Hungry Hungry Hippos)架構思路,利用逐元素乘法門控增強模型的非線性建模能力 |
| 多頭分解 | 類似於 Transformer 的多頭注意力,Hyena 將卷積核分解為多個獨立“頭”並行運算,提升模型容量 |
3.3 理論複雜度對比
| 架構型別 | 計算複雜度 | 視訊記憶體佔用(忽略 Embedding) |
|---|
| 標準 Transformer | O(n²) | O(n²) |
| 稀疏/近似注意力 | O(n × k) 或 O(n log n) | O(n) 至 O(n × k) |
| Hyena(長卷積) | O(n log n) | O(n) |
口徑:本表複雜度為單層前向傳播的理論複雜度,“n”為序列長度,“k”為稀疏注意力視窗大小。實際執行開銷會受底層運算元最佳化和硬體適配影響。
3.4 長程依賴能力驗證
在 Stanford 實驗中,Hyena 在超長序列合成任務 “Path-X”(序列長度 16,384 Token)上取得 90.4% 的準確率,同等規模的 Transformer 模型完全無法訓練(梯度消失/記憶體溢位)。該結果表明 Hyena 的架構偏置更適合捕捉極長序列中的稀疏依賴訊號。
⏱ 4. 關鍵引數
4.1 論文核心實驗引數
| 引數項 | 數值/配置 | 來源說明 |
|---|
| 最大公開實驗引數量 | 約 1.3B(13 億引數) | Stanford 2023 論文最大規模實驗 |
| 序列長度基準測試區段 | 2K – 64K Token | 論文長序列表實驗設定 |
| 隱藏維度 | 768–2048 | 視不同規模實驗調整 |
| Hyena 層數 L | 12–32 | 論文與開原始碼預設配置 |
| 卷積核寬度 | 可擴充套件至序列全長(n) | 隱式引數化支援動態擴充套件 |
| 最佳化器 | AdamW | 論文訓練配置 |
| 關鍵硬體 | NVIDIA A100-80GB × 8 | 論文訓練與基準測試環境 |
| 開原始碼許可 | Apache 2.0 | GitHub 倉庫 HazyResearch/safari |
4.2 實際吞吐量指標(Stanford 2023 基準)
| 序列長度 | 模型 | Batch Size | 吞吐量(Tokens/sec) |
|---|
| 8K | Transformer(同等引數量) | 1 | ×1(基線) |
| 8K | Hyena | 1 | 約 ×2.1 |
| 16K | Transformer | 1 | ×1 |
| 16K | Hyena | 1 | 約 ×2.7 |
| 32K | Transformer | 1 | 視訊記憶體溢位(OOM) |
| 32K | Hyena | 1 | 可正常執行 |
口徑:以上為 Stanford 2023 公開發布的相對吞吐量對比資料,非絕對數量值,具體 Tokens/sec 視硬體與運算元實現有所波動。
4.3 關鍵侷限
- 大規模擴充套件驗證不足:1.3B 以上引數規模、百 B 級的訓練穩定性與收斂表現,公開資料未見系統報告。
- 生態與工具鏈匱乏:Hugging Face Transformers、vLLM、TensorRT-LLM 等主流推論架構尚未對 Hyena 提供原生加速支援。
- 混合精度訓練:FP16/BF16 下長卷積的數值穩定性仍待進一步驗證。
⏱ 5. 技術路線
5.1 純 Hyena 路線
由斯坦福 Hazy Research 主導,以原論文為藍圖,持續最佳化隱式卷積的生成演算法和門控機制,探索在 7B–13B 引數規模的下一階段驗證。
將 Transformer 的部分自注意力層替換為 Hyena 塊,以保持短序列效能的同時降低長序列開銷。相關探索包括:
- Hybrid-Hyena(概念階段):在底層保留區域性注意力,頂層替換為長卷積,以兼顧精度與效率。
- 滑動視窗 + 長卷積:借鑑 Mistral 的滑動視窗思想進行混合設計。
5.3 SSM/Mamba 替代路線與 Hyena 的關係
Hyena 與狀態空間模型(SSM/Mamba)家族同屬“後 Transformer”技術方向,兩者存在交叉聯絡:
| 對比維度 | Hyena | Mamba(S6) |
|---|
| 核心操作 | 隱式長卷積 | 選擇狀態空間模型 |
| 計算複雜度 | O(n log n) | O(n) |
| 引數化方式 | MLP 生成卷積核 | λ、B、C 等 SSM 矩陣直接引數化 |
| 目前主流關注度 | 學術圈關注,產業跟進較慢 | 學術與產業同步推進 |
國內在 Mamba/SSM 方向的跟進速度明顯快於 Hyena,清華、北大、上海 AI Lab 等已有 SSM 相關模型開源。
5.4 FlashAttention 與 Hyena 的競爭關聯
FlashAttention-2 的廣泛應用已將標準 Transformer 的長序列處理能力大幅提升。對 8K–16K 量級序列,最佳化後的 Transformer 在多數生產場景已達到可用水平,一定程度上壓低了產業界對 Hyena 等替代架構的遷移動力。
⏱ 6. 上游
6.1 核心算力層
| 環節 | 相關產品/技術 | 關聯說明 |
|---|
| GPU/加速器 | NVIDIA A100/H100、AMD MI250X/300X | FFT 和長卷積需高效能並行浮點算力 |
| 專用 FFT 加速庫 | cuFFT(NVIDIA)、FFTW(開源)、Intel MKL | Hyena 頻域加速極度依賴底層 FFT 庫最佳化 |
| 高頻寬視訊記憶體 | HBM2e/HBM3 | 長序列場景對視訊記憶體頻寬要求高 |
6.2 架構與編譯層
| 環節 | 技術棧 | 說明 |
|---|
| 主流深度學習架構 | PyTorch | 論文實驗和開原始碼全基於 PyTorch |
| 自定義運算元 | CUDA/C++ 擴充套件 | 長卷積和門控組合需手寫 CUDA kernel 提升效率 |
| 編譯棧 | Triton(OpenAI)、JAX | 部分社群嘗試將 Hyena 運算元移植至 Triton/JAX |
6.3 訓練平台
| 平台 | 角色 |
|---|
| 學術雲端 GPU 叢集 | Stanford 使用 Lambda Labs 及自建 A100 叢集 |
| 商業雲端 | AWS p4d 例項系列、GCP A3 例項、Azure NDm A100 v4 系列 |
| 超算中心 | 未公開見大規模 Hyena 模型依賴超算的報道 |
⏱ 7. 下游
7.1 潛在應用場景(全部處於研究驗證階段)
| 應用方向 | 具體場景 | 驗證狀態 |
|---|
| 長文本理解 | 法律文件審閱、科研論文摘要、整本書分詞建模 | 合成任務(LRA)驗證通過,真實場景公開資料未見 |
| 生命科學 | 基因組序列(DNA/RNA)建模、蛋白質序列分析 | 基因序列建模方向有初步探索,無公開產品 |
| 程式碼智慧 | 超長程式碼倉庫級理解、跨檔案上下文搜尋 | Magic AI 等公司方向相近,但未明確採用 Hyena |
| 音影片生成 | 長音訊建模、高幀率影片預測 | 學術概念探索,產業應用公開資料未見 |
| 金融時序 | 超長高頻交易序列建模 | 無公開驗證案例 |
7.2 規模化商業產品現狀
綜合評估:截至 2025 年初,直接使用 Hyena 架構的商業化產品公開資料未見。相關應用於論文的衍生專案(如結合 SSM 的 safari 庫)多數仍處於學術研究階段,未形成成熟的端側部署方案。
⏱ 8. 受益公司
8.1 直接受益
目前無明確僅依賴 Hyena 架構的上市公司或明確將 Hyena 作為主技術路線的商業實體。
8.2 間接受益
| 公司/實體 | 關聯邏輯 | 說明 |
|---|
| NVIDIA | GPU 推論硬體需求 | 任何新架構的規模化訓練和推論均依賴於 GPU 採購 |
| Together AI | 高效架構研究與平台服務 | 核心團隊與 Hyena 作者有學術合作,重視高效長上下文推論 |
| AI21 Labs | 長上下文模型探索 | 推出 Jamba 等長序列模型,關注注意力替代技術方向 |
| Magic AI | 超長程式碼上下文模型 | 著重解決長程式碼序列建模,與 Hyena 技術目標重疊 |
| Google DeepMind | 同賽道版面配置 | 在 SSM/Mamba、H3 等亞二次架構領域進行顯著投入 |
8.3 中國關聯公司
- 中國頭部大型模型廠商(百度、阿里、位元組、騰訊等)仍以最佳化後的 Transformer 為主路線,對 Hyena 的採用或跟進公開資料未見。
- 部分晶片廠商(如寒武紀、海光、壁仞等)在適配新運算元庫時可能會受益於長卷積類架構,但尚未見具體合作揭露。
⏱ 9. 市場規模
| 市場維度 | 資料/預測 | 年份與口徑 |
|---|
| 全球自然語言處理(NLP)市場 | 約 240 億美元 | 2023 年,MarketsandMarkets 口徑 |
| NLP 市場預計規模 | 約 1120 億美元 | 2030 年預測,Grand View Research 口徑 |
| 全球生成式 AI 市場 | 約 670 億美元 | 2024 年,Bloomberg Intelligence 口徑 |
| 長上下文模型細分市場 | 尚未形成獨立統計口徑 | 多包含在基礎模型市場中 |
9.2 Hyena 直接市場規模
資料不可得:Hyena 作為一項架構創新,本身不直接構成獨立市場。其價值取決於該架構能否在特定場景中轉化為商業化產品。由於尚無量產級商業化案例,無法估算其直接對應的市場規模。
9.3 關鍵驅動因素
- 模型上下文視窗持續擴大的產業趨勢:Gemini 1.5 Pro(最高 1M Token)等產品對推論效率提出更高要求。
- 端側與邊緣裝置部署需求:亞二次架構更為輕量,可能受益於 “AI 端側化” 趨勢。
- 政策與資料合規:模型架構需適配《生成式人工智慧服務管理暫行辦法》等監管要求,雖不直接影響架構選擇,但會間接推高推論效率的需求優先順序。
⏱ 10. 玩家對比
10.1 核心競爭架構對比
| 架構 | 提出方 | 複雜度 | 長序列優勢 | 產業化程度 |
|---|
| Transformer + FlashAttention | 各頭部廠商 | O(n²) 最佳化後有效降低 | 中等 | 極高(絕對主流) |
| Hyena | Stanford | O(n log n) | 強 | 極低(研究期) |
| Mamba/S6 | CMU & Princeton | O(n) | 很強 | 低–中(快速上升) |
| RWKV | 獨立研究者彭博 | O(n) | 中等 | 中(有落地案例) |
| RetNet | Microsoft Research | O(n) | 強 | 低(學術探索) |
10.2 競爭力優劣勢(Hyena 視角)
| 維度 | 評價 |
|---|
| 長程依賴建模 | 強項,Path-X 任務表現驗證 |
| 理論可擴充套件性 | 中性,1.3B 以上規模驗證空白 |
| 生態與相容性 | 明顯劣勢,未進入任何主流推論架構 |
| 易用性與社群 | 劣勢,開源社群活躍度顯著低於 Mamba |
| 混合架構潛力 | 潛在優勢,與 Transformer 混合設計空間大 |
10.3 投資與關注度對比
| 架構 | 主要投資/支援背景 |
|---|
| Transformer 最佳化 | 全行業持續投入 |
| Mamba | 多輪種子輪融資,Cartesia AI |
| Hyena | 以學術基金支援為主,未見獨立商業融資 |
說明:Hyena 論文作者之一後續參與了 SSM/Mamba 方向的商業化專案,產業關注度亦主要由 SSM 路線吸納。
⏱ 11. 風險
11.1 技術風險
| 風險項 | 詳細說明 |
|---|
| 規模化未經驗證 | 當前公開最大實驗僅約 1.3B 引數,訓練 7B/13B 級別 Hyena 模型是否穩定收斂,公開資料未見 |
| 數值穩定性 | 長卷積核在超長序列(>32K)下的頻域計算可能出現精度損失 |
| 動態場景適配 | 自注意力天然支援動態位置編碼;長卷積如何處理動態變化的上下文仍有研究空白 |
| 推論軟體棧缺位 | 無標準化的推論加速庫,實際部署效率可能遠低於理論計算 |
11.2 產業風險
| 風險項 | 詳細說明 |
|---|
| 生態鎖定 | Transformer 生態成熟度極高(Hugging Face 生態、部署工具鏈、硬體適配),遷移成本巨大 |
| 競爭格局擁擠 | Mamba/SSM、RWKV、FlashAttention 等多種方案同步演進,Hyena 面臨被邊緣化風險 |
| 缺乏頭部廠商背書 | 目前沒有 Meta、Google、OpenAI、Microsoft 等頭部 AI 公司公開採用或推廣 Hyena |
| 資本預期偏差 | 資本市場對“後 Transformer”賽道的追捧主要集中在 SSM 分支,Hyena 存在估值/關注度風險 |
11.3 合規風險
| 風險項 | 詳細說明 |
|---|
| 資料合規 | 長上下文場景很可能涉及更大量的非結構化敏感資料,需遵守《個人資訊保護法》和資料出境管理辦法 |
| 生成合規 | Hyena 作為底層架構的生成模型,其輸出仍需滿足《生成式人工智慧服務管理暫行辦法》關於內容安全的相關條款 |
⏱ 12. 誤讀糾偏
| 常見誤讀 | 實際情況 |
|---|
| ❌ “Hyena 可以完全替代 Transformer” | ✅ Hyena 在常規短序列上未有明顯優勢,且生態欠缺;業界共識為“互補”,非“替代” |
| ❌ “Hyena 已經可以商用部署” | ✅ 到 2025 年初仍處於學術研究階段,沒有已知的商業級部署案例 |
| ❌ “Hyena 與 Mamba 是相同技術” | ✅ 兩者同屬後 Transformer 賽道,但數學基礎不同:Hyena 是卷積+門控,Mamba 是選擇性狀態空間模型 |
| ❌ “Hyena 在長序列上全方位優於 Transformer” | ✅ 在 WikiText-103 等同引數量測試中,Hyena 困惑度約 17.5,與 Transformer 的 17.2 略有差距(Stanford 2023),並非全面碾壓 |
| ❌ “直接修改 HuggingFace 模型即可使用 Hyena” | ✅ 需專門實現隱式卷積和頻域運算,運算元尚未標準化,社群外掛不成熟 |
⏱ 13. 最新事件
13.1 時間線(2023–2025)
| 時間 | 事件 | 說明 |
|---|
| 2023.03 | Hyena 論文首次釋出 | 釋出於 arXiv,提出亞二次替代架構 |
| 2023.10 | safari 開源庫釋出 | 斯坦福 Hazy Research 將 Hyena/H3 等模型程式碼在 GitHub 上開源 |
| 2023.12 | Mamba 論文釋出 | Mamba 架構(選擇性 SSM)同期引發關注,部分分流 Hyena 熱度 |
| 2024.02 | Gemini 1.5 Pro 釋出 | Google 宣佈百萬 Token 上下文,強化長上下文推論效率競爭 |
| 2024.06 | FlashAttention-3 釋出 | 進一步壓縮 Transformer 長序列成本,對替代架構形成最佳化競爭 |
| 2025.01 | 大規模 Hyena 模型未見更新 | 自 2023 年至今,未公開出現 1.3B 以上 Hyena 模型的顯著實驗結果 |
13.2 近期關注點
- 是否有 7B+ 引數規模 Hyena 或混合模型出現(截至 2025 年初公開資料未見)。
- Hazy Research 是否會將 Hyena 與 Mamba/SSM 合併為一個統一架構(相關討論存在於學術論壇,但尚未有正式釋出)。
- 國內是否有機構系統性復現 Hyena(清華、北大等暫無明確公開專案)。
⏱ 14. 追蹤指標
14.1 核心指標
| 指標 | 檢視方式 | 意義 |
|---|
| 新發布論文或被引數 | Google Scholar/arXiv | 判斷學術活躍度和方向認可度 |
GitHub safari 倉庫 commits/Stars | GitHub Insights | 觀測社群參與度與維護力度 |
| 7B+ 引數模型釋出 | arXiv、Hugging Face | 規模化驗證的關鍵訊號 |
| 與 HuggingFace / vLLM 等架構整合 | PyPI、GitHub Issues | 產業可用性標誌 |
| 大型 AI 公司引用或採用宣告 | 技術部落格、財報電話會、開發者大會 | “頭部背書”訊號 |
14.2 間接指標
| 指標 | 說明 |
|---|
| Mamba/SSM 商業融資輪次 | 同賽道資本的流向反映“後 Transformer”賽道的整體溫度 |
| FlashAttention 版本迭代 | 直接影響 Hyena 相對於最佳化後 Transformer 的優勢空間 |
| 長上下文模型基準(如 LongBench、LRA)新成績 | 追蹤 Hyena 及其變體的實際效能進展 |
⏱ 15. 信源
| 信源 | 說明 |
|---|
| Poli et al., Hyena Hierarchy: Towards Larger Convolutional Language Models, arXiv:2302.10866, 2023 | Hyena 原論文,技術資料和基準實驗的核心來源 |
| HazyResearch/safari, GitHub, Apache 2.0 | 開源實現,包含 H3、Hyena 及相關混合架構程式碼 |
| Stanford Hazy Research 官方網站及專案日誌 | 團隊動向與最新研究進展 |
| NVIDIA cuFFT 文件與白皮書 | 底層 FFT 運算元實現與效能最佳化指南 |
| MarketsandMarkets, Grand View Research | NLP 與生成式 AI 市場預測資料(間接市場) |
| 中國《生成式人工智慧服務管理暫行辦法》(2023) | 合規參考 |
說明:以上所有財務、市場、份額、產能資料均已標註年份、口徑與來源。未找到對應資料處,統一標註為“公開資料未見”。
最後更新:2025 年 Q1