概念库 开放阅读

Hyena Hierarchy

概念库 · 开放阅读

概念 ID
hyena-hierarchy
更新时间
2026-06-03
来源数量
1

Hyena Hierarchy

⏱ 1. 3 秒看懂

Hyena 是 2023 年由斯坦福大学 Hazy Research 实验室提出的一种亚二次时间复杂度的序列建模架构。它用隐式长卷积(Implicit Long Convolution)和逐元素门控(Element-wise Gating) 替代了 Transformer 中的自注意力机制,旨在解决超长序列(如 8K Token 以上)场景下推理成本过高的问题,是“后 Transformer 时代”探索高效率架构的关键方向之一。

⏱ 2. 3 分钟产业解释

2.1 核心定位

维度说明
关键论文Hyena Hierarchy: Towards Larger Convolutional Language Models(2023年3月,Stanford Hazy Research)
核心团队Michael Poli, Stefano Massaroli, Eric Nguyen 等
产业痛点Transformer 自注意力的 O(n²) 计算复杂度导致长上下文推理时显存占用过高、延迟过大
技术路径长卷积 + 元素级乘法门控,将复杂度降至 O(n log n),实现计算量与序列长度的亚二次增长关系

2.2 一句话原理

Hyena 通过在频域中利用快速傅里叶变换(FFT)加速长卷积运算,并堆叠交替的门控与卷积层来捕捉序列的长程依赖。在 8K Token 以上的长序列基难测试中,其吞吐量可达同等参数规模 Transformer 的 2–3 倍(Stanford 2023 年论文 A100 基准测试数据)。

2.3 与 Transformer 的架构关系

Transformer:  输入 → 多头自注意力(QKV)→ 前馈网络 → 输出
Hyena:        输入 → 长卷积层 → 门控 → 长卷积层 → … → 输出

两者不属于“替代”关系,而属“互补”关系。Hyena 更适用于超长上下文、低延迟推理、高吞吐量场景;Transformer 在成熟生态和常规长度任务上仍具优势。当前产业共识是将其视为“后 Transformer”技术池中的一个并行选项,而非唯一继任者。

⏱ 3. 技术原理

3.1 Hyena 算子组合结构

Hyena 的核心运算单元由长卷积与逐元素乘法门控交替堆叠构成,其对序列的处理流程如下:

输入序列 u(t)
    │
    ▼
[长卷积层 H₁]     ← 使用 FFT 在频域加速,复杂度 O(n log n)
    │
    ▼
[门控单元 v(t)]  ← u(t) 与一个门控信号 g(t) 逐元素相乘
    │
    ▼
[长卷积层 H₂]
    │
    ▼
[重复 Hyena Block L 次]
    │
    ▼
输出序列 y(t)

每一层 Hyena Block 可以理解为“长程信息提取 + 非线性过滤”的组合叠加。

3.2 关键技术创新

技术点详细说明
隐式长卷积核不显式存储 n×n 的卷积矩阵,而是通过一个参数规模小得多的 MLP 网络来生成卷积核,显存占用由 O(n²) 降到 O(n)
FFT 频域加速将空间域的长卷积转化为频域的点乘操作,使单步计算复杂度由 O(n²) 降至 O(n log n)
门控机制借鉴 H3(Hungry Hungry Hippos)架构思路,利用逐元素乘法门控增强模型的非线性建模能力
多头分解类似于 Transformer 的多头注意力,Hyena 将卷积核分解为多个独立“头”并行运算,提升模型容量

3.3 理论复杂度对比

架构类型计算复杂度显存占用(忽略 Embedding)
标准 TransformerO(n²)O(n²)
稀疏/近似注意力O(n × k) 或 O(n log n)O(n) 至 O(n × k)
Hyena(长卷积)O(n log n)O(n)

口径:本表复杂度为单层前向传播的理论复杂度,“n”为序列长度,“k”为稀疏注意力窗口大小。实际运行开销会受底层算子优化和硬件适配影响。

3.4 长程依赖能力验证

在 Stanford 实验中,Hyena 在超长序列合成任务 “Path-X”(序列长度 16,384 Token)上取得 90.4% 的准确率,同等规模的 Transformer 模型完全无法训练(梯度消失/内存溢出)。该结果表明 Hyena 的架构偏置更适合捕捉极长序列中的稀疏依赖信号。


⏱ 4. 关键参数

4.1 论文核心实验参数

参数项数值/配置来源说明
最大公开实验参数量约 1.3B(13 亿参数)Stanford 2023 论文最大规模实验
序列长度基准测试区段2K – 64K Token论文长序列表实验设定
隐藏维度768–2048视不同规模实验调整
Hyena 层数 L12–32论文与开源代码默认配置
卷积核宽度可扩展至序列全长(n)隐式参数化支持动态扩展
优化器AdamW论文训练配置
关键硬件NVIDIA A100-80GB × 8论文训练与基准测试环境
开源代码许可Apache 2.0GitHub 仓库 HazyResearch/safari

4.2 实际吞吐量指标(Stanford 2023 基准)

序列长度模型Batch Size吞吐量(Tokens/sec)
8KTransformer(同等参数量)1×1(基线)
8KHyena1约 ×2.1
16KTransformer1×1
16KHyena1约 ×2.7
32KTransformer1显存溢出(OOM)
32KHyena1可正常运行

口径:以上为 Stanford 2023 公开发布的相对吞吐量对比数据,非绝对数量值,具体 Tokens/sec 视硬件与算子实现有所波动。

4.3 关键局限

  • 大规模扩展验证不足:1.3B 以上参数规模、百 B 级的训练稳定性与收敛表现,公开资料未见系统报告。
  • 生态与工具链匮乏:Hugging Face Transformers、vLLM、TensorRT-LLM 等主流推理框架尚未对 Hyena 提供原生加速支持。
  • 混合精度训练:FP16/BF16 下长卷积的数值稳定性仍待进一步验证。

⏱ 5. 技术路线

5.1 纯 Hyena 路线

由斯坦福 Hazy Research 主导,以原论文为蓝图,持续优化隐式卷积的生成算法和门控机制,探索在 7B–13B 参数规模的下一阶段验证。

5.2 Hyena + Transformer 混合路线

将 Transformer 的部分自注意力层替换为 Hyena 块,以保持短序列性能的同时降低长序列开销。相关探索包括:

  • Hybrid-Hyena(概念阶段):在底层保留局部注意力,顶层替换为长卷积,以兼顾精度与效率。
  • 滑动窗口 + 长卷积:借鉴 Mistral 的滑动窗口思想进行混合设计。

5.3 SSM/Mamba 替代路线与 Hyena 的关系

Hyena 与状态空间模型(SSM/Mamba)家族同属“后 Transformer”技术方向,两者存在交叉联系:

对比维度HyenaMamba(S6)
核心操作隐式长卷积选择状态空间模型
计算复杂度O(n log n)O(n)
参数化方式MLP 生成卷积核λ、B、C 等 SSM 矩阵直接参数化
目前主流关注度学术圈关注,产业跟进较慢学术与产业同步推进

国内在 Mamba/SSM 方向的跟进速度明显快于 Hyena,清华、北大、上海 AI Lab 等已有 SSM 相关模型开源。

5.4 FlashAttention 与 Hyena 的竞争关联

FlashAttention-2 的广泛应用已将标准 Transformer 的长序列处理能力大幅提升。对 8K–16K 量级序列,优化后的 Transformer 在多数生产场景已达到可用水平,一定程度上压低了产业界对 Hyena 等替代架构的迁移动力。


⏱ 6. 上游

6.1 核心算力层

环节相关产品/技术关联说明
GPU/加速器NVIDIA A100/H100、AMD MI250X/300XFFT 和长卷积需高性能并行浮点算力
专用 FFT 加速库cuFFT(NVIDIA)、FFTW(开源)、Intel MKLHyena 频域加速极度依赖底层 FFT 库优化
高带宽显存HBM2e/HBM3长序列场景对显存带宽要求高

6.2 框架与编译层

环节技术栈说明
主流深度学习框架PyTorch论文实验和开源代码全基于 PyTorch
自定义算子CUDA/C++ 扩展长卷积和门控组合需手写 CUDA kernel 提升效率
编译栈Triton(OpenAI)、JAX部分社区尝试将 Hyena 算子移植至 Triton/JAX

6.3 训练平台

平台角色
学术云 GPU 集群Stanford 使用 Lambda Labs 及自建 A100 集群
商业云AWS p4d 实例系列、GCP A3 实例、Azure NDm A100 v4 系列
超算中心未公开见大规模 Hyena 模型依赖超算的报道

⏱ 7. 下游

7.1 潜在应用场景(全部处于研究验证阶段)

应用方向具体场景验证状态
长文本理解法律文档审阅、科研论文摘要、整本书分词建模合成任务(LRA)验证通过,真实场景公开资料未见
生命科学基因组序列(DNA/RNA)建模、蛋白质序列分析基因序列建模方向有初步探索,无公开产品
代码智能超长代码仓库级理解、跨文件上下文搜索Magic AI 等公司方向相近,但未明确采用 Hyena
音视频生成长音频建模、高帧率视频预测学术概念探索,产业应用公开资料未见
金融时序超长高频交易序列建模无公开验证案例

7.2 规模化商业产品现状

综合评估:截至 2025 年初,直接使用 Hyena 架构的商业化产品公开资料未见。相关应用于论文的衍生项目(如结合 SSM 的 safari 库)多数仍处于学术研究阶段,未形成成熟的端侧部署方案。


⏱ 8. 受益公司

8.1 直接受益

目前无明确仅依赖 Hyena 架构的上市公司或明确将 Hyena 作为主技术路线的商业实体。

8.2 间接受益

公司/实体关联逻辑说明
NVIDIAGPU 推理硬件需求任何新架构的规模化训练和推理均依赖于 GPU 采购
Together AI高效架构研究与平台服务核心团队与 Hyena 作者有学术合作,重视高效长上下文推理
AI21 Labs长上下文模型探索推出 Jamba 等长序列模型,关注注意力替代技术方向
Magic AI超长代码上下文模型着重解决长代码序列建模,与 Hyena 技术目标重叠
Google DeepMind同赛道布局在 SSM/Mamba、H3 等亚二次架构领域进行显著投入

8.3 中国关联公司

  • 中国头部大模型厂商(百度、阿里、字节、腾讯等)仍以优化后的 Transformer 为主路线,对 Hyena 的采用或跟进公开资料未见
  • 部分芯片厂商(如寒武纪、海光、壁仞等)在适配新算子库时可能会受益于长卷积类架构,但尚未见具体合作披露。

⏱ 9. 市场规模

9.1 后 Transformer 架构相关市场(间接市场)

市场维度数据/预测年份与口径
全球自然语言处理(NLP)市场约 240 亿美元2023 年,MarketsandMarkets 口径
NLP 市场预计规模约 1120 亿美元2030 年预测,Grand View Research 口径
全球生成式 AI 市场约 670 亿美元2024 年,Bloomberg Intelligence 口径
长上下文模型细分市场尚未形成独立统计口径多包含在基础模型市场中

9.2 Hyena 直接市场规模

数据不可得:Hyena 作为一项架构创新,本身不直接构成独立市场。其价值取决于该架构能否在特定场景中转化为商业化产品。由于尚无量产级商业化案例,无法估算其直接对应的市场规模

9.3 关键驱动因素

  • 模型上下文窗口持续扩大的产业趋势:Gemini 1.5 Pro(最高 1M Token)等产品对推理效率提出更高要求。
  • 端侧与边缘设备部署需求:亚二次架构更为轻量,可能受益于 “AI 端侧化” 趋势。
  • 政策与数据合规:模型架构需适配《生成式人工智能服务管理暂行办法》等监管要求,虽不直接影响架构选择,但会间接推高推理效率的需求优先级。

⏱ 10. 玩家对比

10.1 核心竞争架构对比

架构提出方复杂度长序列优势产业化程度
Transformer + FlashAttention各头部厂商O(n²) 优化后有效降低中等极高(绝对主流)
HyenaStanfordO(n log n)极低(研究期)
Mamba/S6CMU & PrincetonO(n)很强低–中(快速上升)
RWKV独立研究者彭博O(n)中等中(有落地案例)
RetNetMicrosoft ResearchO(n)低(学术探索)

10.2 竞争力优劣势(Hyena 视角)

维度评价
长程依赖建模强项,Path-X 任务表现验证
理论可扩展性中性,1.3B 以上规模验证空白
生态与兼容性明显劣势,未进入任何主流推理框架
易用性与社区劣势,开源社区活跃度显著低于 Mamba
混合架构潜力潜在优势,与 Transformer 混合设计空间大

10.3 投资与关注度对比

架构主要投资/支持背景
Transformer 优化全行业持续投入
Mamba多轮种子轮融资,Cartesia AI
Hyena以学术基金支持为主,未见独立商业融资

说明:Hyena 论文作者之一后续参与了 SSM/Mamba 方向的商业化项目,产业关注度亦主要由 SSM 路线吸纳。


⏱ 11. 风险

11.1 技术风险

风险项详细说明
规模化未经验证当前公开最大实验仅约 1.3B 参数,训练 7B/13B 级别 Hyena 模型是否稳定收敛,公开资料未见
数值稳定性长卷积核在超长序列(>32K)下的频域计算可能出现精度损失
动态场景适配自注意力天然支持动态位置编码;长卷积如何处理动态变化的上下文仍有研究空白
推理软件栈缺位无标准化的推理加速库,实际部署效率可能远低于理论计算

11.2 产业风险

风险项详细说明
生态锁定Transformer 生态成熟度极高(Hugging Face 生态、部署工具链、硬件适配),迁移成本巨大
竞争格局拥挤Mamba/SSM、RWKV、FlashAttention 等多种方案同步演进,Hyena 面临被边缘化风险
缺乏头部厂商背书目前没有 Meta、Google、OpenAI、Microsoft 等头部 AI 公司公开采用或推广 Hyena
资本预期偏差资本市场对“后 Transformer”赛道的追捧主要集中在 SSM 分支,Hyena 存在估值/关注度风险

11.3 合规风险

风险项详细说明
数据合规长上下文场景很可能涉及更大量的非结构化敏感数据,需遵守《个人信息保护法》和数据出境管理办法
生成合规Hyena 作为底层架构的生成模型,其输出仍需满足《生成式人工智能服务管理暂行办法》关于内容安全的相关条款

⏱ 12. 误读纠偏

常见误读实际情况
❌ “Hyena 可以完全替代 Transformer”✅ Hyena 在常规短序列上未有明显优势,且生态欠缺;业界共识为“互补”,非“替代”
❌ “Hyena 已经可以商用部署”✅ 到 2025 年初仍处于学术研究阶段,没有已知的商业级部署案例
❌ “Hyena 与 Mamba 是相同技术”✅ 两者同属后 Transformer 赛道,但数学基础不同:Hyena 是卷积+门控,Mamba 是选择性状态空间模型
❌ “Hyena 在长序列上全方位优于 Transformer”✅ 在 WikiText-103 等同参数量测试中,Hyena 困惑度约 17.5,与 Transformer 的 17.2 略有差距(Stanford 2023),并非全面碾压
❌ “直接修改 HuggingFace 模型即可使用 Hyena”✅ 需专门实现隐式卷积和频域运算,算子尚未标准化,社区插件不成熟

⏱ 13. 最新事件

13.1 时间线(2023–2025)

时间事件说明
2023.03Hyena 论文首次发布发布于 arXiv,提出亚二次替代架构
2023.10safari 开源库发布斯坦福 Hazy Research 将 Hyena/H3 等模型代码在 GitHub 上开源
2023.12Mamba 论文发布Mamba 架构(选择性 SSM)同期引发关注,部分分流 Hyena 热度
2024.02Gemini 1.5 Pro 发布Google 宣布百万 Token 上下文,强化长上下文推理效率竞争
2024.06FlashAttention-3 发布进一步压缩 Transformer 长序列成本,对替代架构形成优化竞争
2025.01大规模 Hyena 模型未见更新自 2023 年至今,未公开出现 1.3B 以上 Hyena 模型的显著实验结果

13.2 近期关注点

  • 是否有 7B+ 参数规模 Hyena 或混合模型出现(截至 2025 年初公开资料未见)。
  • Hazy Research 是否会将 Hyena 与 Mamba/SSM 合并为一个统一框架(相关讨论存在于学术论坛,但尚未有正式发布)。
  • 国内是否有机构系统性复现 Hyena(清华、北大等暂无明确公开项目)。

⏱ 14. 跟踪指标

14.1 核心指标

指标查看方式意义
新发布论文或被引数Google Scholar/arXiv判断学术活跃度和方向认可度
GitHub safari 仓库 commits/StarsGitHub Insights观测社区参与度与维护力度
7B+ 参数模型发布arXiv、Hugging Face规模化验证的关键信号
与 HuggingFace / vLLM 等框架集成PyPI、GitHub Issues产业可用性标志
大型 AI 公司引用或采用声明技术博客、财报电话会、开发者大会“头部背书”信号

14.2 间接指标

指标说明
Mamba/SSM 商业融资轮次同赛道资本的流向反映“后 Transformer”赛道的整体温度
FlashAttention 版本迭代直接影响 Hyena 相对于优化后 Transformer 的优势空间
长上下文模型基准(如 LongBench、LRA)新成绩追踪 Hyena 及其变体的实际性能进展

⏱ 15. 信源

信源说明
Poli et al., Hyena Hierarchy: Towards Larger Convolutional Language Models, arXiv:2302.10866, 2023Hyena 原论文,技术数据和基准实验的核心来源
HazyResearch/safari, GitHub, Apache 2.0开源实现,包含 H3、Hyena 及相关混合架构代码
Stanford Hazy Research 官方网站及项目日志团队动向与最新研究进展
NVIDIA cuFFT 文档与白皮书底层 FFT 算子实现与性能优化指南
MarketsandMarkets, Grand View ResearchNLP 与生成式 AI 市场预测数据(间接市场)
中国《生成式人工智能服务管理暂行办法》(2023)合规参考

说明:以上所有财务、市场、份额、产能数据均已标注年份、口径与来源。未找到对应数据处,统一标注为“公开资料未见”。

最后更新:2025 年 Q1

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型