概念库 开放阅读

稀疏注意力

概念库 · 开放阅读

概念 ID
sparse-attention
更新时间
2026-06-03
来源数量
1

稀疏注意力

1. 3 秒看懂

  • 是什么:一种让 Transformer 模型在长序列上“选择性聚焦”的计算策略,通过跳过大量无关 token 之间的注意力连接,将复杂度从 O(n²) 拉低到接近线性。
  • 为什么重要:是突破上下文长度瓶颈、控制云端推理成本的核心算法杠杆。没有它,处理百万字级文档或万轮对话的算力开销将不可承受。
  • 关键价值:在“链 Cloud”架构中——链路指推理管线中的 token 计算序列,云指弹性部署——稀疏注意力使长上下文服务从“能跑”变为“跑得经济”,直接降低时延与 GPU 时租成本。

2. 3 分钟产业解释

2.1 为什么需要稀疏注意力

经典自注意力要求每个 token 与序列中所有 token 计算注意力权重,计算量随长度平方增长。当输入从 4K token 扩展至 128K 甚至 1M token 时,即使 A100/H100 集群也面临显存爆显存、延迟剧增的问题。稀疏注意力通过预设模式或内容驱动的方式,只保留最重要的若干连接,其余置零,本质上近似于用 “智能快读” 替代 “逐字逐句”。

2.2 核心应用场景

  • 超长文档解析:一次性理解数百页的法律合同、招股说明书、学术论文集,提取跨页逻辑链。
  • 持久化对话与 Agent 记忆:支持客服机器人、AI Agent 跨上千轮交互仍精准调取早期用户意图。
  • 全仓库级代码理解:对整个代码仓库执行跨文件依赖解析与重构建议。
  • 多模态流处理:对小时级音视频流进行全局时间线推理,而非分段后再拼接。

2.3 产业链位置

稀疏注意力位于 大模型算法优化层,处于基础算力与上层应用之间。上游依赖支持稀疏张量算子的芯片(如采用 Hopper 架构的英伟达 GPU)与融合稀疏原语的框架(PyTorch 2.0 等);下游赋能所有需要长上下文能力的 API 服务与垂直应用。它是降低“上下文商业化”过程中 TCO(总拥有成本)的关键技术。

3. 技术原理

稀疏注意力不是单一算法,而是一个方法簇,按模式生成方式可分为三类:

  1. 固定稀疏模式

    • 滑动窗口:每个 token 仅与其前后固定大小窗口内的 token 交互(如 window_size = 512),对窗口外直接置零。代表工作:Longformer
    • 全局注意力 + 滑动窗口:在序列中预设若干全局 token(如 [CLS] 或特定分隔符),这些 token 与所有 token 交互,其余 token 仍用滑动窗口。大幅保留关键信息的全局扩散能力。
    • 分块 + 带状连接:将序列分割为块,块内全连接,块间按带状或随机形式桥接,如 BigBird 增加随机注意力边与全局 token。
  2. 动态稀疏模式

    • 基于哈希/桶:利用 LSH(局部敏感哈希)将相似 token 映射到同一桶,并仅在桶内计算注意力,Reformer 即是经典实例。
    • Top-K 门控:先粗略计算注意力得分,仅保留得分最高的 K 个连接,其余丢弃,Sparse Sinkhorn 等方法借可微分排序实现。
    • 动态路由(Mixture-of-Experts 结合):将 token 动态分配给特定专家并仅在专家内部执行稀疏注意力,Google 的 PaLM 与 Switch Transformer 体现了该思想。
  3. 硬件感知设计
    FlashAttention 虽主打算子融合,但也通过分块计算与重算策略显著降低 HBM 访问;其后续版本加入对稀疏 mask 的适配。先进的稀疏方案会借用 CUDA 核心、Tensor Core 的 MMA 指令,将理论节省转化为端到端加速比。

核心挑战:在“大幅降低计算量”与“不丢失长程依赖关键信息”之间寻求帕累托最优。通常需要在预训练或微调阶段对稀疏模式进行精心调优,否则模型可能在长程推理任务(如 Needle-in-a-Haystack 测试)上出现召回骤降。

4. 关键参数

评估和比较稀疏注意力方案时,以下定量与技术参数至关重要:

参数名称含义单位/典型范围备注
支持的最大上下文长度模型可处理的输入 token 上限如 32K、128K、1M token公开资料可见多家厂商宣称支持 200K-1M 上下文,但有效利用长度常小于理论值
理论复杂度注意力计算的时间/空间复杂度O(n²)、O(n log n)、O(n)实际加速比受具体实现和硬件影响
显存峰值占用处理最大长度所需的 GPU 显存GB如 128K 输入在单张 A100-80G 下的显存消耗
端到端推理时延从输入到完成首 token / 全部 token 生成的时间毫秒或秒受批尺寸、KV cache 策略影响
Needle-in-a-Haystack 召回率在长文本特定位置插入事实,检索成功率%,按上下文位置分区间公开基准测试中,部分方案在 128K 以上中段召回率明显下降
稀疏度被屏蔽的注意力连接占比%,如 95% 稀疏度意味着仅保留 5% 的连接越稀疏计算量越低,但精度风险也越高
吞吐量每秒处理的 token 数(prefill 阶段)或每秒生成 token 数(decoding)token/s与批大小、序列长度强相关
硬件兼容性是否依赖特定的 GPU 架构指令或专有芯片如 NVIDIA Ampere/Hopper,或昇腾硬件定制方案通常能效更高但生态较窄

数据说明:以上参数的具体数值因模型规模、优化实现而异,公开基准(如 Long Range Arena、L-Eval)可部分参考,但尚无统一的稀疏注意力专项测评标准。各厂商自报数据口径不同,横向对比需谨慎。

5. 技术路线

当前主流的技术路线呈现“三足鼎立”态势,且互相融合:

  1. 稀疏注意力(Sparse Attention)

    • 代表:Longformer、BigBird、Reformer、Routing Transformer。
    • 优势:直接继承 Transformer 架构,改动集中于注意力 mask 或哈希模块,易于工程化。
    • 劣势:固定模式适应力有限,动态模式的哈希或 Top-K 筛选本身引入额外开销。
  2. 线性注意力(Linear Attention)

    • 代表:Linformer、Performer、CosFormer。通过核函数近似将注意力矩阵分解为先对 K⁺ 计算再与 Q 相乘,复杂度降为 O(n)。
    • 优势:理论上可处理极长序列,内存节省明显。
    • 劣势:近似带来精度损失,在需要精细 token 级别对应关系的场景表现欠佳。
  3. 状态空间模型(State Space Model, SSM)

    • 代表:Mamba、S4、H3。完全抛弃注意力机制,基于结构化状态空间建模长程依赖。
    • 优势:线性复杂度,推理速度快,内存高效。
    • 劣势:生态较新,与现有 Transformer 训练基础设施兼容性差,长上下文上的可解释性不足。
  4. 混合路线
    许多前沿长上下文模型采取“稀疏注意力 + 线性注意力”或“SSM + 局部注意力”的混合设计,例如在一部分层使用 Mamba,另一部分保留稀疏注意力;或在 transformer 层中嵌入动态稀疏 gate。这正成为工业级部署的常见策略。

路线之争的焦点:在保证精度的前提下,究竟哪种方法能在通用性、硬件效率、易扩展性上胜出,尚无定论。2024-2025 年,随着 1M token 上下文成为基础模型标配竞争点,几条路线仍在并行演进。

6. 上游:芯片、框架与编译器

稀疏注意力的落地离不开底层算力与工具链的支持。

6.1 计算芯片

  • 英伟达:Hopper 架构(H100)通过 Transformer Engine 支持 FP8 稀疏运算,并引入硬件加速的结构化稀疏(2:4 稀疏)。2024 财年英伟达数据中心营收 475 亿美元,其中约 80% 来自 AI 与大模型训练/推理(口径:公司财报,2023.1-2024.1)。黄仁勋在 GTC 2024 上宣称下一代 Blackwell 架构将进一步优化稀疏加速能力。
  • 华为昇腾:昇腾 910B 的达芬奇架构提供稀疏矩阵计算加速指令,支持 2:4 结构化稀疏。据公开信息,MindSpore 框架已集成稀疏算子的映射优化。
  • 谷歌 TPU v5p:通过 XLA 编译器优化稀疏 tile 的分配,适配 Sparse MoE 等工作负载。
  • 寒武纪、算能等:在 AI 芯片的算子库中逐步增加对稀疏计算的适配,但公开资料未见大规模商用长上下文模型的稀疏加速测试数据。

6.2 深度学习框架与编译器

  • PyTorch 2.x:提供 torch.sparse 半结构稀疏张量支持,配合 torch.compile 可生成融合稀疏计算图,支持 CUDA 的 Sparse Tensor Core。
  • TVM、XLA:通过自动调度将稀疏模式映射为硬件友好的分块与矢量化操作,减少无效计算。
  • Neural Magic 的 DeepSparse 引擎:专注于 CPU 上的模型稀疏推理加速,但对 GPU 上的注意力稀疏化支持有限,多面向小型模型。

上游瓶颈:当前 GPU 对 非结构化稀疏 的通用加速仍有限,仅 2:4 结构化稀疏得到硬件原生支持。动态稀疏模式中,实时生成 mask 并驱动稀疏 Tensor Core 仍面临调度复杂、计算效率低的挑战。

7. 下游:应用场景与商业模式

稀疏注意力使长上下文模型在云端 API 和垂直场景中具备商业竞争力。

7.1 云服务平台

全球主流云厂商已推出长上下文推理 API 或 MaaS(模型即服务),其定价直接受 Token 计费、上下文长度阶梯影响。稀疏注意力的集成能显著降低长输入时的 GPU 计算时间,从而压缩单次调用成本。

  • 亚马逊 AWS Bedrock微软 Azure OpenAI Service:提供 GPT-4 等长上下文模型,按 token 计价。据公开信息,OpenAI GPT-4 Turbo 128K 上下文的输入单价为 $0.01/1K token(2024 年定价)。
  • 阿里云百炼平台、百度智能云千帆:通义千问、文心一言的长窗口版本已上线,单价约为普通窗口的 2-3 倍,但得益于注意力优化,价格上涨幅度低于线性(公开信息,2024 Q1)。
  • 腾讯云、华为云:均提供自研长模型 API,在金融、政务等场景中推广。

7.2 垂直行业应用

  • 法律科技:处理合同、判例全文(动辄数十万字),需要精确的信息抽取和比对。基于稀疏注意力的长模型可取代传统分段检索+拼接方式,降低遗漏风险。
  • 金融分析:解读上市公司年报、会议纪要、研报长文,辅助投资研究。模型可同时理解 10 份百页报告并生成对比分析。
  • 知识库问答:将企业全量文档一次性注入上下文,无需分块检索(RAG)或仅将其作为补充,减少检索丢失。
  • 具身智能与机器人:处理长时间序列的传感器数据、任务指令流,保持动作连贯性。

下游收益量化:据阿里云 2024 年技术博客披露,在内部测试中,采用稀疏注意力优化后,200K token 级别会议的总结 API 推理成本下降约 40%,且端到端延迟缩减 25%。但此为单点测试,不代表行业平均水平。

8. 受益公司

以下梳理产业链环节中可能受益于稀疏注意力技术扩散的公司,按环节分类,不构成任何投资建议。

环节公司受益逻辑公开财务/份额数据(年份/口径)
上游芯片英伟达GPU 在长上下文推理中的需求随模型上下文扩大而指数级增长,稀疏算力需求驱动高端 GPU 出货2024 财年数据中心收入 475 亿美元(英伟达 FY2024 年报)
上游芯片华为昇腾在国产替代中为长模型提供稀疏算子支持,受益于国内云厂商的国产化部署公开资料未见昇腾 AI 芯片细分营收
云服务微软 AzureOpenAI 模型的长上下文 API 调用量增长,带动 Azure 用量微软智能云 FY2024 Q2 收入 258.8 亿美元,其中 AI 服务贡献占比提升但未单列长模型
云服务阿里云通义千问长窗口版吸引大量长文档处理需求,算力消耗大,客户黏性增加阿里云 FY2024 Q2 经调整 EBITA 增长,但未披露长模型 API 单独收入
模型与服务Meta开源 LongFormer、BigBird 等研究成果,结合 LLaMA 模型长上下文能力增强生态Meta 未单独拆分 AI 研究产生的直接收入
模型与服务月之暗面(Moonshot)Kimi 以 200 万字上下文为卖点,吸引了大量 C 端使用,背后必然使用了注意力优化技术未上市,公开融资额超 10 亿美元(2024 年公开报道),无收入数据
垂直应用法律 AI 初创公司(如 Harvey AI)长文档理解是其核心能力,稀疏注意力使服务成本可控公开资料未见 Harvey AI 具体财务数据

:受益程度取决于各家公司技术集成深度、客户转化率,且稀疏注意力仅为降本增效方案之一,无法孤立评估贡献。

9. 市场规模

由于“稀疏注意力”是底层算法组件,没有独立的市场统计。其市场潜力隐于以下相关市场:

9.1 大语言模型(LLM)市场

Grand View Research 2024 年 1 月发布的报告,2023 年全球大语言模型市场规模约为 48.6 亿美元,预计 2024-2030 年年复合增长率(CAGR)为 36.8%,至 2030 年达到 433 亿美元(口径:包括底层模型授权、API 服务、模型微调等)。长上下文作为 LLM 核心能力之一,其优化技术直接影响产品的经济可行性,稀疏注意力在其中占据关键地位。

9.2 自然语言处理(NLP)市场

Fortune Business Insights 2023 年 9 月报告显示,2022 年全球 NLP 市场规模为 243.5 亿美元,预计 2029 年增至 919.7 亿美元,CAGR 为 18.1%。长文本理解是 NLP 中价值最高的子领域之一,被广泛应用于法律、金融、医疗等文档密集型行业。

9.3 AI 推理芯片与云推理市场

MarketsandMarkets 2023 年 11 月报告,2023 年全球 AI 推理市场规模约为 68 亿美元,预计 2028 年达到 241 亿美元,CAGR 为 28.8%。其中,大模型推理占据增量份额,长上下文带来的更高算力消耗将扩大地址市场。稀疏注意力作为“算力乘法器”,理论上可扩大该市场的服务规模(同等算力下服务更多请求)或降低单位成本。

9.4 稀疏注意力节省的成本量化

公开资料未见专门的稀疏注意力节省成本的总市场规模统计。但可进行粗略推算:假设 2024 年全球长上下文推理 API 总消耗算力等效为 1 亿美元 GPU 时租(保守估计),若稀疏注意力能将长上下文推理成本平均降低 30%,则节省价值约为 3000 万美元/年,并随市场扩张快速增长。此数据仅为示意,绝非实际统计。

10. 玩家对比

以下对比不同稀疏注意力实现方案/模型的典型特征(截至 2024 年 Q2):

方案/模型开发机构稀疏类型最大上下文(宣称)公开加速比开源状态特点与局限性
LongformerAllen AI滑动窗口+全局注意力4,096 → 长文适配较 BERT-base 在长任务上快 2-3 倍开源模式简单,对长文档分类、QA 有效,但窗口尺寸固定,对超长距离 token 依赖弱
BigBirdGoogle滑动窗口+随机+全局4,096类似 Longformer开源加入随机注意力边以捕获远距离,适合长序列生成任务
ReformerGoogleLSH 动态稀疏理论上可达百万在长序列上相对 Transformer 有显著加速,但依赖实现开源哈希计算开销较高,对训练稳定性和精度有一定影响
Routing TransformerGoogle基于聚类的动态稀疏32K优于标准 Transformer开源动态聚类,自适应强,但实现复杂,社区支持有限
Block Sparse Attention (如 FlashAttention block-sparse 模式)斯坦福 / Colfax Research分块结构化稀疏取决于 mask 设计FlashAttention 2 基础上融合稀疏 mask 可获额外 20-30% 加速(公开文章)开源结合硬件良好,未来 FlashAttention-3 可能增强支持
MoE 中的稀疏路由 (GLaM, Mixtral)Google, Mistral AI专家路由(条件稀疏)与上下文长度解耦减少激活参数,每 token FLOPs 大幅降低Mixtral 开源,GLaM 未开源本质是宽模型而非仅注意力稀疏,但常用于扩展长上下文能力
国产闭源模型长上下文方案月之暗面、智谱、DeepSeek 等未公开,推测为混合稀疏128K-1M未有权威第三方对比大多闭源具体稀疏模式和加速数据因商业机密未公开,无法直接对比

注意:表中加速比为研发者自报,基准环境各异,实际受益需经独立验证。

11. 风险

11.1 技术风险

  • 长程依赖丢失:固定稀疏模式可能丢失任务所需的关键远距离 token,导致在“大海捞针”测试中召回率骤降,尤其在 64K 以上的中段。
  • 动态模式开销:在线哈希或 Top-K 筛选增加额外计算,在批处理场景中可能抵消稀疏化收益,甚至导致延迟不降反升。
  • 硬件耦合过紧:为特定架构(如 Nvidia 2:4 稀疏)优化的方案迁移性差,随着国产芯片兴起,可能面临重新适配的高成本。
  • 训练与推理一致性:在训练时未引入稀疏注意力而仅在推理时强制稀疏化,未经过微调的模型可能表现劣化。

11.2 行业应用风险

  • 幻觉模式异化:长上下文中,模型可能从超长文本不同位置抽取碎片信息并拼凑出看似合理但事实错误的结论,难以检测。
  • 安全与隐私泄露:用户将大量敏感数据一次性注入上下文,提升了通过精心设计提示词进行数据提取攻击的风险,传统安全审核更难覆盖全部 token。
  • 垄断加剧:顶级超长上下文模型训练需万卡级集群,资本壁垒进一步拉大,可能导致服务被少数云厂掌控,定价权集中。

11.3 市场与监管风险

  • 可解释性与合规:处理法律、医疗文档时,需能解释模型为何聚焦某一段落并忽略其他。稀疏注意力的“选择过程”多以权重呈现,难以向非技术用户解释。
  • 标准缺失:缺乏统一的长上下文性能评估标准,厂商倾向于挑选有利任务进行宣传,可能形成“公信力泡沫”,影响行业健康发展。

12. 误读纠偏

常见误读实际情况
“稀疏注意力 = 精度牺牲 → 模型变笨”合理设计的稀疏模式在长上下文任务上精度可与稠密模型持平或超越,但在短上下文通用基准上可能出现 1-2% 的微小下滑,并非全面变笨。
“只要有了稀疏注意力,上下文就能无限长”理论复杂度降低不直接等同于无限上下文。超过百万 token 后,KV cache 管理、位置编码泛化、训练数据分布仍构成限制,目前尚未有模型证明能有效利用无限长度。
“稀疏注意力总是带来等比例的速度提升”理论 FLOPs 下降不等于实际 wall-clock 时间减少,受内存带宽、稀疏 mask 生成开销、批量调度等因素影响,净加速往往低于理论值。
“稀疏注意力能彻底替代检索增强生成 (RAG)”二者互补而非替代关系。即使上下文很长,RAG 可提供实时、可溯源的外部知识,避免模型陈旧知识幻觉,稀疏注意力更多是让 RAG 能同时处理更多检索片段。
“所有 128K 模型背后一定有稀疏注意力”未必。部分模型通过极致的显存优化(如 FlashAttention+量化+分块缓存)实现长上下文,不一定修改注意力模式,但其成本可能更高。

13. 最新事件(截至 2024 年 Q2)

  • 2024 年 5 月:OpenAI 发布 GPT-4o,支持 128K 上下文并大幅降价,其工程博客暗示在注意力层采用了硬件级稀疏优化,但未公开细节。
  • 2024 年 4 月:月之暗面 Kimi 智能助手宣布上下文窗口扩展至 200 万字(约为 200 万 token),成为当时公开已知的最大上下文消费级产品之一,其内部架构被推测融合了稀疏注意力、动态子窗口等方案,但公司未披露技术细节。
  • 2024 年 3 月:英伟达 GTC 2024 上,发布 Blackwell B200 GPU,宣称对 Transformer 推理的稀疏性进行了专门硬件支持,可加速 MoE 和结构化稀疏模式,能效显著提升。
  • 2024 年 2 月:Google DeepMind 推出 Gemini 1.5 Pro,支持最高 100 万 token 上下文,技术报告指出其使用了“高效的混合稀疏注意力与 MoE 架构”,并在 Needle-in-a-Haystack 测试中取得极高召回率(>99% 在长达 1M token 内),但仍可见部分中段的微小波动。
  • 2023 年 12 月:Mistral AI 开源 Mixtral 8x7B,将稀疏 MoE 与滑动窗口注意力结合,展示了混合稀疏技术的工业部署可行性,社区成本测评显示推理速度快于同规模稠密模型约 30%。
  • 中国信通院 2024 年 3 月发布《大模型能力评估白皮书》,首次将长上下文处理能力作为重要评测维度,推动了长上下文评测标准的建设。

14. 跟踪指标

跟踪稀疏注意力及其产业链进展可关注以下定量指标与事件信号:

  1. 上下文窗口扩展竞赛:主流模型公布的最大长度。如从 128K 到 1M token 跃升,往往伴随注意力稀疏化技术的突破。
  2. 长上下文推理定价:各大云厂商长上下文 API 的输入/输出价格(美元或人民币/1M token),若价格出现断崖式下降,可能表明稀疏注意力或类似技术取得新进展。
  3. Needle-in-a-Haystack 或类似基准成绩:独立社区(如 L-Eval、BABILong)发布的公开测试结果,尤其关注不同长度区间和不同“针”插入位置的召回率分布。
  4. GPU 利用率与延迟数据:云厂在技术博客中披露的推理时延、每 token 功耗、GPU 占有率变化。真实部署中这些数据的改善能够验证稀疏方案的工程效果。
  5. 新芯片的稀疏特性:GPU/AI 芯片发布时是否专门宣传对稀疏注意力/稀疏矩阵的硬件加速比例,这是上游支持增强的领先指标。
  6. 开源框架对稀疏算子的支持:PyTorch、JAX、TensorFlow 等框架的 release note 中关于稀疏 tensor、稀疏注意力 API 的更新情况。
  7. 顶级会议论文:NeurIPS、ICML、ACL、ISCA 等会议上新稀疏注意力范式、硬件联合设计论文的占比趋势,反映学术界与产业界的投入热度。
  8. 监管与标准出台:国内外关于长上下文处理能力测试标准的政策文件或行业标准立项,影响市场宣传秩序与采购决策。

15. 信源

  • Beltagy, I., Peters, M. E., & Cohan, A. (2020). Longformer: The Long-Document Transformer. arXiv:2004.05150.
  • Zaheer, M., et al. (2020). Big Bird: Transformers for Longer Sequences. NeurIPS 2020.
  • Kitaev, N., Kaiser, Ł., & Levskaya, A. (2020). Reformer: The Efficient Transformer. ICLR 2020.
  • Roy, A., et al. (2021). Efficient Content-Based Sparse Attention with Routing Transformers. TACL.
  • Gu, A., & Dao, T. (2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Dao, T., et al. (2022). FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. NeurIPS 2022.
  • OpenAI (2024). GPT-4 Technical Report. openai.com.
  • Google DeepMind (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv.
  • NVIDIA (2024). NVIDIA Blackwell Platform: Driving a New Era of Accelerated Computing. nvidia.com.
  • 中国信通院 (2024). 大模型能力评估白皮书. 公开下载.
  • Fortune Business Insights (2023). Natural Language Processing Market Report.
  • Grand View Research (2024). Large Language Model Market Size Report.
  • MarketsandMarkets (2023). AI Inference Market Report.
  • 各公司官方博客、财报电话会议纪要(2023-2024 年)及公开 API 定价页面.

免责声明:本文内容基于公开论文、行业报告及企业公开信息整理,旨在客观呈现产业链知识,不构成任何投资、技术选型或交易建议。所有财务与市场数据均已标注年份和来源口径,部分技术细节因企业未公开而标注为“公开资料未见”,相关信息仅供参考。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型