模型层 开放阅读

自注意力

Self-Attention

概念 ID
self-attention
更新时间
2026-05-29
来源数量
待补

自注意力

3 秒看懂

自注意力是 Transformer 架构的核心,让模型在处理一个序列(比如一句话)时,能够同时关注序列中所有位置的信息,并动态计算每个位置对其他位置的重要程度。它不依赖顺序一步步处理,而是通过全局“配对打分”的方式,直接建模任意两个元素之间的关系,从而高效捕获长距离依赖。

关键类比:传统 RNN 像串行读报纸,只能记住附近几行;自注意力像瞬间扫视整页,并可任意关联相隔很远的词汇。

3 分钟产业解释

自注意力机制彻底改变了自然语言处理、计算机视觉和多模态模型。它的核心思想是:对每个输入 token,生成 Query、Key、Value 三个向量,通过 Query 与所有 Key 的点积计算注意力权重,再用这些权重对 Value 加权求和,得到融合了全局上下文的输出表征。多头注意力进一步将多个不同的“子空间”并行计算,增强表达能力。

在产业中,自注意力是 ChatGPT、BERT、Vision Transformer (ViT)、扩散模型中的 U‑Net 注意力块等一切明星模型的基石。它使模型参数量可达千亿甚至万亿级别,支撑了当前大语言模型的涌现能力。其计算复杂度为序列长度的平方 O(L²),因此长序列场景下的稀疏注意力、FlashAttention、KV Cache等优化是关键工程方向。

15 分钟专家深入

自注意力的形式化定义(Scaled Dot‑Product Attention):

给定输入矩阵 X \in \mathbb{R}^{L \times d}L 为序列长度,d 为隐藏维度),通过可学习矩阵 W^Q, W^K, W^V 线性投影得到:

Q = X W^Q, \quad K = X W^K, \quad V = X W^V

其中 Q, K, V \in \mathbb{R}^{L \times d_k} (通常 d_k = d / hh 为头数)。注意力输出为:

\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V

缩放因子 \sqrt{d_k} 防止点积随维度增大进入 softmax 的饱和区,稳定梯度。多头注意力将 d 切成 h 个头分别计算,再拼接后线性投影:

\text{MultiHead}(Q, K, V) = \text{Concat}(\text{head}_1, \dots, \text{head}_h) W^O

自注意力即 Q, K, V 来自同一输入源(通常加上位置编码),交叉注意力则在解码器中以编码器输出为 K、V,解码器输入为 Q。

复杂度与优化:

  • 原始自注意力的内存与计算均为 O(L^2 d),当 L > 2048 时成为瓶颈。
  • FlashAttention(Dao et al. 2022)利用分块(tiling)和算子融合,在 GPU SRAM 中完成 softmax 重计算,大幅降低 HBM 访问,实现 2~4 倍加速且内存线性相关于 L,已广泛用于 GPT‑4、LLaMA 等模型的训练与推理。
  • KV Cache:自回归生成时,将历史 Key、Value 缓存在显存中,避免每步重新计算,将推理复杂度从 O(L^3) 降至 O(L^2)
  • 稀疏注意力:如 Longformer、BigBird,通过局部窗口+全局 token 或随机模式,将复杂度压至 O(L),支持万级 token 输入。

几何与信号处理视角: 自注意力可视为一种非局部均值滤波(non‑local means)或图神经网络中的亲和传播。Transformer 中的注意力矩阵可视化常呈现某些头负责句法关系、某些头捕获语义全局模式等。位置编码(绝对/相对)弥补序列顺序的缺失,其中旋转位置编码(RoPE)成为主流,能为注意力注入相对位置信息且在长距离外推中表现更优。

技术原理

核心机制:基于内容的软寻址 自注意力其实是一个可微分的键值存储查找过程。Query 相当于搜索词,Key 相当于数据库索引,Value 为存储内容。输出是各个 Value 的加权和,权重由 Query 与相应 Key 的匹配程度决定。无需固定窗口大小,模型自动决定“关注哪里”。

注意力权重计算流(以单头为例):

输入 tokens: [T1, T2, ..., Tn]
每个 token 投影: q_i, k_i, v_i
对于每个 token i:
  分数 s_ij = q_i · k_j^T / sqrt(d_k)   (j = 1..n)
  权重 a_ij = softmax(s_i1, ..., s_in)
  输出 o_i = Σ_j a_ij v_j

矩阵形式:

              Q   [L x d_k]
              K^T [d_k x L]
         QK^T = S [L x L]   -> softmax -> A [L x L]
              V   [L x d_k]
         AV = O [L x d_k]

多头并行: 将 Q、K、V 各切分 h 份,独立计算,最后拼接:

Q → Q1, Q2, ..., Qh
K → K1, K2, ..., Kh
V → V1, V2, ..., Vh
head_i = Attention(Q_i, K_i, V_i)
MultiHead = Concat(head_1, ..., head_h) W^O

关键参数:

  • 隐藏维度 d(如 768, 1024, 4096)
  • 头数 h(如 12, 16, 32;通常使得 d_k = 64 \sim 128
  • 序列长度 L
  • 参数量:Q、K、V 投影各为 d \times d_k \times h(或直接 d \times d),输出投影 d \times d,总计约 4d^2(忽略 bias)。例如 GPT‑3 中的多头自注意力块参数约 4 \times (12288)^2 \approx 603 M,仅一层。

梯度流与初始化: 残差连接与 LayerNorm 包围子层,避免梯度消失。Q、K、V 矩阵常用 Xavier 初始化,输出矩阵初始化通常乘以因子 1/\sqrt{2N} (N 为层数)以保证训练稳定。对于大规模模型,混合精度(FP16/BF16)与注意力层的重计算(gradient checkpointing)必不可少。

技术演进史

时间里程碑要点
2014Bahdanau 注意力在 RNN seq2seq 中引入加性注意力,动态对齐源句与目标词
2015Luong 注意力提出乘性注意力(点积),效率更高
2017Transformer 提出 (Vaswani 等)完全基于自注意力,抛弃循环结构,实现高度并行训练;定义缩放点积注意力和多头机制
2018BERT/GPTBERT 使用 Transformer 编码器的双向自注意力;GPT 使用自回归解码器的因果掩码自注意力
2019Sparse Transformers (Child 等)引入稀疏注意力模式,降低复杂度
2020视觉 Transformer (Dosovitskiy 等)将图像切割为 patch,应用纯自注意力,撼动 CNN 霸权
2021Performer, Linformer通过核近似、低秩分解将注意力复杂度降至线性
2022FlashAttention (Dao 等)IO‑aware 精准实现,解决内存瓶颈,使长序列训练成为可能
2023FlashAttention-2, RingAttention进一步优化并行效率,支持百万 token 上下文
2024FlashAttention-3, MoE + 长上下文模型Gemini 1.5 Pro (1M tokens)、GPT‑4 Turbo (128K) 等,依赖高效注意力实现

技术路线对比

机制典型网络复杂度(单层)长距离依赖并行性局限性
自注意力TransformerO(L^2 d)强(全局)高(逐层并行)序列长度平方开销
线性注意力Linformer, PerformerO(L d)近似全局表达能力弱于标准注意力
稀疏注意力Longformer, BigBirdO(L \log L) \sim O(L)较强(局部+稀疏全局)模式设计需先验知识
循环网络 (RNN/LSTM)Seq2SeqO(L d^2)弱(梯度消失)低(时间步串行)难以建模超长距离关系
卷积网络 (CNN)WaveNet, TCNO(k L d^2)感受野受层数限制较高需堆叠多层,参数效率较低
状态空间模型 (SSM)Mamba (S4, S6)O(L d)强(选择性机制)训练高效,推理可比肩上下文特化能力尚在实证比较

量化比较(以典型中等设置 L=2048, d=1024, h=16 为例,均为 [估算]):

  • 标准自注意力:约 2 \times L^2 \times d 计算量 ≈ 8.6\times10^9 FLOPS,内存占用接近 L^2 矩阵。
  • 稀疏注意力(窗口大小 w=512):约 L \times w \times d 级别,降低 4~8 倍。
  • FlashAttention:实际显存访问降低 20~30 倍,在长序列上取得与理论 FLOPs 缩减近似的 wall‑clock 加速。

上下游

上游:数据与表征

  • 输入 token 的嵌入(Embedding)+ 位置编码(正弦、可学习、RoPE)
  • 对于非文本模态,如 ViT 的 patch embedding,或语音的梅尔频谱特征再投影至序列
  • 训练框架:PyTorch, JAX, TensorFlow;分布式库:Megatron‑LM, DeepSpeed

核心:自注意力计算模块

  • GPU/NPU 上的矩阵乘法 (GEMM) 和 softmax 算子;FlashAttention 等定制内核
  • 内存与带宽:HBM 容量与带宽决定最大序列长度和批次大小([未充分披露])
  • 关键优化:张量并行(列切 QKV, 行切输出)、序列并行(RingAttention)

下游:模型架构与应用

  • 仅编码器 (BERT/RoBERTa):文本理解,分类,抽取式 QA
  • 仅解码器 (GPT, LLaMA, Gemini):自回归语言模型,创意写作,代码生成
  • 编码器‑解码器 (T5, BART):翻译,摘要
  • 视觉:ViT, Swin Transformer, 扩散模型中的交叉注意力(文本控制图像生成)
  • 多模态:CLIP 式双塔、BLIP‑2 的 Q‑Former(使用交叉注意力弥合模态 gap)

端侧部署:

  • 量化 (INT8/INT4)、蒸馏、剪枝减少注意力矩阵计算
  • KV Cache 压缩技术:Grouped Query Attention (GQA)、Multi‑Query Attention (MQA) 降低内存读取
  • NPU/边缘芯片适配自定义注意力算子

关键指标

  • 序列长度 (Context Length):从 512(BERT)到 128K(GPT‑4 Turbo)、1M(Gemini 1.5 Pro),当前前沿百万 token 级别。
  • 头数 (h) 和每头维度 (d_head):常见 d_head 为 64, 128;头数从基础模型的 12 到大模型的 64~128,GQA 中海量 KV 头数缩减。
  • 注意力复杂度/吞吐量:用 FLOPs/token 表征;FlashAttention 实现下,单 A100 GPU 可处理约 64K token 训练([估算])。
  • 推理时延:首个 token 延迟(prefill 阶段)与每 token 延迟(decode 阶段),后者主要受 KV Cache 存取限制。GQA 相比 MHA 在 batch size 较大时可将 decode 延迟降低 30%~50% [估算]。
  • 困惑度 (PPL):评估语言模型质量,自注意力设计(ALiBi vs. RoPE)直接影响长序列外推时的 PPL。
  • 显存占用:总参数量决定模型权重;KV Cache 大小 ≈ 2 \times \text{层数} \times \text{头数} \times d_{\text{head}} \times L(per token),是大批量推理的主要瓶颈。

供需与市场数据

  • 需求端:全球大语言模型训练和推理需求呈指数增长,推动对能效比更高的注意力加速硬件需求。据 [行业报告估算],2024 年大型 AI 集群中 60%~80% 的计算时间消耗在 Transformer 的注意力和前馈网络层。
  • 供给端:NVIDIA H100/B200 的 Transformer Engine 提供对 FP8/BF16 混合精度的原生支持;AMD MI300X 等也引入类似优化。云厂商(AWS, GCP, Azure)提供大规模 GPU 租赁。专用 ASIC/FPGA 如 SambaNova, Cerebras, Groq 针对自注意力设计了数据流架构以破除内存墙。
  • 价格:云端 GPU 算力价格约 $2~$4/GPU·时(H100 市场均价 [估算]),训练千亿参数模型需数千 GPU·月。推理 API 价格(如 GPT‑4 Turbo)已降至 $0.01/1K tokens 级别。
  • 趋势:长上下文需求持续推动 FlashAttention 类算法落地,混合头(GQA)成为标配。线性注意力与状态空间模型(Mamba)在特定场景分流。端侧设备对轻量自注意力的需求催生 MobileViT、EdgeNeXt 等。

代表公司与资本映射

层级公司/组织与自注意力的关联资本属性
核心模型OpenAI (GPT 系列), Google (Gemini, T5), Meta (LLaMA), Anthropic (Claude)架构中深度使用自注意力及其变体,引领技术趋势非上市(OpenAI, Anthropic 估值得天价),上市公司 (Google, Meta)
框架与硬件NVIDIA (CUDA, TensorRT, H100/B200), AMD, Intel提供训练/推理加速,CUDA 生态垄断自注意力计算效率优化上市公司,市值万亿美元级
算法优化Together AI, Mistral, 清华/北大等学术机构提出 FlashAttention‑3, RingAttention, 稀疏注意力等关键优化初创公司融资数亿美元
应用落地Microsoft (Copilot), Salesforce (Einstein GPT), Duolingo将自注意力驱动的生成式 AI 嵌入产品上市公司
端侧推理Apple, Qualcomm, MediaTek在芯片中集成 Neural Engine/DSP 优化 Transformer 算子上市公司

投资逻辑

  1. 算力底层受益:自注意力仍是未来 2~3 年大模型主导范式,训练和推理的 FLOPs 需求随模型规模和上下文长度双增,直接利好 GPU/TPU 芯片、HBM 存储、光模块互联。
  2. 高效注意力创新企业的机遇:能大幅降低自注意力计算成本的技术公司(如稀疏注意力 IP、定制 AI 芯片)可能颠覆现有生态,但风险在于需与 CUDA 生态兼容。
  3. 长上下文催生新应用:自注意力实现百万 token 上下文,开启代码库理解、全基因组分析、长视频理解等新市场,软件层价值大。
  4. 风险:若状态空间模型等新生架构在多项基准上全面超越而不再依赖自注意力,当前庞大的 Transformer 训练投入可能折价。此外,量化、蒸馏等技术降低了推理门槛,可能使硬件专用的注意力加速优势被稀释。
  5. 配置策略:短期(1‑2 年)重标配 GPU/光模块;中长期关注能效比更高的替代算力架构与上下文技术突破,可在初创二级市场或同业对比中分散布局。

常见误读纠偏

  • 误读1:“自注意力就是全局注意力,所以一定能解决所有长距离依赖问题。” 纠偏:自注意力从机制上提供了全局视野,但在训练样本有限或优化不充分时,注意力分布可能崩塌到局部或无关 token,尤其长序列的中间信息可能被稀释。还需要位置编码、初始化策略、正则化等配合,才能使模型真正学会利用长距离信息。

  • 误读2:“多头注意力中每个头一定会学到语法、语义等可解释的角色。” 纠偏:虽然某些头确实可能专注特定模式(句法依存、共指等),但这种解耦并非必然。大量头呈现冗余或混合模式。头数过多反而可能导致过拟合或训练变慢,GQA 便是通过压缩 KV 头数实现效率与效果平衡。

学习路径

  1. 基础理论:阅读 “Attention Is All You Need” 论文原文,重点掌握 Scaled Dot‑Product Attention 公式、多头机制、自注意力和交叉注意力的区别。
  2. 动手实现:用 PyTorch/NumPy 从零实现单头、多头自注意力,在小数据集上调试梯度流。对比不使用注意力、使用加性注意力等实验。
  3. 进阶优化:深入理解 FlashAttention 论文和实现原理(分块,online softmax)。学习 KV Cache 的存储管理与 GQA/MQA 的原理。
  4. 变体探索:了解 Sparse Attention (Longformer, BigBird)、线性注意力 (Performer)、核注意力。
  5. 跨模态迁移:阅读 ViT 论文,理解自注意力从 NLP 到 CV 的适配(patch + 位置编码)。探索扩散模型中的交叉注意力。
  6. 系统与落地:学习 Megatron‑LM 的张量并行、序列并行切分策略;尝试用 vLLM/TGI 部署模型,分析 attention 的显存占用与调度。

一句话总结

自注意力是赋予序列模型全局交互能力的基础算符,其优雅的“查询‑键‑值”体系与注意力重加权的设计,构成了当代大模型理解上下文、跨越长距关联的核心引擎,并通过软硬件协同优化持续拓宽智能边界。

延伸阅读与来源

  • Vaswani et al. (2017) “Attention Is All You Need”, NeurIPS. https://arxiv.org/abs/1706.03762
  • Dao et al. (2022) “FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness”, NeurIPS. https://arxiv.org/abs/2205.14135
  • Dao (2023) “FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning”. https://arxiv.org/abs/2307.08691
  • Brown et al. (2020) “Language Models are Few‑Shot Learners” (GPT‑3), NeurIPS. https://arxiv.org/abs/2005.14165
  • Dosovitskiy et al. (2020) “An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale”, ICLR. https://arxiv.org/abs/2010.11929
  • Chowdhery et al. (2022) “PaLM: Scaling Language Modeling with Pathways”. https://arxiv.org/abs/2204.02311 (涉及 GQA/多查询注意力)
  • 各大科技公司技术博客:Google AI Blog, Meta AI Blog, OpenAI Research, 英伟达开发者博客 (FlashAttention 与 Transformer Engine)
  • 行业估算数据来源:NVIDIA 财务简报、IDC AI 基础设施预测、Semianalysis 等第三方分析平台(已标注 [估算])
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型