模型层 开放阅读

上下文窗口

Context Window

概念 ID
context-window
更新时间
2026-05-29
来源数量
待补

3秒看懂

上下文窗口(Context Window)是大语言模型在生成每个词时能“看到”的文本上限,决定了模型能处理和记忆的对话、文档长度。窗口越长,能一次分析的内容越多(例如整本小说、长代码库、长会议记录),但计算开销通常随长度呈二次方增长。直观理解:它像是模型的工作记忆容量,超出窗口的早期信息会被丢弃,导致模型“遗忘”。

3分钟产业解释

上下文窗口是衡量大语言模型能力的关键性能指标,直接决定应用场景的广度——从对话机器人到长文档摘要、代码分析、多轮复杂指令跟踪。产业中,扩展窗口的路径主要有两条:一是通过高效的注意力机制(如稀疏注意力、线性注意力、分块注意力)将复杂度从 O(L²) 降为 O(L) 或 O(L log L),从而支持上下文从千级 tokens 提升到数十万甚至百万级;二是通过工程优化(增强位置编码的外推、分层内存、缓存压缩)在保持较高精度下延长有效上下文。两者都需要在算力、显存与延迟之间做平衡。当前,行业头部模型已从 2021 年的 2k–4k tokens,经过技术迭代,支持到 32k、128k,部分宣称支持 1M tokens,但实际有效利用的上限仍受指令跟随能力和推理成本的制约。

15分钟专家深入

上下文窗口的增长并非线性收益——它牵动模型架构、训练数据构造、位置编码设计、推理基础设施的全栈协同。

注意力机制的根本瓶颈:标准自注意力的时‑空复杂度与序列长度 L 的平方成正比,这导致显存占用和延迟随窗口扩大急剧膨胀。因此,LLaMA‑2 的长上下文版本采用分组查询注意力和改进的旋转位置编码(RoPE)外推来降低 KV 缓存压力;而 Gemini 1.5 混合稀疏‑密集注意力,在百万 token 上下文下保持计算可行。此外,FlashAttention 等 IO‑aware 算法在 GPU 上优化了显存搬运,使单卡能支撑更大 L。

位置编码的扩展性:原始 Transformer 的正弦位置编码(SinPE)不支持训练长度外推;后来的学习位置编码(可学习嵌入)更限定序列长度。RoPE 以其相对位置特性结合线性插值或 NTK‑aware 缩放后,能较好地将训练时长度(如 4k)推广到推理时数万 token 不出性能断崖。ALiBi 等去学习位置编码也展现了外推优势。

高效注意力范式:除了硬件优化,学术与工业界探索了线性注意力(如 Performer、RetNet)、分块注意力(如 Reformer、Longformer)、内存增强专家路由(Memorizing Transformers)等,旨在将复杂度降至线性或近似线性。然而,这些方法在真实长程依赖上的召回率仍与全二次注意力存在差距,在需要精确指代消解、长程逻辑关系的任务中,全注意力或近似的滑动窗口 + 全局 token 方案(如 StreamingLLM、Mistral)更受青睐。

系统协同:长上下文推理所需 KV 缓存内存与 L 成正比,而 HBM 容量是瓶颈。混合到 CPU 内存或 NVMe 的 Offloading、KV 缓存的量化与共享等成为部署关键技术。同时,长序列并行训练中的序列并行策略(如 DeepSpeed Ulysses、Ring Attention)将序列维度切分到多卡,使得训练一万以上 tokens 长度成为可能。

技术原理

(最深,解释核心机制与关键参数)

1. 自注意力与 O(L²) 的起源

给定输入序列 X∈ℝ^(L×d),通过线性变换得到查询 Q、键 K、值 V∈ℝ^(L×d_k)。输出为:

Attention(Q,K,V) = softmax(QK^T / √d_k) V

QK^T 矩阵尺寸为 L×L,其中的每个元素都需要计算,并且 softmax 后的注意力权重要与 V 相乘。导致计算量 ~ O(L² d),显存存储注意力矩阵亦为 O(L²)。对于长序列,L=128k 时 L² 约 1.6×10¹⁰,远超 GPU 内存可承受。

2. 降低复杂度的方法示意(伪代码结构)

稀疏注意力(局部窗口 + 全局 token)

# 每个 token 仅关注其前后 w 个 token 以及一组预选的全局 token
for i in 1..L:
    local = max(1, i-w) .. min(L, i+w)
    global = [set of global indices]
    attention_mask[i, local ∪ global] = 1

典型的稀疏度使计算量降至 O(L * (w + G)),w≪L,G 为全局 token 数。

线性注意力 用核函数 φ 近似 softmax,使 QK^T 分解为 φ(Q)φ(K)^T,从而可以改变计算顺序:

((φ(Q) φ(K)^T) V) = φ(Q) (φ(K)^T V)

先计算 K^T V ∈ℝ^(d×d),再与 Q 相乘,复杂度 O(L d²)。当 d≪L 时近似线性。

分块注意力(Blockwise) 将序列切分成大小为 B 的块,结合块内全注意力和块间全局注意力,并配以分块 softmax 计算,避免一次性存储整个 L×L 矩阵。FlashAttention 的核心即通过重新融合 kernel 避免了材质化注意力矩阵。

3. 位置编码延长机制(以 RoPE 为例)

RoPE 通过在 Q、K 乘上旋转矩阵来编码相对位置信息。训练窗口长度为 L_train,推理时若序列长度 L_test > L_train,可通过缩放旋转频率 base 值(从 b 调整到 b′ = b·k)来平滑外推,也称为 NTK‑aware 插值。典型配置如:LLaMA‑2‑7B‑4k 使用 linear 插值,LLaMA‑2‑7B‑32k 用 NTK‑aware 缩放。效果好但存在高频信息损失。

4. KV 缓存与内存

自回归生成时,已计算的 K、V 可缓存避免重复计算,所需显存为 2×层数×L×d_h×precision。对于 70B 模型 (d_h≈8192, 40 层),128k 上下文 FP16 下 KV 缓存约需 2×40×128k×8192×2 字节 ≈ 160 GB,远超单卡 HBM(如 H100 80GB)。因此长上下文部署必须使用多卡张量并行、KV 缓存量化或 offloading。

技术演进史

  • 2017 年之前:RNN/LSTM 中信息衰减,理论上无硬窗口,但实际长程依赖差。注意力机制在机器翻译中用于对齐,序列长度有限。
  • 2017 年:Transformer 提出,正弦位置编码实现任意长度序列处理,但训练复杂度 O(L²) 限制 L 通常为 512 或 1024。
  • 2018–2020 年:BERT 等预训练模型上下文多为 512 tokens;GPT‑2 提升至 1024;GPT‑3 达 2048;稀疏注意力学术方案涌现(Sparse Transformer、Longformer、BigBird)。长文本评测数据集(如 SCROLLS)建立。
  • 2021–2022 年:GPT‑3.5 系列部分 API 提供 4k 上下文;开源 LLaMA 1 训练长度 2k;FlashAttention (v1) 使得高效长序列训练成为可能;RoPE 主导位置编码。
  • 2023 年:Claude 推出 100k 上下文;GPT‑4 支持 8k 和 32k;LLaMA‑2 群体微调出 32k/70k 衍生版;MoE 架构(如 Mixtral)与长上下文结合;位置插值、YaRN 等技术成熟。
  • 2024–2025 年:Gemini 1.5 宣称 1M–10M tokens 上下文;Claude 3 系列 200k;GPT‑4 Turbo 128k;国内模型如 Kimi、Qwen 也支持 128k 以上;环形注意力、序列并行训练为长上下文训练提供工程底座。长上下文推理成本持续下降,成为企业级应用的标配要求。

技术路线对比(量化表)

(由于缺乏公开的精确基准测试数据,表中性能指标为定性对比,长度数据基于厂家宣称或行业估算,[据公开迭代信息])

路线代表模型/方案宣称上下文长度(tokens)注意力复杂度长程召回能力推理效率/部署难度
全注意力 + 位置外推GPT‑4‑Turbo, 由 4k 外推至 128k128k[厂商宣称]O(L²)高(理论全召回)需大量显存,部署昂贵
滑动窗口 + 全局 tokenMistral, Longformer32k–128kO(L×(w+G))中‑高中等,KV 缓存随 L 线性
稀疏/分块注意力Gemini 1.5, GPT‑4 (推测)1M[厂商宣称]近似线性中‑高(关键信息召回好)复杂,需专门系统优化
线性/核注意力RetNet, RWKV, Performer理论无限O(L d²) 或 O(L)低‑中训练更快,但精度折损
多阶段记忆增强Memorizing Transformers, MemGPT以外部记忆扩展上下文主模型 O(L²) + 记忆检索动态分配推理逻辑复杂,延迟高

注:长程召回能力指在跨越多段落找回事实或遵循早期指令的准确率,与注意力模式和模型容量强相关。具体数字[未充分披露]。

上下游

上游

  • 底层硬件:GPU(NVIDIA H100/B200 等,提供大 HBM 及高带宽)、AI 加速器(TPU、自研芯片)。HBM 容量和带宽直接决定长上下文推理的单卡可行性。
  • 训练与推理框架:PyTorch、JAX、vLLM、TensorRT‑LLM、LMDeploy 等,需支持 FlashAttention 系列、PagedAttention、KV 缓存量化、序列并行等。
  • 长文本数据集:需要构造跨段落、多文档、带长程依赖的高质量语料;书籍、代码库、法律合同等天然长文本。
  • 位置编码与注意力库:如 xformers、flash‑infer 提供 OSS 实现。

下游

  • 应用层:长文档问答(财报分析、论文审阅)、代码理解与补全(整个仓库做 prompt)、长对话代理(多轮客户服务)、多步推理与规划、影视剧本生成、法律和医疗领域大批量记录处理。
  • 评测与过滤:长上下文“大海捞针”(Needle In A Haystack)测试、长文档问答基准(ZeroSCROLLS、L‑Eval)、现实世界多轮指令跟随后续任务等。另有 RAG 方案可与长上下文协同,长上下文窗口降低了对精确检索的依赖。

关键指标

  • 最大上下文长度(tokens):最直接的产品规格,单位通常为千/百万 tokens(1 token ≈ 0.75 英文单词或 1.5 汉字)。须区分训练窗口和实际可稳定利用窗口。
  • 有效上下文利用率:在长序列内不同位置(前、中、后)的任务准确率,尤其是首尾抓取与中间遗忘的“U 形曲线”程度,衡量位置偏差。
  • 推理时延和每 token 成本:随上下文长度增加的比率。理想为线性,实际常因注意力实现而呈超线性。
  • 首 token 延迟与吞吐:长上下文通常导致预填充阶段计算量大,首 token 延迟高。
  • 内存占用:KV 缓存大小(GB),直接影响所需 GPU 数量和成本。
  • 长程召回率:在大海捞针等测试中,在不同深度比例下正确找到插入句子的精度。

供需与市场数据

  • 需求:企业用户对长文档处理的需求从 2023 年中的 32k 快速跃迁至 2024 年的 128k 以上。代码理解、合同审查等场景要求至少 64k,视频、基因组等模态融合进一步要求百万级。根据[行业调研,未充分披露具体数值],至 2024 年底,超过 60% 的 LLM API 调用涉及 16k 以上上下文。
  • 供给:主流 API 提供商均已推出 128k 或 200k 的上下文窗口,并宣称无额外收费或边际成本很低,但实际推理集群资源紧张时长上下文请求常被限流。开源模型(如 LLaMA‑3、Qwen2)通过长上下文微调版本(128k)降低了获取门槛。
  • 成本趋势:长上下文推理成本随 FlashAttention‑3、KV 缓存量化、层/头共享等优化快速下降。根据[产业估算],2024 年处理 128k token 的单次推理成本较 2023 年同期降低约 60‑80%。
  • 区域竞争:国内模型(Kimi、Qwen、DeepSeek)在上下文长度上展开营销竞赛,推动 API 免费或低价,加速下游应用渗透。

代表公司与产业链映射

(以下基于公开信息,非投资建议)

  • OpenAI:GPT‑4 Turbo 128k 上下文(2023.11),通过 API 服务构建平台生态;与微软深度绑定,微软 Copilot、Office 365 集成长上下文。
  • Anthropic:Claude 系列从 100k 到 200k 上下文,强调高召回率和安全对齐,主攻企业知识库和法律分析市场,融资额超数十亿美元。
  • Google DeepMind:Gemini 1.5 基于混合稀疏注意力实现百万级上下文,可用于视频、音频流分析,体现多模态长上下文能力,Gemini API 已大规模开放。
  • Meta:开源 LLaMA 系列,社区通过微调发布 32k–128k 版本,繁荣开源生态,推动私有化长上下文部署。
  • Mistral AI:采用滑动窗口注意力,模型高效且开源,上下文 32k,以其性能密度吸引关注。
  • 国内:月之暗面(Kimi)主攻长上下文助手,宣称支持 200 万字;阿里(Qwen‑Long 512k)、DeepSeek(128k)等均将超长上下文作为卖点;百度文心一言、字节豆包等也在追赶。
  • 基础设施:NVIDIA(提供 GPU 硬件和 TensorRT‑LLM 软件栈)、CoreWeave、Lambda Labs 等 GPU 云服务商受益于长上下文推理的爆发需求;向量数据库和检索厂商(如 Pinecone、Weaviate)的生态位被部分替代与重构。

产业链研判要点

  1. 成本与效率的剪刀差:长上下文推理降本是下一波 LMM 应用爆发的关键。产业链观察重点包括底层注意力加速(FlashAttention 商业落地)、KV 缓存压缩、内存池化等技术提供商。
  2. 开源长上下文微调生态:基于 LLaMA 等基座衍生出的高利用率 128k 模型,降低了闭源 API 的溢价能力,迫使闭源厂商通过免费扩窗绑定生态。评估模型层护城河时,应观察其是否转向数据飞轮和应用粘性。
  3. 垂直场景刚需:法律、医疗、金融、AI for Science 等领域绝对需要长上下文精准理解,优先受益。具备垂直训练数据与评测闭环的团队可能率先实现产品化收益。
  4. 硬件瓶颈的产业链传导:长上下文对 HBM 带宽和容量的需求是指数上升的,HBM 制造、先进封装、高速互联(NVLink/InfiniBand)等相关供应链会受到需求传导影响。
  5. 注意替代风险:检索增强生成(RAG)和 Agent 工作流仍可与长上下文竞争。当 RAG 方案能在成本上大幅领先时,超长上下文的绝对必要性将受质疑,因此不宜把单一窗口长度叙事写成确定性结论。

常见误读纠偏

  • 误读:“上下文窗口长度 = 模型能准确使用所有 token”
    实际上,大多数模型在超出训练长度的范围后,利用能力急剧衰减。即便经过位置外推或稀疏注意力,模型在序列中间或远端的信息召回率可能依然偏低(中间丢失问题)。因此,厂家宣称的 1M 窗口和实际可用有效窗口是两个概念。

  • 误读:“窗口越大,模型越智能”
    上下文长度仅表示输入容量,不直接提升模型推理或知识容量。在窗口过大而训练数据未充分覆盖时,模型可能产生更多幻觉或迷失在冗长上下文中,反而降低下游任务表现。真正的性能提升需要配套长上下文指令跟随训练和数据质量控制。

  • 误读:“RAG 与长窗口是替代关系”
    两者是互补的。长窗口适合精细控制、上下文连贯性要求高的场景(如代码库级重构、完整合同比较);RAG 则在海量语料、动态知识更新与成本控制方面有优势。实际产业方案多为两者融合:用检索提供候选知识,用长窗口融合多篇文档给出整体洞察。

学习路径

  1. 基础(1~2周):复习 Transformer 自注意力原理,理解 O(L²) 来源;掌握绝对/相对位置编码(Sinusoidal、RoPE、ALiBi)及其扩展方法。
  2. 进阶(2~4周):阅读 FlashAttention v1/v2/v3 论文与源码;学习稀疏/线性注意力机制(Reformer, Longformer, Performer, RetNet);动手运行“大海捞针”评测脚本,体会不同位置的召回能力。
  3. 实战(ongoing):基于 huggingface 模型试用 RoPE 插值外推至超长上下文微调;使用 vLLM 或 TGI 部署长上下文模型,配置 KV 缓存量化及多卡张量并行;参与 LongBench、L‑Eval 等基准的评测与排行榜分析。
  4. 前沿:跟踪 Ring Attention、DistFlashAttention 序列并行训练进展;关注多模态长上下文研究,了解视频流、基因组序列等非文本情况下的窗口挑战;阅读 Gemini 1.5、Claude 3 技术报告中对长上下文的工程手法。

一句话总结

上下文窗口是 LLM 工作记忆的物理限制,其扩展史是一场注意力算法、位置编码工程与硬件挤成本的旷日博弈;窗口容量从千跃百万,但真正的挑战在于让模型在丝滑外推中保持不掉链子的长程理解力。

延伸阅读与来源

  • Vaswani et al., “Attention Is All You Need” (2017) — 原典
  • Dao et al., “FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness” (2022) 及其后续版本
  • Su et al., “RoFormer: Enhanced Transformer with Rotary Position Embedding” (2021)
  • Peng et al., “YaRN: Efficient Context Window Extension of Large Language Models” (2023)
  • Liu et al., “Ring Attention with Blockwise Transformers for Near‑Infinite Context” (2023)
  • Anthropic, “Model Card and Evaluations for Claude Models” (2024) — 大海捞针评测
  • Google DeepMind, “Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context” (2024)
  • 公开技术博客:OpenAI GPT‑4‑Turbo介绍,月之暗面Kimi技术分享,Mistral AI 窗版自注意力的说明
  • 基准与工具:LongChat, ZeroSCROLLS, L‑Eval, RULER; vLLM PagedAttention

(以上所有技术细节基于公开论文和官方发布,具体数字和模型归属以厂商最新声明为准。本文写作时间为2025年4月,部分数据属行业估算或[未充分披露]。)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型