模型層 開放閱讀

上下文視窗

Context Window

概念 ID
context-window
更新時間
2026-05-29
來源數量
待補

3秒看懂

上下文視窗(Context Window)是大語言模型在生成每個詞時能“看到”的文本上限,決定了模型能處理和記憶的對話、文件長度。視窗越長,能一次分析的內容越多(例如整本小說、長程式碼庫、長會議記錄),但計算開銷通常隨長度呈二次方增長。直觀理解:它像是模型的工作記憶容量,超出視窗的早期資訊會被丟棄,導致模型“遺忘”。

3分鐘產業解釋

上下文視窗是衡量大語言模型能力的關鍵效能指標,直接決定應用場景的廣度——從對話機器人到長文件摘要、程式碼分析、多輪複雜指令追蹤。產業中,擴充套件視窗的路徑主要有兩條:一是通過高效的注意力機制(如稀疏注意力、線性注意力、分塊注意力)將複雜度從 O(L²) 降為 O(L) 或 O(L log L),從而支援上下文從千級 tokens 提升到數十萬甚至百萬級;二是通過工程最佳化(增強位置編碼的外推、分層記憶體、快取壓縮)在保持較高精度下延長有效上下文。兩者都需要在算力、視訊記憶體與延遲之間做平衡。當前,行業頭部模型已從 2021 年的 2k–4k tokens,經過技術迭代,支援到 32k、128k,部分宣稱支援 1M tokens,但實際有效利用的上限仍受指令跟隨能力和推論成本的制約。

15分鐘專家深入

上下文視窗的增長並非線性收益——它牽動模型架構、訓練資料構造、位置編碼設計、推論基礎設施的全棧協同。

注意力機制的根本瓶頸:標準自注意力的時‑空複雜度與序列長度 L 的平方成正比,這導致視訊記憶體佔用和延遲隨視窗擴大急劇膨脹。因此,LLaMA‑2 的長上下文版本採用分組查詢注意力和改進的旋轉位置編碼(RoPE)外推來降低 KV 快取壓力;而 Gemini 1.5 混合稀疏‑密集註意力,在百萬 token 上下文下保持計算可行。此外,FlashAttention 等 IO‑aware 演算法在 GPU 上優化了視訊記憶體搬運,使單卡能支撐更大 L。

位置編碼的擴充套件性:原始 Transformer 的正弦位置編碼(SinPE)不支援訓練長度外推;後來的學習位置編碼(可學習嵌入)更限定序列長度。RoPE 以其相對位置特性結合線性插值或 NTK‑aware 縮放後,能較好地將訓練時長度(如 4k)推廣到推論時數萬 token 不出效能斷崖。ALiBi 等去學習位置編碼也展現了外推優勢。

高效注意力範式:除了硬體最佳化,學術與工業界探索了線性注意力(如 Performer、RetNet)、分塊注意力(如 Reformer、Longformer)、記憶體增強專家路由(Memorizing Transformers)等,旨在將複雜度降至線性或近似線性。然而,這些方法在真實長程依賴上的召回率仍與全二次注意力存在差距,在需要精確指代消解、長程邏輯關係的任務中,全注意力或近似的滑動視窗 + 全域性 token 方案(如 StreamingLLM、Mistral)更受青睞。

系統協同:長上下文推論所需 KV 快取記憶體與 L 成正比,而 HBM 容量是瓶頸。混合到 CPU 記憶體或 NVMe 的 Offloading、KV 快取的量化與共享等成為部署關鍵技術。同時,長序列並行訓練中的序列並行策略(如 DeepSpeed Ulysses、Ring Attention)將序列維度切分到多卡,使得訓練一萬以上 tokens 長度成為可能。

技術原理

(最深,解釋核心機制與關鍵引數)

1. 自注意力與 O(L²) 的起源

給定輸入序列 X∈ℝ^(L×d),通過線性變換得到查詢 Q、鍵 K、值 V∈ℝ^(L×d_k)。輸出為:

Attention(Q,K,V) = softmax(QK^T / √d_k) V

QK^T 矩陣尺寸為 L×L,其中的每個元素都需要計算,並且 softmax 後的注意力權重要與 V 相乘。導致計算量 ~ O(L² d),視訊記憶體儲存注意力矩陣亦為 O(L²)。對於長序列,L=128k 時 L² 約 1.6×10¹⁰,遠超 GPU 記憶體可承受。

2. 降低複雜度的方法示意(虛擬碼結構)

稀疏注意力(區域性視窗 + 全域性 token)

# 每個 token 僅關注其前後 w 個 token 以及一組預選的全域性 token
for i in 1..L:
    local = max(1, i-w) .. min(L, i+w)
    global = [set of global indices]
    attention_mask[i, local ∪ global] = 1

典型的稀疏度使計算量降至 O(L * (w + G)),w≪L,G 為全域性 token 數。

線性注意力 用核函式 φ 近似 softmax,使 QK^T 分解為 φ(Q)φ(K)^T,從而可以改變計算順序:

((φ(Q) φ(K)^T) V) = φ(Q) (φ(K)^T V)

先計算 K^T V ∈ℝ^(d×d),再與 Q 相乘,複雜度 O(L d²)。當 d≪L 時近似線性。

分塊注意力(Blockwise) 將序列切分成大小為 B 的塊,結合塊內全注意力和塊間全域性注意力,並配以分塊 softmax 計算,避免一次性儲存整個 L×L 矩陣。FlashAttention 的核心即通過重新融合 kernel 避免了材質化注意力矩陣。

3. 位置編碼延長機制(以 RoPE 為例)

RoPE 通過在 Q、K 乘上旋轉矩陣來編碼相對位置資訊。訓練視窗長度為 L_train,推論時若序列長度 L_test > L_train,可通過縮放旋轉頻率 base 值(從 b 調整到 b′ = b·k)來平滑外推,也稱為 NTK‑aware 插值。典型配置如:LLaMA‑2‑7B‑4k 使用 linear 插值,LLaMA‑2‑7B‑32k 用 NTK‑aware 縮放。效果好但存在高頻資訊損失。

4. KV 快取與記憶體

自迴歸生成時,已計算的 K、V 可快取避免重複計算,所需視訊記憶體為 2×層數×L×d_h×precision。對於 70B 模型 (d_h≈8192, 40 層),128k 上下文 FP16 下 KV 快取約需 2×40×128k×8192×2 位元組 ≈ 160 GB,遠超單卡 HBM(如 H100 80GB)。因此長上下文部署必須使用多卡張量並行、KV 快取量化或 offloading。

技術演進史

  • 2017 年之前:RNN/LSTM 中資訊衰減,理論上無硬視窗,但實際長程依賴差。注意力機制在機器翻譯中用於對齊,序列長度有限。
  • 2017 年:Transformer 提出,正弦位置編碼實現任意長度序列處理,但訓練複雜度 O(L²) 限制 L 通常為 512 或 1024。
  • 2018–2020 年:BERT 等預訓練模型上下文多為 512 tokens;GPT‑2 提升至 1024;GPT‑3 達 2048;稀疏注意力學術方案湧現(Sparse Transformer、Longformer、BigBird)。長文本評測資料集(如 SCROLLS)建立。
  • 2021–2022 年:GPT‑3.5 系列部分 API 提供 4k 上下文;開源 LLaMA 1 訓練長度 2k;FlashAttention (v1) 使得高效長序列訓練成為可能;RoPE 主導位置編碼。
  • 2023 年:Claude 推出 100k 上下文;GPT‑4 支援 8k 和 32k;LLaMA‑2 群體微調出 32k/70k 衍生版;MoE 架構(如 Mixtral)與長上下文結合;位置插值、YaRN 等技術成熟。
  • 2024–2025 年:Gemini 1.5 宣稱 1M–10M tokens 上下文;Claude 3 系列 200k;GPT‑4 Turbo 128k;國內模型如 Kimi、Qwen 也支援 128k 以上;環形注意力、序列並行訓練為長上下文訓練提供工程底座。長上下文推論成本持續下降,成為企業級應用的標配要求。

技術路線對比(量化表)

(由於缺乏公開的精確基準測試資料,表中效能指標為定性對比,長度資料基於廠家宣稱或行業估算,[據公開迭代資訊])

路線代表模型/方案宣稱上下文長度(tokens)注意力複雜度長程召回能力推論效率/部署難度
全注意力 + 位置外推GPT‑4‑Turbo, 由 4k 外推至 128k128k[廠商宣稱]O(L²)高(理論全召回)需大量視訊記憶體,部署昂貴
滑動視窗 + 全域性 tokenMistral, Longformer32k–128kO(L×(w+G))中‑高中等,KV 快取隨 L 線性
稀疏/分塊注意力Gemini 1.5, GPT‑4 (推測)1M[廠商宣稱]近似線性中‑高(關鍵資訊召回好)複雜,需專門系統最佳化
線性/核注意力RetNet, RWKV, Performer理論無限O(L d²) 或 O(L)低‑中訓練更快,但精度折損
多階段記憶增強Memorizing Transformers, MemGPT以外部記憶擴充套件上下文主模型 O(L²) + 記憶檢索動態分配推論邏輯複雜,延遲高

注:長程召回能力指在跨越多段落找回事實或遵循早期指令的準確率,與注意力模式和模型容量強相關。具體數字[未充分揭露]。

上下游

上游

  • 底層硬體:GPU(NVIDIA H100/B200 等,提供大 HBM 及高頻寬)、AI 加速器(TPU、自研晶片)。HBM 容量和頻寬直接決定長上下文推論的單卡可行性。
  • 訓練與推論架構:PyTorch、JAX、vLLM、TensorRT‑LLM、LMDeploy 等,需支援 FlashAttention 系列、PagedAttention、KV 快取量化、序列並行等。
  • 長文本資料集:需要構造跨段落、多文件、帶長程依賴的高質量語料;書籍、程式碼庫、法律合同等天然長文本。
  • 位置編碼與注意力庫:如 xformers、flash‑infer 提供 OSS 實現。

下游

  • 應用層:長文件問答(財報分析、論文審閱)、程式碼理解與補全(整個倉庫做 prompt)、長對話代理(多輪客戶服務)、多步推論與規劃、影視劇本生成、法律和醫療領域大批次記錄處理。
  • 評測與過濾:長上下文“大海撈針”(Needle In A Haystack)測試、長文件問答基準(ZeroSCROLLS、L‑Eval)、現實世界多輪指令跟隨後續任務等。另有 RAG 方案可與長上下文協同,長上下文視窗降低了對精確檢索的依賴。

關鍵指標

  • 最大上下文長度(tokens):最直接的產品規格,單位通常為千/百萬 tokens(1 token ≈ 0.75 英文單詞或 1.5 漢字)。須區分訓練視窗和實際可穩定利用視窗。
  • 有效上下文利用率:在長序列內不同位置(前、中、後)的任務準確率,尤其是首尾抓取與中間遺忘的“U 形曲線”程度,衡量位置偏差。
  • 推論時延和每 token 成本:隨上下文長度增加的比率。理想為線性,實際常因注意力實現而呈超線性。
  • 首 token 延遲與吞吐:長上下文通常導致預填充階段計算量大,首 token 延遲高。
  • 記憶體佔用:KV 快取大小(GB),直接影響所需 GPU 數量和成本。
  • 長程召回率:在大海撈針等測試中,在不同深度比例下正確找到插入句子的精度。

供需與市場資料

  • 需求:企業使用者對長文件處理的需求從 2023 年中的 32k 快速躍遷至 2024 年的 128k 以上。程式碼理解、合同審查等場景要求至少 64k,影片、基因組等模態融合進一步要求百萬級。根據[行業調研,未充分揭露具體數值],至 2024 年底,超過 60% 的 LLM API 呼叫涉及 16k 以上上下文。
  • 供給:主流 API 提供商均已推出 128k 或 200k 的上下文視窗,並宣稱無額外收費或邊際成本很低,但實際推論叢集資源緊張時長上下文請求常被限流。開源模型(如 LLaMA‑3、Qwen2)通過長上下文微調版本(128k)降低了獲取門檻。
  • 成本趨勢:長上下文推論成本隨 FlashAttention‑3、KV 快取量化、層/頭共享等最佳化快速下降。根據[產業估算],2024 年處理 128k token 的單次推論成本較 2023 年同期降低約 60‑80%。
  • 區域競爭:國內模型(Kimi、Qwen、DeepSeek)在上下文長度上展開營銷競賽,推動 API 免費或低價,加速下游應用滲透。

代表公司與產業鏈對映

(以下基於公開資訊,非投資建議)

  • OpenAI:GPT‑4 Turbo 128k 上下文(2023.11),通過 API 服務建置平台生態;與微軟深度繫結,微軟 Copilot、Office 365 整合長上下文。
  • Anthropic:Claude 系列從 100k 到 200k 上下文,強調高召回率和安全對齊,主攻企業知識庫和法律分析市場,融資額超數十億美元。
  • Google DeepMind:Gemini 1.5 基於混合稀疏注意力實現百萬級上下文,可用於影片、音訊流分析,體現多模態長上下文能力,Gemini API 已大規模開放。
  • Meta:開源 LLaMA 系列,社群通過微調發布 32k–128k 版本,繁榮開源生態,推動私有化長上下文部署。
  • Mistral AI:採用滑動視窗注意力,模型高效且開源,上下文 32k,以其效能密度吸引關注。
  • 國內:月之暗面(Kimi)主攻長上下文助手,宣稱支援 200 萬字;阿里(Qwen‑Long 512k)、DeepSeek(128k)等均將超長上下文作為賣點;百度文心一言、位元組豆包等也在追趕。
  • 基礎設施:NVIDIA(提供 GPU 硬體和 TensorRT‑LLM 軟體棧)、CoreWeave、Lambda Labs 等 GPU 雲端服務商受益於長上下文推論的爆發需求;向量資料庫和檢索廠商(如 Pinecone、Weaviate)的生態位被部分替代與重構。

產業鏈研判要點

  1. 成本與效率的剪刀差:長上下文推論降本是下一波 LMM 應用爆發的關鍵。產業鏈觀察重點包括底層注意力加速(FlashAttention 商業落地)、KV 快取壓縮、記憶體池化等技術提供商。
  2. 開源長上下文微調生態:基於 LLaMA 等基座衍生出的高利用率 128k 模型,降低了閉源 API 的溢價能力,迫使閉源廠商通過免費擴窗繫結生態。評估模型層護城河時,應觀察其是否轉向資料飛輪和應用粘性。
  3. 垂直場景剛需:法律、醫療、金融、AI for Science 等領域絕對需要長上下文精準理解,優先受益。具備垂直訓練資料與評測閉環的團隊可能率先實現產品化收益。
  4. 硬體瓶頸的產業鏈傳導:長上下文對 HBM 頻寬和容量的需求是指數上升的,HBM 製造、先進封裝、高速互聯(NVLink/InfiniBand)等相關供應鏈會受到需求傳導影響。
  5. 注意替代風險:檢索增強生成(RAG)和 Agent 工作流仍可與長上下文競爭。當 RAG 方案能在成本上大幅領先時,超長上下文的絕對必要性將受質疑,因此不宜把單一視窗長度敘事寫成確定性結論。

常見誤讀糾偏

  • 誤讀:“上下文視窗長度 = 模型能準確使用所有 token”
    實際上,大多數模型在超出訓練長度的範圍後,利用能力急劇衰減。即便經過位置外推或稀疏注意力,模型在序列中間或遠端的資訊召回率可能依然偏低(中間丟失問題)。因此,廠家宣稱的 1M 視窗和實際可用有效視窗是兩個概念。

  • 誤讀:“視窗越大,模型越智慧”
    上下文長度僅表示輸入容量,不直接提升模型推論或知識容量。在視窗過大而訓練資料未充分覆蓋時,模型可能產生更多幻覺或迷失在冗長上下文中,反而降低下游任務表現。真正的效能提升需要配套長上下文指令跟隨訓練和資料質量控制。

  • 誤讀:“RAG 與長視窗是替代關係”
    兩者是互補的。長視窗適合精細控制、上下文連貫性要求高的場景(如程式碼庫級重構、完整合年增率較);RAG 則在海量語料、動態知識更新與成本控制方面有優勢。實際產業方案多為兩者融合:用檢索提供候選知識,用長視窗融合多篇文件給出整體洞察。

學習路徑

  1. 基礎(1~2周):複習 Transformer 自注意力原理,理解 O(L²) 來源;掌握絕對/相對位置編碼(Sinusoidal、RoPE、ALiBi)及其擴充套件方法。
  2. 進階(2~4周):閱讀 FlashAttention v1/v2/v3 論文與原始碼;學習稀疏/線性注意力機制(Reformer, Longformer, Performer, RetNet);動手執行“大海撈針”評測指令碼,體會不同位置的召回能力。
  3. 實戰(ongoing):基於 huggingface 模型試用 RoPE 插值外推至超長上下文微調;使用 vLLM 或 TGI 部署長上下文模型,配置 KV 快取量化及多卡張量並行;參與 LongBench、L‑Eval 等基準的評測與排行榜分析。
  4. 前沿:追蹤 Ring Attention、DistFlashAttention 序列並行訓練進展;關注多模態長上下文研究,瞭解影片流、基因組序列等非文本情況下的視窗挑戰;閱讀 Gemini 1.5、Claude 3 技術報告中對長上下文的工程手法。

一句話總結

上下文視窗是 LLM 工作記憶的物理限制,其擴充套件史是一場注意力演算法、位置編碼工程與硬體擠成本的曠日博弈;視窗容量從千躍百萬,但真正的挑戰在於讓模型在絲滑外推中保持不掉鏈子的長程理解力。

延伸閱讀與來源

  • Vaswani et al., “Attention Is All You Need” (2017) — 原典
  • Dao et al., “FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness” (2022) 及其後續版本
  • Su et al., “RoFormer: Enhanced Transformer with Rotary Position Embedding” (2021)
  • Peng et al., “YaRN: Efficient Context Window Extension of Large Language Models” (2023)
  • Liu et al., “Ring Attention with Blockwise Transformers for Near‑Infinite Context” (2023)
  • Anthropic, “Model Card and Evaluations for Claude Models” (2024) — 大海撈針評測
  • Google DeepMind, “Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context” (2024)
  • 公開技術部落格:OpenAI GPT‑4‑Turbo介紹,月之暗面Kimi技術分享,Mistral AI 窗版自注意力的說明
  • 基準與工具:LongChat, ZeroSCROLLS, L‑Eval, RULER; vLLM PagedAttention

(以上所有技術細節基於公開論文和官方釋出,具體數字和模型歸屬以廠商最新宣告為準。本文寫作時間為2025年4月,部分資料屬行業估算或[未充分揭露]。)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型