模型層 開放閱讀

長上下文

Long Context

概念 ID
long-context
更新時間
2026-05-29
來源數量
待補

長上下文

3 秒看懂

長上下文(Long Context)是讓大語言模型單次處理海量資訊的能力——從幾萬到百萬 token 不等,相當於一次吞下整部《三體》或數百頁法律合同。它通過位置編碼擴充套件、注意力機制最佳化、視訊記憶體工程與並行策略實現,使得模型能在晶片設計、金融報告、長程對話等場景中保持全域性一致性,是 Agent、多模態、RAG 替代路徑中的關鍵軍備競賽維度。

3 分鐘產業解釋

長上下文不是簡單的把輸入框拉大,而是讓 Transformer 架構突破“序列長度平方爆炸”與“位置泛化”兩大物理瓶頸。產業上,它決定了模型能否真正替代人類閱讀長文件、處理完整的程式碼倉庫、記憶數月對話。核心是在不犧牲推論速度或精度的情況下,把有效上下文視窗從 4K 擴充套件到 100K、1M token。

實現路徑包括:

  1. 位置編碼創新——讓模型在訓練長度外推,例如 RoPE 的 NTK‑aware/ReRoPE/YaRN 等動態縮放,或 ALiBi 的相對編碼。
  2. 稀疏/區域性注意力——讓注意力複雜度從 O(N²) 降至接近 O(N log N),例如 Sliding Window、Longformer、Mistral 的 SWA。
  3. 視訊記憶體與 IO 最佳化——FlashAttention、PagedAttention、GQA(分組查詢注意力)、KV cache 量化與解除安裝,使長序列推論在單卡可行。
  4. 並行策略——RingAttention/Striped Attention 將長序列切分到多裝置,用環形通訊計算注意力,突破單卡限制。
  5. 資料工程——用長文件、程式碼庫逐步延長訓練長度,維持效能不退化。

商業上,GPT‑4‑Turbo (128K)、Claude‑3 (200K)、Gemini 1.5 Pro (1M stable / 10M 實驗)、Kimi (200 萬字)、Qwen‑Long 等已實現。長上下文正重塑 AI 應用的邊界:法律合同審查、基因序列分析、全庫程式碼生成、長影片理解。但成本激增(KV cache 隨長度線性增長)和“迷失在中間”效應(模型對長文本中央的資訊關注度下降)仍是落地難題。

15 分鐘專家深入

為什麼長上下文如此艱難?

Transformer 的自注意力機制是 O(N²) 計算與儲存複雜度(N 為序列長度)。即使記憶體足夠,位置編碼的訓練長度限制也讓模型在超出訓練時的長度時困惑甚至崩潰。此外,長序列推論時,KV cache 佔用的視訊記憶體常超引數量本身:對 1M token,若用 FP16 且未最佳化,KV cache > 3TB,遠超任何單卡 HBM。因此產業必須多點協同:演算法減複雜度、系統擴容量、位置編碼推長度、資料保質量。

關鍵技術棧深度解析

1. 位置編碼:突破“長度泛化”

  • RoPE(旋轉位置編碼):通過旋轉矩陣對 Query/Key 注入位置資訊,具有相對位置衰減遠端的特性,但直接外推會崩潰。業界通過調整基頻(base frequency)實現 NTK‑aware 縮放,或 YarN 方法(頻率分割槽縮放+溫度機制),在不重訓或輕量續訓下把 4K 模型擴充套件至 128K 甚至 1M。
  • ALiBi:在注意力分數上直接加一個與距離成反比的偏置,天然支援任意長度外推,無需複雜縮放,在 BLOOM 等模型中應用,但上限可能不如調整後的 RoPE。
  • 其他路徑:NoPE(無顯式位置編碼)在 Transformer 中通過因果掩碼自發學習位置,長上下文能力仍在探索。

2. 注意力機制:突破 O(N²)

  • 稀疏注意力:讓每個 token 只關注區域性視窗(如 4096)和少量全域性 token(如 Longformer 的全域性注意力),或使用 Block‑Sparse Attention(分割槽計算)。Mistral 的滑動視窗注意力(SWA)讓推論時只需快取視窗內的 KV,極大降低視訊記憶體,但會犧牲全域性長依賴;Mistral 並未使用 sink token(sink token 是 StreamingLLM 等方法中的概念),僅靠滑動視窗。
  • 低秩近似:如Linformer、Performer,用核函式或低秩投影逼近標準注意力,理論上可線性複雜度,但實際精度往往不足,在 LLM 未大規模採用。
  • 硬體適配:FlashAttention 利用分塊(tiling)和重算,將 HBM 訪問最小化,在長序列下提速數倍,已成為標配。FlashDecoding 專為推論長序列加速。

3. 系統並行:跨卡“拼”上下文

  • RingAttention(環形注意力):每個裝置持有序列的一塊,迴圈傳遞 K/V 塊,通訊與計算重疊。理論上可隨裝置數線性擴充套件序列長度,已用於 Gemini 1.5 Pro 的百萬級訓練。
  • 張量並行 + 序列並行:將序列維度切分(如 Megatron‑SP)或使用 Head‑Parallel 實現。
  • KV Cache 最佳化:GQA/MQA 將多個 Query 頭共享同一個 KV 頭,使 KV cache 量減少數十倍;量化(如 INT4)和 offload(解除安裝到 CPU/SSD)讓超長推論成本可接受。

4. 訓練與資料:如何“喂”出長上下文

  • 短兩段訓練:先用短上下文(如 2K/4K)訓練大部分算力,再用長文本(32K–128K)小比例訓練,確保長距離理解不衝擊短文本效能。
  • 資料配比:書籍、程式碼、對話長文件、維基長條目,並加入“大海撈針”式合成數據,提升檢索精度。
  • 課程學習:逐步增加長度,配合位置編碼縮放,讓模型平穩泛化。

量化挑戰:推論成本

KV cache 大小 = 2×層數×num_kv_heads×head_dim×序列長度×精度位元組。以模型 LLaMA‑2‑70B 為例,GQA 後(num_kv_heads=8)KV cache 每 token 約 320KB(估算值),128K 上下文約 40GB,接近單卡 HBM 上限(如 A100/H100 為 80GB),並非此前部分估計的“遠超”單卡 HBM。即使可單卡裝載,延遲和吞吐仍是商業部署的瓶頸。因此生產環境中常壓縮上下文步長、使用投機取樣、快取複用或 prompt 壓縮。

技術原理(最深,含機制與引數關係)

以標準因果自注意力 Transformer 為例,輸入序列 tokens X ∈ R^(N×d),通過線性投影得到 Q、K、V。

注意力公式

Attention(Q,K,V) = softmax( QK^T / √d_k + M ) V

M 為掩碼矩陣,通常為因果掩碼(上三角為 -∞)。計算 QK^T 需要 O(N²d) 時間和 O(N²) 視訊記憶體(儲存注意力分數)。輸出的計算也需要 O(N²d)。對於長序列 N=128K,d_head=128,單層注意力分數矩陣就有 16B 個元素,FP16 下約 32GB,完全不可行。因此必須分塊計算或稀疏化。

位置編碼注入機制

  • RoPE 在 Q、K 上逐對維度應用旋轉:q_rot_i = q_i * cos(θ_i*pos) - q_j * sin(θ_i*pos) 等,使得點積結果依賴於相對位置 pos_q – pos_k。其基頻 θ = 10000^(-2i/d) 控制波長。外推需要放大頻率(如 NTK 加倍基頻),或 YaRN 的精細縮放。
  • ALiBi 直接在注意力分數上加入 (-m · |pos_q – pos_k|),m 是頭特定的坡度,訓練時不需位置嵌入,天然泛化。

視訊記憶體與計算瓶頸示意圖 (ASCII)

序列長度 N
輸入 tokens: [T1, T2, T3 ... TN]

Q,K,V 形狀: [N, d]
QK^T: [N, N]   —— O(N²) 矩陣
softmax 之後: [N, N]
乘以 V: [N, d]

KV Cache 在自迴歸推論中:
每個生成步, 儲存所有前文 K,V,
形狀: 2 × 層數 × [N, num_heads, head_dim]

長上下文關鍵技術協同

  • FlashAttention:將大矩陣切分為 tile,在 SRAM 內完成 softmax 區域性計算後更新全域性,避免 HBM 頻繁讀寫,降低 IO。
  • GQA:假設 num_kv_heads = 1 或 n,遠小於 num_query_heads,KV cache 量減少 num_query_heads / num_kv_heads 倍。
  • RingAttention:裝置 i 持有序列塊 i,計算其區域性 Q 與當前環上傳遞的 K/V 塊互動,完成後將自身 KV 塊傳給下一個裝置,迴圈 N/塊數次,通訊與計算重疊,最大長度擴充套件為裝置數×單卡長度。

技術演進史

  • 2017–2019 基礎期:Transformer 原文使用絕對位置編碼(正弦/餘弦或可學習),固定訓練長度。BERT/GPT‑2 約 512/1024 token。
  • 2020 稀疏注意力探索:Longformer、BigBird、Reformer 提出多種稀疏模式,將複雜度降至 O(N) 或 O(N log N),但往往針對特定任務,不通用。
  • 2021 位置編碼革命:RoPE (Su et al.) 為相對位置提供了優雅方案,ALiBi 釋出展現零外推能力,兩者成為後來幾乎所有 LLM 的基石。
  • 2022 系統化擴充套件:FlashAttention 解決 I/O 瓶頸,GQA 視訊記憶體最佳化,同時 PaLM、Chinchilla 等強調訓練長度(2048/8192)。
  • 2023 “上下文軍備”:GPT‑4 128K、Claude 100K、開源模型(LLaMA 4K,後續擴充套件至 32K/128K 通過微調),出現 NTK‑aware、YaRN 等方法社群爆發,Mistral 通過滑動視窗實現低成本長上下文。
  • 2024 百萬 token 時代:Gemini 1.5 Pro 可穩定處理 1M token,甚至 10M;國內 Kimi 支援 200 萬字;成本下降但技術挑戰轉移到資訊檢索精度和多跳推論的深度保持。

技術路線對比(量化表)

維度稀疏注意力(Sliding Window / Longformer)RoPE + 動態縮放(NTK/YaRN)ALiBiRingAttention+並行分塊
位置編碼依賴通常配合 RoPE,但視窗外無位置資訊需要原有 RoPE 模型,輕量續訓獨立位置方案不直接涉及位置編碼
最大有效長度(估算)128K 級別(視窗 4K+全域性 token)取決於縮放與續訓,可達 1M+理論上無限,實測 ~128K裝置數 × 單卡長度,已實現 10M+
計算複雜度O(NW) (W 視窗大小)O(N²) 但用 FlashAttention 加速O(N²)總體 O(N²) 但按裝置分攤
全域性長依賴能力弱,除非全域性 token 精心設計強,可檢索文件任意位置,有“迷失中間”強,但遠距衰減過快可能理論上完整,受並行通訊開銷影響
推論視訊記憶體 (KV cache)僅存視窗內 KV,極小全序列 KV,佔用大,需 GQA/量化全序列 KV,需最佳化分散式儲存,單卡壓力小
典型代表Mistral 7BLLaMA2‑Chat(通過社群微調), QwenBLOOM, MPT-7B‑8kGemini 1.5 Pro 訓練
落地成熟度高,成本優勢突出高,成為主流開源擴充套件方案中等,大型模型較少使用低,主要用於超大型模型訓練

注:具體量化引數因模型和實現而異,標記為“估算”或基於公開論文。

上下游

上游

  • 算力基礎設施:高頻寬 GPU/TPU 叢集,Interconnect(NVLink、InfiniBand)決定 RingAttention 等並行效率。
  • 高容量 HBM:長上下文推論是視訊記憶體消耗大戶,HBM3e(60+ GB)與新一代封裝(CoWoS-L)擴大容量。
  • 資料標註與合成:長文件、程式碼庫、對話資料集,合成“大海撈針”(Needle In A Haystack) 測試集。
  • 演算法研究:高校/實驗室的位置編碼理論、注意力近似理論。

下游

  • 法律/金融文件分析:合年增率對、年報解讀、合規審查。
  • 程式碼智慧代理:整個倉庫級別的程式碼補全、重構、bug 定位。
  • 生物醫療:基因序列、蛋白質長鏈建模。
  • 多模態融合:長影片理解、高解析度影像拼接。
  • AI 對話與助手:數月記憶的無損對話,客戶服務記錄。
  • RAG 替代/補充:長上下文削弱了對檢索增強的依賴,但兩者將混合使用。

關鍵指標

  1. 有效上下文視窗(Effective Context Window):模型能準確使用的最長 token 數,通常用“大海撈針”測試訊號保留(>95% 檢索率)衡量。
  2. 推論延遲:首 token 延遲(prefill latency)與後續每 token 延遲(decode latency),隨長度線性或超線性增長。
  3. KV cache 視訊記憶體佔用:每 token 的 KV 體積(位元組)決定部署規模。
  4. 困惑度(PPL)或精度衰減曲線:隨著序列位置變化,模型預測質量的下墜速度。
  5. 吞吐量:在給定長上下文下每秒能處理的請求數,受視訊記憶體頻寬和並行策略影響。

供需與市場資料

以下資料為行業估算,未經廠商確切揭露

  • 2024 年,長上下文(≥128K)已成為旗艦模型標配,預計 2025 年主流開源模型將普遍支援 256K–1M。
  • 推論成本方面,100K 上下文呼叫成本通常是 4K 的 20–40 倍(基於 GPT‑4 Turbo / Claude‑3 pricing 推算),因 KV cache 線性增長。
  • 全球長上下文 API 呼叫量季度季增率增長約 50%([行業估算]),驅動因素為法律、金融、程式碼和 Agent 場景。
  • 硬體支出方面,為在 1M token 下保持可接受延遲,單使用者可能需要 8 卡 A100/H100 叢集,推論服務商開始推出專用“長上下文”方案。

代表公司與資本對映

  • OpenAI:GPT‑4‑Turbo 128K,通過 tokenizer 最佳化與系統訓練,率先定義長上下文產品標準。
  • Anthropic:Claude 3 Opus 200K,強調資訊提取精度與安全。
  • Google DeepMind:Gemini 1.5 Pro 宣稱達到 10M token 實驗水平,1M 穩定,依託 TPU 與 RingAttention,打造差異化。
  • Meta:開源 Llama 3 直接釋出時支援 8K,社群基於其模型開發 YaRN/LongLoRA 等擴充套件至 128K,形成生態。
  • 月之暗面 (Moonshot AI):Kimi 特色長上下文,支援 200 萬字,主打生產力場景,帶動國內融資熱度。
  • 阿里巴巴 (Qwen):推出 Qwen‑Long,通過資料與模型改造支援長文。
  • Mistral AI:以滑動視窗注意力實現極致推論效率,在開源長上下文賽道保持競爭力。
  • 輝達 (NVIDIA):通過 TensorRT‑LLM、FlashAttention 庫最佳化長序列推論,提供 NeMo 訓練架構,賦能所有模型廠。

投資邏輯

  • 短期(1–2 年):能提供穩定百萬 token 且推論成本可控的方案將贏得企業級合同(法律、金融)。關注開源生態與雲端廠商 API 價格戰。投資重點:擁有基礎模型且長上下文實現領先的公司,及推論最佳化工具鏈(如 FlashAttention 團隊關聯企業)。
  • 中期(2–5 年):長上下文將帶動 AI 應用範式轉變,Agent 和複雜工作流的自主迴圈依賴長記憶能力。投資機遇在垂直場景的“上下文即服務”平台。
  • 風險:“迷失在中間”未能根本解決可能導致長上下文成為營銷噱頭;KV cache 硬體需求指數級增長,若 HBM 成本下降不及預期可能限制採用;RAG 混合系統可能以更低成本實現類似效果,壓制純長上下文市場。

常見誤讀糾偏(≥2)

誤讀一:“支援 128K 上下文”意味著模型能 100% 準確使用所有資訊。
事實:幾乎所有長上下文模型都存在“迷失在中間”(Lost in the Middle) 現象,即對文件中部的資訊召回率顯著低於開頭和結尾。真實有效使用範圍通常遠低於宣稱視窗,需輔助以提示工程或分塊檢索。

誤讀二:長上下文可以完全替代 RAG。
事實:長上下文與 RAG 並非對立,而是互補。RAG 通過外部檢索降低對單次上下文長度的需求,且知識更新無需重新訓練模型;長上下文讓模型在上下文內推論更連貫。未來趨勢是“長上下文 + 動態檢索”混合架構。

誤讀三:滑動視窗注意力讓模型丟失全域性長程資訊,因此是落後技術。
事實:Mistral 等模型證明,通過巧妙設計(如視窗內密集註意力 + 少量 sink token),在大量應用場景中效能不弱於全注意力,且推論成本優勢巨大。本質上是在“足夠好”的全域性長依賴與極致效率中尋找平衡。

學習路徑

  1. 精讀“Attention Is All You Need”原論文,理解基礎 O(N²) 挑戰。
  2. 學習 RoPE (Su et al. 2021) 與 ALiBi (Press et al. 2022) 的原理及實現細節。
  3. 復現 FlashAttention 論文 (Dao et al. 2022),理解 tiling 和 recomputation。
  4. 閱讀 YaRN 方法 (Peng et al. 2023) 及 NTK‑aware scaling 社群部落格,掌握外推核心。
  5. 研究 RingAttention (Li et al. 2023) 或 Striped Attention,實現多卡長序列微調。
  6. 動手用 vLLM 或 TensorRT‑LLM 部署一個 64K+ 模型,體驗 PagedAttention\GQA 等最佳化。
  7. 關注前沿:Infini‑Attention(Memory Transformer)等無限上下文方案。

一句話總結

長上下文是大型模型從“聊天玩具”升級為“企業生產力核心”的關鍵階梯,它把深度算力與演算法巧思壓縮排超長序列的記憶體銀行,讓模型真正讀懂鉅著、回顧歲月,但商業化仍有賴於克服“迷失”與“成本”兩大天塹。

延伸閱讀與來源

  • Su et al. “RoFormer: Enhanced Transformer with Rotary Position Embedding.” 2021.
  • Dao et al. “FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.” 2022.
  • Peng et al. “YaRN: Efficient Context Window Extension of Large Language Models.” 2023.
  • Liu et al. “Ring Attention with Blockwise Transformers for Near-Infinite Context.” 2023.
  • Gemma, Reid et al. “Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.” 2024.
  • Anthropic “The Claude 3 Model Family.” 2024.
  • 月之暗面 Kimi 技術報告 [未充分揭露具體引數,僅定性描述]
  • 輝達 Technical Blog: “mitigating the Transformer’s quadratic complexity.”
  • 各公司財報與公開 pricing 頁:OpenAI,Anthropic,Google Cloud。

資料說明:因檢索受限,具體數值多取自公開論文與行業共識,部分標為“估算”;實際產品規格請以廠商最新發布為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型