截斷策略
1 三秒看懂
一句話定義:當模型無法一次吃進全部輸入時,截斷策略決定“保留哪些、壓縮什麼、丟棄什麼”,是連線長上下文能力與硬體成本的核心排程層。 一句話原理:依照資訊的新舊、位置偏好和重要程度對 token 序列做權衡,將計算複雜度從 O(N²) 壓縮到可負擔的界限內。 一句話價值:直接決定模型在長文件、長對話、長程式碼等場景的真實可用性與 API 成本,是“百元算力跑出千元體驗”的關鍵工程槓桿。
2 三分鐘產業解釋
讓大語言模型處理一整本《紅樓夢》或者一家公司十年的郵件存檔,並不像開啟文件、Ctrl+A、貼上進對話方塊那麼簡單。Transformer 架構的自注意力機制會對輸入每兩個 token 之間計算一次關係,序列長度 N 每翻一倍,計算量就漲到原來的四倍。當 N 來到十萬、百萬級別時,即便是頂級 GPU 叢集也會被消耗殆盡,且推論延遲會讓使用者無法忍受。
截斷策略做的是“給輸入做減法和重排”。它從八個方向同時幹活:
- 界定視窗:最新 4k、8k 還是 32k token 必須完整保留;
- 評估重要性:哪些舊句子是後面問題必須依賴的前提;
- 壓縮歷史:把十年前的年會發言濃縮成一句“某年曾討論海外事業部”;
- 外掛記憶:像翻檔案櫃一樣,把不常訪問的內容存到向量庫,只在需要時調取;
- 混合編排:將前述手段組合為流水線,根據上下文長度和任務型別動態切換。
這不再是簡單的“刪掉最早的”或“只留最新 2k”,而是逐步進化為一套資訊熵管理系統,直接坐擁大型模型應用的成本結構。據 2024 年多家雲端廠商客戶案例,長上下文查詢若不施加高效截斷策略,單次 API 成本可高出 5–10 倍,並引發“中間資訊丟失”帶來的業務差錯(如漏審合同關鍵條款)。因此,能否做好截斷,正在成為大型模型工程技術團隊的核心競爭力。
3 技術原理
Transformer 自注意力的計算複雜度是 O(N²),記憶體佔用同樣隨 N² 膨脹。截斷策略的出發點是:並非所有 token 都對下一個回答同等重要。
3.1 三個基礎假設
- 時間區域性性:在多輪對話和流式場景中,越靠近當下的 token 越可能被立即引用。
- 位置偏好(U 型注意力):大量實驗表明,模型對序列開頭(系統提示、任務描述)和結尾(最新對話輪次)的注意力權重較高,中間段被關注的程度明顯更低。
- 語義稀疏性:一段文字裡,真正影響答案的關鍵實體、約束條件常常只集中在少數幾個句子中。
3.2 常見策略分類
-
固定視窗截斷 (Fixed Window)
- 只保留最近 W 個 token,其餘全部丟棄。
- 優點:零額外開銷,延遲可忽略。
- 缺點:早期事實永久丟失,不支援“翻舊賬”。
-
滑動視窗重編碼 (Sliding Window with Re-encoding)
- 視窗滑動時,將剛滑出視窗的文本用一個輕量編碼器壓縮成若干“記憶 token”或向量,拼接在新視窗之前。
- 代表:Landmark Attention、StreamingLLM 中的 Attention Sinks 機制。
-
重要性剪枝 (Importance-based Pruning)
- 訓練或線上預測每個 token 的保留價值(如使用一個小型打分網路),只保留前 K 個高分 token。
- 優點:資訊保留率可調優;缺點:打分本身引入計算開銷,需額外訓練。
-
分塊摘要 (Chunked Summarization)
- 將長序列分成若干塊,對每一塊用模型自行生成一段摘要,再將摘要拼接給主模型。
- 生成式代理 (Generative Agents) 中的“反思-摘要”機制即屬此類。
-
外部記憶檢索 (External Memory + RAG)
- 將所有歷史文本存入向量資料庫,當模型需要時,根據問題檢索相關片段(Top-K 檢索),僅將檢索結果注入當前視窗。
- 這實質上是把截斷決策外移給檢索器,結合重排序(Rerank)技術後可達高精度。
-
原生稀疏注意力 (Sparse/Linear Attention)
- 修改注意力機制本身,使計算複雜度降至 O(N·logN) 或 O(N),從而直接支援更長的完全上下文而不依賴截斷。
- 典型:Mamba(狀態空間模型)、RWKV、Linear Attention 變體。但這類模型往往需要重新訓練或微調,尚未完全取代 Transformer。
3.3 截斷策略系統的總體架構
原始長序列 N tokens
│
├── 瞬時記憶層 (最新W tokens) ──────────→ 完整保留
├── 近期摘要層 (W~2W tokens) ──────────→ 向量壓縮/關鍵句抽取
├── 長期記憶庫 (歷史全部內容) ──────────→ 向量資料庫 + 檢索
└── 任務提示/規則 (系統指令) ──────────→ 始終保留在序列頭部
↓
拼接層 (Concatenation + Token Budget Management)
↓
最終模型推論輸入 (final_input ≤ M tokens)
其中,Token Budget (M) 是模型能承受的最大序列長度(或為成本設定的上限),管理機制即時計算每個來源的配額分配。
4 關鍵引數
-
視窗大小 (Window Size, W)
- 典型值:2k、4k、8k、32k 或 128k tokens。
- 影響:W 越大,短期連貫性越好,但計算量 O(W²) 急劇上升。2024 年主流消費級應用常設 W 為 4k–8k,企業級長文件場景則可能開到 32k。
-
壓縮比 (Compression Ratio, R)
- 定義:原始 token 數 / 壓縮後用於代表該段歷史的 token 數。
- 界內實踐:早期方法如使用小型 BERT 生成摘要,可達 10:1–50:1。用向量池化(pooling)可到 100:1,但細節損失顯著。
-
資訊保留率 (Fact Retention Rate)
- 通常通過下游任務(如長文件問答 F1 分數)間接測量。
- 已知基準:在 ZeroSCROLLS 等長上下文評測中,簡單視窗截斷(僅留最新 4k)相比最優策略,答案准確性可能下降 10–30 個百分點(2023 年多篇論文資料)。
-
推論額外延遲 (Overhead Latency)
- 固定視窗幾乎無延遲;摘要壓縮可能增加 10–50 ms/塊;RAG 檢索延遲取決於索引速度,通常增加 20–200 ms,可通過預取技術降低。
- 硬性約束:對即時對話系統,總延遲需控制在 <2–3 秒。
-
峰值記憶體 (Peak Memory)
- 比如,128k token 的全注意力推論在 FP16 下會佔用 >100 GB 視訊記憶體甚至更多,引入了截斷後可以使需求降至 40 GB 內(視 W 和批處理大小而定)。
-
泛化性 (Generalization)
- 衡量同一套引數在不同任務(長文件摘要 vs 多輪客服對話)上的平均表現。單一策略常需結合場景自適應排程器。
5 技術路線對比
| 技術路線 | 核心機制 | 代表方案 | 計算開銷(推論) | 資訊保留質量 | 適用文件長度 | 部署難度 |
|---|---|---|---|---|---|---|
| 固定視窗 | 保留尾部 | 預設 max_tokens 截斷 | 極低 | 低(失去全部歷史) | <4k tokens | 無需開發 |
| 滑動視窗 + Sinks | 滑出的內容轉為少數注意力聚集點 | StreamingLLM | 低 | 中等(可保持流暢度但細節缺失) | 數百萬 tokens | 低,改動注意掩碼即可 |
| 分塊摘要 | 歷史塊 → 摘要向量 | Generative Agents 記憶模組、MemGPT | 中高 | 中等偏上(摘要丟失細粒度資訊) | 理論無上限 | 中 |
| 檢索增強記憶 | 向量庫儲存,按需取回 | LangChain/LlamaIndex + 重排序 | 中高 | 高(依賴檢索質量) | 無上限,受向量庫規模限制 | 中高,需搭建檢索管路 |
| 混合流水線 | 視窗 + 檢索 + 摘要自適應 | 企業內部定製方案(未公開統一命名) | 可調 | 高 | 無上限 | 高 |
| 原生長上下文 | 稀疏注意力、線性注意力 | Mamba(狀態空間模型)、RWKV、Infini-attention(2024 Google) | 推論線性或近線性 | 極高(理論上無損) | 1M 及以上 | 極高,需重新訓練生態 |
資料來源:各方案論文及對應開源實現,定性比較為綜合 2023-2024 年相關 benchmark 與社群反饋。
6 上游
上游決定了截斷策略得以實施的物理和演算法土壤,核心構成包括三部分。
6.1 算力硬體與視訊記憶體
- GPU/TPU 記憶體頻寬與容量:HBM(高頻寬記憶體)的大小直接限制無截斷時能容納的最大序列。例如,NVIDIA H100 (80 GB HBM2e) 在 FP16 全注意力下,單 batch 最大序列長度約 32k–64k;若沒有截斷,處理 128k 文件需拆分 batch 或動用多個 GPU 張量並行,視訊記憶體需求翻倍。2025 年即將量產的 B200 將提供更大容量 HBM3e(192 GB 以上),有望將無需截斷的“舒適區”推至 200k tokens,但硬體增速仍落後於客戶期望的長度(百萬級)。
- 成本約束:雲端例項按 GPU 時計費,截斷策略每節省 30% 視訊記憶體,即可在同等硬體下處理更多併發請求,直接降低單元推論成本。
6.2 基礎模型架構
- Transformer 變體:分組查詢注意力(Grouped-Query Attention, GQA)、多查詢注意力(MQA)可以減少 KV 快取,從而增大實際視窗。例如 Llama 2 70B 採用 GQA 後,視訊記憶體佔用大幅下降,允許更長序列而無需激進截斷。
- 位置編碼外推:RoPE 配合 NTK-aware 縮放、YaRN 等技術,可讓模型在推論時超出訓練長度,降低對歷史資訊丟棄的依賴。這些方法雖不是截斷策略本身,但為截斷策略爭取了更大的預算空間。
6.3 訓練資料與範式
- 長文本預訓練資料:書籍、Codebase、學術論文等長文件的比例增加,使得模型的“中間位置”利用能力增強,部分緩解“Lost in the Middle”問題,可提升視窗策略中保留中間關鍵資訊的成功率。
- 微調對齊:針對長對話和長文件 QA 的監督微調資料,會讓模型更適應某種截斷模式(例如系統指令永遠前置),進而影響策略的設計。
7 下游
下游應用直接決定截斷策略的嚴苛程度和形態側重。
7.1 場景矩陣
| 應用場景 | 典型輸入長度 | 對截斷策略的核心要求 | 代表產品或服務 |
|---|---|---|---|
| 多輪客服/私域助手 | 10k–50k tokens(數月對話) | 極低延遲,不能丟失使用者最近的過渡資訊 | Zendesk AI, Intercom Fin |
| 長文件分析與合同稽核 | 50k–500k tokens | 關鍵條款必須 100% 保留,可接受更高延遲 | 律所內部 AI 工具、金融 Dataroom QA |
| 程式碼庫理解與生成 | 數百萬 tokens(整個倉庫) | 需要細粒度檢索,截斷前必須對檔案樹結構化 | GitHub Copilot Workspace, Cursor |
| 書籍級長篇創作/翻譯 | 100k–500k tokens | 保持整體一致性,不丟失前面章節設定 | NovelAI, 自家內容生成流水線 |
| 沉浸式遊戲 NPC | 持續增長的長期記憶 | 記憶高度結構化(事件、物件、情緒),壓縮需保留關係和因果 | Inworld AI, OpenAI+遊戲廠商合作 |
7.2 商業價值兌現
截斷策略的最佳化直接轉化為三個商業指標:
- API 成本縮減:對於基於 token 計費的服務,例如 OpenAI GPT-4 Turbo 128k,若每次查詢都塞滿 128k 歷史,但實際只需其中 20% 的內容,則會浪費 80% 的 token 費用。高效截斷可把平均請求長度降至合理範圍,企業客戶年省可達數十萬美元(基於 2024 年公開客戶案例推算,具體數字因使用量而異)。
- 使用者體驗提升:延遲從 10 秒壓縮到 3 秒,次留率和任務完成率改善顯著,尤其是在法律和金融分析等需要多次互動的場景。
- 合規性保障:例如 GDPR 要求刪除某些對話,通過外掛記憶庫刪除底層片段遠比從模型引數中遺忘容易,間接影響資料治理架構。
8 受益公司
以下分類基於公開技術路線和產品生態,不代表投資建議,僅展示截斷策略相關技術鏈上活躍的參與者。
-
基礎模型廠商
- OpenAI:GPT-4 Turbo、GPT-4o 均支援 128k 上下文,內部通過“注意力分塊”及黑盒策略降低開銷,未詳細揭露。
- Anthropic:Claude 3 Opus 在長文件任務中表現突出,據公開評測其長上下文的“中間利用率”優於同期競品,推測採用最佳化過的視窗與壓縮機制。
- Google DeepMind:Gemini 1.5 Pro 宣稱支援 1M token,採用 MoE 架構和 Infini-attention(線性記憶整合)減少對傳統截斷的依賴;但仍在 API 中設定分塊和管理邏輯。
-
開源架構與中介軟體
- LangChain:提供多種文本分割器(RecursiveCharacterTextSplitter 等)和向量檢索鏈,是開發者實現智慧截斷的常用工具。
- LlamaIndex (原 GPT Index):專為長資料索引和檢索而設計,支援樹狀、關鍵詞、自動合併等多種索引方式,間接充當截斷策略的上層排程。
- MemGPT:開源專案將作業系統虛擬記憶體概念引入 LLM,實現自動分頁與中斷式調取歷史,是分層截斷的典型自管理方案。
-
向量資料庫 & 檢索基礎設施
- Pinecone, Weaviate, Milvus, Qdrant:儲存外掛記憶的核心,其檢索速度和精度直接影響動態截斷策略的效果。
- Cohere:提供語義重排序 (Rerank),可大幅提升從大規模記憶中取回片段的準確性。
-
算力與雲端平台
- NVIDIA:其高階 GPU(H100, B200)和大容量 HBM 為寬鬆的截斷視窗提供硬體基礎;同時推出 TensorRT-LLM 最佳化 KV 快取,提升長序列效率。
- AWS, Azure, GCP:提供整合好的 LLM 服務和向量資料庫,其管理平台內必定內建了預設截斷或上下文收縮邏輯。
公開資料未系統揭露各公司的具體截斷實現細節,上述均為基於論文、部落格和官方文件的合理推斷。
9 市場規模
截斷策略本身不構成獨立的市場分類,其價值巢狀在“長上下文 AI”和“LLM 工程最佳化”賽道中。此處採用兩個近似口徑估算,均註明來源與時間點。
-
基於 API 成本節省的反推
- 據 Grand View Research 2024 年報告,全球大語言模型 API 市場規模在 2024 年約 63 億美元(口徑:涵蓋雲端 API 及模型周邊推論服務),預計 2030 年達 400 億美元以上。
- 若假設平均 30% 的 API token 通過截斷或壓縮策略可以安全省去(基於 LangSmith 社群案例分析和 2024 年多家初創公司公開分享的最佳化結果),則截斷策略所影響的成本池約為 19 億美元(2024 年)。其中一部分會轉化為截斷/記憶管理工具和服務營收。
-
基於長上下文中介軟體的市場規模
- 根據 MarketsandMarkets 2025 年初發布的“企業 AI 資料管道及 RAG 工具市場”研究,相關市場(包含文本分割器、索引器、檢索器)在 2025 年約 18 億美元,2028 年預期升至 92 億美元。截斷策略作為資料管道的關鍵一環,可類比佔據其中 15–25% 的價值,即 2.7–4.5 億美元(2025 年)。
- 該資料口徑涵蓋向量資料庫、ETL 工具、檢索增強架構,截斷策略的價值隱含其中。
結論:儘管沒有直接標品“截斷策略”市場,但其作為工程槓桿影響的成本和工具營收池在 2025 年已達數十億美元量級,且隨著長上下文需求激增而持續擴大。具體份額統計暫未有權威獨立資料,上述均為依據公開可查市場報告的合理推算。
10 玩家對比
以下對比針對主流模型/架構對截斷策略的依賴方式和公開程度,基於 2025 年 2 月前的公開資訊。
| 玩家 | 最大上下文(宣稱) | 截斷方式(公開資訊) | 資訊保留特點 | 延遲/成本最佳化 | 適用場景 |
|---|---|---|---|---|---|
| OpenAI GPT-4 Turbo/4o | 128k tokens | 未公開具體細節;推測內部使用分塊注意力 + 壓縮 | 在基準評測中長文本表現優秀,但存在“中間丟失”現象(2023 年論文) | API 設 max_tokens 限制,預設策略將早期資訊截斷 | 通用對話、長文件分析、程式碼 |
| Anthropic Claude 3 Opus | 200k tokens | 未公開,但技術部落格強調“對長文件設計” | 多篇獨立評測顯示其長文件中段的資訊保留率高 | 官方未公開最佳化手段 | 企業報告、法律文本 |
| Google Gemini 1.5 Pro | 1M tokens (部分使用者) | Infini-attention (線性記憶) + MoE,公開論文提及 | 聲稱“近乎完美”的針入大海測試,在百萬 token 中可精確檢索細節 | 推論成本雖高,但通過 MoE 稀疏化控制 | 長影片多模態、超大文件 |
| 開源 MemGPT | 無限(虛擬) | 分層記憶頁表,自動分頁觸發中斷,核心為 LLM OS 概念 | 歷史事件不同時段分層摘要,適應長期互動 | 增加了管理開銷,需頻繁呼叫 LLM | 個人陪伴 AI、遊戲 NPC |
| LangChain/LlamaIndex | 取決於底層模型 | 豐富的文本分割器與檢索器組合,可配置多種截斷模板 | 取決於所選策略,提供多種關鍵詞和向量檢索器 | 開發者自行權衡延遲與質量 | 通用應用建置 |
| 基於 Mamba 的模型 | 1M+ tokens 訓練後推論 | 狀態空間模型,不使用自注意力,無需傳統截斷 | 理論上無丟失,但實際長序列效能仍在追趕 Transformer | 推論速度理論上極快,但生態不足 | 研究及低資源部署 |
注:資訊保留質量對比來自公開評測(如 L-Eval、ZeroSCROLLS)和獨立部落格,僅供參考。
11 風險
-
架構顛覆風險
- 如果線性注意力、狀態空間模型等新架構在未來 2–3 年內成為主流,並解決長上下文的資訊保留問題,則當前圍繞 Transformer 設計的高階截斷策略價值將大幅縮水。2024 年 Mamba-2 等模型已展示與 Transformer 相近的效能,但是否能在長尾場景替代仍需觀察。
-
截斷導致的事實遺漏與安全風險
- 重要資訊(如安全規範、法律免責宣告)若被截斷策略錯誤丟棄,可能導致模型輸出危害性內容或產生業務損失。在醫療、金融、法律等強監管領域,此類風險尤其突出。
-
策略通用性不足
- 一種截斷策略可能在客服對話中表現優異,但在長文件抽取事即時卻丟失關鍵細節。高度定製增加了維護成本和工程複雜性。
-
隱私與合規風險
- 外部記憶儲存(向量庫)若未能與隱私策略緊密結合,可能造成歷史對話洩露。在 GDPR 等架構下,使用者有權要求徹底刪除,必須確保檢索庫同步清除,加重了系統複雜度。
-
工程複雜性與技術債務
- 多層混合流水線(視窗+摘要+RAG+打分)除錯難度指數上升,任何一環的升級(如模型更換)都可能需要重新調參,極易積累難以維護的技術債。
-
硬體被追高
- 企業可能不斷追加更貴的 GPU 來“暴力”擴大視窗,而不願投資截斷最佳化,形成對硬體的路徑依賴。一旦硬體迭代放緩,成本負擔將凸顯。
12 誤讀糾偏
-
誤讀 1:“截斷就是直接丟掉前面。” 糾偏:這是一種 2018 年的認知。今天的主流方案會先對歷史做語義壓縮、摘要抽取或存入外部記憶庫,再決定丟棄哪些不相關部分。即便是視窗截斷,也通常保留系統指令和最早的關鍵定義。
-
誤讀 2:“長上下文模型出現後,截斷就不再需要了。” 糾偏:即便模型支援 1M token,每次填充滿 1M 的成本和延遲仍不現實。截斷策略從“解決模型能不能看”轉向“解決使用者用不用得起、等不等得起”。此外,超大上下文存在“中間丟失”現象,智慧截斷和檢索反而能提升準確率。
-
誤讀 3:“RAG 可以完全替代截斷。” 糾偏:RAG 本質上是一種外掛式的截斷決策器,它負責選擇哪些歷史片段輸入模型,但搜尋回來的片段仍可能過大,需要二次截斷。而且 RAG 自身有檢索失敗的機率,常與視窗策略混合使用才能保底。
-
誤讀 4:“截斷策略是純軟體問題,與硬體無關。” 糾偏:截斷的觸發閾值、視窗大小、是否使用壓縮編碼器等,都與 GPU 視訊記憶體大小、頻寬和 FP8/INT4 量化策略高度耦合。軟硬協同設計才能榨出極致價效比。
13 最新事件
以下為 2024–2025 年初的重要進展,直接影響截斷策略的技術選型和商業實踐。
- 2024 年 2 月:Google 釋出 Gemini 1.5 Pro,宣佈達到 1M token 上下文,同時公開 Infini-attention 技術,能夠在 Transformer 中融入線性記憶,減少對粗暴截斷的依賴。
- 2024 年 6 月:Anthropic 推出 Claude 3.5 Sonnet,其長上下文的“中間資訊”檢索能力引發社群關注,獨立評測顯示在 200k token 深度提取任務上錯誤率明顯低於競品。
- 2024 年 7 月:Meta 釋出 LLaMA 3.1 405B,原生支援 128k token,開源社群基於其 GQA 和 RoPE 外推最佳化,衍生出多種視窗縮放方法,降低了對截斷的被動需求。
- 2024 年 10 月:微軟推出 LLaMA-2-7B 長上下文微調方案,配合其 Azure AI 中的智慧分割器,實現混合流水線;同時 OpenAI DevDay 上展示可通過“Prompt Caching”自動重用歷史片段,實質上將截斷與快取結合,降低 50% 成本。
- 2024 年 12 月:開源專案 MemGPT 釋出重大更新,引入“自適應記憶頁大小”,可根據對話型別動態調整壓縮閾值。
- 2025 年 1 月:DeepSeek-V3 支援 128K 上下文並開源,採用 MoE 架構,社群反應其推論 API 成本極低,得益於高效的 KV 快取壓縮,變相將截斷責任前移到模型內部。
以上事件資訊來源:各公司官方部落格、arXiv 預印本及知名 AI 媒體(如 The Verge、VentureBeat)報道。
14 追蹤指標
追蹤以下指標有助於判斷一家公司或一個開源方案在截斷策略維度的真實實力。
-
上下文利用率 (Context Utilization Rate)
- 定義:在長文本評測(如 L-Eval, LongBench)中,同樣模型在不同截斷設定下取得的分數 / 全量輸入時的分數。
- 獲取方式:檢視官方技術部落格或第三方評測機構的對比測試。
-
每百萬 token 的平均推論延遲 (TBT, Time Between Tokens 或 E2E Latency)
- 標定不同輸入長度下的延遲曲線,觀察拐點位置。若延遲呈超線性增長,說明截斷或壓縮機制不足。
- 資料來源:雲端廠商 API 效能監控頁面(如 OpenRouter、Anyscale 的公開排行)。
-
平均請求 token 數 vs 實際必要資訊 token 數
- 可通過 LangSmith、Weights & Biases 等可觀測平台獲取,衡量截斷策略的浪費程度。
-
關鍵資訊召回率 (Needle-in-a-Haystack Metric)
- 在長文件中隨機插入一個事實,檢測回答是否正確。Google、Anthropic 等定期釋出此資料作為長上下文能力證明。
-
記憶體/視訊記憶體消耗峰值 vs 模型理論值
- 用 NVIDIA Nsight 或同類工具監控,在給定模型和 W 引數下,實際視訊記憶體佔用是否接近線性增長,還是依然接近於 O(N²) 的趨勢。
-
檢索增強流水線的 Top-K 召回率與精度
- 用於評估外部記憶檢索環節是否成為瓶頸。可使用 BEIR 或自定義測試集。
-
開源專案活躍度
- Star、Issue、PR 頻率,是否跟進最新模型結構(如 Mamba 支援程度),能在一定程度上折射工具鏈的健壯性。
15 信源
-
基礎論文
- Vaswani et al., Attention Is All You Need, NeurIPS 2017.
- Xiao et al., Efficient Streaming Language Models with Attention Sinks, 2023.
- Wang et al., Landmark Attention: Random-Access Infinite Context Length for Transformers, 2023.
- Park et al., Generative Agents: Interactive Simulacra of Human Behavior, 2023.
- Munkhdalai et al., Infini-attention: Infinite Context with Transformer-based Models, 2024.
-
綜述與評測
- A Survey on Long Context Language Modeling (2024 多個版本, arXiv).
- Lost in the Middle: How Language Models Use Long Contexts (2023).
- L-Eval, LongBench, ZeroSCROLLS 等基準論文。
-
技術部落格與官方文件
- Hugging Face Blog: “The Quest for Long Contexts” (2024).
- LangChain/LlamaIndex 官方文件 – 文本分割、檢索章節。
- OpenAI, Anthropic, Google DeepMind 各自的長上下文技術簡報(2024–2025)。
-
行業報告
- Grand View Research: Large Language Model (LLM) Market Size, 2024.
- MarketsandMarkets: Enterprise AI Data Pipeline & RAG Tools Market, 2025.
- Gartner: Emerging Technologies: The Long-Term Impact of Long-Context LLMs, 2024.
-
社群與評測
- OpenRouter 公開延遲/成本對比(持續更新)。
- 獨立評測機構如 Artificial Analysis 的模型長上下文評分。
所有市場數字均依據上述信源口徑,未見於公開報告的細項數字已標註“公開資料未見”或“估算”。本文不構成任何投資或採購建議,僅做技術產業分析。