截断策略
1 三秒看懂
一句话定义:当模型无法一次吃进全部输入时,截断策略决定“保留哪些、压缩什么、丢弃什么”,是连接长上下文能力与硬件成本的核心调度层。 一句话原理:依照信息的新旧、位置偏好和重要程度对 token 序列做权衡,将计算复杂度从 O(N²) 压缩到可负担的界限内。 一句话价值:直接决定模型在长文档、长对话、长代码等场景的真实可用性与 API 成本,是“百元算力跑出千元体验”的关键工程杠杆。
2 三分钟产业解释
让大语言模型处理一整本《红楼梦》或者一家公司十年的邮件存档,并不像打开文档、Ctrl+A、粘贴进对话框那么简单。Transformer 架构的自注意力机制会对输入每两个 token 之间计算一次关系,序列长度 N 每翻一倍,计算量就涨到原来的四倍。当 N 来到十万、百万级别时,即便是顶级 GPU 集群也会被消耗殆尽,且推理延迟会让用户无法忍受。
截断策略做的是“给输入做减法和重排”。它从八个方向同时干活:
- 界定窗口:最新 4k、8k 还是 32k token 必须完整保留;
- 评估重要性:哪些旧句子是后面问题必须依赖的前提;
- 压缩历史:把十年前的年会发言浓缩成一句“某年曾讨论海外事业部”;
- 外挂记忆:像翻档案柜一样,把不常访问的内容存到向量库,只在需要时调取;
- 混合编排:将前述手段组合为流水线,根据上下文长度和任务类型动态切换。
这不再是简单的“删掉最早的”或“只留最新 2k”,而是逐步进化为一套信息熵管理系统,直接坐拥大模型应用的成本结构。据 2024 年多家云厂商客户案例,长上下文查询若不施加高效截断策略,单次 API 成本可高出 5–10 倍,并引发“中间信息丢失”带来的业务差错(如漏审合同关键条款)。因此,能否做好截断,正在成为大模型工程技术团队的核心竞争力。
3 技术原理
Transformer 自注意力的计算复杂度是 O(N²),内存占用同样随 N² 膨胀。截断策略的出发点是:并非所有 token 都对下一个回答同等重要。
3.1 三个基础假设
- 时间局部性:在多轮对话和流式场景中,越靠近当下的 token 越可能被立即引用。
- 位置偏好(U 型注意力):大量实验表明,模型对序列开头(系统提示、任务描述)和结尾(最新对话轮次)的注意力权重较高,中间段被关注的程度明显更低。
- 语义稀疏性:一段文字里,真正影响答案的关键实体、约束条件常常只集中在少数几个句子中。
3.2 常见策略分类
-
固定窗口截断 (Fixed Window)
- 只保留最近 W 个 token,其余全部丢弃。
- 优点:零额外开销,延迟可忽略。
- 缺点:早期事实永久丢失,不支持“翻旧账”。
-
滑动窗口重编码 (Sliding Window with Re-encoding)
- 窗口滑动时,将刚滑出窗口的文本用一个轻量编码器压缩成若干“记忆 token”或向量,拼接在新窗口之前。
- 代表:Landmark Attention、StreamingLLM 中的 Attention Sinks 机制。
-
重要性剪枝 (Importance-based Pruning)
- 训练或在线预测每个 token 的保留价值(如使用一个小型打分网络),只保留前 K 个高分 token。
- 优点:信息保留率可调优;缺点:打分本身引入计算开销,需额外训练。
-
分块摘要 (Chunked Summarization)
- 将长序列分成若干块,对每一块用模型自行生成一段摘要,再将摘要拼接给主模型。
- 生成式代理 (Generative Agents) 中的“反思-摘要”机制即属此类。
-
外部记忆检索 (External Memory + RAG)
- 将所有历史文本存入向量数据库,当模型需要时,根据问题检索相关片段(Top-K 检索),仅将检索结果注入当前窗口。
- 这实质上是把截断决策外移给检索器,结合重排序(Rerank)技术后可达高精度。
-
原生稀疏注意力 (Sparse/Linear Attention)
- 修改注意力机制本身,使计算复杂度降至 O(N·logN) 或 O(N),从而直接支持更长的完全上下文而不依赖截断。
- 典型:Mamba(状态空间模型)、RWKV、Linear Attention 变体。但这类模型往往需要重新训练或微调,尚未完全取代 Transformer。
3.3 截断策略系统的总体架构
原始长序列 N tokens
│
├── 瞬时记忆层 (最新W tokens) ──────────→ 完整保留
├── 近期摘要层 (W~2W tokens) ──────────→ 向量压缩/关键句抽取
├── 长期记忆库 (历史全部内容) ──────────→ 向量数据库 + 检索
└── 任务提示/规则 (系统指令) ──────────→ 始终保留在序列头部
↓
拼接层 (Concatenation + Token Budget Management)
↓
最终模型推理输入 (final_input ≤ M tokens)
其中,Token Budget (M) 是模型能承受的最大序列长度(或为成本设置的上限),管理机制实时计算每个来源的配额分配。
4 关键参数
-
窗口大小 (Window Size, W)
- 典型值:2k、4k、8k、32k 或 128k tokens。
- 影响:W 越大,短期连贯性越好,但计算量 O(W²) 急剧上升。2024 年主流消费级应用常设 W 为 4k–8k,企业级长文档场景则可能开到 32k。
-
压缩比 (Compression Ratio, R)
- 定义:原始 token 数 / 压缩后用于代表该段历史的 token 数。
- 界内实践:早期方法如使用小型 BERT 生成摘要,可达 10:1–50:1。用向量池化(pooling)可到 100:1,但细节损失显著。
-
信息保留率 (Fact Retention Rate)
- 通常通过下游任务(如长文档问答 F1 分数)间接测量。
- 已知基准:在 ZeroSCROLLS 等长上下文评测中,简单窗口截断(仅留最新 4k)相比最优策略,答案准确性可能下降 10–30 个百分点(2023 年多篇论文数据)。
-
推理额外延迟 (Overhead Latency)
- 固定窗口几乎无延迟;摘要压缩可能增加 10–50 ms/块;RAG 检索延迟取决于索引速度,通常增加 20–200 ms,可通过预取技术降低。
- 硬性约束:对实时对话系统,总延迟需控制在 <2–3 秒。
-
峰值内存 (Peak Memory)
- 比如,128k token 的全注意力推理在 FP16 下会占用 >100 GB 显存甚至更多,引入了截断后可以使需求降至 40 GB 内(视 W 和批处理大小而定)。
-
泛化性 (Generalization)
- 衡量同一套参数在不同任务(长文档摘要 vs 多轮客服对话)上的平均表现。单一策略常需结合场景自适应调度器。
5 技术路线对比
| 技术路线 | 核心机制 | 代表方案 | 计算开销(推理) | 信息保留质量 | 适用文档长度 | 部署难度 |
|---|---|---|---|---|---|---|
| 固定窗口 | 保留尾部 | 默认 max_tokens 截断 | 极低 | 低(失去全部历史) | <4k tokens | 无需开发 |
| 滑动窗口 + Sinks | 滑出的内容转为少数注意力聚集点 | StreamingLLM | 低 | 中等(可保持流畅度但细节缺失) | 数百万 tokens | 低,改动注意掩码即可 |
| 分块摘要 | 历史块 → 摘要向量 | Generative Agents 记忆模块、MemGPT | 中高 | 中等偏上(摘要丢失细粒度信息) | 理论无上限 | 中 |
| 检索增强记忆 | 向量库存储,按需取回 | LangChain/LlamaIndex + 重排序 | 中高 | 高(依赖检索质量) | 无上限,受向量库规模限制 | 中高,需搭建检索管路 |
| 混合流水线 | 窗口 + 检索 + 摘要自适应 | 企业内部定制方案(未公开统一命名) | 可调 | 高 | 无上限 | 高 |
| 原生长上下文 | 稀疏注意力、线性注意力 | Mamba(状态空间模型)、RWKV、Infini-attention(2024 Google) | 推理线性或近线性 | 极高(理论上无损) | 1M 及以上 | 极高,需重新训练生态 |
数据来源:各方案论文及对应开源实现,定性比较为综合 2023-2024 年相关 benchmark 与社区反馈。
6 上游
上游决定了截断策略得以实施的物理和算法土壤,核心构成包括三部分。
6.1 算力硬件与显存
- GPU/TPU 内存带宽与容量:HBM(高带宽内存)的大小直接限制无截断时能容纳的最大序列。例如,NVIDIA H100 (80 GB HBM2e) 在 FP16 全注意力下,单 batch 最大序列长度约 32k–64k;若没有截断,处理 128k 文档需拆分 batch 或动用多个 GPU 张量并行,显存需求翻倍。2025 年即将量产的 B200 将提供更大容量 HBM3e(192 GB 以上),有望将无需截断的“舒适区”推至 200k tokens,但硬件增速仍落后于客户期望的长度(百万级)。
- 成本约束:云实例按 GPU 时计费,截断策略每节省 30% 显存,即可在同等硬件下处理更多并发请求,直接降低单元推理成本。
6.2 基础模型架构
- Transformer 变体:分组查询注意力(Grouped-Query Attention, GQA)、多查询注意力(MQA)可以减少 KV 缓存,从而增大实际窗口。例如 Llama 2 70B 采用 GQA 后,显存占用大幅下降,允许更长序列而无需激进截断。
- 位置编码外推:RoPE 配合 NTK-aware 缩放、YaRN 等技术,可让模型在推理时超出训练长度,降低对历史信息丢弃的依赖。这些方法虽不是截断策略本身,但为截断策略争取了更大的预算空间。
6.3 训练数据与范式
- 长文本预训练数据:书籍、Codebase、学术论文等长文档的比例增加,使得模型的“中间位置”利用能力增强,部分缓解“Lost in the Middle”问题,可提升窗口策略中保留中间关键信息的成功率。
- 微调对齐:针对长对话和长文档 QA 的监督微调数据,会让模型更适应某种截断模式(例如系统指令永远前置),进而影响策略的设计。
7 下游
下游应用直接决定截断策略的严苛程度和形态侧重。
7.1 场景矩阵
| 应用场景 | 典型输入长度 | 对截断策略的核心要求 | 代表产品或服务 |
|---|---|---|---|
| 多轮客服/私域助手 | 10k–50k tokens(数月对话) | 极低延迟,不能丢失用户最近的过渡信息 | Zendesk AI, Intercom Fin |
| 长文档分析与合同审核 | 50k–500k tokens | 关键条款必须 100% 保留,可接受更高延迟 | 律所内部 AI 工具、金融 Dataroom QA |
| 代码库理解与生成 | 数百万 tokens(整个仓库) | 需要细粒度检索,截断前必须对文件树结构化 | GitHub Copilot Workspace, Cursor |
| 书籍级长篇创作/翻译 | 100k–500k tokens | 保持整体一致性,不丢失前面章节设定 | NovelAI, 自家内容生成流水线 |
| 沉浸式游戏 NPC | 持续增长的长期记忆 | 记忆高度结构化(事件、对象、情绪),压缩需保留关系和因果 | Inworld AI, OpenAI+游戏厂商合作 |
7.2 商业价值兑现
截断策略的优化直接转化为三个商业指标:
- API 成本缩减:对于基于 token 计费的服务,例如 OpenAI GPT-4 Turbo 128k,若每次查询都塞满 128k 历史,但实际只需其中 20% 的内容,则会浪费 80% 的 token 费用。高效截断可把平均请求长度降至合理范围,企业客户年省可达数十万美元(基于 2024 年公开客户案例推算,具体数字因使用量而异)。
- 用户体验提升:延迟从 10 秒压缩到 3 秒,次留率和任务完成率改善显著,尤其是在法律和金融分析等需要多次交互的场景。
- 合规性保障:例如 GDPR 要求删除某些对话,通过外挂记忆库删除底层片段远比从模型参数中遗忘容易,间接影响数据治理架构。
8 受益公司
以下分类基于公开技术路线和产品生态,不代表投资建议,仅展示截断策略相关技术链上活跃的参与者。
-
基础模型厂商
- OpenAI:GPT-4 Turbo、GPT-4o 均支持 128k 上下文,内部通过“注意力分块”及黑盒策略降低开销,未详细披露。
- Anthropic:Claude 3 Opus 在长文档任务中表现突出,据公开评测其长上下文的“中间利用率”优于同期竞品,推测采用优化过的窗口与压缩机制。
- Google DeepMind:Gemini 1.5 Pro 宣称支持 1M token,采用 MoE 架构和 Infini-attention(线性记忆整合)减少对传统截断的依赖;但仍在 API 中设置分块和管理逻辑。
-
开源框架与中间件
- LangChain:提供多种文本分割器(RecursiveCharacterTextSplitter 等)和向量检索链,是开发者实现智能截断的常用工具。
- LlamaIndex (原 GPT Index):专为长数据索引和检索而设计,支持树状、关键词、自动合并等多种索引方式,间接充当截断策略的上层调度。
- MemGPT:开源项目将操作系统虚拟内存概念引入 LLM,实现自动分页与中断式调取历史,是分层截断的典型自管理方案。
-
向量数据库 & 检索基础设施
- Pinecone, Weaviate, Milvus, Qdrant:存储外挂记忆的核心,其检索速度和精度直接影响动态截断策略的效果。
- Cohere:提供语义重排序 (Rerank),可大幅提升从大规模记忆中取回片段的准确性。
-
算力与云平台
- NVIDIA:其高端 GPU(H100, B200)和大容量 HBM 为宽松的截断窗口提供硬件基础;同时推出 TensorRT-LLM 优化 KV 缓存,提升长序列效率。
- AWS, Azure, GCP:提供集成好的 LLM 服务和向量数据库,其管理平台内必定内置了默认截断或上下文收缩逻辑。
公开资料未系统披露各公司的具体截断实现细节,上述均为基于论文、博客和官方文档的合理推断。
9 市场规模
截断策略本身不构成独立的市场分类,其价值嵌套在“长上下文 AI”和“LLM 工程优化”赛道中。此处采用两个近似口径估算,均注明来源与时间点。
-
基于 API 成本节省的反推
- 据 Grand View Research 2024 年报告,全球大语言模型 API 市场规模在 2024 年约 63 亿美元(口径:涵盖云 API 及模型周边推理服务),预计 2030 年达 400 亿美元以上。
- 若假设平均 30% 的 API token 通过截断或压缩策略可以安全省去(基于 LangSmith 社区案例分析和 2024 年多家初创公司公开分享的优化结果),则截断策略所影响的成本池约为 19 亿美元(2024 年)。其中一部分会转化为截断/记忆管理工具和服务收入。
-
基于长上下文中间件的市场规模
- 根据 MarketsandMarkets 2025 年初发布的“企业 AI 数据管道及 RAG 工具市场”研究,相关市场(包含文本分割器、索引器、检索器)在 2025 年约 18 亿美元,2028 年预期升至 92 亿美元。截断策略作为数据管道的关键一环,可类比占据其中 15–25% 的价值,即 2.7–4.5 亿美元(2025 年)。
- 该数据口径涵盖向量数据库、ETL 工具、检索增强框架,截断策略的价值隐含其中。
结论:尽管没有直接标品“截断策略”市场,但其作为工程杠杆影响的成本和工具营收池在 2025 年已达数十亿美元量级,且随着长上下文需求激增而持续扩大。具体份额统计暂未有权威独立数据,上述均为依据公开可查市场报告的合理推算。
10 玩家对比
以下对比针对主流模型/框架对截断策略的依赖方式和公开程度,基于 2025 年 2 月前的公开信息。
| 玩家 | 最大上下文(宣称) | 截断方式(公开信息) | 信息保留特点 | 延迟/成本优化 | 适用场景 |
|---|---|---|---|---|---|
| OpenAI GPT-4 Turbo/4o | 128k tokens | 未公开具体细节;推测内部使用分块注意力 + 压缩 | 在基准评测中长文本表现优秀,但存在“中间丢失”现象(2023 年论文) | API 设 max_tokens 限制,默认策略将早期信息截断 | 通用对话、长文档分析、代码 |
| Anthropic Claude 3 Opus | 200k tokens | 未公开,但技术博客强调“对长文档设计” | 多篇独立评测显示其长文档中段的信息保留率高 | 官方未公开优化手段 | 企业报告、法律文本 |
| Google Gemini 1.5 Pro | 1M tokens (部分用户) | Infini-attention (线性记忆) + MoE,公开论文提及 | 声称“近乎完美”的针入大海测试,在百万 token 中可精确检索细节 | 推理成本虽高,但通过 MoE 稀疏化控制 | 长视频多模态、超大文档 |
| 开源 MemGPT | 无限(虚拟) | 分层记忆页表,自动分页触发中断,核心为 LLM OS 概念 | 历史事件不同时段分层摘要,适应长期互动 | 增加了管理开销,需频繁调用 LLM | 个人陪伴 AI、游戏 NPC |
| LangChain/LlamaIndex | 取决于底层模型 | 丰富的文本分割器与检索器组合,可配置多种截断模板 | 取决于所选策略,提供多种关键词和向量检索器 | 开发者自行权衡延迟与质量 | 通用应用构建 |
| 基于 Mamba 的模型 | 1M+ tokens 训练后推理 | 状态空间模型,不使用自注意力,无需传统截断 | 理论上无丢失,但实际长序列性能仍在追赶 Transformer | 推理速度理论上极快,但生态不足 | 研究及低资源部署 |
注:信息保留质量对比来自公开评测(如 L-Eval、ZeroSCROLLS)和独立博客,仅供参考。
11 风险
-
架构颠覆风险
- 如果线性注意力、状态空间模型等新架构在未来 2–3 年内成为主流,并解决长上下文的信息保留问题,则当前围绕 Transformer 设计的高级截断策略价值将大幅缩水。2024 年 Mamba-2 等模型已展示与 Transformer 相近的性能,但是否能在长尾场景替代仍需观察。
-
截断导致的事实遗漏与安全风险
- 重要信息(如安全规范、法律免责声明)若被截断策略错误丢弃,可能导致模型输出危害性内容或产生业务损失。在医疗、金融、法律等强监管领域,此类风险尤其突出。
-
策略通用性不足
- 一种截断策略可能在客服对话中表现优异,但在长文档抽取事实时却丢失关键细节。高度定制增加了维护成本和工程复杂性。
-
隐私与合规风险
- 外部记忆存储(向量库)若未能与隐私策略紧密结合,可能造成历史对话泄露。在 GDPR 等框架下,用户有权要求彻底删除,必须确保检索库同步清除,加重了系统复杂度。
-
工程复杂性与技术债务
- 多层混合流水线(窗口+摘要+RAG+打分)调试难度指数上升,任何一环的升级(如模型更换)都可能需要重新调参,极易积累难以维护的技术债。
-
硬件被追高
- 企业可能不断追加更贵的 GPU 来“暴力”扩大窗口,而不愿投资截断优化,形成对硬件的路径依赖。一旦硬件迭代放缓,成本负担将凸显。
12 误读纠偏
-
误读 1:“截断就是直接丢掉前面。” 纠偏:这是一种 2018 年的认知。今天的主流方案会先对历史做语义压缩、摘要抽取或存入外部记忆库,再决定丢弃哪些不相关部分。即便是窗口截断,也通常保留系统指令和最早的关键定义。
-
误读 2:“长上下文模型出现后,截断就不再需要了。” 纠偏:即便模型支持 1M token,每次填充满 1M 的成本和延迟仍不现实。截断策略从“解决模型能不能看”转向“解决用户用不用得起、等不等得起”。此外,超大上下文存在“中间丢失”现象,智能截断和检索反而能提升准确率。
-
误读 3:“RAG 可以完全替代截断。” 纠偏:RAG 本质上是一种外挂式的截断决策器,它负责选择哪些历史片段输入模型,但搜索回来的片段仍可能过大,需要二次截断。而且 RAG 自身有检索失败的几率,常与窗口策略混合使用才能保底。
-
误读 4:“截断策略是纯软件问题,与硬件无关。” 纠偏:截断的触发阈值、窗口大小、是否使用压缩编码器等,都与 GPU 显存大小、带宽和 FP8/INT4 量化策略高度耦合。软硬协同设计才能榨出极致性价比。
13 最新事件
以下为 2024–2025 年初的重要进展,直接影响截断策略的技术选型和商业实践。
- 2024 年 2 月:Google 发布 Gemini 1.5 Pro,宣布达到 1M token 上下文,同时公开 Infini-attention 技术,能够在 Transformer 中融入线性记忆,减少对粗暴截断的依赖。
- 2024 年 6 月:Anthropic 推出 Claude 3.5 Sonnet,其长上下文的“中间信息”检索能力引发社区关注,独立评测显示在 200k token 深度提取任务上错误率明显低于竞品。
- 2024 年 7 月:Meta 发布 LLaMA 3.1 405B,原生支持 128k token,开源社区基于其 GQA 和 RoPE 外推优化,衍生出多种窗口缩放方法,降低了对截断的被动需求。
- 2024 年 10 月:微软推出 LLaMA-2-7B 长上下文微调方案,配合其 Azure AI 中的智能分割器,实现混合流水线;同时 OpenAI DevDay 上展示可通过“Prompt Caching”自动重用历史片段,实质上将截断与缓存结合,降低 50% 成本。
- 2024 年 12 月:开源项目 MemGPT 发布重大更新,引入“自适应记忆页大小”,可根据对话类型动态调整压缩阈值。
- 2025 年 1 月:DeepSeek-V3 支持 128K 上下文并开源,采用 MoE 架构,社区反应其推理 API 成本极低,得益于高效的 KV 缓存压缩,变相将截断责任前移到模型内部。
以上事件信息来源:各公司官方博客、arXiv 预印本及知名 AI 媒体(如 The Verge、VentureBeat)报道。
14 跟踪指标
跟踪以下指标有助于判断一家公司或一个开源方案在截断策略维度的真实实力。
-
上下文利用率 (Context Utilization Rate)
- 定义:在长文本评测(如 L-Eval, LongBench)中,同样模型在不同截断设置下取得的分数 / 全量输入时的分数。
- 获取方式:查看官方技术博客或第三方评测机构的对比测试。
-
每百万 token 的平均推理延迟 (TBT, Time Between Tokens 或 E2E Latency)
- 标定不同输入长度下的延迟曲线,观察拐点位置。若延迟呈超线性增长,说明截断或压缩机制不足。
- 数据来源:云厂商 API 性能监控页面(如 OpenRouter、Anyscale 的公开排行)。
-
平均请求 token 数 vs 实际必要信息 token 数
- 可通过 LangSmith、Weights & Biases 等可观测平台获取,衡量截断策略的浪费程度。
-
关键信息召回率 (Needle-in-a-Haystack Metric)
- 在长文档中随机插入一个事实,检测回答是否正确。Google、Anthropic 等定期发布此数据作为长上下文能力证明。
-
内存/显存消耗峰值 vs 模型理论值
- 用 NVIDIA Nsight 或同类工具监控,在给定模型和 W 参数下,实际显存占用是否接近线性增长,还是依然接近于 O(N²) 的趋势。
-
检索增强流水线的 Top-K 召回率与精度
- 用于评估外部记忆检索环节是否成为瓶颈。可使用 BEIR 或自定义测试集。
-
开源项目活跃度
- Star、Issue、PR 频率,是否跟进最新模型结构(如 Mamba 支持程度),能在一定程度上折射工具链的健壮性。
15 信源
-
基础论文
- Vaswani et al., Attention Is All You Need, NeurIPS 2017.
- Xiao et al., Efficient Streaming Language Models with Attention Sinks, 2023.
- Wang et al., Landmark Attention: Random-Access Infinite Context Length for Transformers, 2023.
- Park et al., Generative Agents: Interactive Simulacra of Human Behavior, 2023.
- Munkhdalai et al., Infini-attention: Infinite Context with Transformer-based Models, 2024.
-
综述与评测
- A Survey on Long Context Language Modeling (2024 多个版本, arXiv).
- Lost in the Middle: How Language Models Use Long Contexts (2023).
- L-Eval, LongBench, ZeroSCROLLS 等基准论文。
-
技术博客与官方文档
- Hugging Face Blog: “The Quest for Long Contexts” (2024).
- LangChain/LlamaIndex 官方文档 – 文本分割、检索章节。
- OpenAI, Anthropic, Google DeepMind 各自的长上下文技术简报(2024–2025)。
-
行业报告
- Grand View Research: Large Language Model (LLM) Market Size, 2024.
- MarketsandMarkets: Enterprise AI Data Pipeline & RAG Tools Market, 2025.
- Gartner: Emerging Technologies: The Long-Term Impact of Long-Context LLMs, 2024.
-
社区与评测
- OpenRouter 公开延迟/成本对比(持续更新)。
- 独立评测机构如 Artificial Analysis 的模型长上下文评分。
所有市场数字均依据上述信源口径,未见于公开报告的细项数字已标注“公开资料未见”或“估算”。本文不构成任何投资或采购建议,仅做技术产业分析。