模型层 开放阅读

上下文工程

Context Engineering

概念 ID
context-engineering
更新时间
2026-05-29
来源数量
待补

上下文工程

1. 3秒看懂

上下文工程是设计、组装与动态管理输入给大语言模型(LLM)的信息结构的系统方法论。它决定了模型在单次推理中能“看到”并“理解”的上下界——不只包含提示词怎么写,更包含对话历史如何压缩、外部检索结果如何编排、以及在动辄十万甚至百万 token 的上下文窗口里如何把有限的注意力预算分配到最关键的信息片段上,使模型产生符合预期的输出。

2. 3分钟产业解释

可以把上下文工程理解为大模型的“工作记忆管理师”。大语言模型拥有一次性容纳的文本长度上限(上下文窗口),当我们需要解决复杂问题——分析数百页财报、调试跨文件代码、操作带长期记忆的自主智能体——就要向模型塞进大量背景资料、工具调用结果和多轮对话记录。然而窗口越长,推理成本越高,模型越容易在长文本中“迷失重点”。上下文工程要回答的核心问题就是:在给定的窗口内,放什么、怎么放、何时更新、何时遗忘

工程手段包括动态提示组装、检索增强生成(RAG)、对话压缩与摘要、结构化信息抽取、思维链编排、多智能体上下文共享等。产业实践中,上下文工程是连接基础模型能力与真实业务场景的最后一公里——既影响最终输出质量,又直接决定推理成本和延迟。因此,它正从“调提示的小技巧”上升为一种基础设施能力,被企业视为提高大模型应用可靠性和经济性的关键杠杆。

3. 技术原理

上下文工程的底层依赖 Transformer 的自注意力机制:每个 token 都需与序列中所有其他 token 计算注意力权重,导致计算复杂度为 O(n^2),其中 n 为上下文 token 数。这是所有长上下文工程实现的根本瓶颈。

关键机制:

  • 位置编码:为模型注入序列顺序感。旋转位置编码(RoPE)是当前长上下文扩展的主流基础,通过调整基频可将上下文窗口外推到训练时未见过的长度。部分模型也采用 ALiBi 等线性偏置实现外推。
  • KV 缓存:推理时缓存历史的 Key、Value 矩阵,避免重复计算。缓存大小与上下文长度、层数、隐藏维度成正比,带来了显著的显存压力和访存带宽需求。
  • 注意力稀疏化与窗口划分:为了降低复杂度,部分方案强制 token 只注意到局部窗口或预设的摘要 token,代价是可能损害全局连贯性。
  • “迷失中间”效应:模型对上下文开头和结尾的信息往往记得更牢,而对中间部分容易忽略(Liu et al., 2023)。上下文工程需要通过分段、索引、显式标题等结构将关键信息推入注意力的有效区域。

上下文组装典型流程(ASCII 图)

输入源:
  [系统指令] + [对话历史摘要] + [检索到的片段1,2,3] + [用户当前提问]

  ┌───────────────────────────────┐
  │  上下文组装器 (排序、去重、截断) │
  └──────────────┬────────────────┘
                 │ 填入上下文窗口 (如 128k tokens)
                 ▼
  ┌──────────────────────────────────────────────┐
  │ 模型推理时,注意力矩阵覆盖整个窗口           │
  │ 关键信息最好位于窗口头部或尾部,           │
  │ 或通过结构化标记提升中间内容的注意力权重     │
  └──────────────────────────────────────────────┘

上下文污染也是重要关注点:过多无关或低质量信息会导致模型输出质量下降,因此需要设计过滤、去重和优先级排序机制。此外,在长时间运行的任务(如客服、自主代理)中,上下文会不断膨胀,必须引入遗忘策略、递归压缩和关键事实提取,以维持信息的相关性和一致性。

4. 关键参数

  • 上下文窗口长度:模型厂商设定的最大 token 数上限。目前主流闭源模型处于 128k–200k 区间,部分模型声明可达 1M token(如 Gemini 1.5 Pro,来源:Google AI Blog,2024年2月),开源模型常见 4k–128k。
  • 有效上下文利用率:模型实际能从长文本中准确检索信息的比例。根据 Liu et al.(2023)的“大海捞针”实验,在文档中间位置的关键信息召回准确率较首尾可下降 20 个百分点以上,表明窗口长度与有效利用并非线性关系。
  • 关键信息召回率:给定长文档中分散的多条事实,模型能正确提取的比例。在多跳问答场景中,该指标直接反映上下文编排质量。
  • 上下文污染率:无关信息引发输出错误的概率增幅。衡量信息过滤与优先级排序策略的成效。
  • 推理延迟增长系数:上下文长度每翻倍时延迟增加的倍数。理想情况为线性增加,但实际因 O(n^2) 注意力计算常表现为超线性增长,受硬件、稀疏化策略影响。
  • KV 缓存占用:单位 token 占用的显存量(约 2 × 层数 × 隐藏维度 × 精度字节),直接影响最大并发和硬件成本。以 7B FP16 模型为例,单 token 的 KV 缓存约 0.3 MB,128k token 则达约 38 GB(未优化前,来源:基于公开 Transformer 架构推算)。
  • 压缩率与保真度:应用上下文压缩(如摘要、递归记忆)后,压缩信息在下游任务上的性能保持度,通常以 ROUGE/BERTScore 与任务准确率联合评估。

5. 技术路线

技术路线典型窗口规模核心机制推理延迟上下文利用率工程复杂度适用场景
短上下文 + 丰富提示2k–8k tokens纯提示工程,拼接指令与少量示例高(信息密集)简单任务、单轮问答
检索增强生成(RAG)8k–32k tokens外部检索 + 片段插入与排序中(依赖检索质量)知识问答、文档分析
长上下文原生支持32k–200k tokens模型原生扩展位置编码,满窗口注意力高(O(n²))中(存在“迷失中间”)中高长文档摘要、代码库分析
超长上下文 + 智能压缩200k–1M+ tokens递归摘要、结构化分段索引、选择性注意力与持久记忆很高中等偏高长篇多轮对话、自主智能体

注:窗口规模为行业常见公开披露区间,非精确规格,2024年数据;延迟与利用率基于定性评估及公开研究报告。

6. 上游

上下文工程的上游主要包括以下几类供给要素:

  • 基础模型能力:上下文窗口长度、位置编码机制(如 RoPE 外推能力)、注意力实现(闪存注意力等)直接决定工程可行性。代表供给方为 OpenAI、Anthropic、Google DeepMind 等闭源厂商,以及 Meta、Mistral、阿里 Qwen 等开源社区。
  • 存内/近存计算硬件:大容量高带宽显存(HBM)是长上下文推理的核心硬件约束。NVIDIA H200(2024 年发售)提供 141 GB HBM3e,带宽 4.8 TB/s;AMD MI300X 提供 192 GB HBM3(来源:NVIDIA、AMD 官方规格 2024)。更高 KV 缓存容量和带宽能够支撑更长的上下文和高并发推理。
  • 向量数据库与检索系统:为 RAG 型上下文提供高质量片段。召回率、排序精度、混合检索能力(稠密+稀疏)直接影响上下文组装质量。主流系统包括 Pinecone、Weaviate、Milvus、Chroma 等。
  • 提示编排框架:LangChain、LlamaIndex、Microsoft Semantic Kernel 等提供了高层次抽象,将碎片化的上下文工程组件标准化,显著降低开发成本。

7. 下游

上下文工程的下游覆盖几乎所有需要将 LLM 应用于长周期、复杂认知任务的场景:

  • 智能体与多步推理:任务分解、工具调用、观察与反思的历史链接,要求上下文保持连贯、精简、无污染。典型应用如代码智能体(Devin, SWE-Agent)、操作系统智能体。
  • 企业级 RAG 应用:客服、合规审查、内部知识库等场景依赖长文档检索和高质量片段编排,上下文工程直接影响答案准确率与幻觉率。
  • 长文本理解与生成:分析论文、法律文书、基因序列、大型代码仓库,要求模型在数万 token 上下文内精确定位信息。
  • 个性化助手与持久记忆:通过用户画像动态注入、跨会话记忆更新,实现“认识你,记住你”的体验。
  • AI 原生工作流:自动报告生成、多文档交叉验证等,依赖结构化上下文注入和动态更新。

8. 受益公司

上下文工程作为系统能力层,受益方分布于基础设施、工具平台和行业应用等多个环节。以下根据公开信息梳理受益的产业角色(不构成投资建议):

类型代表公司 / 项目在上下文工程中的受益逻辑
长上下文模型先锋OpenAI (GPT-4o/o1), Anthropic (Claude 3.5), Google (Gemini 1.5)原生支持超长窗口与记忆功能,定义能力边界,吸引复杂任务客户
上下文编排与中间件LangChain, LlamaIndex, Microsoft Semantic Kernel提供 RAG、智能体上下文管理的抽象框架,降低工程门槛,成为“上下文操作系统”
记忆与持久化上下文Mem0, Letta (原MemGPT), OpenAI Memory 功能实现跨会话持久化记忆管理,拓展大模型应用场景
向量数据库与检索Pinecone, Weaviate, Chroma, Milvus提供高性能检索,是上下文供给的关键组件,受益于 RAG 需求增长
推理硬件NVIDIA (H100/H200/B200), AMD (MI300X)高带宽显存提升 KV 缓存容量,支撑长上下文推理,直接受益于上下文规模扩张
开源长上下文模型社区Meta (Llama 3.1), Mistral, Qwen 系列推动低成本长上下文工程策略,降低使用门槛

9. 市场规模

公开资料未见专门针对“上下文工程”的独立市场报告,其价值附着于 LLM 应用平台、向量数据库、MLOps 工具等关联市场。可观测的关联规模如下:

  • 向量数据库市场:据 MarketsandMarkets 2023 年 9 月报告,全球向量数据库市场规模 2023 年约为 15 亿美元,预计 2028 年达到 43 亿美元,复合年增长率约 23.2%(来源:MarketsandMarkets, Vector Database Market Report, 2023)。
  • 检索增强生成 (RAG) 相关市场:上下文工程在很大程度上牵引 RAG 工具链需求。行业分析机构 Fortune Business Insights 指出,2023 年全球自然语言处理市场规模为 327.2 亿美元,预计 2030 年增至 1568.0 亿美元(来源:Fortune Business Insights, 2024)。RAG 与企业搜索智能化的渗透率提升,将持续为上下文工程工具链提供增长动力。
  • LLMOps/大模型运维工具:据 Grand View Research 2023 年报告,MLOps 市场 2022 年约 12 亿美元,2030 年有望超过 100 亿美元,其中上下文组装与监控工具被视为新增细分。

上述数据表明,上下文工程虽无独立测算口径,但作为基础设施层能力,其商业价值蕴含在百亿美元级关联市场中。

10. 玩家对比

玩家 / 模型最大公开上下文窗口是否内置记忆/持久化“迷失中间”缓解策略生态与工程支持
OpenAI GPT-4o / o1128k tokens提供 Memory 功能(跨对话)系统提示指引与检索增强;优化长上下文微调LangChain/LlamaIndex 深度集成,多模态
Anthropic Claude 3.5 Sonnet200k tokens项目记忆(Projects)提示缓存(Prompt Caching)降低重复成本,大规模优化“大海捞针”表现API 质量高,长文档分析见长
Google Gemini 1.5 Pro1M tokens(研究环境 2M)无独立记忆产品,依赖开发者实现基于稀疏 MoE 与高效注意力,长上下文检索实验表现突出Google Cloud 生态,Vertex AI 集成
Meta Llama 3.1 / 3.2128k tokens无内置开源可微调,社区探索 RoPE 外推和压缩策略开源社区广泛,支持多框架
Mistral Large 2128k tokens无内置位置编码支持长上下文,准确率稳定欧洲及企业级部署
阿里 Qwen 2.5128k tokens(部分量化版可达 1M)无内置提出 Dual Chunk Attention 等改进,大海捞针准确率高开源生态,多语言能力强

注:数据基于各公司 2024 年公开文档与第三方评测,记忆/持久化功能指原生产品化状态。

11. 风险

  • 技术天花板不透明:长上下文窗口的“可用”与“好用”之间存在显著鸿沟。“大海捞针”测试表明,多数模型在上下文中间区域的可靠检索仍不理想,可能影响高准确率场景的交付。
  • 成本非线性增长:长上下文推理的显存占用和计算量攀升,在超长窗口下可能导致推理延迟和经济成本难以控制,削弱应用的经济可行度。
  • 模型原生能力吞噬工程层:若未来基础模型在长上下文理解和记忆方面取得根本性突破(例如近乎完美且成本极低),当前大量中间件和编排方案的价值空间可能被压缩。
  • 隐私与数据安全:上下文中往往包含企业敏感信息、个人对话历史。持久化记忆和片段缓存使得数据治理、合规(如 GDPR)和防泄露挑战更为突出。
  • 标准碎片化:各模型厂商的上下文格式、记忆接口、工具调用协议不统一,导致上下文工程层需要适配大量定制逻辑,增加开发和维护成本。
  • 评估基准缺失:缺乏统一、被业界公认的上下文工程性能基准,使得方案选型和优化缺乏客观坐标系。

12. 误读纠偏

  • 误读1:“上下文窗口越大越好,就不会有信息丢失了。” 纠偏:窗口大小不等于有效利用。大量实测表明,诸多百万 token 窗口的模型在中间区域的信息召回率大幅低于首尾区域(Liu et al., 2023)。若不配合分段、摘要和位置优化,盲目塞满长文本反而引入噪声,降低输出质量。

  • 误读2:“上下文工程就是提示工程2.0。” 纠偏:提示工程关注单条指令的措辞与少样本示例设计,是上下文工程的一个子集。上下文工程还包括检索增强、记忆管理、结构化信息注入、跨智能体上下文共享等系统性设计,更接近信息架构与认知负载调度的复合学科。

  • 误读3:“只要交给 RAG 就能解决长上下文问题。” 纠偏:RAG 虽能减轻上下文压力,但其效果严重依赖检索质量、片段排序和信息去重。错误或无关的检索片段同样会造成上下文污染,无法替代长上下文理解本身对信息内部关联的精细建模。

13. 最新事件

  • 2024年2月:Google 发布 Gemini 1.5 Pro,上下文窗口达到 1M token(提供研究环境 2M),首次在大规模多模态模型中实现实用化百万级上下文(来源:Google AI Blog,2024年2月15日)。
  • 2024年4月:Meta 发布 Llama 3 系列,初始 8k 窗口,后续推出 128k 版本,并开源权重,推动长上下文开源生态(来源:Meta AI 官方发布)。
  • 2024年6月:Anthropic 推出 Claude 3.5 Sonnet,200k 上下文窗口,并引入 Prompt Caching 功能以降低重复上下文成本,在“大海捞针”等长上下文测试中取得领先(来源:Anthropic 官方博客)。
  • 2024年9月:OpenAI 发布 o1-preview 和 o1-mini 模型,支持 128k 上下文,并将内存功能融入推理链条,进一步强化长链推理与上下文管理(来源:OpenAI 官网)。
  • 2024年9月:阿里云发布 Qwen 2.5 系列,支持 128k 原生上下文,其中部分量化版本可扩展至 1M,并提出 Dual Chunk Attention 等长文优化机制(来源:Qwen 官方博客)。
  • 2024年10月:记忆管理平台 Mem0 发布更新版本,增强与 LangChain 等框架的上下文持久化集成,引发业界对“上下文即服务”的关注(来源:Mem0 GitHub 及官方公告)。
  • 2024年11月:行业大会(如 COLM、NeurIPS 相关研讨会)出现多个关于上下文压缩、递归记忆和注意力动态剪枝的前沿工作,标志着上下文工程学术界与工业界的加速融合。

14. 跟踪指标

  • 有效上下文利用率:通过标准化“大海捞针”(Needle-in-a-Haystack)或多文档问答基准,跟踪模型在不同位置、不同文档长度的关键信息召回率。
  • 关键信息召回率与污染率:构建专属评测集,衡量上下文组装策略在真实企业场景下的信息提取精度和噪声引入比例。
  • 推理延迟与成本指数:记录上下文长度翻倍时,推理端到端延迟和显存占用(KV 缓存)的增幅,监控线性度偏离。
  • 压缩保真度:对比上下文压缩(摘要、递归记忆)前后在下游任务上的准确率变化,评估压缩策略的可用性。
  • 记忆持久性命中率:针对带记忆的系统,追踪跨会话中用户画像、历史事实的召回准确性,衡量记忆系统的可靠度。
  • 工具/智能体上下文连贯性:在多步智能体任务中,记录因上下文缺失或错误导致的工具调用失败率和任务完成率。
  • 生态兼容成本:衡量为适配不同模型厂商、编排框架所需的适配代码量和维护开销,指导工程抽象层级的选择。

15. 信源

  • 论文:Vaswani et al., Attention Is All You Need, 2017.
  • 论文:Su et al., RoFormer: Enhanced Transformer with Rotary Position Embedding, 2021.
  • 论文:Liu et al., Lost in the Middle: How Language Models Use Long Contexts, 2023.
  • 论文:Gao et al., A Survey on Retrieval-Augmented Generation, 2023.
  • 行业报告:MarketsandMarkets, Vector Database Market Report, 2023年9月.
  • 行业报告:Fortune Business Insights, Natural Language Processing Market, 2024.
  • 行业报告:Grand View Research, MLOps Market Size & Share, 2023.
  • 官方文档:OpenAI Platform Documentation (Memory, 上下文窗口), 2024.
  • 官方博客:Anthropic Blog (Claude 3.5 Sonnet, Prompt Caching), 2024.
  • 官方博客:Google AI Blog (Gemini 1.5 Pro), 2024年2月.
  • 开源项目:LangChain、LlamaIndex、Mem0、Letta GitHub 仓库及文档.
  • 硬件规格:NVIDIA H200 Datasheet, AMD MI300X Official Specifications, 2024.

注:财务与市场数据均标明年份、口径及来源,对无法独立核实的数据以“公开资料未见”表述;本内容不包含任何形式的投资建议或买卖推荐。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型