模型层 开放阅读

链式思考

Chain-of-Thought, CoT

概念 ID
chain-of-thought-cot
更新时间
2026-05-29
来源数量
待补

链式思考

3 秒看懂

链式思考(Chain-of-Thought, CoT) 是一类通过生成中间推理步骤来引导大语言模型解决复杂问题的提示技术。它不是模型架构,也不是训练方法,而是操纵模型“思维过程”的手段。CoT 使得模型在数学、逻辑、多跳问答等需要多步推理的任务上获得显著提升,并且推理过程透明、可验证,已成为大模型应用于严肃场景的标配能力。

3 分钟产业解释

大语言模型直接回答复杂问题时错误率高,尤其是需要多步推演的任务。CoT 通过要求模型在给出最终答案之前,先输出一系列自然语言推理步骤,大幅提升准确率与可解释性。这一范式的产业价值体现在三个方面:

  • 推理能力解锁:使原本不擅长的数学、代码生成、科学推理等“重逻辑”领域成为模型可用的战场;
  • 产品化信任:显式推理链让用户、监管者能审视模型决策过程,降低“幻觉”带来的风险;
  • 新范式催化:从 2022 年的手动提示,到 2024-2025 年以 OpenAI o1、DeepSeek-R1 为代表的“推理模型”,CoT 已从外部提示内化为模型固有的长链推理行为,并推动训练流程从单纯模仿人类文本,转向强化学习驱动的思维链路优化。

产业层面,几乎所有大型 AI 实验室和产品(搜索、编程助手、办公套件)都已将 CoT 或类似机制纳入系统,推理算力需求也因此出现结构性增长。

15 分钟专家深入

CoT 的核心是“推迟答案生成”,迫使模型在自回归解码时沿着一条逐步推理的路径前进。该过程并非让模型进行外部迭代搜索,而是利用前文生成的推理令牌,作为后续令牌的条件,实现一种上下文内部自修正。从机制上讲,模型每一层 transformer 的自注意力都会对之前所有推理步骤进行聚合,从而逐步缩小可能的解空间。

产业上的深入理解必须区分三种形态:

  1. 提示级 CoT (Prompt-level CoT):在输入中加入思维链示例(少样本)或触发指令(零样本),模型运行时产生推理步骤。代表:Wei et al. (2022); Kojima et al. (2022) 的“Let’s think step by step”。
  2. 后训练内化 CoT (Post-training Internalized CoT):通过强化学习或蒸馏,使模型在无外部提示时自发产生详细思维过程,甚至形成隐藏的推理链(如 o1 的隐蔽思维令牌)。代表:OpenAI o1 系列、DeepSeek-R1。
  3. 结构化解码 CoT (Structured Decoding):在解码时引导模型按特定图/树结构搜索(如 Tree-of-Thought、Graph-of-Thought),将线性链变为更复杂的推理拓扑。

从推理算力角度,CoT 显著拉长了生成序列的长度(例如从数十个 token 扩展到数千个 token),直接导致每查询的推理算力开销呈数量级增长。这意味着即便基础模型参数不再膨胀,推理市场仍将高速扩张,对高速 HBM、推理加速芯片的需求构成中长期支撑。

技术原理

机理与关键参数

CoT 建立在自回归语言模型基础上。给定输入问题 X,常规直接回答将 P(Answer|X) 分解为答案令牌的乘积。CoT 则将推理链 R 显式插入:

  1. 生成推理链: P(R|X)
  2. 基于推理链生成答案: P(Answer|X,R)

由于 R 是顺序生成的自然语言句子,每个推理步骤 r_t 的条件概率为 P(r_t|X, r_{<t})。这使得模型可以在生成“经过验证的中间结论”后,再基于这些结论给出答案,从而减少复合错误。

关键参数/要素(定性):

  • 链长度:推理步骤数。通常越长则准确率上升,但过度拉长可能引入漂移或重复。
  • 少样本示例数量与质量:提供 2–8 个带推理步骤的示例,要求步骤逻辑清晰、覆盖不同情景。数量并非越多越好,饱和点通常约 4 例。
  • 触发提示(零样本):“Let’s think step by step” 等简单指令即可激发模型输出推理,效果虽弱于精心设计的少样本提示,但具备通用性。
  • 自洽性(Self-Consistency):对同一问题采样多条 CoT 路径,取多数投票答案,可进一步大幅提升准确性,是推理时计算(Test-time Compute)的早期实践。
  • 推理拓扑:直线链(coT)、树状搜索(ToT)、图谱推理(GoT)等,影响解空间的覆盖度和计算量。

工作流示意(ASCII)

常规提示:
  输入: "小明有5个苹果,买了3个,又给了朋友2个,还剩几个? 答案:"
  模型生成: "6"  (可能错误)

CoT 提示 (零样本):
  输入: "小明有5个苹果,买了3个,又给了朋友2个,还剩几个? 让我们一步一步思考。"
  模型生成:
    "小明一开始有5个苹果,
     买了3个后总共有5+3=8个,
     给了朋友2个后剩下8-2=6个。
     所以答案是6。"
  最终答案提取: 6 (准确)

内部注意力机制: 在推理过程中,模型每层自注意力会将问题 token 与已生成的推理步骤进行融合。实验分析发现,关键注意力头会追踪“角色”“数量”“关系”的中间状态,形成类似于变量的动态绑定,但没有显式符号计算单元,全靠分布式表示完成。

技术演进史

  • 2021 年前:大模型以直接问答为主,复杂推理需搭配外部符号求解器或专用训练策略。提示工程刚起步。
  • 2022.1:Wei et al. 提出 Chain-of-Thought Prompting,在系列大型数学推理基准上验证少样本 CoT 的威力,统一了“推理步骤 + 答案”的范式。
  • 2022.5:Kojima et al. 发现零样本 CoT——仅加一句“Let’s think step by step”即可触发推理,极大降低使用门槛。
  • 2022–2023:自洽性、多样化推理路径、受限解码等方法出现,CoT 从提示技巧演化为推理策略族。同时,研究者开始尝试用生成的长链数据微调模型,使其内化推理能力 (如 FLAN-PaLM、Distilling CoT)。
  • 2023:Tree-of-Thought (Yao et al.)、Graph-of-Thought 等结构,将推理建模为搜索问题,利用 DFS/BFS 或 LLM+评估器组合探索多步解空间,适用于需要前瞻回溯的任务(规划、创意写作等)。
  • 2024:OpenAI 发布 o1 系列模型,在训练时采用大规模强化学习优化内在 CoT(用户不可见的隐藏思维链)。模型学会自行分解问题、自我校验、纠正错误,在 AIME 数学竞赛、博士级科学问题上大幅超越以往版本。推理算力首次成为模型能力的关键杠杆。
  • 2025 初:DeepSeek-R1 通过纯 RL 在基础模型上激发出长且丰富的 CoT,并且思维过程完全透明,展示 RL 无需人工编写思维链即可实现推理涌现,引发开源社区及产业对推理时计算策略的重新评估。

技术路线对比

技术路线机制推理时计算可解释性典型适用场景主要局限
直接回答端到端映射,无中间步骤很低常识问答、简单事实检索复杂推理错误率高
少样本 CoT手动提供推理示例,模型模仿数学、逻辑、多跳推理依赖示例质量,不可自适应
零样本 CoT一句触发指令引发模型自推理通用复杂问题性能略逊于少样本,路径易发散
自洽性 CoT多次采样+投票高准确要求的数学推理计算开销数倍增长
树/图搜索 CoT维护多条路径,剪枝评估,外部搜索很高规划、博弈、复杂决策实现复杂,调用次数激增
内化RL-CoTRL 训练模型发掘内在思维链,推理时自主产生极高低/中(可隐含)竞赛级数学、编程、科学训练成本高昂,输出控制难

注: “推理时计算” 指单次查询的 token 量与 GPU 占用,仅作相对比较。

上下游

上游

  • 基础模型能力:模型需具备一定的长距离依存和基础逻辑能力;多数 70 亿参数以上模型经提示可展现 CoT 增益,但真正高质量长链推理通常需要数百亿参数或专用训练。
  • 提示工程与数据:优质推理示例的构造、验证,或大规模带推理链的精标数据,用于微调/RL。
  • 强化学习框架:若需内化 CoT,上游需 RLHF/RLAIF 环境、奖励模型设计(如对中间步骤给出过程奖励,Process Reward Model)。
  • 推理硬件:随着推理链延长至数千 token,推理服务器的上下文窗口、KV 缓存容量、内存带宽成为瓶颈,利好 HBM、大显存 GPU/NPU。

下游

  • 教育:自动批改作业并展示解题步骤,智能辅导系统。
  • 编程助手:代码生成中的逐步逻辑分解,调试推理链。
  • 企业知识管理:多跳文档问答,合规审查中的推理链路审计。
  • 科学研究:自动化文献推理、实验设计辅助。
  • 金融/法律:合同的逻辑校验,风险评估、尽职调查的多步骤分析。
  • 安全与对齐:可监视的推理链有助于发现越狱或偏差,实现更可控的 AI 行为。

关键指标

  • 任务准确率:在 GSM8K、MATH、AIME、Big-Bench Hard 等基准上的性能,通常以百分比体现提升幅度。CoT 带来的增益因基模型和任务而异,定性评估为“显著”(部分基准翻倍或更多)。
  • 推理步骤正确率 / 忠实度:生成的推理步骤是否逻辑上正确、是否有事实错误。目前绝大多数 CoT 会输出看似合理但实际错误的不忠实推理,需引入验证机制。
  • 推理长度效率:平均生成 token 数与准确率的关系,期望在不太过冗长的情况下获得最优准确率。
  • 校准度 (Calibration):CoT 后模型的置信度与正确率是否匹配,常因步骤增加导致过度自信。
  • 推理时计算开销:每次查询的浮点运算量、内存占用、延迟,与响应质量之间的帕累托前沿。

供需与市场数据

(由于缺乏直接的市场研究报告,以下为基于产业观察的定性分析)

  • 需求侧:企业客户对 AI 解决复杂分析任务的需求急速攀升,尤其在金融服务、法律科技、教育和生命科学领域,要求模型不仅产出结果,还要提供可审计的推理过程。这一需求驱动了推理链技术的快速落地。
  • 供给侧
    • 模型提供商:OpenAI (o1, o3), Google (Gemini Thinking), Anthropic (Extended Thinking), DeepSeek (R1), Meta (正研发推理扩展) 竞相推出具备深度 CoT 能力的模型或模式。
    • 平台/工具:推理链被集成到 LlamaIndex、LangChain 等框架作为“代理”策略;云计算平台推出专用推理优化实例。
    • 算力市场:由于 CoT 模型的序列长度普遍达到以前的 5–20 倍,推理算力需求结构性激增,对高端 GPU(NVIDIA H100/B200)及未来专用推理芯片的需求构成强支撑。据粗略估算,推理市场规模可能在 2025–2026 年超过训练市场规模,CoT 是重要推动力之一。

代表公司与资本映射

  • OpenAI:o1 系列被视为“CoT 原生模型”的标杆,通过 RL 和过程奖励训练,在高难度推理考试中展露锋芒。资本关注其 API 定价(o1 价格远高于 GPT-4o),反映高推理算力成本和对企业市场的强力牵引。
  • Anthropic:Claude 3.5+ 推出的“线型思考”(Extended Thinking)允许用户查看可控制的推理过程,在产品侧实现透明度与安全性的平衡,差异化定位在受监管行业。
  • Google DeepMind:Gemini 模型整合了思维链与搜索增强;同时在研究层面推进“端到端推理”创新,对云业务和 TPU 生态有基础设施价值。
  • DeepSeek/中国团队:DeepSeek-R1 以纯 RL 方式激发长思维链,证明开源模型可实现顶尖推理性能,颠覆“闭源垄断”叙事,带动国产算力适配与推理服务需求。
  • Meta:发布 Llama 等开源模型,社区通过微调+CoT 数据蒸馏复现推理能力,降低行业门槛。
  • 云基础设施与芯片厂商:NVIDIA (推理算力主流)、AMD、云厂商(为 CoT 负载优化实例)从中受益;推理芯片初创公司(如Groq、Cerebras)获得差异化窗口。

投资逻辑

  1. 推理算力扩张主线:CoT 推动的序列长度暴增,使推理市场在未来数年的算力需求增长率可能远超训练。投资逻辑向推理硬件倾斜——高速 HBM、大显存芯片、低延迟网络(InfiniBand/超以太网)。
  2. 模型即服务差异化:具备先进 CoT 能力的模型可获得更高 API 定价权,提高模型层收入。关注头部实验室和拥有垂直深度推理数据的企业。
  3. 软件/中间件机会:用于编排、缓存、路由、压缩思维链的中间件将涌现,以降低企业和云厂商的推理成本,切入 LLM Ops 与 AI 代理框架赛道。
  4. 安全与合规溢价:可审计的推理链在金融、法律、医疗等高合规行业成为刚需,推动相关产品获得更高单位经济价值。
  5. 开源生态的颠覆作用:低成本复现顶尖推理能力(如 DeepSeek-R1)冲击单一闭源厂商的垄断地位,推理链能力可能快速商品化,此时应用层壁垒(数据飞轮、用户粘性)更为关键。

常见误读纠偏

误读 1:“CoT 是一种微调技术,需要训练模型才能使用。” 纠正:CoT 起源于无需训练的提示技术,零样本和少样本均无需修改模型参数。虽然后续发展出用 CoT 数据微调/RL 强化模型,使其原生产出长链,但 CoT 的本质仍是部署时引导推理的方法,而非特定的训练范式。把 CoT 等同于 RLHF 或 SFT 是对其概念的窄化。

误读 2:“CoT 能让模型真正‘思考’,理解数学原理。” 纠正:CoT 是统计模式下的路径生成,模型并不具备人类式的概念理解和逻辑公理。它只是学会了以类似推理的文本模式,利用训练语料中的统计学规律来降低错误概率。在分布外或极端复杂问题下,产生的推理链可能充满精致谬误(看似正确实则错误)。产业应用需警惕这种“可解释的幻觉”。

误读 3:“思维链越长越好,无脑增加步骤能提高性能。” 纠正:过长的推理链容易引入漂移、重复和矛盾,且消耗大量算力和延迟。实际系统需要平衡:通过自适应控制(模型自行判断何时停止思考)、预算强制(限制令牌数)或过程奖励修剪来找到最优链长。OpenAI o1 等系统在内部会动态决定何时输出最终答案。

学习路径

  1. 入门:阅读原始论文 “Chain-of-Thought Prompting Elicits Reasoning in Large Language Models” (Wei et al., 2022),理解 why/how 框架。用 OpenAI Playground 实测添加 CoT 示例前后的对比。
  2. 进阶手法:研究 “Large Language Models are Zero-Shot Reasoners” (Kojima et al., 2022) 和 “Self-Consistency Improves Chain of Thought Reasoning in Language Models” (Wang et al., 2023)。尝试构建自己的推理提示,并评估自洽性效果。
  3. 架构与训练:追踪 OpenAI o1 的技术报告(获取公开部分)和 DeepSeek-R1 论文 (“DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning” ),理解 RL 如何激发长思维链。
  4. 深化搜索逻辑:学习 “Tree of Thoughts” (Yao et al., 2023) 和 “Graph of Thoughts” 的框架,运行开源实现,掌握将推理建模为搜索的思想。
  5. 产业实践:使用 LangChain 或 LlamaIndex 搭建带 CoT 的 RAG 系统;在真实业务场景中设计评估指标,研究如何检测不忠实推理、如何压缩推理成本。

一句话总结

链式思考是将大模型的“直觉式回答”改造成“可审计的推理过程”的提示范式,已成为复杂智能应用的基石,并正在从外部技巧演进为模型内在的核心能力,深刻重塑推理算力市场与 AI 产品形态。

延伸阅读与来源

  • Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS.
  • Kojima et al. (2022). Large Language Models are Zero-Shot Reasoners. NeurIPS.
  • Wang et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR.
  • Yao et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS.
  • DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv.
  • OpenAI (2024). Learning to Reason with LLMs (o1 system card and technical overview). (来源:openai.com)
  • Lightman et al. (2023). Let’s Verify Step by Step (process reward models for reasoning). arXiv.

(注:上述为领域关键文献,部分结论已在正文中专性提及,未提供具体数字系因无检索数据可资确证,均以定性表述。)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型