模型層 開放閱讀

鏈式思考

Chain-of-Thought, CoT

概念 ID
chain-of-thought-cot
更新時間
2026-05-29
來源數量
待補

鏈式思考

3 秒看懂

鏈式思考(Chain-of-Thought, CoT) 是一類通過生成中間推論步驟來引導大語言模型解決複雜問題的提示技術。它不是模型架構,也不是訓練方法,而是操縱模型“思維過程”的手段。CoT 使得模型在數學、邏輯、多跳問答等需要多步推論的任務上獲得顯著提升,並且推論過程透明、可驗證,已成為大型模型應用於嚴肅場景的標配能力。

3 分鐘產業解釋

大語言模型直接回答覆雜問題時錯誤率高,尤其是需要多步推演的任務。CoT 通過要求模型在給出最終答案之前,先輸出一系列自然語言推論步驟,大幅提升準確率與可解釋性。這一範式的產業價值體現在三個方面:

  • 推論能力解鎖:使原本不擅長的數學、程式碼生成、科學推論等“重邏輯”領域成為模型可用的戰場;
  • 產品化信任:顯式推論鏈讓使用者、監管者能審視模型決策過程,降低“幻覺”帶來的風險;
  • 新範式催化:從 2022 年的手動提示,到 2024-2025 年以 OpenAI o1、DeepSeek-R1 為代表的“推論模型”,CoT 已從外部提示內化為模型固有的長鏈推論行為,並推動訓練流程從單純模仿人類文本,轉向強化學習驅動的思維鏈路最佳化。

產業層面,幾乎所有大型 AI 實驗室和產品(搜尋、程式設計助手、辦公套件)都已將 CoT 或類似機制納入系統,推論算力需求也因此出現結構性增長。

15 分鐘專家深入

CoT 的核心是“推遲答案生成”,迫使模型在自迴歸解碼時沿著一條逐步推論的路徑前進。該過程並非讓模型進行外部迭代搜尋,而是利用前文生成的推論令牌,作為後續令牌的條件,實現一種上下文內部自修正。從機制上講,模型每一層 transformer 的自注意力都會對之前所有推論步驟進行聚合,從而逐步縮小可能的解空間。

產業上的深入理解必須區分三種形態:

  1. 提示級 CoT (Prompt-level CoT):在輸入中加入思維鏈示例(少樣本)或觸發指令(零樣本),模型執行時產生推論步驟。代表:Wei et al. (2022); Kojima et al. (2022) 的“Let’s think step by step”。
  2. 後訓練內化 CoT (Post-training Internalized CoT):通過強化學習或蒸餾,使模型在無外部提示時自發產生詳細思維過程,甚至形成隱藏的推論鏈(如 o1 的隱蔽思維令牌)。代表:OpenAI o1 系列、DeepSeek-R1。
  3. 結構化解碼 CoT (Structured Decoding):在解碼時引導模型按特定圖/樹結構搜尋(如 Tree-of-Thought、Graph-of-Thought),將線性鏈變為更復雜的推論拓撲。

從推論算力角度,CoT 顯著拉長了生成序列的長度(例如從數十個 token 擴充套件到數千個 token),直接導致每查詢的推論算力開銷呈數量級增長。這意味著即便基礎模型引數不再膨脹,推論市場仍將高速擴張,對高速 HBM、推論加速晶片的需求構成中長期支撐。

技術原理

機理與關鍵引數

CoT 建立在自迴歸語言模型基礎上。給定輸入問題 X,常規直接回答將 P(Answer|X) 分解為答案令牌的乘積。CoT 則將推論鏈 R 顯式插入:

  1. 生成推論鏈: P(R|X)
  2. 基於推論鏈生成答案: P(Answer|X,R)

由於 R 是順序生成的自然語言句子,每個推論步驟 r_t 的條件機率為 P(r_t|X, r_{<t})。這使得模型可以在生成“經過驗證的中間結論”後,再基於這些結論給出答案,從而減少複合錯誤。

關鍵引數/要素(定性):

  • 鏈長度:推論步驟數。通常越長則準確率上升,但過度拉長可能引入漂移或重複。
  • 少樣本示例數量與質量:提供 2–8 個帶推論步驟的示例,要求步驟邏輯清晰、覆蓋不同情景。數量並非越多越好,飽和點通常約 4 例。
  • 觸發提示(零樣本):“Let’s think step by step” 等簡單指令即可激發模型輸出推論,效果雖弱於精心設計的少樣本提示,但具備通用性。
  • 自洽性(Self-Consistency):對同一問題取樣多條 CoT 路徑,取多數投票答案,可進一步大幅提升準確性,是推論時計算(Test-time Compute)的早期實踐。
  • 推論拓撲:直線鏈(coT)、樹狀搜尋(ToT)、圖譜推論(GoT)等,影響解空間的覆蓋度和計算量。

工作流示意(ASCII)

常規提示:
  輸入: "小明有5個Apple,買了3個,又給了朋友2個,還剩幾個? 答案:"
  模型生成: "6"  (可能錯誤)

CoT 提示 (零樣本):
  輸入: "小明有5個Apple,買了3個,又給了朋友2個,還剩幾個? 讓我們一步一步思考。"
  模型生成:
    "小明一開始有5個Apple,
     買了3個後總共有5+3=8個,
     給了朋友2個後剩下8-2=6個。
     所以答案是6。"
  最終答案提取: 6 (準確)

內部注意力機制: 在推論過程中,模型每層自注意力會將問題 token 與已生成的推論步驟進行融合。實驗分析發現,關鍵注意力頭會追蹤“角色”“數量”“關係”的中間狀態,形成類似於變數的動態繫結,但沒有顯式符號計算單元,全靠分散式表示完成。

技術演進史

  • 2021 年前:大型模型以直接問答為主,複雜推論需搭配外部符號求解器或專用訓練策略。提示工程剛起步。
  • 2022.1:Wei et al. 提出 Chain-of-Thought Prompting,在系列大型數學推論基準上驗證少樣本 CoT 的威力,統一了“推論步驟 + 答案”的範式。
  • 2022.5:Kojima et al. 發現零樣本 CoT——僅加一句“Let’s think step by step”即可觸發推論,極大降低使用門檻。
  • 2022–2023:自洽性、多樣化推論路徑、受限解碼等方法出現,CoT 從提示技巧演化為推論策略族。同時,研究者開始嘗試用生成的長鏈資料微調模型,使其內化推論能力 (如 FLAN-PaLM、Distilling CoT)。
  • 2023:Tree-of-Thought (Yao et al.)、Graph-of-Thought 等結構,將推論建模為搜尋問題,利用 DFS/BFS 或 LLM+評估器組合探索多步解空間,適用於需要前瞻回溯的任務(規劃、創意寫作等)。
  • 2024:OpenAI 釋出 o1 系列模型,在訓練時採用大規模強化學習最佳化內在 CoT(使用者不可見的隱藏思維鏈)。模型學會自行分解問題、自我校驗、糾正錯誤,在 AIME 數學競賽、博士級科學問題上大幅超越以往版本。推論算力首次成為模型能力的關鍵槓桿。
  • 2025 初:DeepSeek-R1 通過純 RL 在基礎模型上激發出長且豐富的 CoT,並且思維過程完全透明,展示 RL 無需人工編寫思維鏈即可實現推論湧現,引發開源社群及產業對推論時計算策略的重新評估。

技術路線對比

技術路線機制推論時計算可解釋性典型適用場景主要侷限
直接回答端到端對映,無中間步驟很低常識問答、簡單事實檢索複雜推論錯誤率高
少樣本 CoT手動提供推論示例,模型模仿數學、邏輯、多跳推論依賴示例質量,不可自適應
零樣本 CoT一句觸發指令引發模型自推論通用複雜問題效能略遜於少樣本,路徑易發散
自洽性 CoT多次取樣+投票高準確要求的數學推論計算開銷數倍增長
樹/圖搜尋 CoT維護多條路徑,剪枝評估,外部搜尋很高規劃、博弈、複雜決策實現複雜,呼叫次數激增
內化RL-CoTRL 訓練模型發掘內在思維鏈,推論時自主產生極高低/中(可隱含)競賽級數學、程式設計、科學訓練成本高昂,輸出控制難

注: “推論時計算” 指單次查詢的 token 量與 GPU 佔用,僅作相對比較。

上下游

上游

  • 基礎模型能力:模型需具備一定的長距離依存和基礎邏輯能力;多數 70 億引數以上模型經提示可展現 CoT 增益,但真正高質量長鏈推論通常需要數百億引數或專用訓練。
  • 提示工程與資料:優質推論示例的構造、驗證,或大規模帶推論鏈的精標資料,用於微調/RL。
  • 強化學習架構:若需內化 CoT,上游需 RLHF/RLAIF 環境、獎勵模型設計(如對中間步驟給出過程獎勵,Process Reward Model)。
  • 推論硬體:隨著推論鏈延長至數千 token,推論伺服器的上下文視窗、KV 快取容量、記憶體頻寬成為瓶頸,利好 HBM、大視訊記憶體 GPU/NPU。

下游

  • 教育:自動批改作業並展示解題步驟,智慧輔導系統。
  • 程式設計助手:程式碼生成中的逐步邏輯分解,除錯推論鏈。
  • 企業知識管理:多跳文件問答,合規審查中的推論鏈路審計。
  • 科學研究:自動化文獻推論、實驗設計輔助。
  • 金融/法律:合同的邏輯校驗,風險評估、盡職調查的多步驟分析。
  • 安全與對齊:可監視的推論鏈有助於發現越獄或偏差,實現更可控的 AI 行為。

關鍵指標

  • 任務準確率:在 GSM8K、MATH、AIME、Big-Bench Hard 等基準上的效能,通常以百分比體現提升幅度。CoT 帶來的增益因基模型和任務而異,定性評估為“顯著”(部分基準翻倍或更多)。
  • 推論步驟正確率 / 忠實度:生成的推論步驟是否邏輯上正確、是否有事實錯誤。目前絕大多數 CoT 會輸出看似合理但實際錯誤的不忠實推論,需引入驗證機制。
  • 推論長度效率:平均生成 token 數與準確率的關係,期望在不太過冗長的情況下獲得最優準確率。
  • 校準度 (Calibration):CoT 後模型的置信度與正確率是否匹配,常因步驟增加導致過度自信。
  • 推論時計算開銷:每次查詢的浮點運算量、記憶體佔用、延遲,與響應質量之間的帕累托前沿。

供需與市場資料

(由於缺乏直接的市場研究報告,以下為基於產業觀察的定性分析)

  • 需求側:企業客戶對 AI 解決複雜分析任務的需求急速攀升,尤其在金融服務、法律科技、教育和生命科學領域,要求模型不僅產出結果,還要提供可審計的推論過程。這一需求驅動了推論鏈技術的快速落地。
  • 供給側
    • 模型提供商:OpenAI (o1, o3), Google (Gemini Thinking), Anthropic (Extended Thinking), DeepSeek (R1), Meta (正研發推論擴充套件) 競相推出具備深度 CoT 能力的模型或模式。
    • 平台/工具:推論鏈被整合到 LlamaIndex、LangChain 等架構作為“代理”策略;雲端運算平台推出專用推論最佳化例項。
    • 算力市場:由於 CoT 模型的序列長度普遍達到以前的 5–20 倍,推論算力需求結構性激增,對高階 GPU(NVIDIA H100/B200)及未來專用推論晶片的需求構成強支撐。據粗略估算,推論市場規模可能在 2025–2026 年超過訓練市場規模,CoT 是重要推動力之一。

代表公司與資本對映

  • OpenAI:o1 系列被視為“CoT 原生模型”的標杆,通過 RL 和過程獎勵訓練,在高難度推論考試中展露鋒芒。資本關注其 API 定價(o1 價格遠高於 GPT-4o),反映高推論算力成本和對企業市場的強力牽引。
  • Anthropic:Claude 3.5+ 推出的“線型思考”(Extended Thinking)允許使用者檢視可控制的推論過程,在產品側實現透明度與安全性的平衡,差異化定位在受監管行業。
  • Google DeepMind:Gemini 模型整合了思維鏈與搜尋增強;同時在研究層面推進“端到端推論”創新,對雲端業務和 TPU 生態有基礎設施價值。
  • DeepSeek/中國團隊:DeepSeek-R1 以純 RL 方式激發長思維鏈,證明開源模型可實現頂尖推論效能,顛覆“閉源壟斷”敘事,帶動國產算力適配與推論服務需求。
  • Meta:釋出 Llama 等開源模型,社群通過微調+CoT 資料蒸餾復現推論能力,降低行業門檻。
  • 雲端基礎設施與晶片廠商:NVIDIA (推論算力主流)、AMD、雲端廠商(為 CoT 負載最佳化例項)從中受益;推論晶片初創公司(如Groq、Cerebras)獲得差異化視窗。

投資邏輯

  1. 推論算力擴張主線:CoT 推動的序列長度暴增,使推論市場在未來數年的算力需求增長率可能遠超訓練。投資邏輯向推論硬體傾斜——高速 HBM、大視訊記憶體晶片、低延遲網路(InfiniBand/超乙太網路)。
  2. 模型即服務差異化:具備先進 CoT 能力的模型可獲得更高 API 定價權,提高模型層營收。關注頭部實驗室和擁有垂直深度推論資料的企業。
  3. 軟體/中介軟體機會:用於編排、快取、路由、壓縮思維鏈的中介軟體將湧現,以降低企業和雲端廠商的推論成本,切入 LLM Ops 與 AI 代理架構賽道。
  4. 安全與合規溢價:可審計的推論鏈在金融、法律、醫療等高合規行業成為剛需,推動相關產品獲得更高單位經濟價值。
  5. 開源生態的顛覆作用:低成本復現頂尖推論能力(如 DeepSeek-R1)衝擊單一閉源廠商的壟斷地位,推論鏈能力可能快速商品化,此時應用層壁壘(資料飛輪、使用者粘性)更為關鍵。

常見誤讀糾偏

誤讀 1:“CoT 是一種微調技術,需要訓練模型才能使用。” 糾正:CoT 起源於無需訓練的提示技術,零樣本和少樣本均無需修改模型引數。雖然後續發展出用 CoT 資料微調/RL 強化模型,使其原生產出長鏈,但 CoT 的本質仍是部署時引導推論的方法,而非特定的訓練範式。把 CoT 等同於 RLHF 或 SFT 是對其概念的窄化。

誤讀 2:“CoT 能讓模型真正‘思考’,理解數學原理。” 糾正:CoT 是統計模式下的路徑生成,模型並不具備人類式的概念理解和邏輯公理。它只是學會了以類似推論的文本模式,利用訓練語料中的統計學規律來降低錯誤機率。在分佈外或極端複雜問題下,產生的推論鏈可能充滿精緻謬誤(看似正確實則錯誤)。產業應用需警惕這種“可解釋的幻覺”。

誤讀 3:“思維鏈越長越好,無腦增加步驟能提高效能。” 糾正:過長的推論鏈容易引入漂移、重複和矛盾,且消耗大量算力和延遲。實際系統需要平衡:通過自適應控制(模型自行判斷何時停止思考)、預算強制(限制令牌數)或過程獎勵修剪來找到最優鏈長。OpenAI o1 等系統在內部會動態決定何時輸出最終答案。

學習路徑

  1. 入門:閱讀原始論文 “Chain-of-Thought Prompting Elicits Reasoning in Large Language Models” (Wei et al., 2022),理解 why/how 架構。用 OpenAI Playground 實測新增 CoT 示例前後的對比。
  2. 進階手法:研究 “Large Language Models are Zero-Shot Reasoners” (Kojima et al., 2022) 和 “Self-Consistency Improves Chain of Thought Reasoning in Language Models” (Wang et al., 2023)。嘗試建置自己的推論提示,並評估自洽性效果。
  3. 架構與訓練:追蹤 OpenAI o1 的技術報告(獲取公開部分)和 DeepSeek-R1 論文 (“DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning” ),理解 RL 如何激發長思維鏈。
  4. 深化搜尋邏輯:學習 “Tree of Thoughts” (Yao et al., 2023) 和 “Graph of Thoughts” 的架構,執行開源實現,掌握將推論建模為搜尋的思想。
  5. 產業實踐:使用 LangChain 或 LlamaIndex 搭建帶 CoT 的 RAG 系統;在真實業務場景中設計評估指標,研究如何檢測不忠實推論、如何壓縮推論成本。

一句話總結

鏈式思考是將大型模型的“直覺式回答”改造成“可審計的推論過程”的提示範式,已成為複雜智慧應用的基石,並正在從外部技巧演進為模型內在的核心能力,深刻重塑推論算力市場與 AI 產品形態。

延伸閱讀與來源

  • Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS.
  • Kojima et al. (2022). Large Language Models are Zero-Shot Reasoners. NeurIPS.
  • Wang et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR.
  • Yao et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS.
  • DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv.
  • OpenAI (2024). Learning to Reason with LLMs (o1 system card and technical overview). (來源:openai.com)
  • Lightman et al. (2023). Let’s Verify Step by Step (process reward models for reasoning). arXiv.

(注:上述為領域關鍵文獻,部分結論已在正文中專性提及,未提供具體數字系因無檢索資料可資確證,均以定性表述。)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型