模型層 開放閱讀

冷啟動

Cold Start

概念 ID
cold-start
更新時間
2026-05-29
來源數量
待補

冷啟動》(Cold Start)

領域覆蓋:大型模型強化學習 · 推薦系統 · 系統工程 注意:本次檢索未成功獲取外部資料,以下技術描述基於公開論文(如DeepSeek-R1技術報告)和行業共識。具體數字如無標註均為定性描述或行業估算,請讀者自行交叉驗證。

3 秒看懂

┌─────────────────────────────────────────────────┐
│  冷啟動 (Cold Start)                            │
│                                                 │
│  本質:在「幾乎沒有有用先驗」的條件下,讓系統    │
│       從零開始進入有效工作狀態的技術挑戰        │
│                                                 │
│  三大戰場:                                      │
│  ├─ 大型模型RL:基座模型→RL訓練的"初始化困境"   │
│  ├─ 推薦系統:新使用者/新物品的"無資料困局"      │
│  └─ 系統工程:服務啟動的"預熱延遲"             │
│                                                 │
│  核心矛盾:需要資料才能學,但剛開始就是沒資料   │
└─────────────────────────────────────────────────┘

3 分鐘產業解釋

為什麼「冷啟動」是AI落地的核心痛點?

想像你開了一家新餐廳:

  • 沒有點評資料 → 平台不知道推薦給誰(推薦系統冷啟動)
  • 沒有經營經驗 → 不知道定多少價、備多少貨(RL冷啟動)
  • 廚房還沒熱 → 第一位客人要等很久(系統冷啟動)

2024-2025年的產業焦點集中在大型模型強化學習的冷啟動問題。以DeepSeek-R1為代表的推論模型需要通過強化學習訓練來獲得”思考能力”,但直接從基座模型開始RL會遇到嚴重問題:輸出格式混亂、探索效率極低、訓練不穩定。這就是所謂的”RL冷啟動困境”。

市場規模估算:冷啟動相關技術(包括推薦系統冷啟動解決方案、RLHF/RLAIF工程化平台)涉及的市場空間在數十億至百億量級[行業估算],是AI基礎設施的重要組成部分。

關鍵洞察:冷啟動不僅是一個技術問題,更是AI產品能否在”零經驗期”存活的生死問題。解決冷啟動的成本和效果直接決定了AI系統的商業化可行性。


15 分鐘專家深入

一、冷啟動的三種典型形態

1. 大型模型強化學習中的冷啟動(當前熱點)

問題描述: 當你想訓練一個像DeepSeek-R1這樣具備”鏈式推論”(Chain-of-Thought)能力的模型時,標準路徑是:

基座模型 (如DeepSeek-V3)
    ↓ 監督微調 (SFT)
指令跟隨模型
    ↓ 強化學習 (RL)
推論增強模型 (如R1)

但如果跳過SFT,直接從基座模型開始RL呢?

DeepSeek在R1技術報告中明確測試了這一路徑(即R1-Zero方案),發現了「RL冷啟動」的核心問題[DeepSeek-R1 Technical Report, 2025]:

問題維度具體表現
格式混亂模型輸出缺乏結構化格式(如“標籤),難以解析和評估
探索低效策略在巨大空間中隨機遊走,獎勵訊號稀疏,學習極其緩慢
訓練不穩定沒有良好初始化點,RL最佳化容易發散或陷入區域性最優
可讀性差即使學會了推論,輸出文本對人類不友好

解決方案:冷啟動資料注入

DeepSeek-R1的做法是收集數千條高質量的”長推論”SFT樣本(包含“格式的思維鏈),用這些資料微調基座模型,再開始RL訓練。這些冷啟動資料的作用是:

┌──────────────────────────────────────────────────┐
│              冷啟動資料的三重作用                 │
├──────────────────────────────────────────────────┤
│ 1. 格式初始化:教會模型使用...  │
│ 2. 策略錨定:提供一個"不算太差"的起點           │
│ 3. 稀疏獎勵補償:在RL早期提供額外監督訊號       │
└──────────────────────────────────────────────────┘

資料規模參考:DeepSeek-R1報告中提及使用了約數千條冷啟動SFT樣本[DeepSeek-R1 Technical Report]。具體條數因版本迭代可能有所調整。

2. 推薦系統中的冷啟動(經典問題)

推薦系統冷啟動有三種子型別[經典文獻綜述]:

型別描述典型場景
使用者冷啟動新註冊使用者無歷史行為新使用者首次開啟APP
物品冷啟動新上架物品無互動資料新商品/新影片釋出
系統冷啟動整個系統從零開始新平台上線

主流應對策略

使用者冷啟動解決路徑:
├─ 顯式收集:註冊時填寫偏好問卷
├─ 隱式推斷:裝置型號、地理位置、時間特徵
├─ 跨域遷移:其他平台的使用者畫像(隱私合規前提下)
└─ 元學習:MAML等方法快速適應新使用者

物品冷啟動解決路徑:
├─ 內容特徵:文本/影像/屬性的Embedding
├─ 知識圖譜:利用品類關係、屬性關係
├─ 聯邦學習:利用相似物品的全域性模式
└─ 主動學習:優先探索不確定性高的新物品

3. 系統工程中的冷啟動

定義:應用/服務在首次啟動或長時間停機後,沒有快取、沒有連線池、沒有預熱資料的狀態。

典型延遲來源

  • JIT編譯/程式碼載入
  • 資料庫連線建立
  • 快取預熱
  • 模型權重載入(對AI服務尤其嚴重)

最佳化手段

  • 預熱指令碼(warm-up queries)
  • 預編譯(AOT compilation)
  • 快照恢復(checkpoint-based recovery)
  • 模型權重預載入到記憶體/視訊記憶體

技術原理

大型模型RL冷啟動的數學視角

在強化學習架構下,冷啟動問題可以形式化為:

目標:找到最優策略 π* = argmax_π E[Σ γ^t · r(s_t, a_t)]

挑戰:當 π 初始化為基座模型 π_base 時,
      π_base 從未接觸過獎勵訊號 r,
      其輸出分佈 P_base(y|x) 可能與「好答案」分佈 P_good(y|x)
      嚴重不重疊。

後果:RL探索階段幾乎取樣不到高獎勵軌跡,
      梯度訊號極度稀疏,學習效率極低。

冷啟動SFT的作用可以理解為

令 π_init = SFT(π_base, D_cold)

其中 D_cold = {(x_i, y_i)},y_i 包含格式良好的推論鏈

效果:
1. KL(π_init || P_good) <&lt; KL(π_base || P_good)
   → 策略更接近「好答案」分佈

2. E_&#123;a~π_init}[r(s,a)] >> E_&#123;a~π_base}[r(s,a)]
   → 初始平均獎勵顯著提升

3. Var_&#123;a~π_init}[r(s,a)] 更適中
   → 獎勵方差既不過大(不穩定)也不過小(無梯度)

圖示

獎勵景觀(概念圖)
    ↑ 獎勵
    │         ╭───╮
    │    ╭────╯   ╰────╮   ╭──╮
    │────╯              ╰───╯  ╰───
    │    ↑                ↑
    │  π_base           π_init
    │  (谷底,           (半山腰,
    │   探索困難)        RL可以爬坡)
    └──────────────────────────→ 策略空間

冷啟動SFT相當於把策略從谷底挪到半山腰,
讓RL的梯度上升有更高機率到達峰頂。

推薦系統冷啟動的Embedding視角

使用者空間 (User Embedding Space)

    │  ● = 已有使用者 (有行為資料, embedding質量高)
    │  ◐ = 新使用者 (無行為資料, embedding待定)

    │  方法1: 基於相似使用者插值
    │    u_new ≈ Σ α_i · u_i (K近鄰加權平均)

    │  方法2: 基於元資訊對映
    │    u_new = f_θ(user_features) (神經網路對映)

    │  方法3: 冷啟動專用先驗
    │    u_new ~ N(μ_cluster, σ²) (聚類中心初始化)

技術演進史

時期領域冷啟動問題主要解法
2006-2010推薦系統Netflix競賽暴露協同過濾的冷啟動缺陷Content-based + CF混合
2012-2016推薦系統移動網際網路爆發,新使用者湧入Deep Neural Networks, 深度學習Embedding
2017-2019推薦系統跨域推薦、元學習興起MAML, Prototypical Networks
2020-2022推薦系統大規模預訓練模型Foundation Models for RecSys
2023大型模型RLRLHF大規模應用,冷啟動問題浮現ChatGPT式SFT→RLHF流水線
2024大型模型RL推論模型需求爆發DeepSeek-R1冷啟動資料方案
2025大型模型RL探索無SFT的RL方案(如R1-Zero)GRPO, 好奇心驅動探索, 自我博弈

DeepSeek-R1/R1-Zero的里程碑意義

  • R1-Zero:證明純RL可以從基座模型訓練出推論能力(但有格式和可讀性問題)
  • R1:通過冷啟動資料注入解決上述問題,獲得更實用的推論模型

技術路線對比

大型模型RL冷啟動解決方案對比

方案原理冷啟動資料需求RL訓練效率輸出質量代表工作
純RL(Zero-shot RL)直接從基座模型開始RL極低差(格式混亂)DeepSeek-R1-Zero
SFT冷啟動 → RL先用少量高質量SFT初始化中等(千級)DeepSeek-R1
大規模SFT(無RL)只用SFT不走RL極高(萬級+)N/A中等早期InstructGPT變體
課程式RL先簡單任務RL,逐漸增加難度低-中中-高中-好[學術研究中]
自我博弈冷啟動模型與自身副本對弈生成訓練資料無(自生成)待驗證待驗證[前沿探索]

推薦系統冷啟動方案對比

方案適用場景所需額外資訊效果複雜度
隨機推薦基線極低
熱門推薦物品冷啟動物品熱度統計
Content-based物品冷啟動物品特徵中-好
使用者畫像對映使用者冷啟動註冊資訊
跨域遷移使用者冷啟動其他平台資料
元學習通用少量互動

上下游

大型模型RL冷啟動的產業鏈

上游(資料供給)
├─ 高質量推論鏈資料標註
│   ├─ 人工標註(成本高,質量可控)
│   ├─ 模型蒸餾(用強模型生成,如GPT-4生成推論鏈)
│   └─ 合成數據(程式化生成數學/程式碼推論過程)
├─ 基座模型提供
│   ├─ 通用基座(DeepSeek-V3, Llama, Qwen等)
│   └─ 領域基座(程式碼、數學專用預訓練模型)
└─ RL演算法架構
    ├─ GRPO, PPO, REINFORCE等
    └─ 獎勵模型/獎勵函式設計

中游(冷啟動技術實施)
├─ 冷啟動資料策劃與清洗
├─ 冷啟動SFT訓練
├─ RL訓練Pipeline(含分散式基礎設施)
└─ 評估與迭代

下游(應用)
├─ 推論增強對話(類R1產品)
├─ 程式碼生成與除錯
├─ 數學與科學推論
└─ Agent規劃與工具使用

推薦系統冷啟動的產業鏈

上游
├─ 使用者行為日誌系統
├─ 內容理解(NLP/CV特徵提取)
├─ 知識圖譜服務
└─ 第三方資料(合規前提下)

中游
├─ 冷啟動演算法引擎
├─ A/B測試平台
└─ 即時特徵服務

下游
├─ 電商推薦
├─ 內容推薦(影片/資訊)
├─ 廣告投放
└─ 社交匹配

關鍵指標

大型模型RL冷啟動關鍵指標

指標定義理想值說明
冷啟動資料規模SFT樣本數量千級(數千條)DeepSeek-R1的量級參考[報告揭露]
RL收斂速度達到目標效能所需訓練步數越低越好冷啟動好的方案收斂快數倍
輸出格式合規率輸出符合“格式的比例>95%冷啟動SFT的核心指標
獎勵訊號訊雜比有效梯度/噪聲梯度越高越好影響訓練穩定性
Human Eval得分人類評估的輸出質量基線以上最終質量指標

推薦系統冷啟動關鍵指標

指標定義理想值說明
冷啟動覆蓋率能有效推薦的新使用者/物品比例>80%
冷啟動準確率冷啟動推薦的CTR/轉化率接近成熟使用者通常會低10-30%
冷啟動週期從新使用者到穩定推薦所需互動次數<5次
NDCG@K推薦列表排序質量越高越好

供需與市場資料

需求側

大型模型RL冷啟動需求驅動

需求方典型場景規模估算
大型模型廠商訓練推論增強模型頭部廠商均需[行業共識]
AI應用公司領域專用推論Agent數百家[估算]
雲端運算平台提供RL訓練服務AWS/Azure/GCP/阿里雲端等

推薦系統冷啟動需求

需求方典型場景規模估算
電商平台新商品/新賣家推薦每日新增商品數以百萬計[估算]
內容平台新影片/新文章推薦YouTube日上傳影片量500h+[歷史資料]
社交平台新使用者匹配每日新註冊使用者數以百萬計[估算]

供給側

冷啟動解決方案供應商

型別代表提供服務
大型模型廠商自研DeepSeek, OpenAI, Anthropic端到端訓練pipeline
推薦演算法服務商早期的RecSys公司推薦演算法SaaS
資料標註公司Scale AI等冷啟動訓練資料
雲端服務商各大雲端廠商RL訓練基礎設施

代表公司與資本對映

大型模型RL冷啟動相關公司

公司/機構相關動作資本關聯
DeepSeekR1/R1-Zero開創性工作,冷啟動資料方案幻方量化旗下
OpenAIInstructGPT→ChatGPT的SFT+RLHF流水線私募融資,估值數百億美元
AnthropicConstitutional AI,含類似冷啟動環節Google, Spark Capital等投資
Google DeepMindGemini訓練中的RL階段Alphabet (GOOGL)
MetaLlama系列開源,社群自行探索RL冷啟動META
阿里巴巴Qwen系列,含推論增強版本BABA/9988.HK
字節跳動豆包等產品,涉及推論能力訓練未上市

推薦系統冷啟動相關公司

公司冷啟動場景資本關聯
字節跳動抖音/TikTok新內容推薦未上市
拼多多新商品/新店鋪推薦PDD
快手新影片推薦1024.HK
Netflix新使用者推薦(經典案例)NFLX

投資邏輯

大型模型RL冷啟動的投資視角

核心邏輯:冷啟動是大型模型”湧現”推論能力的關鍵瓶頸,誰解決得好誰的模型就更有競爭力。

產業對映分層:
┌─────────────────────────────────────────────────────┐
│  Layer 3: 應用層                                     │
│  ├─ 推論增強產品(類R1的ChatBot)                    │
│  └─ 程式碼/數學/科學Agent                              │
│  關注點:使用者體驗、付費轉化                           │
├─────────────────────────────────────────────────────┤
│  Layer 2: 技術層                                     │
│  ├─ 冷啟動資料策展服務                               │
│  ├─ RL訓練平台                                       │
│  └─ 評估與對齊工具                                   │
│  關注點:技術壁壘、客戶粘性                           │
├─────────────────────────────────────────────────────┤
│  Layer 1: 基礎設施層                                  │
│  ├─ 高效能運算叢集(GPU/TPU)                        │
│  ├─ 分散式訓練架構                                   │
│  └─ 資料標註平台                                     │
│  關注點:需求確定性、規模效應                         │
└─────────────────────────────────────────────────────┘

關鍵判斷

  1. 冷啟動資料的質量比數量更重要 → 高質量資料標註/蒸餾服務有溢價
  2. 冷啟動方案會持續迭代 → 純SFT方案可能被更高效的RL方案替代
  3. 開源模型生態(如Llama+社群RL方案)可能降低冷啟動門檻

風險提示

  • 技術迭代快,今天的解決方案可能很快過時
  • 冷啟動資料的獲取可能涉及版權/隱私問題
  • RL訓練成本高,小公司難以獨立承擔

常見誤讀糾偏

誤讀1:“冷啟動問題已經被徹底解決”

糾偏

  • 冷啟動問題沒有被徹底解決,只是找到了在當前階段”夠用”的工程方案
  • DeepSeek-R1的冷啟動方案依賴數千條高質量標註資料,這些資料的獲取成本不低
  • 對於新領域(如醫學、法律),冷啟動資料的獲取更加困難
  • 純RL方案(R1-Zero)雖然不需要冷啟動資料,但輸出質量和訓練穩定性仍有問題

誤讀2:“冷啟動SFT資料越多越好”

糾偏

  • DeepSeek-R1報告明確指出使用的是少量高質量冷啟動資料(千級),而非大規模SFT
  • 資料質量 >> 資料數量:少量高質量推論鏈的效果優於大量低質量資料
  • 過多的SFT資料可能導致”過度擬合”SFT風格,反而限制RL的探索空間
  • 這也是DeepSeek選擇”冷啟動→RL”而非”大規模SFT”的原因之一

誤讀3:“推薦系統冷啟動只靠演算法就行”

糾偏

  • 演算法只是解決方案的一部分,產品設計同樣關鍵
  • 例如:註冊流程中的偏好選擇、新手引導任務、首次推薦的多樣性策略
  • 工程層面:快取預熱、模型載入最佳化也是”冷啟動”的一部分
  • 資料層面:沒有好的特徵工程,再好的演算法也無米下炊

誤讀4:“DeepSeek-R1-Zero是純RL所以不需要冷啟動”

糾偏

  • R1-Zero確實不需要冷啟動SFT資料
  • 但它仍然依賴基座模型的預訓練知識(即DeepSeek-V3的引數)作為”隱式先驗”
  • 它仍然需要精心設計的獎勵函式作為RL的引導
  • 所以”無冷啟動”是相對的,只是去除了顯式的SFT步驟

學習路徑

推薦系統冷啟動學習路徑

Level 1: 基礎概念
├─ 閱讀:推薦系統概論教材(如項亮《推薦系統實踐》)
├─ 實踐:用MovieLens資料集復現基礎CF
└─ 理解:協同過濾 vs Content-based

Level 2: 經典方法
├─ 論文:《A Survey of Cold-Start Problem in Recommender Systems》(綜述)
├─ 實踐:實現基於內容的冷啟動推薦
└─ 理解:Embedding、特徵工程

Level 3: 深度學習方法
├─ 論文:Meta-Learning相關(MAML, Prototypical Networks)
├─ 實踐:用PyTorch實現元學習冷啟動
└─ 理解:少樣本學習、遷移學習

Level 4: 前沿進展
├─ 論文:Foundation Models for Recommendation
├─ 關注:GNN、Transformer在推薦中的應用
└─ 理解:大型模型時代的推薦系統演變

大型模型RL冷啟動學習路徑

Level 1: 基礎知識
├─ 學習:強化學習基礎(Sutton & Barto教材)
├─ 實踐:實現簡單的Policy Gradient
└─ 理解:馬爾可夫決策過程、策略最佳化

Level 2: RLHF基礎
├─ 論文:《Training language models to follow instructions with human feedback》(InstructGPT)
├─ 實踐:用trl庫實現簡單的RLHF
└─ 理解:獎勵模型、PPO演算法

Level 3: 冷啟動技術
├─ 論文:DeepSeek-R1 Technical Report(精讀)
├─ 分析:R1-Zero vs R1的差異
└─ 理解:冷啟動資料的作用機制

Level 4: 前沿探索
├─ 論文:GRPO, REINFORCE++等新RL演算法
├─ 關注:無SFT的RL方案進展
└─ 理解:冷啟動問題的可能終局

推薦資源

資源型別連結/說明
DeepSeek-R1 Technical Report論文[DeepSeek官網]
InstructGPT論文論文arXiv:2203.02155
Sutton & Barto: RL Introduction教材強化學習入門必讀
《推薦系統實踐》書籍項亮著
Hugging Face trl庫程式碼RLHF訓練工具庫

一句話總結

冷啟動是AI系統從「零經驗」到「可用狀態」的關鍵瓶頸;在大型模型時代,通過少量高質量資料的SFT”點火”來啟動強化學習,是當前最有效的解法——但遠非終局。


延伸閱讀與來源

核心文獻

文獻來源說明
DeepSeek-R1 Technical ReportDeepSeek 2025冷啟動SFT方案的開創性工作
InstructGPT論文OpenAI 2022SFT→RLHF流水線的奠基
A Survey of Cold-Start Problem in RS學術綜述推薦系統冷啟動的經典綜述
MAML論文 (Model-Agnostic Meta-Learning)Finn et al. 2017元學習解決冷啟動

行業報告

報告來源說明
AI基礎設施市場報告各券商/諮詢公司涉及RL訓練成本估算
推薦系統技術趨勢行業白皮書推薦系統演進

資料來源宣告

本文涉及的具體數字:

  • DeepSeek-R1冷啟動資料規模:來自DeepSeek-R1 Technical Report原文描述,具體條數可能因版本而異
  • 市場規模估算:為行業共識性估算,非精確統計
  • 其他定量描述:均為定性描述或基於公開資訊的估算,已標註[估算]或[行業共識]

本頁最後更新:2025年 作者:AI產業鏈研究 宣告:本文為技術學習材料,不構成投資建議。技術規格請以官方文件為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型