模型层 开放阅读

冷启动

Cold Start

概念 ID
cold-start
更新时间
2026-05-29
来源数量
待补

冷启动》(Cold Start)

领域覆盖:大模型强化学习 · 推荐系统 · 系统工程 注意:本次检索未成功获取外部资料,以下技术描述基于公开论文(如DeepSeek-R1技术报告)和行业共识。具体数字如无标注均为定性描述或行业估算,请读者自行交叉验证。

3 秒看懂

┌─────────────────────────────────────────────────┐
│  冷启动 (Cold Start)                            │
│                                                 │
│  本质:在「几乎没有有用先验」的条件下,让系统    │
│       从零开始进入有效工作状态的技术挑战        │
│                                                 │
│  三大战场:                                      │
│  ├─ 大模型RL:基座模型→RL训练的"初始化困境"   │
│  ├─ 推荐系统:新用户/新物品的"无数据困局"      │
│  └─ 系统工程:服务启动的"预热延迟"             │
│                                                 │
│  核心矛盾:需要数据才能学,但刚开始就是没数据   │
└─────────────────────────────────────────────────┘

3 分钟产业解释

为什么「冷启动」是AI落地的核心痛点?

想象你开了一家新餐厅:

  • 没有点评数据 → 平台不知道推荐给谁(推荐系统冷启动)
  • 没有经营经验 → 不知道定多少价、备多少货(RL冷启动)
  • 厨房还没热 → 第一位客人要等很久(系统冷启动)

2024-2025年的产业焦点集中在大模型强化学习的冷启动问题。以DeepSeek-R1为代表的推理模型需要通过强化学习训练来获得”思考能力”,但直接从基座模型开始RL会遇到严重问题:输出格式混乱、探索效率极低、训练不稳定。这就是所谓的”RL冷启动困境”。

市场规模估算:冷启动相关技术(包括推荐系统冷启动解决方案、RLHF/RLAIF工程化平台)涉及的市场空间在数十亿至百亿量级[行业估算],是AI基础设施的重要组成部分。

关键洞察:冷启动不仅是一个技术问题,更是AI产品能否在”零经验期”存活的生死问题。解决冷启动的成本和效果直接决定了AI系统的商业化可行性。


15 分钟专家深入

一、冷启动的三种典型形态

1. 大模型强化学习中的冷启动(当前热点)

问题描述: 当你想训练一个像DeepSeek-R1这样具备”链式推理”(Chain-of-Thought)能力的模型时,标准路径是:

基座模型 (如DeepSeek-V3)
    ↓ 监督微调 (SFT)
指令跟随模型
    ↓ 强化学习 (RL)
推理增强模型 (如R1)

但如果跳过SFT,直接从基座模型开始RL呢?

DeepSeek在R1技术报告中明确测试了这一路径(即R1-Zero方案),发现了「RL冷启动」的核心问题[DeepSeek-R1 Technical Report, 2025]:

问题维度具体表现
格式混乱模型输出缺乏结构化格式(如“标签),难以解析和评估
探索低效策略在巨大空间中随机游走,奖励信号稀疏,学习极其缓慢
训练不稳定没有良好初始化点,RL优化容易发散或陷入局部最优
可读性差即使学会了推理,输出文本对人类不友好

解决方案:冷启动数据注入

DeepSeek-R1的做法是收集数千条高质量的”长推理”SFT样本(包含“格式的思维链),用这些数据微调基座模型,再开始RL训练。这些冷启动数据的作用是:

┌──────────────────────────────────────────────────┐
│              冷启动数据的三重作用                 │
├──────────────────────────────────────────────────┤
│ 1. 格式初始化:教会模型使用...  │
│ 2. 策略锚定:提供一个"不算太差"的起点           │
│ 3. 稀疏奖励补偿:在RL早期提供额外监督信号       │
└──────────────────────────────────────────────────┘

数据规模参考:DeepSeek-R1报告中提及使用了约数千条冷启动SFT样本[DeepSeek-R1 Technical Report]。具体条数因版本迭代可能有所调整。

2. 推荐系统中的冷启动(经典问题)

推荐系统冷启动有三种子类型[经典文献综述]:

类型描述典型场景
用户冷启动新注册用户无历史行为新用户首次打开APP
物品冷启动新上架物品无交互数据新商品/新视频发布
系统冷启动整个系统从零开始新平台上线

主流应对策略

用户冷启动解决路径:
├─ 显式收集:注册时填写偏好问卷
├─ 隐式推断:设备型号、地理位置、时间特征
├─ 跨域迁移:其他平台的用户画像(隐私合规前提下)
└─ 元学习:MAML等方法快速适应新用户

物品冷启动解决路径:
├─ 内容特征:文本/图像/属性的Embedding
├─ 知识图谱:利用品类关系、属性关系
├─ 联邦学习:利用相似物品的全局模式
└─ 主动学习:优先探索不确定性高的新物品

3. 系统工程中的冷启动

定义:应用/服务在首次启动或长时间停机后,没有缓存、没有连接池、没有预热数据的状态。

典型延迟来源

  • JIT编译/代码加载
  • 数据库连接建立
  • 缓存预热
  • 模型权重加载(对AI服务尤其严重)

优化手段

  • 预热脚本(warm-up queries)
  • 预编译(AOT compilation)
  • 快照恢复(checkpoint-based recovery)
  • 模型权重预加载到内存/显存

技术原理

大模型RL冷启动的数学视角

在强化学习框架下,冷启动问题可以形式化为:

目标:找到最优策略 π* = argmax_π E[Σ γ^t · r(s_t, a_t)]

挑战:当 π 初始化为基座模型 π_base 时,
      π_base 从未接触过奖励信号 r,
      其输出分布 P_base(y|x) 可能与「好答案」分布 P_good(y|x)
      严重不重叠。

后果:RL探索阶段几乎采样不到高奖励轨迹,
      梯度信号极度稀疏,学习效率极低。

冷启动SFT的作用可以理解为

令 π_init = SFT(π_base, D_cold)

其中 D_cold = {(x_i, y_i)},y_i 包含格式良好的推理链

效果:
1. KL(π_init || P_good) <&lt; KL(π_base || P_good)
   → 策略更接近「好答案」分布

2. E_&#123;a~π_init}[r(s,a)] >> E_&#123;a~π_base}[r(s,a)]
   → 初始平均奖励显著提升

3. Var_&#123;a~π_init}[r(s,a)] 更适中
   → 奖励方差既不过大(不稳定)也不过小(无梯度)

图示

奖励景观(概念图)
    ↑ 奖励
    │         ╭───╮
    │    ╭────╯   ╰────╮   ╭──╮
    │────╯              ╰───╯  ╰───
    │    ↑                ↑
    │  π_base           π_init
    │  (谷底,           (半山腰,
    │   探索困难)        RL可以爬坡)
    └──────────────────────────→ 策略空间

冷启动SFT相当于把策略从谷底挪到半山腰,
让RL的梯度上升有更高概率到达峰顶。

推荐系统冷启动的Embedding视角

用户空间 (User Embedding Space)
    │
    │  ● = 已有用户 (有行为数据, embedding质量高)
    │  ◐ = 新用户 (无行为数据, embedding待定)
    │
    │  方法1: 基于相似用户插值
    │    u_new ≈ Σ α_i · u_i (K近邻加权平均)
    │
    │  方法2: 基于元信息映射
    │    u_new = f_θ(user_features) (神经网络映射)
    │
    │  方法3: 冷启动专用先验
    │    u_new ~ N(μ_cluster, σ²) (聚类中心初始化)

技术演进史

时期领域冷启动问题主要解法
2006-2010推荐系统Netflix竞赛暴露协同过滤的冷启动缺陷Content-based + CF混合
2012-2016推荐系统移动互联网爆发,新用户涌入Deep Neural Networks, 深度学习Embedding
2017-2019推荐系统跨域推荐、元学习兴起MAML, Prototypical Networks
2020-2022推荐系统大规模预训练模型Foundation Models for RecSys
2023大模型RLRLHF大规模应用,冷启动问题浮现ChatGPT式SFT→RLHF流水线
2024大模型RL推理模型需求爆发DeepSeek-R1冷启动数据方案
2025大模型RL探索无SFT的RL方案(如R1-Zero)GRPO, 好奇心驱动探索, 自我博弈

DeepSeek-R1/R1-Zero的里程碑意义

  • R1-Zero:证明纯RL可以从基座模型训练出推理能力(但有格式和可读性问题)
  • R1:通过冷启动数据注入解决上述问题,获得更实用的推理模型

技术路线对比

大模型RL冷启动解决方案对比

方案原理冷启动数据需求RL训练效率输出质量代表工作
纯RL(Zero-shot RL)直接从基座模型开始RL极低差(格式混乱)DeepSeek-R1-Zero
SFT冷启动 → RL先用少量高质量SFT初始化中等(千级)DeepSeek-R1
大规模SFT(无RL)只用SFT不走RL极高(万级+)N/A中等早期InstructGPT变体
课程式RL先简单任务RL,逐渐增加难度低-中中-高中-好[学术研究中]
自我博弈冷启动模型与自身副本对弈生成训练数据无(自生成)待验证待验证[前沿探索]

推荐系统冷启动方案对比

方案适用场景所需额外信息效果复杂度
随机推荐基线极低
热门推荐物品冷启动物品热度统计
Content-based物品冷启动物品特征中-好
用户画像映射用户冷启动注册信息
跨域迁移用户冷启动其他平台数据
元学习通用少量交互

上下游

大模型RL冷启动的产业链

上游(数据供给)
├─ 高质量推理链数据标注
│   ├─ 人工标注(成本高,质量可控)
│   ├─ 模型蒸馏(用强模型生成,如GPT-4生成推理链)
│   └─ 合成数据(程序化生成数学/代码推理过程)
├─ 基座模型提供
│   ├─ 通用基座(DeepSeek-V3, Llama, Qwen等)
│   └─ 领域基座(代码、数学专用预训练模型)
└─ RL算法框架
    ├─ GRPO, PPO, REINFORCE等
    └─ 奖励模型/奖励函数设计

中游(冷启动技术实施)
├─ 冷启动数据策划与清洗
├─ 冷启动SFT训练
├─ RL训练Pipeline(含分布式基础设施)
└─ 评估与迭代

下游(应用)
├─ 推理增强对话(类R1产品)
├─ 代码生成与调试
├─ 数学与科学推理
└─ Agent规划与工具使用

推荐系统冷启动的产业链

上游
├─ 用户行为日志系统
├─ 内容理解(NLP/CV特征提取)
├─ 知识图谱服务
└─ 第三方数据(合规前提下)

中游
├─ 冷启动算法引擎
├─ A/B测试平台
└─ 实时特征服务

下游
├─ 电商推荐
├─ 内容推荐(视频/资讯)
├─ 广告投放
└─ 社交匹配

关键指标

大模型RL冷启动关键指标

指标定义理想值说明
冷启动数据规模SFT样本数量千级(数千条)DeepSeek-R1的量级参考[报告披露]
RL收敛速度达到目标性能所需训练步数越低越好冷启动好的方案收敛快数倍
输出格式合规率输出符合“格式的比例>95%冷启动SFT的核心指标
奖励信号信噪比有效梯度/噪声梯度越高越好影响训练稳定性
Human Eval得分人类评估的输出质量基线以上最终质量指标

推荐系统冷启动关键指标

指标定义理想值说明
冷启动覆盖率能有效推荐的新用户/物品比例>80%
冷启动准确率冷启动推荐的CTR/转化率接近成熟用户通常会低10-30%
冷启动周期从新用户到稳定推荐所需交互次数<5次
NDCG@K推荐列表排序质量越高越好

供需与市场数据

需求侧

大模型RL冷启动需求驱动

需求方典型场景规模估算
大模型厂商训练推理增强模型头部厂商均需[行业共识]
AI应用公司领域专用推理Agent数百家[估算]
云计算平台提供RL训练服务AWS/Azure/GCP/阿里云等

推荐系统冷启动需求

需求方典型场景规模估算
电商平台新商品/新卖家推荐每日新增商品数以百万计[估算]
内容平台新视频/新文章推荐YouTube日上传视频量500h+[历史数据]
社交平台新用户匹配每日新注册用户数以百万计[估算]

供给侧

冷启动解决方案供应商

类型代表提供服务
大模型厂商自研DeepSeek, OpenAI, Anthropic端到端训练pipeline
推荐算法服务商早期的RecSys公司推荐算法SaaS
数据标注公司Scale AI等冷启动训练数据
云服务商各大云厂商RL训练基础设施

代表公司与资本映射

大模型RL冷启动相关公司

公司/机构相关动作资本关联
DeepSeekR1/R1-Zero开创性工作,冷启动数据方案幻方量化旗下
OpenAIInstructGPT→ChatGPT的SFT+RLHF流水线私募融资,估值数百亿美元
AnthropicConstitutional AI,含类似冷启动环节Google, Spark Capital等投资
Google DeepMindGemini训练中的RL阶段Alphabet (GOOGL)
MetaLlama系列开源,社区自行探索RL冷启动META
阿里巴巴Qwen系列,含推理增强版本BABA/9988.HK
字节跳动豆包等产品,涉及推理能力训练未上市

推荐系统冷启动相关公司

公司冷启动场景资本关联
字节跳动抖音/TikTok新内容推荐未上市
拼多多新商品/新店铺推荐PDD
快手新视频推荐1024.HK
Netflix新用户推荐(经典案例)NFLX

投资逻辑

大模型RL冷启动的投资视角

核心逻辑:冷启动是大模型”涌现”推理能力的关键瓶颈,谁解决得好谁的模型就更有竞争力。

产业映射分层:
┌─────────────────────────────────────────────────────┐
│  Layer 3: 应用层                                     │
│  ├─ 推理增强产品(类R1的ChatBot)                    │
│  └─ 代码/数学/科学Agent                              │
│  关注点:用户体验、付费转化                           │
├─────────────────────────────────────────────────────┤
│  Layer 2: 技术层                                     │
│  ├─ 冷启动数据策展服务                               │
│  ├─ RL训练平台                                       │
│  └─ 评估与对齐工具                                   │
│  关注点:技术壁垒、客户粘性                           │
├─────────────────────────────────────────────────────┤
│  Layer 1: 基础设施层                                  │
│  ├─ 高性能计算集群(GPU/TPU)                        │
│  ├─ 分布式训练框架                                   │
│  └─ 数据标注平台                                     │
│  关注点:需求确定性、规模效应                         │
└─────────────────────────────────────────────────────┘

关键判断

  1. 冷启动数据的质量比数量更重要 → 高质量数据标注/蒸馏服务有溢价
  2. 冷启动方案会持续迭代 → 纯SFT方案可能被更高效的RL方案替代
  3. 开源模型生态(如Llama+社区RL方案)可能降低冷启动门槛

风险提示

  • 技术迭代快,今天的解决方案可能很快过时
  • 冷启动数据的获取可能涉及版权/隐私问题
  • RL训练成本高,小公司难以独立承担

常见误读纠偏

误读1:“冷启动问题已经被彻底解决”

纠偏

  • 冷启动问题没有被彻底解决,只是找到了在当前阶段”够用”的工程方案
  • DeepSeek-R1的冷启动方案依赖数千条高质量标注数据,这些数据的获取成本不低
  • 对于新领域(如医学、法律),冷启动数据的获取更加困难
  • 纯RL方案(R1-Zero)虽然不需要冷启动数据,但输出质量和训练稳定性仍有问题

误读2:“冷启动SFT数据越多越好”

纠偏

  • DeepSeek-R1报告明确指出使用的是少量高质量冷启动数据(千级),而非大规模SFT
  • 数据质量 >> 数据数量:少量高质量推理链的效果优于大量低质量数据
  • 过多的SFT数据可能导致”过度拟合”SFT风格,反而限制RL的探索空间
  • 这也是DeepSeek选择”冷启动→RL”而非”大规模SFT”的原因之一

误读3:“推荐系统冷启动只靠算法就行”

纠偏

  • 算法只是解决方案的一部分,产品设计同样关键
  • 例如:注册流程中的偏好选择、新手引导任务、首次推荐的多样性策略
  • 工程层面:缓存预热、模型加载优化也是”冷启动”的一部分
  • 数据层面:没有好的特征工程,再好的算法也无米下炊

误读4:“DeepSeek-R1-Zero是纯RL所以不需要冷启动”

纠偏

  • R1-Zero确实不需要冷启动SFT数据
  • 但它仍然依赖基座模型的预训练知识(即DeepSeek-V3的参数)作为”隐式先验”
  • 它仍然需要精心设计的奖励函数作为RL的引导
  • 所以”无冷启动”是相对的,只是去除了显式的SFT步骤

学习路径

推荐系统冷启动学习路径

Level 1: 基础概念
├─ 阅读:推荐系统概论教材(如项亮《推荐系统实践》)
├─ 实践:用MovieLens数据集复现基础CF
└─ 理解:协同过滤 vs Content-based

Level 2: 经典方法
├─ 论文:《A Survey of Cold-Start Problem in Recommender Systems》(综述)
├─ 实践:实现基于内容的冷启动推荐
└─ 理解:Embedding、特征工程

Level 3: 深度学习方法
├─ 论文:Meta-Learning相关(MAML, Prototypical Networks)
├─ 实践:用PyTorch实现元学习冷启动
└─ 理解:少样本学习、迁移学习

Level 4: 前沿进展
├─ 论文:Foundation Models for Recommendation
├─ 关注:GNN、Transformer在推荐中的应用
└─ 理解:大模型时代的推荐系统演变

大模型RL冷启动学习路径

Level 1: 基础知识
├─ 学习:强化学习基础(Sutton & Barto教材)
├─ 实践:实现简单的Policy Gradient
└─ 理解:马尔可夫决策过程、策略优化

Level 2: RLHF基础
├─ 论文:《Training language models to follow instructions with human feedback》(InstructGPT)
├─ 实践:用trl库实现简单的RLHF
└─ 理解:奖励模型、PPO算法

Level 3: 冷启动技术
├─ 论文:DeepSeek-R1 Technical Report(精读)
├─ 分析:R1-Zero vs R1的差异
└─ 理解:冷启动数据的作用机制

Level 4: 前沿探索
├─ 论文:GRPO, REINFORCE++等新RL算法
├─ 关注:无SFT的RL方案进展
└─ 理解:冷启动问题的可能终局

推荐资源

资源类型链接/说明
DeepSeek-R1 Technical Report论文[DeepSeek官网]
InstructGPT论文论文arXiv:2203.02155
Sutton & Barto: RL Introduction教材强化学习入门必读
《推荐系统实践》书籍项亮著
Hugging Face trl库代码RLHF训练工具库

一句话总结

冷启动是AI系统从「零经验」到「可用状态」的关键瓶颈;在大模型时代,通过少量高质量数据的SFT”点火”来启动强化学习,是当前最有效的解法——但远非终局。


延伸阅读与来源

核心文献

文献来源说明
DeepSeek-R1 Technical ReportDeepSeek 2025冷启动SFT方案的开创性工作
InstructGPT论文OpenAI 2022SFT→RLHF流水线的奠基
A Survey of Cold-Start Problem in RS学术综述推荐系统冷启动的经典综述
MAML论文 (Model-Agnostic Meta-Learning)Finn et al. 2017元学习解决冷启动

行业报告

报告来源说明
AI基础设施市场报告各券商/咨询公司涉及RL训练成本估算
推荐系统技术趋势行业白皮书推荐系统演进

数据来源声明

本文涉及的具体数字:

  • DeepSeek-R1冷启动数据规模:来自DeepSeek-R1 Technical Report原文描述,具体条数可能因版本而异
  • 市场规模估算:为行业共识性估算,非精确统计
  • 其他定量描述:均为定性描述或基于公开信息的估算,已标注[估算]或[行业共识]

本页最后更新:2025年 作者:AI产业链研究 声明:本文为技术学习材料,不构成投资建议。技术规格请以官方文档为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型