Case Temperature
3 秒看懂
Case Temperature (Tc) 是芯片封装表面(通常定义在热分布均匀的特定位置,如散热盖正中央或 Die 正上方)的温度。它是芯片设计者与系统散热设计者之间的 一项强制契约参数:芯片方保证在给定 Tc 规格内器件可稳定工作;系统方则必须确保在任何工作负载与环境条件下,散热方案都能将封装表面温度压制在该阈值以内。Tc 处于芯片内部 结温 (Tj) 与外部 环境温度 (Ta) 之间的热传导路径上,是平衡算力释放、功耗限制与长期可靠性的核心控制标尺。
3 分钟产业解释
把 AI 芯片想象成一台全速运转的“赛车发动机”——晶体管开关活动就是燃烧过程,产生巨量热能。结温 (Tj) 对应燃烧室核心温度,超标直接导致拉缸(性能退化)甚至熔毁(永久失效)。环境温度 (Ta) 对应赛道气温,外部条件不可控。然而,在真实系统中直接测量或控制 Tj 近乎不可行。
为此,工程界定义了一个可实测、可管理的接口——Case Temperature (Tc),如同发动机缸体表面的温度传感器读数。
- 对芯片供应商:通过仿真与实验,确定保障 Tj 安全时所能承受的 Tc 上限(如 105°C/110°C),并写入数据手册,作为产品规格的硬边界。
- 对系统设计者:其任务是在客户给定的最高环境温度(如 35°C 数据中心入口温度)和最大芯片功耗条件下,通过散热器、风扇或液冷系统,将 Tc 持续压制在供应商承诺的上限以下。
在整个 AI 产业链中,单芯片功耗已从几十瓦跃升至千瓦级,如何将热量从 Die(Tj)高效搬运至封装壳(Tc),再从壳搬运到环境,正成为决定芯片能否跑满算力、系统能否可靠运行的“卡脖子”环节。Tc 就是这场热搬运接力赛的核心交接棒。
技术原理
从微观热源到宏观冷源的完整传热路径,决定了 Tc 的物理本质。以下为简化热阻网络模型:
[芯片 Die (Tj)]
|
| (热量经由硅衬底、键合层、填充材料等传导)
| (主导热阻: Rjc — 结到壳热阻)
V
[封装外壳 / Lid (Tc)] <--- Case Temperature 定义平面
|
| (热量通过导热界面材料 TIM1、散热器底座扩散)
| (主导热阻: Rca_1 — 壳到散热器热阻)
V
[散热器基座 (T_base)]
|
| (翅片或冷板内对流/相变换热)
| (主导热阻: Rca_2 — 散热器到环境热阻)
V
[环境流体 (Ta)]
-
关键方程一:芯片设计域
Tj = Tc + (P_dissipation × Rjc)该式表明,给定功耗 P,若 Rjc 偏大,即便 Tc 被控制得较低,Tj 仍可能触顶。Rjc 由芯片封装架构决定。 -
关键方程二:系统散热域
Tc = Ta + (P_dissipation × Rca)其中Rca = Rca_1 + Rca_2。Rca_1 取决于 TIM 材料与装配压力,Rca_2 取决于风冷/液冷方案效率。 -
多热源耦合下的热点效应 AI 芯片(如 GPU + HBM 合封)存在多个高功率密度区域。局部热流密度可超过 200 W/cm²(来源:IEEE 学术文献中关于 2.5D/3D 封装热管理的综述,2022-2024 年间多次报告)。若 Rjc 不能有效横向扩散,局部热点可能造成“伪低温壳面”——Tc 在测量点符合规格,Die 内却已局部超温,导致提前触发热节流(Throttling)。
关键参数
-
Tc_max(最大允许壳温) 芯片数据手册的硬性上限。对于风冷 AI 加速卡,常见 Tc_max 处于 85–105°C 区间;液冷版本因 Rca 可做得极低,有时会将 Tc_max 定义得更为严格,以释放更高持续功耗。具体数值以芯片厂商规格书为准。
-
Rjc(结壳热阻) 衡量封装内部散热能力的核心指标。高端 AI GPU(如 H100 SXM5)的 Rjc 可低至约 0.05°C/W(参考英伟达官方热设计指南,2023 年版);普通消费级 GPU 则常在 0.3–2.0°C/W 量级。
-
Rca(壳到环境热阻) 系统散热的考核总指标。高性能液冷可实现 Rca < 0.02°C/W ,风冷典型值在 0.1–0.5°C/W 范围内。该项需标注冷板、TIM、风道、流体温度等边界条件,直接横向对比时须注意工况差异。
-
TDP/PBP(热设计功耗) 散热设计需覆盖的最大热负荷。英伟达 H100 SXM5 TDP 为 700W(官方数据,2023);Grace Hopper Superchip 功耗进一步上升。下一代平台(Blackwell 架构 B200)热设计参数已由厂商发布,单 GPU 功耗进入千瓦级。
-
功率密度(W/cm²) Die 面积有限使热流密度急剧攀升。典型 AI 芯片计算 Die 面积约 800–900 mm² 量级,若对应 700–1000W 功耗,平均热流密度约 80–120 W/cm²,热点区可远超此值。
-
TIM 导热系数与 BLT(粘合层厚度) 界面材料的本体导热率(W/m·K)与装配后实际粘合层厚度共同决定 Rca_1。液态金属可达 30–80 W/m·K,高端硅脂约 6–12 W/m·K。
-
热节流阈值(Tj_throttle) 当 Tj 到达设定值(通常略低于 Tj_max,如 100°C 附近),芯片开始降频降压。系统必须通过控制 Tc 使实际 Tj 长期远离该阈值。
技术路线
根据 Rca 与 Rjc 的解决重心,技术路线可划分为三个代际。
第一代:纯风冷散热范式
- 时间跨度:2018 年之前,AI 训练需求尚未大规模井喷。
- 特征:依靠铜/铝散热器+高转速风扇降低 Rca_2。
- 局限性:当单芯片功耗突破 300W,环境温度 35°C 时,将 Tc 压至规格上限所需的风扇功耗及噪音已不可接受,且数据中心 PUE(电源使用效率)恶化。
第二代:冷板式液冷(Direct-to-Chip)
- 时间跨度:2020 年前后进入规模化部署,2023–2025 年成为 AI 训练集群主流。
- 特征:通过冷板(Cold Plate)将冷却液(通常为去离子水或介电液)直接引入封装外壳上方,大幅压缩 Rca_2。
- 对 Tc 的控制能力:可将 Tc 稳定在 50–65°C,即便室温偏高仍有余量。
- 瓶颈:Rca_1(TIM 层级)和 Rjc 成为剩余热阻的主要来源;封装内多芯片耦合热管理要求更复杂的冷板微通道设计。
第三代:浸没式与芯片级液冷
- 前沿探索阶段(2024 年后逐步试点)。
- 单相浸没:将整个服务器浸入介电冷却液,Rca 几乎压缩到极限。
- 两相浸没:利用冷却液沸腾吸热,进一步提升换热系数。
- 芯片级微流体:在封装基板或散热盖内部集成微通道,同时降低 Rjc 和 Rca。
- 行业现状:微软、Meta 等超大规模数据中心运营商已公开披露浸没式液冷试点项目;中国大陆也有运营商开展类似测试(信源来自各家公司可持续发展报告,2023–2024 年)。公开资料尚未见到大规模商业化铺开的准确份额数据。
上游
上游产业聚焦于 Rjc 的构成要素与材料,即芯片封装内部热管理。
- 硅中介层与先进封装工艺 台积电 CoWoS、英特尔 EMIB/Foveros 等 2.5D/3D 封装将计算 Die 与 HBM 等异构芯片密集集成。热耦合加剧使得热管理设计从系统级下沉至封装级。供应商通过选择高热导率中介层材料、优化堆叠结构来降低 Rjc。
- 封装填充材料 芯片与基板间的底部填充胶(Underfill)、Die 与散热盖间的界面材料,均要求高热导率与长期可靠性。供应商包括信越化学、陶氏、汉高、长兴等。
- 散热盖(Lid)与均热技术 铜盖为常见方案;铜-金刚石复合材料、钼铜合金、均热板集成盖可进一步降低扩散热阻。据公开技术文献(IEEE ITherm 会议,2022–2023),铜-金刚石复合材料热导率可达 500–800 W/m·K。
- 封装衬底(Substrate) 有机基板或陶瓷基板的热导率直接决定 Rjc 的基底分量。ABF 基板(Ajinomoto Build-up Film)的热特性持续优化,是封装厂竞争焦点之一。
下游
下游产业围绕 Rca 的实现与系统集成,是将 Tc 约束在规格以内的执行者。
- 导热界面材料 (TIM) 二级应用 即使同一款 TIM,服务器组装工艺(涂覆量、压力均匀度)对实际 Rca_1 离散性影响显著。部分 AI 服务器厂商自研 TIM 或定制涂抹工艺,以降低平均壳温并提升批次一致性。
- 散热器与液冷组件 风冷散热器(热管、均热板)和液冷组件(冷板、管路、快接头、CDU)构成 Rca_2 的核心。快接头与 CDU(冷却剂分配单元)的可靠性直接影响大规模集群运维成本。
- 整机与数据中心集成 服务器厂商(如戴尔、HPE、浪潮、超微)在设计风道、分配冷却液流量、优化机柜内部温度场时,均以 Tc 达标为首要目标。数据中心运营商则通过提高供给侧冷冻水温度、采用温水冷却等手段追求综合能效最优。
- 检测与验证 符合 JEDEC JESD51 系列标准的热测设备(如 T3Ster、红外热像仪)、风洞实验室、液冷系统流量与温度传感器网络,是保证 Tc 测量可信的底层设施。
受益公司
(以下公司按产业链位置与典型业务列举,仅为行业说明,不构成任何投资建议。)
- 芯片与封装端 英伟达(定义 Tc 规格,同时依靠台积电先进封装控制 Rjc)、AMD、英特尔(自研 Foveros/EMIB 热管理方案)、台积电(CoWoS 封装方案,据公司投资者报告 2023–2024 年,先进封装产能持续扩张以满足 AI 需求)。
- 液冷系统集成商 Vertiv(维谛技术,冷板、CDU 系列解决方案)、Stulz、CoolIT Systems(为 OEM 提供直接接触液冷模块)、Asetek(冷板与数据中心液冷方案)、曙光数创(浸没式与冷板液冷产品线,来源:公司公告 2023 年)、高澜股份等。
- 散热组件与材料 双鸿、奇鋐、Cooler Master(均热板、高端散热器);Laird(现为杜邦旗下,TIM 与电磁屏蔽材料);信越化学、贝格斯(TIM 领域);派克汉尼汾(液冷快接头与管路)。
- 基础设施与运维 Vertiv、施耐德电气、华为数字能源等提供数据中心整体散热与电力配套。超大规模云厂商(微软、谷歌、Meta、亚马逊)自研定制散热方案,并联合硬件厂商推动液冷标准化。
市场规模
- AI 服务器出货与功耗牵引 根据 TrendForce 集邦咨询(2024 年报告),全球 AI 服务器出货量在 2023 年约 118 万台,2024 年预估达到 150–160 万台量级。单机柜功率密度从传统 5–8kW 快速向 30–50kW 演进(超大规模数据中心部分机柜已超过 100kW,来源:IDC 2024 年数据中心趋势报告)。
- 液冷市场增速 MarketResearch.com 等第三方机构估算,全球数据中心液冷市场规模 2023 年约 12–17 亿美元,预计 2028 年达到 50–70 亿美元,对应年复合增长率 25–35%(因口径不同,各机构数据略有差异)。对 Tc 的刚性控制要求是驱动该市场扩张的根本原因。
- 封装级热管理成本占比 因涉及客户定制,公开数据未见一线芯片厂商披露先进封装中热管理成本占比的精确数字。行业定性判断是,随着 CoWoS 等方案复杂化,热管理相关工艺(散热盖、填充材料、应力匹配设计)在封装总成本中的比例持续上升。
玩家对比
(按技术路线与市场定位进行定性比较,不提供任何形式的优劣排序或投资取向。)
| 维度 | 传统风冷方案商 | 冷板液冷方案商 | 浸没式/芯片级方案商 |
|---|---|---|---|
| 主流 Rca 范围 | 0.10–0.50°C/W | 0.02–0.08°C/W(含 TIM) | <0.02°C/W |
| 应对 800W+ 单芯片能力 | 通常难以经济地达标 | 主流方案,可解 1000W 级 | 理论冗余度最大 |
| 产业链成熟度 | 完全成熟 | 2023 年后快速标准化 | 仍处于试点与标准制定早期 |
| 运维复杂度 | 低 | 中(需监控 CDU、水质) | 高(冷却液管理、兼容性) |
| 成本参考 | 散热模组数十美元量级 | 单节点百至数百美元 | 单节点成本显著更高,公开定价信息有限 |
关键对比事实:
- 英伟达 H100 SXM5 模块官方严格推荐液冷以满足 700W TDP 持续工况(来源:英伟达热设计指南,2023)。
- 风冷方案在该功耗下需引入超大体积散热器与高转速风扇,噪音与尺寸无法满足数据中心密度需求,固多数超大规模客户在建置训练集群时直接跳过纯风冷选项。
风险
-
技术路径锁定风险 若未来 3nm、2nm 及以下制程的 AI 芯片在功率密度上进一步跃升,今日的冷板液冷设计可能需彻底重构。提前锁定某一特定方案可能面临沉没成本。
-
材料与供应链瓶颈 高性能 TIM、铜-金刚石复合材料、液冷快接头等关键零组件存在较为集中的供应格局。地缘政治或原材料价格波动(如铜价)可能影响大规模产能扩张节奏。
-
漏液与可靠性事故 液冷系统一旦发生冷却液泄漏,可能导致整机柜甚至整个集群损毁。尽管厂商已发展防漏检测与负压设计,但在百万节点量级部署下,尾端故障概率仍不可忽视。此风险对所有液冷路线均适用。
-
标准碎片化 OCP(开放计算项目)等组织正在推动液冷标准化,但各主要云厂商自有设计仍然存在差异,导致组件互换性不足,限制规模化降本速度。
-
散热能力被误认为可无限挖掘 部分行业参与者片面强调液冷可“解决一切散热问题”,忽视 Tc 受 Rjc 上限约束。若封装内部热阻未同步改善,单靠外部液冷无法阻止热点导致的热节流。该认知错配可能导致系统设计出现短板。
误读纠偏
-
误读一:“Case Temperature 就是环境温度。”
- 纠偏:Ta 指不受设备废热干扰的空气/冷却液入口温度;Tc 永远是封装表面温度,严格高于 Ta。二者差值 ΔT = P × Rca,在高功耗场景下可轻松超过 40°C。将 Tc 等同 Ta 将严重低估热设计量级。
-
误读二:“只要散热器够强,Tc 就能无限低。”
- 纠偏:Tc 的下限由 Ta + (P × Rca) 决定。即便 Rca 趋近零,Tc 最低也只能无限接近 Ta,无法低于 Ta。同时,Rjc 造成的壳内温升 (Tj − Tc) 不受外部散热器任何改善影响。过度追求外部散热而忽视封装本身等效于“只扩建出水管,不清理内部水垢”。
-
误读三:“液冷可以取代低热阻封装的需求。”
- 纠偏:液冷压缩的是 Rca,而多芯片封装的横向热扩散与热点沉没依赖 Rjc。两者是热链路的前后串联环节,缺一不可。在 700W 以上高功耗芯片中,即使 Rca ≈ 0.01°C/W,若 Rjc 仍维持老旧水平,Tj 仍可能撞墙触发节流。
-
误读四:“留足够裕度的 Tc 规格就代表系统散热能力强。”
- 纠偏:Tc_max 定义宽泛(如 105°C)仅说明器件有较高承受极限,并非鼓励在接近极限下长期运行。长期靠近 Tc_max 运行会加速封装材料老化(如 TIM 泵出效应、焊料蠕变),显著影响长期可靠性。行业最佳实践一般将实际 Tc 控制在 Tc_max 以下 15–25°C,以兼顾寿命与性能。
最新事件
- 英伟达 Blackwell 平台发布(2024 年 GTC):B200 GPU 单芯片功耗进入千瓦量级,NVSwitch 及 Grace CPU 合封方案进一步增强。NVIDIA 同时展示了配套的直接液冷方案(来源:英伟达官方新闻稿,2024 年 3 月)。
- OCP 液冷标准化推进(2024 年):开放计算项目发布了针对冷板设计与盲插快接头的新规范草案,旨在解决跨厂商液冷组件互换性问题。包括微软、谷歌、Meta 在内的主要超大规模厂商参与其中(来源:OCP 官方网站项目更新,2024 年)。
- 中国大陆液冷数据中心试点:部分电信运营商与云厂商在 2023–2024 年先后宣布启动千卡至万卡级液冷 GPU 集群建设,官方披露 PUE 目标值低于 1.15(来源:相关公司 ESG 披露与行业会议演讲,2023–2024 年)。
- 台积电 CoWoS-L 等新封装技术量产:台积电 2024–2025 年扩展 CoWoS 系列的变体(如 CoWoS-L),其中热管理设计被视为一大工程挑战。公开技术论文指出新一代中介层材料与散热盖集成方案正进行验证(来源:IEEE ECTC 2024 会议论文摘要)。
- TIM 与液冷流体研究活跃:2024 年 ITherm 等学术会议上,多篇论文聚焦于液态金属 TIM 的长期可靠性、定制化微通道冷板的拓扑优化设计,反映出工业界与学界共同将 Tc 控制视作核心议题。
跟踪指标
-
主流 AI 芯片 TDP 与 Tc_max 更新 关注英伟达、AMD、英特尔下一代加速器的数据手册热参数更新,尤其 TDP 是否突破 1000W 以及 Tc_max 是否调整。
-
数据中心液冷渗透率 按季度追踪超大规模云厂商新建或改造数据中心时采用液冷的机架比例,第三方机构如 Dell’Oro Group、IDC 的散热市场报告可作参考。
-
先进封装 Rjc 演进 观察台积电、三星、英特尔在 2.5D/3D 封装论文或技术日公布的 Rjc 改善数据,以判断封装侧热瓶颈的缓解速度。
-
TIM 导热率与可靠性认证进展 留意主流 TIM 厂家送样测试结果及客户导入消息,尤其液态金属 TIM 的长期泵出与氧化抑制方案是否满足 5 年以上生命周期要求。
-
冷却液价格与供应链信号 浸没式冷却液(如 3M Novec、Solvay 等产品)的产能扩建与价格走势,将影响前沿路线经济性拐点到来时间。
-
PUE 与水利用效率 (WUE) 指标 液冷系统可实现更低 PUE(理论可达 1.05–1.10),但用水量可能上升。平衡 PUE 与 WUE 成为新一代数据中心的设计重点,公开披露的这些数据可侧面反映 Tc 控制策略的实际落地水平。
信源
- 标准与方法论:JEDEC JESD51 系列标准(JESD51-1、JESD51-14 等,持续更新)。
- 芯片厂商技术文档:英伟达 GPU 热设计指南、AMD 加速卡数据手册、英特尔处理器散热设计指南(2022–2024 年版)。
- 行业研究报告:IDC 全球数据中心散热与可持续发展报告、TrendForce 先进封装与 AI 服务器报告、Dell’Oro Group 数据中心基础设施资本支出报告(注:具体数据点均需查阅最新付费版本)。
- 学术与会议论文:IEEE ITherm、ECTC、SEMI-THERM 等会议中关于 2.5D/3D 封装热管理、液冷技术、TIM 材料的前沿综述(2022–2024 年)。
- 公司公开披露:Vertiv、CoolIT Systems、曙光数创等上市公司财报及投资者演示材料;微软、Meta、谷歌等云厂商可持续发展报告与基础设施博客。
- 行业联盟:OCP Advanced Cooling Solutions 工作组发布的设计规范与技术白皮书。
说明:本概念页所有技术原理基于通用传热学定律与行业标准。引用的具体公司数据来源于其各自官方披露或行业公开研究报告。文中任何财务、市场、份额、产能数字均已在可行范围内标注口径与年份;若某领域中公开资料未见可靠数字,则已如实注明。文中所涉公司仅为行业说明之示例,不构成任何形式投资建议或买卖推荐。