"Your move, Nvidia." —— 一句话看懂 AI 网络战争
本节学什么
本节只讲 TPM 用一句话打开 AI 网络战争全局的能力。2023 年 7 月 Ultra Ethernet Consortium 成立时,普通读法会停在成员名单和规范目标;TPM 的读法是把它放进 2014 年 25GbE 联盟、IEEE 标准流程、超大规模厂商采购权和 Nvidia InfiniBand/NVSwitch 收费站的历史坐标里。他写下 “Your move, Nvidia.”,不是为了戏剧化,而是在说:AI 后端网络已经从产品竞争升级为生态围攻,开放以太网要挑战的不只是一种线缆或交换机,而是一整套封闭利润池。
核心框架
这节的框架是“三层战争图”。第一层是协议层:InfiniBand、Ethernet、UEC、NVLink、NVSwitch 分别控制不同半径的通信。第二层是产业层:超大规模厂商、云厂商、交换 ASIC、整机厂和 Nvidia 网络资产之间重新分配议价权。第三层是钱流层:谁拿到后端交换收入,谁失去专有互连溢价,谁能在新标准内部重建收费点。TPM 的总纲不是“以太网更好”,而是“开放标准、量产经济学和 hyperscaler 采购权会不断逼迫封闭平台调整”。
他怎么用(具体案例+数据+原话)
2023-07-20 的 UEC 文章里,他把局面类比到 2014 年 25GbE 联盟:超大规模厂商和云厂商当年觉得标准流程太慢,自己组团推动 25GbE,最后 IEEE 也不得不承认新标准。他的原话判断是 “And if history is any guide, they are going to get it.” 接着才是那句 “Your move, Nvidia.” 两年后的回测站在这条线上:Dell’Oro 2025 口径显示,AI 后端网络两年前 InfiniBand 接近 80%,到 2025 年以太网反超,并占交换机销售额三分之二以上。这个案例说明,TPM 的价值不在提前喊某个代码,而在把一条联盟新闻翻译成“谁在围攻谁的利润池”。
常见误区
第一,把“以太网赢”读成“Nvidia 必输”。TPM 后续专门指出 Nvidia 也能用 Spectrum-X 在以太网内重建收入,因此协议失守不等于公司失守。第二,把 UEC 成立当成已经兑现的结果。联盟是起点,真正验证来自规范、芯片、交换机、客户部署和市场份额。第三,把这场战争看成网络工程师的细节问题。后端网络决定集群可扩展性和训练时间,本质上是 AI 基础设施的钱流控制权。
可迁移方法
看到任何 AI 网络新闻,先不要写涨跌,先写五个字段:它属于协议、ASIC、整机、云厂商部署还是财报收入;它围攻的是哪一层利润池;替代品有没有成本或性能触发器;验证日期在哪里;谁可能失去收入。这样读 UEC、Spectrum-X、UALink、Tomahawk Ultra 都不会混成一句“网络很重要”。标的名称只作案例入口,不构成投资建议。
小结
TPM 的第一课是把新闻升维成生态战。“Your move, Nvidia.” 的真正含义是:当开放标准和超大规模采购权结盟,封闭平台必须出牌;但出牌方式可能是防守,也可能是在新标准里重新收费。
平台整体观:为什么芯片参数表不会告诉你谁赢
本节学什么
本节只讲 TPM 的平台整体观。The Next Platform 这个名字本身就是方法论:真正的计算机不是某颗芯片,而是计算、网络、存储、系统软件、电力和资本开支组合成的平台。读交换芯片新闻时,很多人记住 14.4T、51.2T、102.4T 这类参数;TPM 会追问这颗芯片进入哪张拓扑、能减少几层网络、影响多少训练时间、把收入从谁的口袋转到谁的口袋。参数只有变成平台变化,才有产业含义。
核心框架
平台整体观有四步。第一,把单品参数换成集群尺度,例如一颗 102.4 Tb/sec 交换 ASIC 能否支撑 131,072 颗 GPU 两层互连。第二,把时间换成钱,因为 AI/HPC 的训练时间就是资本回报的一部分。第三,把网络放进总成本:网络可能只占集群成本 10%-20%,但它决定训练作业是否被通信拖慢。第四,把厂商动作拆成收入拓扑:谁卖 ASIC,谁卖交换机,谁卖系统,谁通过软件和协议锁住客户。
他怎么用(具体案例+数据+原话)
2023-04-26 他写 Jericho3-AI 时,没有停在 14.4 Tb/sec,而是引用 Meta 的数据:集合通信会浪费计算节点 18%-57% 的时间,单节点价值约 40-50 万美元。因此他写出类似原话的判断:“If time is money”,在 AI/HPC 里通常就是这样,同样时间能训练更多模型就是经济收益。2025-06-03 他写 Tomahawk 6,也不是只庆祝 102.4T,而是把它放进 131,072 颗 GPU 两层网络的可能性里。2026-03-31 解读 Nvidia 与 Marvell 的 20 亿美元交易时,他看的也不是单一 NVLink Fusion,而是 Vera CPU、ConnectX、BlueField、Spectrum-X 和第三方 XPU 如何组成半开放平台。
常见误区
第一是参数崇拜。带宽、端口、延迟都重要,但脱离拓扑就只是规格表。第二是低估网络,因为网络成本占比看似小,却可能吞掉大量节点时间。第三是把平台观理解成只看大公司。平台视角确实容易偏向在位者,所以遇到良率、封装、HBM 排产这类底层问题,需要和供应链研究交叉验证。TPM 的能力圈是系统与市场层,不是所有半导体细节。
可迁移方法
给每条基础设施新闻画两张图。一张是物理拓扑:XPU、网卡、DPU、交换、存储、电力分别在哪里。另一张是收入拓扑:芯片、盒子、系统、软件、运维分别由谁收费。只有两张图的交叉点出现变化,才说明参数进入了钱流。这个方法可用于 AVGO、NVDA、ANET、GOOG、META 等案例,但只代表观察框架。
小结
平台整体观把问题从“谁参数更高”改成“谁定义系统,谁重新分配钱流”。TPM 的强项正是把工程参数接到训练时间、集群拓扑和厂商收入上。
Tomahawk 鼓点:以太网交换的世代节拍器
本节学什么
本节只讲 Tomahawk 这条节拍线。TPM 写 Broadcom Tomahawk 的价值,不是报道“又发布一颗交换芯片”,而是把以太网交换 ASIC 写成 AI 网络的世代节拍器。Tomahawk 5 在 2022 年达到 51.2T,Tomahawk 6 在 2025 年达到 102.4T,路线图还指向 TH7 的 204.8T 和 TH8 的 409.6T。这个约两年翻倍的鼓点,会影响云厂商网络层数、交换机设计、白盒交付和财报确认窗口。
核心框架
Tomahawk 鼓点法分五步。第一,记录代际和发布时间,而不是只看发布会口号。第二,把 ASIC 带宽换成集群规模,TH6 的核心意义是十万级 GPU 两层网络的可能性。第三,拆分商业阶段:发布、送样、交换机设计、云厂商验证、批量部署、财报确认。第四,跟管理层口径和第三方份额交叉,避免只被技术路线图带着走。第五,把 scale-out 的已验证部分和 scale-up 的在途想象分开,不提前把预测当现实。Tomahawk 还有一个隐含用途:它给研究者提供“默认节奏”。任何厂商声称提前跳代或绕开这一节奏,都要拿出客户设计和量产证据。
他怎么用(具体案例+数据+原话)
2022-08-17,TPM 写 Tomahawk 5,强调 51.2T 单片是以太网交换带宽鼓点中的关键一代。2025-06-03,他写 Tomahawk 6,把 102.4T 放进 AI 数据中心“饥饿”的语境,讨论它如何服务 131,072 颗 GPU 两层网络。思想体系还记录 Broadcom FY2025 AI 收入各季同比从 46% 到 63% 再到 74% 加速,Q2 AI 网络收入同比约 +170%,占 AI 收入约 40%。这些数据让 Tomahawk 不只是产品故事,而是有收入曲线验证的节拍器。
常见误区
第一,把路线图等同出货。TH7、TH8 是节奏观察点,不是当期收入。第二,把 Broadcom AI 收入增长完全归给单颗 Tomahawk,实际还要区分定制芯片、网络、客户节奏和产品组合。第三,忽略 Nvidia 的反击,Spectrum-X 也能在以太网窗口夺收入。第四,把带宽翻倍直接理解成价值翻倍。价值来自是否减少网络层、降低单位端口成本、改善作业完成时间和被客户采用。
可迁移方法
建立一张“产品节拍/收入节拍”双表。产品节拍记录 TH5、TH6、Tomahawk Ultra、TH7、TH8 的参数、发布时间和目标拓扑;收入节拍记录 AI 网络收入、客户采用、交换机份额和交付周期。每次更新只把证据放进对应阶段,不用发布新闻替代财报确认。相关公司只是研究入口,不能据此形成买卖建议。
小结
Tomahawk 鼓点告诉我们,以太网 ASIC 的节奏会提前映射 AI 网络部署窗口。TPM 的独到之处是把芯片代际、集群拓扑和收入确认放在同一条时间线上。











































































































