AI 基建瓶颈从 GPU 迁到互连物理层
本节学什么
这一节只讲 Fabian 的总命题:AI 基建的真实瓶颈正在从单颗 GPU 性能,迁移到 GPU 之间、机柜之间、园区之间的互连物理层。深研把他的底层信念概括得很直接:测试台比电话会议更早暴露胜负。他不是从估值表或订单传闻起步,而是从信号能不能稳定传过去起步。100G lambda、PAM4、FEC、DSP、EML、AEC、CPO/LPO 在他那里不是概念,而是眼图、误码、功耗、风冷边界和客户认证。
核心框架
本节框架是“瓶颈迁移三问”。第一问,算力是否真的被单芯片 FLOPS 限制,还是被 scale-up、scale-out、scale-across 链路限制。第二问,互连问题落在哪个物理约束:损耗、误码、FEC 开销、TDECQ、模块功耗、散热、距离或客户认证。第三问,这个约束能否提前在测试台和资格认证中显形,而不是等到财报电话会才被管理层承认。Fabian 的独特性在于,他把 AI 基建从“GPU 多快”改写成“GPU 之间多快、稳不稳、热不热、错不错”。
他怎么用(具体案例+数据+原话)
深研记录他的履历是“测试台一手派”:计算机工程背景,曾在 MultiLane 从实习和工程岗位进入全球 FAE,长期接触信号完整性、眼图、BER、FEC、TDECQ、MSA 标准与光模块合规测试,后来经历 AWS、Quantifi Photonics,并在 2026 年 5 月加入 FundaAI 任高级分析师。这个路径解释了他为什么会说“真实约束不是 GPU 多快,而是 GPU 之间多快”。在 Google Ironwood TPU v7 供应链文章中,他把市场注意力从 AVGO、TSMC 这类显性核心,拉到 MediaTek、Celestica、光互连、测试测量、连接器、材料和更深供应链。这个案例说明,AI 平台的胜负不是只由加速器芯片决定,还由它能否被稳定、低误码、可散热地连成系统决定。
常见误区
第一,把 Fabian 读成普通光模块多头。深研明确说他不是“光模块多头”,而是测试台约束迁移的分析师。第二,把 AI 基建等同于 GPU 采购,忽略互连层的误码、功耗和认证。第三,把工程正确自动等同于投资正确;他自己的材料也反复强调不构成建议。第四,把财报后的管理层语言当第一信号,忽略测试台、样品认证和客户资格测试往往更早改变。
可迁移方法
遇到任何 AI 基建叙事,先写一张“瓶颈迁移卡”。第一格写当前约束:计算、内存、网络、光互连、供电、散热还是测试。第二格写可观测物理指标:BER、FEC 前误码、TDECQ、功耗、距离、温度、良率。第三格写验证阶段:实验室、送样、客户认证、小批量、高量产。第四格写财报语言是否已跟上。这样可以把宏大的 AI buildout 拆成可复核的工程链路。
小结
本节的核心是把 AI 基建从单点 GPU 叙事,推回互连物理层。Fabian 的价值不是喊光学受益,而是提醒研究者:当集群规模变大,真正的约束会在信号、误码、功耗、散热和认证中出现。合规使用这套方法,就是学他的工程验证顺序,不把它变成任何证券的买卖建议。
拆物理层:层级/速率节点/物理红线
本节学什么
这一节只讲“拆物理层”。Fabian 看互连不是先问哪家公司受益,而是先问链路在哪一层:机柜内、数据中心内,还是跨园区;再问速率节点是 100G/lane、200G/lane,还是未来 400G/lane;最后问物理红线在哪里。深研列出的 checklist 很清楚:损耗、功耗、误码、FEC、散热、距离,任何一个不过关,路线图都不能自动变成收入。
核心框架
本节框架是“层级 × 速率 × 红线”。层级决定距离和介质:机柜内可以讨论铜缆、AEC、ACC、短距光;数据中心内要看 800G、1.6T 模块和交换机端口;跨园区 scale-across 则会把 coherent、DCI、OCS 和光纤管理带进来。速率决定工程难度:100G/lane 是上一代大规模基础,200G/lane 是 1.6T 的现实商业窗口,400G/lane 更像工程终局而不是立刻统治。红线决定可部署性:模块功耗超过风冷边界,FEC 开销吞掉收益,误码率无法稳定,客户认证延后,都会改变判断。
他怎么用(具体案例+数据+原话)
深研在未来判断里写得很具体:2026 年现实部署以 200G/lane 为主,400G/lane 是方向但不会立即统治。Fabian 的问法不是“更快一定更好”,而是“200G/lane 没有 DSP 能不能跑,模块功耗超过 25W 是否破坏风冷,1.6T 过渡是否制造 800G air pocket”。这几个问题都属于物理层红线。比如 1.6T 如果依赖 200G/lane,它的商业化不只取决于模块厂样机,还取决于 DSP、TIA/driver、EML、SerDes、测试设备和客户交换机平台是否一起闭合。他也会把 “无差错传输链路是复杂数学维持的幻觉” 这类语言放到讨论里,提醒读者不要把高速链路想成插上就能跑的水管。
常见误区
第一,把 800G、1.6T、3.2T 当成线性升级。速率翻倍会把功耗、热、眼图、FEC 和测试复杂度一起抬高。第二,把 lane 速率和模块总速率混在一起。1.6T 可以来自更多 lane,也可以来自更高速 lane,两者对器件和测试要求不同。第三,把跨园区训练和机柜内互连放在同一张表里比较。距离变了,介质、DSP、相干技术和运维方式都会变。第四,只看供应商发布,不看客户认证阶段。
可迁移方法
研究任何互连新闻时,用三行表强制拆开。第一行写层级:rack、inside DC、scale-out、scale-across。第二行写速率:模块总速率和单 lane 速率分开写。第三行写红线:损耗预算、功耗预算、误码目标、FEC 方案、散热条件、距离、客户平台。若新闻只给“1.6T 样机”却不给功耗、认证、端口平台和量产时间,就只能放在技术进展栏,不能放进收入兑现栏。
小结
本节的重点是物理层先于公司映射。Fabian 的研究强度来自把互连拆到层级、速率节点和物理红线,而不是把所有 AI 光互连都写成同一种机会。合规使用这节方法,就是先判断链路能不能跑,再判断供应链谁可能参与;不从技术路线图直接跳到投资结论。
供应链节点口径:三色表
本节学什么
这一节只讲证据口径。Fabian 的供应链拼图很有冲击力,但深研也提醒:他的长尾映射不是内部确认,而是高质量拼图。因此,学习他的同时必须学会给每个节点标口径等级。绿色是硬事实,黄色是高质量推断,红色是低确定性叙事。没有这张三色表,Ironwood、CPO、AEC、测试测量、长尾材料都容易被读成确定性名单。
核心框架
三色表要同时记录“证据等级”和“产业阶段”。绿色包括公司正式披露、财报数字、客户已确认、标准组织公开材料、明确的量产或 sole-source 资格认证。黄色包括管理层暗示、供应链公告、读者线索与多源交叉后形成的强推断。红色包括相关性联想、市场传闻、只因为技术听起来相近就被塞进 AI 叙事的公司。产业阶段则分研发、送样、认证和高量产四格。绿色研发与绿色量产不是一回事;黄色认证也不能写成收入已经发生。
他怎么用(具体案例+数据+原话)
Google Ironwood TPU v7 是本节最好的案例。深研记录,2025 年 11 月 24 日的 Ironwood 供应链长尾论让他成名:市场原本看显性核心,他把 MediaTek、Celestica、光互连、测试测量、连接器、材料和更深供应链拉到台前。真正重要的是后续 v2 修正:2026 年 4 月 1 日,他公开承认初版某些 Broadcom 杠杆和 Arista spine 判断不稳。这个动作说明他知道拼图边界。把冷门节点拉出来是能力,把 Broadcom 和 Arista 判断不稳写出来是纪律。深研把这件事定义为“既能把冷门节点拉到台前,也愿意把拼图错误写出来”。
常见误区
第一,把出现在 Fabian 图谱里的公司都当成确认供应商。深研已经明确:供应链拼图依赖公开资料、读者纠错和模式匹配,不等于内部确认。第二,把公司“可能受益”写成“已经出货”。第三,把读者评论、X 线索、Substack Note 与财报披露混为一档。第四,只保存命中案例,不保存被修正的判断。这样会把一个研究流程误读成战绩展示。
可迁移方法
建立一张四列证据表。第一列写节点:DSP、EML、TIA/driver、测试设备、连接器、photomask、电镀化学、光纤管理。第二列写阶段:研发、送样、认证、量产。第三列写颜色:绿、黄、红。第四列写验证日期和下一次可复核事件。任何长尾公司只有从红变黄、从黄变绿,才提高置信度;反过来,若财报或客户披露不支持,就降级。这个方法能保留 Fabian 的供应链敏感度,同时避免把推断包装成确定事实。
小结
本节的核心是口径纪律。Fabian 的 alpha 很多来自长尾拼图,但长尾拼图最容易被滥用。三色表能把“看见可能性”和“确认事实”分开,让研究者既不迟钝,也不越界。合规上,本节只教证据分级,不把任何图谱节点写成提及。











































































































