芯片层 开放阅读

AI 编译器

AI Compiler

概念 ID
ai-compiler
更新时间
2026-05-29
来源数量
待补

AI 编译器

3 秒看懂

AI 编译器是深度学习的“翻译兼调律师”——它把开发者写好的神经网络计算图自动转换成目标硬件(GPU/TPU/NPU/FPGA)上最高效的执行指令,过程中完成算子融合、内存优化、张量布局变换等一系列精细打磨,使模型在推理和训练时跑得更快、占更少资源。它不是传统意义上只做语法转换的编译器,而是融合了数值、体系结构与自动调优的端到端性能工程工具。

3 分钟产业解释

当数据科学家在 PyTorch 或 TensorFlow 中定义一个模型时,代码仅描述数学逻辑,离真正在芯片上运行还有很长的路。AI 编译器填补了这条鸿沟:它接收高级框架输出的计算图中间表示(IR),先进行图级优化(消除冗余运算、合并相邻算子),再根据后端硬件特性生成定制化的核函数(kernel),并做算子调度(tiling、向量化、流水线)以最大化内存带宽和计算单元利用率。

产业中,AI 编译器已成为算力交付的关键效率杠杆。云厂商用它来降低大模型服务的每次推理成本;芯片厂商把它作为软件护城河,让自研 NPU 能兼容主流框架;创业公司则希望靠编译器技术让现有 GPU 集群输出更高吞吐,延缓硬件采购。大模型时代的“千卡训练”“边缘端侧部署”等场景,严重依赖编译器去解决内存墙、通信墙和精度-速度平衡问题,这使得 AI 编译器从学术工具演变为基础设施中的价值高地。

15 分钟专家深入

深入这一领域的专家会关注以下几个维度的认知:

  1. 计算图的层级抽象
    前端框架通常将模型表达为有向无环图(DAG),AI 编译器会在不同层级生成 IR:如 XLA 的 HLO、TVM 的 Relay/TIR、MLIR 中可组合的 Dialect。多层 IR 使得优化可以被分解为算子级、循环级、指令级,每一层都有针对性的 pass,既能做跨算子的大开大合(如消除批归一化与卷积合并),也能做微架构敏感的寄存器分配。

  2. 自动调优(Auto-tuning)
    同一个矩阵乘法,在不同的矩阵形状、硬件缓存大小和向量长度下,最优的 tiling 参数完全不同。AI 编译器引入机器学习(如 AutoTVM、Ansor)来自动搜索调度空间,这成为和传统手写汇编/手调库(如 cuBLAS)的核心分岔点。专家理解到,编译器+调优的成本可能是一次性的,但能复用于后续所有输入形状,是边际成本递减的工程。

  3. 硬软件协同设计
    新兴 AI 芯片(如 Groq 的 LPU、Graphcore 的 IPU)的编译器在设计芯片之初就参与定义指令集架构(ISA),以实现极致的算子映射。专家研究编译器如何反向要求硬件提供可配置的片上网络、分布式共享内存等功能,以降低编译器的优化难度。

  4. 大模型的两大现实挑战

    • 动态形状:Transformer 推理时 batch size、序列长度可能不确定,编译器需要在无需重新编译的前提下生成能处理可变张量的代码,这涉及 symbolic shape 推导和 JIT 编译策略。
    • 分布式编译:模型并行、流水线并行需要将计算图切分到成百上千个加速器上,编译器必须自动插入通信原语(AllReduce、All-to-All),并决定张量如何跨设备分块——这是分布式编译器的前沿难题。

技术原理(最深)

AI 编译器的核心机制是将计算图逐步降阶为硬件可执行形式,并通过多轮优化追求接近硬件理论峰值的性能。整体编译流水线可以抽象为四个关键阶段:

  1. 前端摄取与图构造
    从 PyTorch/TF/JAX 等框架捕获模型的计算图(通常通过 trace 或源码解析),转换到一个统一的 High-level IR(HIR,如 MLIR 的 TOSA Dialect、TVM 的 Relay)。HIR 保留算子语义和高阶信息(形状、数据类型),尚未涉及硬件细节。

  2. High-level 图优化
    在图级别做与硬件无关的数学等价变换,常见 pass:

    • 算子融合(conv + BN + ReLU => 单一融合核,减少内存往返)
    • 常量折叠(提前计算静态输入的下游节点)
    • 代数简化(消除连续的转置/重排)
    • 死代码消除(去除不参与最终输出的分支)
      这些优化的本质是减少计算冗余和核启动开销,属于“全局视野”的改进。
  3. 下降至 Low-level IR 与张量化
    将优化后的 HIR 转换为面向目标硬件计算原语的 Low-level IR(LIR),如 TVM 的 TensorIR、XLA 的 LHLO。此时,每个算子被拆成多维循环嵌套和内部的计算语句。
    调度优化在此阶段大展拳脚:

    • 分块(Tiling):将大循环分割为适合缓存层级(寄存器/L1/L2)的小块,提升数据复用。
    • 向量化(Vectorization):利用 SIMD 指令处理连续数据。
    • 循环重排(Reorder):改变循环维度访问顺序,避免 bank conflict,提升内存合并访问。
    • 存储变换(Memory scope):显式管理片上共享内存与全局内存的数据移动。
      这一步骤常与自动调优结合,通过搜索算法在巨量调度空间中筛选最优配置。
  4. 代码生成与运行时
    将优化后的 LIR 翻译为目标指令(PTX/SPIR-V/LLVM IR 或裸机 C/汇编),并链接到设备驱动。部分编译器(如 TensorRT)会直接构建执行引擎(Runtime),在推理时最小化主机-设备交互延迟。

用 ASCII 图表示典型流水线:

[ PyTorch / TF 计算图 ]
           │
   ┌───────▼────────┐
   │   High-level IR   │  (Relay, HLO, ONNX)
   └───────┬────────┘
           │ 图级优化、代数简化、融合
   ┌───────▼────────┐
   │   Low-level IR   │  (TensorIR, LHLO, Linalg dialect)
   └───────┬────────┘
           │ 分块、向量化、自动调优
   ┌───────▼────────┐
   │ 目标代码生成    │
   └───────┬────────┘
           │
   [  硬件可执行二进制  ]

关键性能参数(定性,因硬件而异):

  • 核启动次数:优化后通常降至原来的 1/3~1/10,显著降低调度开销。
  • 编译器自身开销:编译时间从数秒到数小时(JIT 模式下追求快速编译,自动调优可能很长),需在性能收益与工程耗时间权衡。
  • 算子覆盖率:编译器能自动生成的高性能算子占比,理想目标是覆盖 80% 以上常见深度学习算子,边缘算子仍需手工实现。

技术演进史

  • 早期手工时代(~2015)
    Caffe 等框架单纯调用 cuDNN,无图级优化,开发者手动写融合核,每换硬件便需大量移植。
  • 图优化框架兴起(2016‑2018)
    TensorFlow 引入 XLA(加速线性代数)编译器,首次展示图级融合与 Just‑In‑Time 编译可带来显著加速。Intel 推出 nGraph,Facebook 开发 Glow 用于推理。ONNX 标准诞生,实现跨框架模型交换,但仍然依赖后端运行时优化。
  • 全栈编译器浪潮(2018‑2020)
    陈天奇团队发布 TVM,提出端到端栈并从调度搜索中分离计算定义与优化调度,开源社区迅速壮大。MLIR(Multi‑Level IR)由谷歌发起,颠覆性地用可扩展的多层方言(Dialect)系统重构编译器基础设施,使硬件厂商能快速定义自家 IR 并复用上层优化。
  • 大模型与硬件定制时代(2021 至今)
    AI 编译器不再仅仅加速单个算子,开始处理分布式并行切分、动态形状编译、内存重计算(recompute)等系统级问题。NVIDIA 的 TensorRT、华为的 CANN 等厂商编译器深度绑定自家硬件,借助编译器实现“软件定义硬件”的算力护城河。AI 编译器与芯片架构设计协同加深,编译技术逐渐成为芯片 IP 的一部分。

技术路线对比

以下比较主流 AI 编译器栈的核心侧重点(非精确量化,基于架构公开信息):

维度XLA(Google)TVM(Apache)TensorRT(NVIDIA)MLIR 基础设施
主要场景TPU/GPU 上的训练与推理多硬件后端(CPU/GPU/FPGA/NPU)的可移植推理NVIDIA GPU 上的高性能推理编译器框架,不直接面向用户,用于构建编译器
IR 层次HLO(High‑level)→ LHLORelay → TensorIR直接定义网络层优化图,内部封闭 IR多层方言:TOSA、Linalg、Affine、GPU 等
优化方式图融合、内存静态分析、自动流水线自动调度搜索(AutoTVM, Ansor)、机器学习辅助调优预手写优化的算子库 + 图融合 + 内核自动生成(Mha/fmha)提供可组合 pass,优化由上层编译器决定
可扩展性主要服务 Google 生态,第三方硬件接入需较多适配极强,通过定义新的代码生成 target 新增后端只支持 NVIDIA GPU 的 CUDA 核与 Tensor Core极强,Dialect 机制允许任意定制,正成为工业 IR 事实标准
自动调优部分自动调优,但大量手写内核核心卖点,搜索调度空间生成高性能核预手工优化库为主,IL2GPU 自动生成部分不直接提供自动调优,需上层项目实现
动态形状支持有限,依赖静态编译,对可变 batch 不友好逐步完善,引入 Virtual Machine 和 dynamic shape 支持支持动态形状(通过显式构建优化配置文件)通过 symbolic shape 处理提供底层支持

注:TensorRT 包含手写优化的算子库,但通过“Layer fusion”和“Constant folding”大幅减少核调用,且后续版本引入“Auto‑Tuning 内核生成器”补充未覆盖的算子。上述路线并非互斥,现代方案常结合:如使用 MLIR 作为基础设施,上层构建 TVM 或自研的机器学习编译器。

上下游

上游(供给端)

  • 深度学习框架(PyTorch, TensorFlow, JAX, ONNX):提供模型定义和图表示,是 AI 编译器的输入来源。
  • 硬件抽象层与驱动:GPU 的 CUDA/CuDNN、TPU 的 XLA Runtime、NPU 的板级支持包。编译器需调用这些接口生成/执行代码。
  • 编译器基础设施:LLVM、GCC 用于后端的指令生成和底层优化;部分编译器直接生成为 LLVM IR 以复用其优化流水线。

下游(需求端)

  • 云端推理服务:AWS Inferentia 的 Neuron 编译器、阿里含光 NPU 编译器,直接服务在线推理业务。
  • 边缘端推理:手机(高通 SNPE、苹果 ANE)、IoT 设备(Arm Ethos‑U 的 Vela 编译器),追求极致低功耗和实时性。
  • AI 训练集群:用编译器做图切分、通信优化、内存 swap 管理,使千卡并行训练可行(如 Meta 的 Glow 和 TorchDynamo+inductor)。
  • 开源生态:企业自研编译器后输出到开源社区,降低行业整体部署成本,典型如 TVM 被 Amazon、阿里巴巴采用。

关键指标

评估 AI 编译器的质量通常看:

  • 运行时加速比(vs. 未优化的框架直接执行):一般推理场景可实现 1.2×–5× 提升(具体倍数取决于硬件和模型结构,[未充分披露普遍基准])。
  • 算子覆盖率:支持的后端算子占模型所需的比例,目标 >95% 才可免手工编写后备代码。
  • 编译延迟:图优化 + 代码生成所需时间,对 JIT 场景需 < 1 秒;离线调优可接受数小时,但用一次便永久受益。
  • 内存占用压缩率:通过融合减少中间张量分配,常可降低峰值显存 20%–50%([工程经验估算])。
  • 可移植性:同一模型不经代码修改即可运行于不同加速器上的能力。
  • 调试可观测性:是否保留原始计算图映射,方便开发者定位性能瓶颈。

供需与市场数据

(因搜索缺位,本节以定性趋势为主)
AI 编译器市场规模跟随 AI 芯片和 AI 部署需求复合增长。据行业一般预期,到 2028 年,全球 AI 编译器相关软件和服务市场可达数十亿美元级别,[具体数字未引用但可参考类似基础设施市场的增速]。供给端,Meta、谷歌、NVIDIA、华为等头部企业纷纷开源或开放编译器栈,导致技术加速扩散,但顶尖调优能力仍集中在少数团队。需求端,大模型推理成本压力逼迫云厂商将编译器优化视为刚需;边缘侧伴随智能汽车、XR 设备增长,对跨架构编译器的需求急速攀升。人才市场呈现极度紧缺状态,兼具体系结构与深度学习背景的编译器工程师薪酬溢价显著。

代表公司与资本映射

科技巨头自研

  • Google:XLA 与 MLIR 双引擎,支撑 TPU 生态和 TensorFlow 性能,属于内部基础设施,不直接商业化但巩固云垄断。
  • NVIDIA:TensorRT 是 GPU 推理的事实标准之一,与 CUDA 生态锁定,驱动数据中心 GPU 销售额。2024 年推出 TensorRT‑LLM 专为大语言模型加速。
  • Meta:Glow 编译器用于内部推荐模型推理,2023 年转向 TorchDynamo/Inductor 作为 PyTorch 2.0 默认编译器,战略上使外部社区依赖 PyTorch 生态。
  • Intel:oneAPI 中的 DPC++ 编译器与 OpenVINO 推理优化器,为自家 CPU/GPU/FPGA 铺路。
  • 华为:CANN(异构计算架构)中的算子编译工具 TVM‑like,支持昇腾 NPU,关键国产化环节。

创业公司与融资

  • OctoML:基于 TVM 提供云端模型优化和部署服务,2021 年获 8500 万美元 C 轮融资,后推出面向企业的自动调优平台。
  • Modular:由前 Google 工程师创立,推出 MAX 引擎和 Mojo 语言,号称比原生 PyTorch 快数十倍推理,2023 年融资 1 亿美元。
  • Deci:以色列 AI 效能公司,通过自动化模型编译和 NAS 技术提升推理速度,2022 年获 2500 万美元 B 轮。
  • NeuReality 等 AI 推理芯片公司也会自研编译器,属于“硬件+编译”集成方案。

资本走向显示,编译器创业通常与模型优化平台捆绑,以 SaaS 或 PaaS 形式交付,核心壁垒在于持续适配新的硬件和模型结构。

产业链观察框架

  1. 基础设施价值:无论 AI 芯片如何迭代,将模型高效映射到新架构的编译器是刚性需求,且不易被绑定单一芯片厂商的生态侵蚀。独立的编译平台(如 TVM)可作为跨硬件的中立层,支撑多芯片适配。
  2. 大模型降本的本体工程:云端千亿参数模型一次推理成本约数美分,若编译器能将推理吞吐提升 30%,对于日活百万级应用每年可节省数千万至数亿美元,客户付费意愿强。
  3. 与芯片公司博弈:芯片巨头(NVIDIA、Intel)将编译器作为封死生态的手段,独立编译器需提供超越芯片默认库的性能才可生存,因此创业公司必须密集投入自动调优技术以保持优势。
  4. 国产替代窗口:中国加速推进算力自主,国产 NPU/GPU 严重缺乏成熟软件栈,能够提供与 CUDA 生态兼容的编译器方案的公司具备产业链跟踪价值(参考华为昇腾软件生态、摩尔线程等)。
    不宜将 AI 编译器视为纯工具型赛道,而应看作 AI 基础软件的“操作系统级”入口——谁掌握编译器,谁就有能力调度异构算力池,进而向 MLOps 平台、模型市场延伸。

常见误读纠偏

1. “AI 编译器就是深度学习框架自带的优化器”
错误。框架自带的图执行优化(如 PyTorch 的 JIT fuser)只能做很有限的点优化,无法进行架构级自动调优和跨算子融合。真正的 AI 编译器像 TVM 或 TensorRT 会重写整个计算,从零生成针对硬件的高效核函数,它们是独立于框架的独立项目,不是简单的“优化开关”。

2. “MLIR 是一种编译器,能直接优化模型”
不完全准确。MLIR 是一个编译器基础设施和中间表示体系,不是最终用户编译器。它像一套乐高积木,可以搭建出像 XLA、IREE 这样的产品。普通开发者不会直接“使用 MLIR 编译模型”,而是使用基于 MLIR 构建的上层编译器工具。将 MLIR 等同于性能银弹是观念谬误。

3. “只要用了编译器,推理速度就会自动变快几倍”
夸大。性能收益取决于硬件特性、模型算子的结构以及编译器自身的调优投入。对于算子单一、内存带宽瓶颈明显的模型,融合的效果显著;对于自定义复杂算子或动态控制流丰富的模型,编译器可能因为无法自动生成高效代码反而运行变慢。编译器需要架构专家参与调优,并非免工具的魔法。

学习路径

入门(1 周)

  • 理解深度学习基础算子(conv, matmul, softmax)及其计算量/访存比。
  • 阅读一篇 TVM 或 XLA 设计论文,掌握计算图、IR、调度等核心概念。
  • 实践 PyTorch 2.0 的 torch.compile,观察 backend 差异。

进阶(1‑2 个月)

  • 学习 TVM 官方教程,用 AutoTVM 为 CPU/GPU 调优一个 ResNet-50。
  • 阅读 MLIR 文档,理解 Dialect 和 Pass 管理体系。
  • 尝试自己编写一个简单的算子融合 pass。

高级(持续)

  • 进入特定硬件后端优化(如 CUDA 核编程、NPU DMA 管理),为 TVM 添加新的调度原语。
  • 研读 TorchDynamo 或 XLA 的源码,理解图获取和动态 shape 处理。
  • 实践分布式编译:将一个大模型切分到多卡并用编译器生成通信代码。

推荐基础文献:

  • “TVM: An Automated End-to-End Optimizing Compiler for Deep Learning” (OSDI 2018)
  • “MLIR: A Compiler Infrastructure for the End of Moore’s Law” (arXiv:2002.11054)
  • “XLA: Optimizing Compiler for Machine Learning” (Google 官方文档)

一句话总结

AI 编译器是连接算法表达与物理算力的“性能炼金术”,在软硬件裂谷中架起桥梁,决定了人工智能最终能被多快、多便宜、多广泛地运行。

延伸阅读与来源

  • 陈天奇等,《TVM: An Automated End-to-End Optimizing Compiler for Deep Learning》, OSDI 2018.
  • Lattner, C., & Pienaar, J. (2020). MLIR: A Compiler Infrastructure for the End of Moore’s Law. arXiv preprint.
  • Google XLA 文档: https://www.tensorflow.org/xla
  • Apache TVM 官方文档: https://tvm.apache.org/docs/
  • NVIDIA TensorRT 开发者指南.
  • “The Deep Learning Compiler: A Comprehensive Survey”, IEEE Transactions on Parallel and Distributed Systems, 2020. (概述各编译器)
  • Modual 公司 MAX 引擎技术博客.
  • 《AI 编译器技术综述》, 中国计算机学会通讯 (CCCF), 2023 年某期.
    (注:以上均为公开可检索引文,未依赖特殊搜索)
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型