应用层 开放阅读

NPU 应用

NPU-Accelerated Application

概念 ID
npu-accelerated-application
更新时间
2026-05-29
来源数量
待补

NPU 应用(NPU-Accelerated Application)

3 秒看懂

一句话: NPU 应用 = 把 AI 推理/部分训练任务从通用 CPU/GPU 搬到专用神经网络加速器上跑,换取更高能效比和更低延迟的软件与服务生态。

类比: CPU 像瑞士军刀什么都能干但不精,GPU 像流水线工厂擅长并行,NPU 则是为”矩阵乘法”这种 AI 核心运算量身定制的专用流水线——把每瓦特算力榨到极致。

3 分钟产业解释

为什么需要 NPU?

AI 大模型爆发后,算力需求呈指数增长,但两个瓶颈制约了传统架构:

  1. 能效墙:通用 GPU 执行神经网络推理时,大量晶体管用于通用逻辑而非计算,能耗效率存在天花板。移动端/边缘设备电池有限,无法承受 GPU 的功耗密度。
  2. 成本墙:数据中心推理请求量巨大,如果全部依赖 GPU 集群,TCO(总拥有成本)高昂。NPU 的专用架构可以在特定负载下用更少硅面积、更低功耗完成相同任务。

NPU 应用的三层生态

层级内容典型形态
端侧应用手机/PC/可穿戴设备上的本地 AI实时抠图、语音助手、端侧大模型推理
边缘应用工业/安防/车载场景的低延迟 AI智能摄像头、ADAS 辅助、工业质检
云端应用数据中心的高吞吐推理服务搜索排序、推荐系统、云游戏 AI NPC

产业链定位

芯片设计商 → NPU 硬件(集成在 SoC 中或独立加速卡)
    ↓
编译器/工具链商 → 模型优化、算子编译、量化部署
    ↓
应用开发商 → 构建 NPU 加速的终端软件/云服务
    ↓
终端用户 → 体验到更快、更省电的 AI 功能

15 分钟专家深入

NPU 应用的技术本质

NPU 应用不是简单地”跑在 NPU 上”,而是一个完整的 软硬协同优化工程

1. 模型适配层

  • 原始模型(如 PyTorch/HuggingFace 格式)需要经过 量化(FP32 → INT8/INT4/NF4)、剪枝算子融合 等转换
  • 不同 NPU 架构对算子支持度不同,需要针对性适配
  • 典型工具链:ONNX Runtime、TFLite、厂商私有 SDK(如高通 QNN、苹果 Core ML)

2. 编译与调度层

  • NPU 通常有分层的存储架构(寄存器 → SRAM → DRAM),编译器需要完成 tiling(数据分块)、流水线调度
  • 某些算子若 NPU 不支持,需要 fallback 到 CPU/GPU 执行(异构调度)

3. 运行时层

  • 管理内存分配、任务队列、功耗控制
  • 端侧场景需要动态调频以平衡性能与功耗

关键性能指标

指标含义为什么重要
峰值算力(TOPS)每秒可执行的整型运算次数决定理论吞吐上限(注意:实际利用率通常远低于峰值)
能效比(TOPS/W)每瓦特功耗可提供的算力端侧设备的核心约束指标
延迟(ms)单次推理的端到端时间影响用户体验(如语音助手响应)
模型支持度可直接加速的算子/模型类型决定实际应用场景的广度
片上 SRAM 容量NPU 可直接访问的高速缓存大小减少 DRAM 访问,对 Transformer 类模型尤为关键

⚠️ 数据警示:各厂商公布的 TOPS 值通常基于峰值理论值,实际应用中因内存带宽瓶颈、算子利用率等因素,有效算力可能仅为峰值的 30%-70% [估算,具体视模型和架构而异]。

NPU 与 GPU/CPU 的本质区别

           CPU                    GPU                     NPU
        ┌─────────┐          ┌─────────┐           ┌─────────┐
        │ 复杂控制 │          │ 大规模并行│           │ 数据流优化│
        │ 逻辑单元 │          │ 算术单元 │           │ 专用数据通路│
        │ (少核强) │          │ (众核弱) │           │ (MAC阵列) │
        └────┬────┘          └────┬────┘           └────┬────┘
             │                    │                      │
        通用计算              并行计算                矩阵计算
        灵活但低效            吞吐高但功耗大           高能效但场景受限

NPU 的核心架构特征:

  • 大规模 MAC(乘累加)阵列:直接映射矩阵乘法
  • 片上 SRAM 为主的数据流架构:减少 DRAM 带宽依赖
  • 低精度计算单元:原生支持 INT8/INT4,而非像 GPU 那样以 FP32/FP16 为主

技术原理

NPU 核心计算单元

┌──────────────────────────────────────────────────┐
│                   NPU 芯片                        │
│  ┌─────────────────────────────────────────────┐ │
│  │            MAC 阵列(核心计算引擎)            │ │
│  │  ┌─────┬─────┬─────┬─────┐                 │ │
│  │  │ MAC │ MAC │ MAC │ ... │  ← 数百至数千个  │ │
│  │  └─────┴─────┴─────┴─────┘                 │ │
│  │       × (多行/多列)                          │ │
│  └─────────────────────────────────────────────┘ │
│                      ↕ 数据搬运                    │
│  ┌───────────────────────┐  ┌───────────────────┐│
│  │    片上 SRAM(数MB级)  │  │  控制逻辑/调度器  ││
│  │  (权重缓存/激活缓存)  │  │                  ││
│  └───────────────────────┘  └───────────────────┘│
│                      ↕                           │
│  ┌─────────────────────────────────────────────┐ │
│  │            DRAM 接口(HBM/LPDDR)            │ │
│  └─────────────────────────────────────────────┘ │
└──────────────────────────────────────────────────┘

推理加速的数学本质

神经网络推理的核心运算为:

Y = Activation(X × W + Bias)

其中 X × W 是矩阵乘法,占推理计算量的绝大部分。

NPU 的优化思路:

  1. 空分复用:将矩阵展开到 MAC 阵列的物理维度上并行计算
  2. 低精度量化:将 FP16/BF16 的权重和激活量化为 INT8/INT4,单次运算能耗可降低 [数量级估算,具体比例与工艺和实现相关]
  3. 数据本地化:将权重预加载到片上 SRAM,避免反复访问 DRAM

Transformer 模型在 NPU 上的挑战

大语言模型(LLM)的 Transformer 架构对 NPU 提出了特殊要求:

  • 注意力机制的 KV Cache 需要大量片上存储
  • 自回归解码是串行的,难以充分利用 MAC 阵列的并行度
  • 长序列推理对 SRAM 容量和带宽要求极高

这解释了为什么端侧 NPU 运行大模型时,通常需要配合 量化 + KV Cache 压缩 + 稀疏化 等技术。


技术演进史

阶段时间关键里程碑
萌芽期2016-2017华为麒麟 970 首次集成独立 NPU 单元(具体型号名称待厂商确认);Google 发布 TPU v2
端侧普及期2018-2020高通骁龙、苹果 A 系列、联发科天玑纷纷集成 NPU;端侧 AI 应用爆发(计算摄影、语音唤醒)
边缘扩展期2021-2023NPU 算力持续提升至 [数十TOPS量级,具体型号数据未充分披露];边缘 AI 盒子、智能摄像头等场景扩展
大模型适配期2024-端侧大模型成为新战场(3B-7B 参数级别);NPU 架构开始针对 Transformer 优化(增大 SRAM、支持注意力机制加速)

关键转折点:2024 年起,业界从”能跑 AI”转向”能跑大模型”,NPU 的 SRAM 容量和内存带宽成为比峰值算力更重要的瓶颈因素。


技术路线对比

NPU vs GPU vs CPU 推理对比

维度CPUGPUNPU(端侧)NPU(云端,如 Google TPU)
设计目标通用计算大规模并行端侧低功耗 AI高吞吐 AI 训练/推理
典型算力低(<1 TOPS 量级)高(数百至数千 TFLOPS)中(数至数十 TOPS)高(数百 TOPS 以上)
能效比(核心优势)中高
灵活性最高(算子受限)
延迟中高(端侧场景)
适用模型规模小模型大模型中小模型(端侧)大模型
成本低(集成于 SoC)

主要 NPU 架构路线

路线代表特点
SoC 集成 NPU高通 Hexagon、苹果 Neural Engine、联发科 APU与 CPU/GPU 共享内存,低延迟,适合端侧
独立 NPU 加速卡Intel Gaudi、Groq LPU、部分国产 AI 芯片独立 HBM,算力更高,面向数据中心推理
存内计算 NPU部分学术/初创公司探索中在存储单元内直接完成计算,理论上可突破内存墙(尚处早期阶段)

上下游

上游(NPU 应用的依赖链)

EDA 工具(Synopsys/Cadence)
        ↓
IP 授权(Arm Ethos-N、自研架构)
        ↓
晶圆代工(台积电/三星/中芯)
        ↓
先进封装(如 2.5D/3D 封装,用于高端 NPU)
        ↓
NPU 芯片完成

中游(NPU 平台与工具链)

  • 硬件平台:集成 NPU 的 SoC(手机/PC)或独立加速卡
  • 软件栈
    • 编译器:将模型图编译为 NPU 可执行指令
    • 量化工具:精度转换
    • 运行时:调度与内存管理
    • 算子库:NPU 专用的高效算子实现

下游(NPU 应用层)

应用类别典型场景NPU 价值点
计算摄影夜景增强、人像虚化、超分辨率实时处理,功耗敏感
语音 AI语音助手、实时翻译、降噪低延迟唤醒与响应
端侧大模型本地对话、文本摘要、代码补全隐私保护,离线可用
智能驾驶ADAS 辅助感知、舱内监控实时性要求高
工业视觉缺陷检测、OCR边缘部署,成本敏感

关键指标(选购/评估 NPU 应用方案时的核心参数)

指标评估要点
有效 TOPS区分峰值 TOPS 与实际可用算力;查看第三方 benchmark 而非厂商理论值
支持的量化精度INT8 是基本要求,INT4/NF4 支持对端侧大模型至关重要
片上 SRAM 大小直接影响 Transformer 类模型的 KV Cache 可用性
内存带宽端侧 LPDDR5x vs 云端 HBM,差距巨大
算子覆盖率所用模型的算子是否 100% 被 NPU 加速,还是需要 CPU fallback
软件生态成熟度框架支持(PyTorch/TensorFlow/ONNX)、社区活跃度、文档质量
功耗包络移动端需关注持续推理功耗而非峰值功耗

供需与市场数据

⚠️ 声明:以下为定性趋势判断,具体数据来源待确认。因检索受限,未获取到可引用的第三方报告数据。

供给侧

  • 端侧 NPU 已成为手机/PC SoC 的标配组件,渗透率接近 100%(旗舰至中端机型)
  • 云端 NPU 加速卡市场仍由 GPU 主导,但 Google TPU、AWS Inferentia 等自研 NPU 在特定场景中获得一定份额
  • 国产 NPU(如华为昇腾、寒武纪等)在国内市场有政策驱动的需求

需求侧

  • 端侧大模型(3B-7B 参数级别)的部署需求正在推动 NPU 算力升级
  • 企业端 AI 推理成本敏感度提升,NPU 在高吞吐低延迟场景的 TCO 优势开始显现
  • 边缘 AI 部署(安防、工业、车载)是增量市场

供需缺口

  • NPU 算力增长速度是否能跟上模型规模膨胀,是核心不确定性
  • 软件生态碎片化(各厂商工具链不统一)可能制约应用开发效率

代表公司与资本映射

类型代表公司定位
端侧 NPU 集成商高通(Hexagon NPU)、苹果(Neural Engine)、联发科(APU)SoC 内置 NPU,面向手机/PC
云端自研 NPUGoogle(TPU)、AWS(Inferentia/Trainium)、Microsoft(Maia)自研自用,服务云客户
独立 AI 芯片公司Groq(LPU)、Cerebras、寒武纪、地平线、黑芝麻专注 AI 加速器
软件/工具链Qualcomm AI Engine、MediaTek NeuroPilot、Intel OpenVINO提供 NPU 软件栈
模型优化/部署ONNX Runtime、TensorRT(NVIDIA)、MLC-LLM模型编译与部署框架

资本映射逻辑

  • 关注 NPU 生态的”卖铲人”:EDA、IP 授权、先进封装
  • 关注工具链/编译器层的公司(软件锁定效应强)
  • 关注特定垂直场景的 NPU 解决方案商(如车载 AI 芯片)

投资逻辑

看多逻辑

  1. 端侧大模型是确定性趋势:隐私需求 + 离线可用 + 降低云端推理成本,推动端侧 NPU 算力需求持续增长
  2. 渗透率仍有提升空间:从旗舰向中低端下沉,从手机向 PC/IoT/车载扩展
  3. 软件生态带来锁定效应:一旦开发者依赖某 NPU 平台的工具链,迁移成本高
  4. 国产替代逻辑:地缘政治因素下,国内 NPU 需求有政策支撑

看空/风险因素

  1. GPU 仍是大模型训练/推理的主流:NPU 在大模型场景中的份额有限
  2. 软件生态碎片化:各厂商工具链互不兼容,增加开发成本,可能拖累应用落地速度
  3. 模型与硬件的 co-design 不确定性:如果未来模型架构变革(如 Mamba 等非 Transformer 架构),当前 NPU 的架构优化可能失效
  4. 算力过剩风险:端侧 AI 应用的实际使用频率可能低于预期

关键观测指标

  • 端侧可运行的模型规模上限(当前约 7B 参数,趋势向上)
  • NPU 工具链的第三方模型覆盖率
  • 端侧 AI 应用的月活/日活数据
  • 云端推理中 NPU vs GPU 的 TCO 对比报告

常见误读纠偏

误读 1:「NPU 的 TOPS 值越高,AI 性能越好」

纠偏:TOPS 是峰值理论值,实际性能取决于:

  • 内存带宽瓶颈(端侧 LPDDR 带宽远低于 NPU 计算需求)
  • 算子利用率(很多算子无法完全映射到 NPU 的 MAC 阵列)
  • 实际量化精度(INT4 TOPS 不等于 INT8 性能)

建议:关注具体模型(如 Llama-7B、Stable Diffusion)的实际推理延迟和吞吐,而非单纯的 TOPS 数字。

误读 2:「NPU 会取代 GPU」

纠偏:NPU 和 GPU 定位不同:

  • GPU 擅长大模型训练和通用并行计算,灵活性高
  • NPU 擅长特定推理任务的能效优化,但灵活性低
  • 短期内两者是互补关系,而非替代关系。训练仍需 GPU,端侧推理更适合 NPU。

误读 3:「端侧 NPU 可以轻松运行大模型」

纠偏:端侧运行大模型面临多重约束:

  • 内存容量有限(手机通常 8-16GB 总内存,系统占用后留给模型的不多)
  • NPU 片上 SRAM 有限,KV Cache 需要频繁回写 DRAM
  • 量化到 INT4/INT2 会带来精度损失
  • 实际体验(token/s 生成速度)可能与云端差距明显

误读 4:「所有 AI 推理都适合用 NPU 加速」

纠偏

  • NPU 最擅长的是计算密集型的矩阵运算(如卷积、全连接)
  • 对于访存密集型或逻辑密集型的任务(如后处理、分支判断),CPU 可能更高效
  • 某些动态 shape 的模型(如目标检测中数量不定的检测框)在 NPU 上调度困难

学习路径

入门(1-2 天)

  1. 理解 NPU 的基本概念与定位:本文 + 各厂商产品页
  2. 了解 NPU 与 GPU/CPU 的区别
  3. 体验一次端侧 AI 应用(如手机的计算摄影、语音助手)

进阶(1-2 周)

  1. 学习神经网络推理的基本流程(量化、编译、部署)
  2. 了解至少一个 NPU 工具链(如高通 QNN、MediaTek NeuroPilot、ONNX Runtime)
  3. 阅读 NPU 架构的基础论文/技术文档(如 Google TPU 论文、Arm Ethos-N 白皮书)

深入(1-3 月)

  1. 实操:将一个模型(如 MobileNet、Llama-7B)编译部署到 NPU 并分析性能
  2. 学习 NPU 编译器优化(tiling、调度、算子融合)
  3. 研究 Transformer 在 NPU 上的优化挑战(KV Cache、注意力计算、稀疏化)
  4. 关注行业动态:端侧大模型进展、NPU 架构演进、工具链生态

推荐资源

  • 论文:TPU v1/v2 论文(Google)、Efficient Processing of Deep Neural Networks(书)、DianNao 系列论文(中科院)
  • 工具:ONNX Runtime(开源)、MLC-LLM(端侧大模型部署)
  • 社区:各芯片厂商的开发者社区(Qualcomm AI Hub、MediaTek Dimensity Developer)

一句话总结

NPU 应用是 AI 推理从云端走向端侧的基础设施,其核心价值在于以专用架构换取能效比,但实际落地效果高度依赖软硬件协同优化与模型适配,投资/技术判断时需穿透 TOPS 数字看实际部署表现。


延伸阅读与来源

类型来源说明
原始论文Jouppi et al., “In-Datacenter Performance Analysis of a Tensor Processing Unit” (ISCA 2017)Google TPU 架构奠基论文
原始论文Chen et al., “DianNao: A Small-Footprint High-Throughput Accelerator for Ubiquitous Machine-Learning” (ASPLOS 2014)中科院 NPU 早期开创性工作
行业报告各芯片厂商投资者日材料(高通、联发科、苹果)NPU 算力与功能演进的一手信息
开源工具ONNX Runtime (https://onnxruntime.ai/)跨平台 NPU 部署工具链
开源工具MLC-LLM (https://github.com/mlc-ai/mlc-llm)端侧大模型部署框架
社区Qualcomm AI Hub、MediaTek Dimensity Developer厂商 NPU 生态与模型库

⚠️ 数据声明:本文未成功检索到第三方市场数据,所有定量指标(如 TOPS、市占率、成本对比)均基于行业常识性认知的定性表述,不构成精确技术数据引用。如需精确数据,建议查阅各厂商官方财报、IDC/Gartner 行业报告或第三方 Benchmark(如 MLPerf)。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型