模型压缩
3 秒看懂
模型压缩是一类算法与工程实践,旨在大幅减小已训练深度学习模型的体积、计算量和内存占用,同时尽可能保持其预测精度。它的核心目标,是让强大但笨重的AI模型能够在手机、汽车、传感器等资源受限的边缘设备上高效运行,实现真正的本地智能,降低云端依赖。
3 分钟产业解释
模型压缩是AI从“实验室作品”走向“规模化产品”的关键一环。当今大规模预训练模型参数动辄数十亿乃至上万亿,推理一次需要多块昂贵GPU,功耗和延迟都难以满足实时应用。压缩技术相当于为这些“巨人”定制一套轻盈的装甲,让它们能够塞进智能手机、IoT微控制器、自动驾驶域控制器等终端,在保证体验的同时,实现低功耗、低成本、低延迟的本地推理。
从产业链看,模型压缩是连接 上游算力基础设施 与 下游应用生态 的桥梁。
- 上游牵引:压缩算法的需求直接影响了AI芯片的设计方向(如引入INT8/FP8张量计算单元)、编译器优化策略和推理引擎架构。
- 下游赋能:压缩质量决定了AI能否在手机摄影、语音助手、工业视觉质检、智能驾驶感知等场景中流畅运行。可以说,压缩使AI从“云端昂贵的奢侈品”变成了“边缘普惠的生产力”。
从商业逻辑看,模型压缩的每一次突破都能极大拓展AI应用的广度和深度。能提供高效压缩工具链的芯片厂商、掌握核心压缩算法的软件公司,以及能将压缩与场景深度融合的解决方案商,都会在AI落地浪潮中获得显著竞争优势。同时,压缩也直接降低云端推理的运营成本,是云计算厂商优化TCO的重要手段。
技术原理
模型压缩的本质是 “用更少的比特或更少的连接,承载模型的智能”。主要技术路径包括量化、剪枝、知识蒸馏、低秩分解和神经架构搜索(NAS),实践中常常组合使用。
量化
量化将模型权重和/或激活值从高精度(如32位浮点数FP32)映射到低精度(如8位整数INT8、4位整数INT4甚至更低)。核心机制是利用仿射变换,将连续浮点数范围映射到离散整数范围。
高精度权重 (FP32) : [ 0.01234, -0.56789, 1.23456 … ]
↓ 缩放因子 s 与零点 z 映射
低精度权重 (INT8) : [ 12, -56, 127 ] (离散整数,运算等价于(int_val - z) * s )
推理时,整数运算在支持低精度计算的硬件上速度更快、能效更高。典型技术包括训练后量化(PTQ,只需少量校准数据)和量化感知训练(QAT,通过在训练中模拟量化噪声保持精度)。近年来面向大语言模型的后训练量化方法如GPTQ、AWQ等,能将千亿参数模型压缩至4比特甚至3比特,且性能损失极小。
剪枝
剪枝通过移除网络中冗余的连接或结构来减少计算。
- 非结构化剪枝:将权重矩阵中绝对值低于阈值的元素置零,生成稀疏矩阵。这种方法能实现极高稀疏度(如90%),但需要专用硬件或稀疏计算库才能转化为实际加速。
- 结构化剪枝:以整层、整通道或整个注意力头为单位进行移除,直接得到一个更小的稠密模型,对现有硬件友好,是产业界更偏爱的方案。剪枝通常需要评估重要性(基于权重大小、梯度、激活值等),并配合微调恢复精度。
知识蒸馏
知识蒸馏使用一个大型、高精度的“教师模型”来指导一个轻量级的“学生模型”学习。学生模型的损失函数不仅包含与真实硬标签的交叉熵,还包含与教师输出软标签的KL散度,迫使学生逼近教师的输出分布,从而继承其泛化能力。
教师模型 (大) → 输出 “软标签” (包含类别间相似度信息)
学生模型 (小) → 同时拟合硬标签和软标签,模仿教师行为
这一方法在NLP领域取得巨大成功,例如BERT的蒸馏版DistilBERT在保留97%性能的同时将体积减小40%。对大语言模型,常通过从大模型蒸馏得到更小的任务专用模型,以极低成本提供服务。
低秩分解与神经架构搜索
- 低秩分解:利用矩阵分解(如SVD)将大型权重矩阵近似为两个或多个较小矩阵的乘积,减少参数量和乘法次数。它对全连接层效果明显,但对卷积层和非线性层的适用性受限,一般作为其他方法的补充。
- 神经架构搜索:NAS在给定延迟、内存等约束下自动搜索最优网络结构,本质上是一种“设计时压缩”。它能在精度‑效率帕累托边界上找到优秀模型,但搜索过程需要消耗大量算力。
关键参数
评估模型压缩方案时,需重点考察以下参数,这些参数相互制约,需要根据部署场景权衡。
- 压缩率:压缩后模型参数总量或存储体积 (MB/GB) 与原模型的比值。例如,“4倍压缩”即参数体积减少75%。对于大语言模型,通常报告每参数比特数(BPW),如4‑bit压缩表示平均每参数用4比特,相比原始FP16减少4倍。
- 精度保持度:压缩后模型在目标任务验证集上的关键指标(准确率、F1分数、BLEU等)相对于原始模型的下降幅度。通常以“精度损失 XX%”表示,或同样严格标准下比较。
- 推理加速比:在目标硬件上实际测量的吞吐量(如每秒处理样本数)或延迟(单次推理时间)相对于原始模型的倍数提升。需注意,理论计算量缩减与实测加速往往存在差距,受内存带宽和算子支持影响。
- 能效比:完成一次推理所消耗的能量(焦耳/推理),对电池供电设备至关重要,常用能效提升倍数衡量。
- 硬件友好性:压缩后模型的计算模式、数据格式是否与目标硬件(如GPU Tensor Core、NPU、MCU)原生匹配。例如,结构化剪枝得到的规整小模型比高稀疏度的非结构化模型更容易被通用加速器调度。
- 校准与训练成本:完成压缩所需的数据量和计算开销。PTQ仅需少量校准数据(如100‑1000样本),成本极低;而QAT或蒸馏需要完整训练流程,成本高但精度更好。
- 支持的精度等级:如FP16、INT8、INT4、混合精度等。现代推理引擎(如NVIDIA TensorRT)可自动融合层和选择精度,以最小化精度损失。
- 鲁棒性与可复现性:压缩后模型在分布偏移下的退化是否严重,以及结果在不同批次训练之间的波动情况。
技术路线
当前,模型压缩技术路线可以按“何时压缩”和“如何压缩”两个维度划分。
| 技术路线 | 核心思想 | 代表方法/工具 | 主要优势 | 典型挑战 | 适用场景 |
|---|---|---|---|---|---|
| 训练后量化 (PTQ) | 在不修改模型训练流程的情况下,将调优好的模型直接转换为低精度 | NVIDIA TensorRT, ONNX Runtime, Intel OpenVINO | 无需重训练,快速部署 | 极低比特下精度难保证,需精心校准 | 视觉、推荐等成熟模型,对推理延迟敏感场景 |
| 量化感知训练 (QAT) | 在训练中模拟量化噪声,让模型学会适应低精度运算 | PyTorch Quantization, TensorFlow Model Optimization | 能在低比特下保持更高精度 | 需要完整训练数据和算力,周期长 | 对精度要求严苛的应用,如医疗影像、自动驾驶感知 |
| 结构化剪枝 | 按通道/层/注意力头整体移除,直接生成更小稠密模型 | Torch Pruning, NVIDIA Apex | 硬件兼容性好,实际加速明显 | 剪枝准则设计复杂,可能需多次微调 | 模型存在明显冗余层级,目标硬件为通用GPU/NPU |
| 非结构化剪枝 & 稀疏化 | 将个别权重置零,追求极高稀疏率 | NeMo Megatron (Neural Magic), SpFR | 理论压缩倍数高 | 实际加速依赖专用稀疏引擎,软件生态不完善 | 特定AI芯片(如支持稀疏的NPU),成本敏感型云端推理 |
| 知识蒸馏 | 小模型学习大模型的输出分布 | DistilBERT, TinyBERT, DeepSpeed Chat | 可改变模型架构,学生模型轻量且高能 | 依赖高性能教师模型,训练成本高 | 需要定制化轻量模型,或需将大模型能力迁移到新结构 |
| 混合精度量化 & 自动化策略 | 对敏感层保留较高精度,非敏感层使用极低精度 | TensorRT混合精度, HAWQ系列 | 在速度和精度间取得自动平衡 | 自动化搜索成本较高 | 部署场景复杂,模型层间敏感度差异大 |
| 低秩分解 + 量化 | 先分解矩阵再量化,叠加压缩效益 | 针对大语言模型的LoSparse等 | 针对特定层可大幅压缩 | 泛化性有限,实施复杂 | 模型参数集中在全连接层(如LLM) |
| 神经架构搜索 (NAS) | 在设计阶段按约束搜索最优架构 | Once‑for‑All, ProxylessNAS | 从源头获得高效模型 | 搜索算力消耗极大 | 芯片厂商设计用于自家硬件的基准模型 |
近年来,针对大语言模型的压缩成为热点。GPTQ与AWQ等权重量化方法,能在数小时内将百亿参数模型量化至4比特,精度几乎无损失。SmoothQuant通过数学等效变换将激活值的量化难度转移给权重,实现W8A8(权重8位、激活8位)的高效量化。这些技术正在重塑百亿级模型在消费级GPU上的部署可能。
上游
模型压缩的上游主要由算力硬件、系统软件与基础模型三大支柱构成。
- AI芯片与硬件
- NVIDIA:Tensor Core从Volta架构开始支持INT8推理,H100引入FP8 Transformer Engine,支持动态混合精度,为量化提供原生加速。
- Qualcomm:Hexagon NPU支持INT8/INT16推理,AI Engine提供量化与剪枝配套工具,是移动端AI的核心平台。
- Apple:A系列/M系列芯片的Neural Engine对INT8/Float16模型提供高效调度,Core ML的模型转换中自动执行量化与剪裁。
- 华为:昇腾(Ascend)系列NPU原生支持INT8/FP16,MindSpore框架的模型压缩工具箱(金箍棒)提供剪枝、量化、NAS功能。
- AMD:XDNA AI Engine针对边缘推理,支持INT8与块浮点;ROCm生态的MIOpen库提供量化推理算子。
- Intel:Gaudi 2 AI加速器集成硬件量化引擎;OpenVINO工具链对CPU/GPU/VPU的量化推理做了深度优化。
- 推理引擎与中间件
- NVIDIA TensorRT:在GPU上实现层融合、精度校准、kernel自动调优,是云端和边缘嵌入式GPU部署的事实标准。
- ONNX Runtime:跨平台推理加速器,支持多种执行提供程序(张量RT、OpenVINO、DirectML),内置量化与剪枝工具。
- TVM / Apache TVM:开源深度学习编译器,通过自动调优为特定硬件生成优化算子,支持量化与稀疏计算。
- MLIR与IREE:新兴的编译器基础设施,致力于统一不同硬件的量化与调度,Google、Apple等参与投入。
- 基础模型提供商
- 大语言模型(如LLaMA 2/3、Mistral、Qwen)和视觉大模型的发布、开源,为压缩技术提供了广泛的应用对象。很多模型直接提供量化版本或适配脚本,极大降低了部署门槛。
下游
压缩技术的下游覆盖所有需要AI推理且对资源敏感的终端与场景。
- 智能手机与可穿戴设备:计算摄影中的语义分割、人像模式、超夜景等算法几乎全部依赖量化模型运行于NPU/DSP上。语音助手、实时翻译也受益于模型压缩,可在本地离线运行,保护隐私。根据Counterpoint 2023 Q4数据,具备AI加速芯片的智能手机出货量占比已超过80%,其中绝大多数推理负载运行在压缩模型上。
- 自动驾驶与智能座舱:车载感知、预测与规划模型需在车规级芯片(如Orin、地平线征程系列)上实时处理多路高清视频流,INT8量化与结构化剪枝是标配。例如,典型的视觉BEV模型经过INT8量化后可满足30FPS以上的实时处理要求,延时低于50毫秒。公开资料未见总体采用压缩模型的比例,但从主要车企的招标技术需求看,量化已成为基础要求。
- 物联网与工业边缘:工业相机、机器人、可编程逻辑控制器等设备内存和算力极有限。TensorFlow Lite Micro等框架甚至支持将模型压缩至仅需几十KB闪存运行,用于振动分析、视觉缺陷检测等。据IoT Analytics 2023年报告,全球工业AIoT市场规模已达600亿美元,其中边缘推理芯片的出货量中超过90%运行某种形式的压缩模型(报告原文指“optimized models”)。
- 云端与数据中心推理:即使是云端推理,为降低每token成本,压缩同样关键。例如,通过4‑bit量化和KV缓存压缩,可将LLaMA 2‑70B的推理所需GPU数量减少一半以上,从而直接影响云API的定价。2024年,多家云厂商发布基于量化模型的推理服务,其每百万token价格相较使用原始精度模型降低了30%~50%不等(来源:各厂商官网定价比较,2024年4月)。
- 金融与医疗:高频交易中的极低延迟模型、医疗影像的实时辅助诊断,也依赖压缩技术。不过这类场景对精度与可解释性要求更高,通常采用QAT或保守的剪枝策略。
受益公司
压缩技术本身并不直接产生独立市场,其商业价值体现于提升硬件竞争力和赋能应用生态,受益主体可分为三类。
硬件平台厂商
- NVIDIA:TensorRT与GPU捆绑,压缩工具链构成其数据中心和自动驾驶平台的竞争优势。在2024财年,NVIDIA数据中心收入475亿美元,其中推理已贡献约40%(来源:公司财报及高管公开评论),压缩技术支持的大规模推理是其增长关键。
- Qualcomm:Snapdragon移动平台的AI Engine凭借出色的量化模型支持,持续巩固旗舰手机AI功能领先。2023财年,Qualcomm手机芯片业务收入为239亿美元,AI加速被视为推动平均售价(ASP)提升的重要因子。
- 华为:昇腾生态通过MindSpore压缩工具箱构建软硬件闭环,服务于运营商、能源等国产化场景。2023年,华为轮值董事长曾表示昇腾AI集群已在多地部署,但公司未单独披露压缩相关收入,公开资料未见具体数字。
- Apple:Ironically,其模型压缩能力隐含在Core ML与芯片设计中,不单独商业化,但提升了iPhone、Mac等产品的AI体验,间接拉动硬件销售。
算法/中间件独立厂商
- Neural Magic:专注模型稀疏化,提供开源工具SparseML,助力CPU推理。2023年宣布与VMware等公司合作,但其财务数据未公开。
- Deci:基于NAS自动构建高效模型,已获数轮融资。2022年完成2500万美元B轮融资(来源:Crunchbase),持续为移动设备定制模型。
- Moffett AI:开发基于稀疏计算的AI加速卡,直接以硬件+软件的方式为云端推理提供压缩优化,但2023年公开收入数据未见。
- OctoML:提供模型优化与部署平台,支持自动量化与调优,2022年完成8500万美元C轮融资(来源:公司新闻稿),致力于将ML模型性能工程自动化。
云服务与解决方案商
- AWS:SageMaker Neo与Inferentia芯片提供推理优化与压缩,将成本节省传导给客户。2023年AWS的市场份额保持第一,但未公开压缩相关的直接收入。
- 微软 Azure:Azure Machine Learning拥有自动化压缩流水线,支撑OpenAI等大模型推理服务,通过对GPT-4等模型的量化部署降低API定价,从而吸引更多开发者和企业用户。
- Google Cloud:TensorFlow Lite与Edge TPU结合,同时提供云端模型优化建议,其TPU v5e支持INT8推理,2024年宣布可驱动更大规模且更具性价比的生成式AI推理。
需注意,上述多数公司的压缩工具并非独立售卖,而是集成在更大系统的产品组合中,因此很难估算其独立产生的营收;公开市场数据多以外界估算的推理优化相关市场规模为参考。
市场规模
模型压缩作为一项共性使能技术,其自身并无独立的统计市场规模。相关市场可从边缘AI芯片、推理优化软件以及AI推理服务等维度侧面衡量。
- 边缘AI芯片市场:据MarketsandMarkets 2022年报告,全球边缘AI处理器市场2022年为260亿美元,预计2027年达到693亿美元(CAGR 21.8%)。这些芯片几乎全部支持量化推理,压缩技术是芯片利用率的关键。
- 推理优化软件与服务:目前尚无独立市场报告。根据Grand View Research 2023年估算,全球MLOps(机器学习运维)平台市场2022年为13.5亿美元,预计到2030年将达190亿美元,其中模型优化与管理是重要组成部分。压缩工具常常作为MLOps链条的一部分而存在。
- 云端推理成本下降:压缩技术的直接效果是计算成本的同比缩减。以OpenAI GPT‑3.5‑Turbo为例,其API输入价格在2023年11月为$0.0010/1K tokens,到2024年4月已降至$0.0005/1K tokens,半年内下降50%(来源:OpenAI官方定价页面),背后包含量化、批处理优化等多种工程手段的贡献。
- 其他相关数据:IoT Analytics报告显示,2023年工业AIoT设备连接数达到24亿,其中运行压缩AI推理的设备超过15亿。Strategy Analytics预测2025年80%以上的智能手机将具备片上AI能力,相机/音频等应用将全部依赖压缩模型运行。
综合来看,模型压缩直接驱动的硬件、软件和服务市场虽然难以精确剥离,但其影响范围极广,间接支撑了数千亿美元级别设备的智能化升级。
玩家对比
选取市面上最具代表性的推理优化工具链进行横向对比。
| 工具链 | 主要支持硬件 | 量化能力 | 剪枝/蒸馏支持 | 生态与易用性 | 典型部署场景 |
|---|---|---|---|---|---|
| NVIDIA TensorRT | NVIDIA GPU (CUDA) | FP16, INT8, INT4, FP8(A); PTQ, QAT;层融合 | 结构化剪枝(依赖第三方) | 强大的生态系统,大量预优化模型,闭源 | 云端推理、自动驾驶Jetson边缘 |
| Qualcomm AI Engine | Snapdragon NPU/DSP | INT8, INT16;依赖AIMET工具,PTQ/QAT | 支持结构化剪枝 | 针对手机芯片深度优化,闭源但提供SDK | 智能手机、XR设备 |
| Apple Core ML | Apple Neural Engine, GPU, CPU | FP16, INT8;自动模型检测与转换 | 权重剪枝与调色板量化 | 与Xcode深度集成,对第三方模型友好 | iPhone, iPad, Mac, Vision Pro |
| ONNX Runtime | GPU (CUDA/TensorRT), CPU, NPU等多后端 | INT8, INT4 (部分后端);PTQ,动态量化 | 通过ONNX生态集成 | 开源,广泛社区支持,跨平台 | 通用模型部署,服务器与边缘 |
| Intel OpenVINO | Intel CPU, GPU, VPU, Gaudi | INT8, FP16;PTQ;自动精度选择 | 结构剪枝(NNCF工具) | 开源,与Intel硬件协同优化 | 工业PC,边缘服务器 |
| Apache TVM | 多家AI芯片(GPU, FPGA, 专用ASIC) | 多种量化方案,自动调优 | 稀疏化支持 | 开源,需较强编译知识,定制灵活度高 | 自研或小众芯片的推理优化 |
| PyTorch / TF Lite | 通用框架,依赖后端 | 原生量化API,易用 | 框架内剪枝与蒸馏 | 开源最大社区,原型开发快 | 研究与快速验证,后续需转换成专用引擎 |
从趋势看,越来越多的工具链正通过编译器+自动化方式统一量化与剪枝流程,并提供Python API,降低开发者门槛。NVIDIA TensorRT生态最为庞大,但其他方案在特定硬件(高通、苹果)或特定场景(TVM自研芯片)上更具优势。
风险
- 精度‑效率权衡的不确定性:某些模型在压缩后虽然平均精度达标,但在某些边缘案例或少数群体数据上可能出现严重性能退化,且较难在开发阶段发现。
- 硬件绑定与升级风险:高度定制化的压缩方案(如图优化、稀疏模式)可能高度依赖特定芯片,一旦硬件迭代或供货中断,已部署的模型需要重新适配,增加维护成本。
- 研发投入回报率波动:部分压缩技术如NAS、QAT等需要大量算力,获得极致效率增益的成本可能高于直接使用更大算力或采用更先进芯片的边际成本,在摩尔定律仍有作用时,软件优化效益可能被硬件进步稀释。
- 安全与可解释性削弱:量化引入的噪声和剪枝导致的模型结构变化可能降低模型的可解释性,在金融风控、医疗等强监管领域存在合规风险。此外,压缩模型可能对对抗样本更敏感,安全性存疑。
- 生态碎片化:不同的推理引擎、芯片、框架推出各自独立的压缩标准与格式,导致模型移植困难,增加整个生态系统维护成本。
- 人才与专业知识壁垒:深入理解硬件特性、优化编译技术的压缩工程师稀缺,企业可能难以独立建立完整的压缩优化能力。
误读纠偏
-
“模型压缩必然导致精度大幅下降”
现代压缩技术本质是去除冗余、优化信息表示,而非简单丢弃信息。通过QAT、知识蒸馏等方法,即使在极低比特(如4‑bit)下,许多任务仍能保持与原始模型不相上下的体验。对大语言模型而言,量化后的困惑度(PPL)增加往往小于0.5,对多数应用感觉不到差异。 -
“压缩技术主要用于小模型,大模型太重要不能压缩”
恰恰相反,大模型是压缩技术最迫切的需求方。原始大模型推理成本极其高昂,压缩(如4‑bit权重量化、KV缓存压缩)是将它们部署到消费级硬件上的唯一可行方案。压缩是大模型落地的“必修课”。 -
“量化只适用于推理,训练不能量化”
虽然参数更新仍需较高精度,但训练中的混合精度(AMP)以及某些低比特优化器、通信中的梯度压缩已经广泛使用。而且,量化感知训练(QAT) 本身就是在训练中模拟量化效果。因此,量化也已渗透到训练环节,以降低训练成本。 -
“压缩后模型比原始小,意味着能力弱”
压缩并不完全是“削减”,知识蒸馏能够将大模型的知识迁移给更小的学生,有时学生模型通过更好的归纳偏置和训练方案,甚至能在某些任务上超越教师。压缩模型可能“小而美”,并非能力缩水。
最新事件
- 2024年4月:Meta发布LLaMA 3,同时提供了8‑bit和4‑bit量化版本,通过Hugging Face transformers库可直接使用,促进开发者社区在消费级显卡上运行百亿参数模型。
- 2024年3月:NVIDIA在GTC 2024上宣布TensorRT‑LLM更新,针对L40S等GPU,将Llama 2‑70B的4‑bit量化推理吞吐提升至每秒2500 tokens(延迟低于50ms),相比半年前版本提升约2倍。
- 2024年2月:微软研究院发布BitNet b1.58,展示一种1.58‑bit(每个参数仅用-1, 0, +1表示)的语言模型,规模达30亿参数,在同等算力下性能超越全精度的LLaMA风格模型,引发业界对极低比特训练与推理的极大兴趣。
- 2023年10月:高通发布 AI Stack 新版本,引入硬件感知模型压缩工具 Qualcomm AI Model Efficiency Toolkit (AIMET) 的更新,支持自动混合精度与更高效的Transformer模型剪枝。
- 2023年8月:Graphcore宣布其IPU‑POD系统支持FP8训练与推理,在大型视觉与语言模型上提供新的压缩效率选项。
- 2023年7月:Hugging Face推出 Text Generation Inference (TGI) 推理服务框架,原生集成GPTQ与AWQ量化,大幅降低社区部署开源LLM的门槛,迅速成为自托管推理的常用选择。
跟踪指标
- 学术进展:机器学习顶级会议(NeurIPS, ICML, ICLR, MLSys)中关于模型压缩、高效推理论文的数量和受关注度;arXiv上相关的预印本热度。
- 开源工具生态:GitHub上关键项目的Star数增长趋势,如
llama.cpp(支持各种量化格式的LLM推理)、AutoGPTQ、vLLM等,反映开发者社区采纳速度。 - 硬件推理性能基准:MLPerf Inference的提交结果,关注各硬件在压缩模型上的延迟与吞吐量刷新;AnandTech等媒体的手机AI基准测试中,NPU执行量化模型的能效比。
- 云API定价变化:OpenAI、Azure、Google Cloud等大模型API的每百万token价格走势,快速下降往往意味着后端模型压缩与优化取得新进展。
- 边缘AI设备出货量:Statista、IDC等机构发布的智能音箱、智能摄像头、智能汽车等边缘AI设备出货量数据,反映压缩模型的应用渗透速度。
- 压缩能效指标:特定芯片厂商公布的“TOPS/W”(每瓦每秒万亿次运算)在使用量化/剪枝模型时的提升值。
- 企业相关招聘与并购:NVIDIA、Qualcomm、Intel等公司AI优化工程师的招聘数量及初创公司融资/并购新闻,可视为产业投资风向。
信源
- 经典论文:
Han, S. et al. (2016). Deep Compression. ICLR 2016.
Hinton, G. et al. (2015). Distilling the Knowledge in a Neural Network. NIPS 2015 Workshop.
Frantar, E. et al. (2023). GPTQ: Accurate Post‑Training Quantization for Generative Pre‑trained Transformers. ICLR 2023.
Lin, J. et al. (2023). AWQ: Activation‑aware Weight Quantization for On‑Device LLMs. arXiv.
Xiao, G. et al. (2023). SmoothQuant: Accurate and Efficient Post‑Training Quantization for Large Language Models. ICML 2023. - 综述:
Deng, L. et al. (2020). Model Compression and Hardware Acceleration for Neural Networks: A Comprehensive Survey. Proceedings of the IEEE.
Liang, T. et al. (2021). Pruning and quantization for deep neural network acceleration: A survey. Neurocomputing. - 行业报告:
MarketsandMarkets (2022). Edge AI Processor Market - Global Forecast to 2027.
Grand View Research (2023). MLOps Platform Market Size, Share & Trends Analysis Report.
IoT Analytics (2023). Global Industrial IoT Market Report 2023.
Counterpoint (2024). Global Smartphone AP/SoC Tracker, Q4 2023. - 官方文档与博客:
NVIDIA TensorRT Documentation.
PyTorch Quantization Documentation.
TensorFlow Lite Model Optimization Toolkit.
OpenAI Pricing page (as of April 2024).
Meta AI, LLaMA 3 release blog, April 2024. - 公司财务与公开披露:
NVIDIA FY2024 Annual Report.
Qualcomm FY2023 Annual Report.
Crunchbase关于Deci、OctoML融资记录。 - 新闻与媒体:
高通AI Stack更新新闻稿(2023.10)。
GTC 2024 Keynote by NVIDIA CEO.
微软BitNet b1.58研究论文及技术社区报道。
注:文中所有财务、市场份额及产能数字均基于注明来源年份的口径,如未注明则表示公开资料未见。所有分析不构成投资建议。