参数量
3 秒看懂
参数量是深度学习模型中所有可学习权重与偏置的总数,直接决定模型的“规模”——它既是表达能力的底子,也是计算、存储、通信开销的根因。在 Transformer 时代,参数量常被用来快速衡量一个模型的量级,但并非越大越好;稀疏模型(如 MoE)的“激活参数量”远小于总参数量,澄清这一区别是读懂现代大模型的关键。
3 分钟产业解释
参数量可以理解为模型内部的“可调节旋钮”个数。训练时,每一个参数都根据数据不断调整,以拟合复杂的输入-输出关系。一般而言,更多参数意味着更高的容量上限,但也需要更多的高质量数据、算力和更长的训练时间,否则极易过拟合。
产业实践中,参数量已从早期深度学习的百万量级,膨胀到如今的千亿甚至万亿量级。这种扩展催生了“缩放定律”(Scaling Laws),即在一定条件下,模型性能随参数量、数据量和计算量的幂律增长而提升。但近两年的趋势已分化:一边是继续追求极致规模的基础模型,另一边是通过稀疏激活(Mixture-of-Experts, MoE)、参数高效微调(PEFT)、量化、剪枝等手段,在有限的激活参数量下获得接近甚至更好的效果。因此,读懂“总参数量”和“有效参数量”的差异,已是产业链各环节的必修课。
技术原理
参数的本质与存储形式
每一个参数都是一个可微的标量,通常以 float32(4字节)或 bfloat16(2字节)等浮点格式存储。训练时,优化器会为每个参数维护梯度,甚至一阶/二阶动量(如 Adam 需维护 m 和 v 两个状态量),这导致优化器状态占用的显存往往是参数本身的数倍。以 Adam 优化器为例,每个参数需额外存储两个与参数同尺寸的状态变量,若参数以 bf16 存储(2字节),而优化器状态通常以 fp32 存储(4字节),则优化器状态占用为 8 字节/参数,是参数本身占用的 4 倍。推理时则仅需加载参数本身,因此对显存和带宽的压力相对降低。
逐层参数量计算
以下以典型 Transformer 解码器块为例,定性展示参数量的构成。设输入隐藏维度为 d_model,前馈层中间维度为 d_ff,注意力头数为 h,词表大小为 V,层数为 L。单层参数量的典型构成如下:
- 自注意力投影层:Q、K、V、O 四个矩阵,每个形状为 [d_model, d_model](部分实现中存在 bias 项,此处忽略以简化计算)→ 参数量 = 4 × d_model²
- 前馈层(FFN):两个线性层 W1 [d_model, d_ff] 和 W2 [d_ff, d_model] → 参数量 = 2 × d_model × d_ff
- 层归一化(LayerNorm/RMSNorm):包含缩放和偏移参数,每个形状为 [d_model],通常有 2 个,参数极少,约 2 × d_model,在大模型中可近似忽略
- 词嵌入矩阵:[V, d_model] → 参数量 = V × d_model
- 最终输出头(lm_head):若与嵌入层共享权重(Weight Tying),则不计入额外参数;若不共享,则参数量 = d_model × V
总参数量 ≈ L × (4×d_model² + 2×d_model×d_ff) + V×d_model (+ V×d_model,若输出头不共享)
以 Llama 2 70B 为例(公开技术报告,Meta,2023 年 7 月),其 d_model=8192,d_ff=28672,V=32000,L=80,采用 Weight Tying。据此可大致估算其参数量级:单层 ≈ 4×8192² + 2×8192×28672 ≈ 268M + 470M ≈ 738M,80 层 ≈ 59B,加上嵌入层 32000×8192≈262M,总量约 59.3B,与官方标称的 70B 在量级上一致(实际实现中存在其他参数项与偏置)。
对于卷积神经网络(CNN),卷积层的参数量取决于卷积核尺寸 K×K、输入通道数 C_in、输出通道数 C_out,单个卷积层的参数量 = K² × C_in × C_out(不含 bias)。全连接层则为输入神经元数 × 输出神经元数。
参数量与计算量的关系
在标准 Transformer 解码器的自回归生成中,单 token 前向传播的计算量(FLOPs)近似为 2 倍的参数量。对于完整的前向传播(处理 T 个 token),计算量 ≈ 2 × P × T,其中 P 为总参数量。这一近似关系源于每个参数在前向传播中大致参与一次乘法和一次加法(即一次 MAC,计为 2 FLOPs)。训练时还需反向传播,计算量约为前向的 2 倍,总计约为前向的 3 倍(即总计算量 ≈ 6 × P × T × 训练步数)。
这一关系直接决定了训练成本:一个千亿参数模型(P=100B),处理 1 万亿 token(T=1T)的数据,仅前向传播就需要约 2×10¹¹ × 10¹² = 2×10²³ FLOPs,即 200 ZettaFLOPs。以 NVIDIA H100 GPU(FP16 下约 989 TFLOPS 理论峰值,公开规格)为例,理论单卡需约 2×10²³ / 9.89×10¹⁴ ≈ 2×10⁸ 秒(约 6.3 年),实际训练需数百至数千张加速卡并行运行数周至数月。
训练中的显存占用分解
训练大模型时的显存占用由四个主要部分构成,可用以下公式近似表达:
总显存 ≈ 参数存储 + 梯度存储 + 优化器状态 + 中间激活值
- 参数存储:P × bytes_per_param(如 bf16 为 2×P 字节)
- 梯度存储:与参数同精度,通常 fp32 存储,为 4×P 字节
- 优化器状态:以 Adam 为例,m 和 v 各占 4×P 字节(fp32),共 8×P 字节;若使用 AdamW,还需存储权重衰减相关量
- 中间激活值:取决于批量大小(batch size)、序列长度、d_model 及并行策略,通常采用激活重计算(Activation Recomputation)进行时间换空间的权衡
以 bf16 参数、Adam 优化器(fp32 状态)为例,参数本身的 2×P 字节加上梯度与优化器状态的 12×P 字节,基础存储系数约为 14×P 字节(不含激活值),其中优化器状态占比最大(约 57%)。近年来,8-bit 优化器(如 bitsandbytes 提供的 8-bit Adam)可将优化器状态压缩至约 2×P 字节,大幅降低训练显存需求。
量化对参数量与计算的影响
模型权重的数值精度并不改变参数量本身(参数个数不变),但显著改变存储和计算开销:
- 从 fp32(4字节)降至 bf16(2字节),存储减半
- 从 bf16 降至 int8(1字节),存储再减半
- 从 int8 降至 int4(0.5字节),存储进一步压缩
量化技术分为训练后量化(Post-Training Quantization, PTQ)和量化感知训练(Quantization-Aware Training, QAT)。PTQ 可直接对已有模型进行量化,无需重新训练;QAT 则在训练过程中模拟量化效果,通常能获得更高的精度保留率。以 GPTQ、AWQ 等主流算法为例,4-bit 量化通常可将模型推理显存需求降至 bf16 的约 1/4,同时性能损失控制在较小范围内(具体损失因模型规模、任务和量化方案而异,公开资料多见 1-3% 以内的准确率波动)。
稀疏模型与有效参数量
MoE 架构是当前实现万亿级参数模型的核心技术路径。其核心思想是将 Transformer 中的部分前馈层(FFN)替换为多个并行的“专家”网络(通常每个专家的结构与原始 FFN 相同或类似),并通过一个可训练的路由器(Router/Gate)为每个 token 动态选择 1-2 个专家参与计算。
因此,总参数量可以极大(所有专家参数之和),但每次前向传播实际被激活的参数仅为:
- 所有共享层(注意力层、层归一化等)的参数
- 被选中的专家(通常 1-2 个)的参数
以 Mixtral 8×7B(Mistral AI,2023 年 12 月)为例,其总参数量约 46.7B,但每个 token 仅激活约 12.9B 参数。Switch Transformer(Google,2021)更极致地采用单专家激活策略(top-1 gating),万亿参数规模下仍能控制在合理计算量内。
MoE 并非没有代价:路由器训练需额外负载均衡损失(Load Balancing Loss)以避免专家坍塌,通信开销因 all-to-all 分发而增加,且在批量较小时可能出现专家利用率不均。
参数高效微调的原理与外延
针对已预训练好的大模型,参数高效微调(PEFT)通过仅训练极少量新增参数来实现任务适配,而不修改原有庞大的基座参数。主流方法包括:
- LoRA(Low-Rank Adaptation,微软,2021):在原始权重矩阵旁加入低秩分解矩阵 A×B,仅训练 A 和 B。以 d_model=4096、秩 r=16 为例,新增参数量约为 4096×16×2(注意:此处为示意量级,实际 LoRA 可作用于 Q、K、V、O 等多个投影矩阵;且部分实现仅作用于其中部分矩阵)= 约 13 万参数/目标矩阵,远小于原始模型的数亿至数十亿参数。使用 Adam 优化器,以 fp32 存储时,实际微调仅训练极少量部分,整体开销极低。
- Prefix-Tuning / Prompt-Tuning:在输入序列前添加可训练的连续向量(软提示),仅训练这些向量。
- Adapter:在 Transformer 层间插入小型的瓶颈结构(降维→激活→升维)。
PEFT 显著降低了微调的算力和存储需求,并有效避免了灾难性遗忘(Catastrophic Forgetting),使得大模型可被快速适配到垂直领域,是将大模型能力产业化的关键手段之一。
关键参数
核心衡量指标
| 指标名称 | 定义 | 单位/表述 | 典型应用场景 |
|---|---|---|---|
| 总参数量 | 模型完整规模 | M(百万)、B(十亿)、T(万亿) | 对比模型规模量级 |
| 激活参数量 | 单次前向实际计算的参数 | 同上 | 评估推理延迟与显存 |
| 参数效率 | 单位参数量产生的性能 | 下游任务得分/参数规模 | 架构设计评估 |
| 计算效率 | 单位 FLOP 的性能提升 | 同上 | 训练成本评估 |
| 训练显存系数 | 训练总显存 ÷ 参数存储 | 倍数(如 14×) | 硬件选型 |
| 压缩比 | 原始精度存储 ÷ 压缩后存储 | 倍数(如 2×, 4×) | 推理部署 |
各代际模型参数量参照(定性量级,基于公开资料)
- 2012 AlexNet:约 60M(CNN,5 个卷积层 + 3 个全连接层,NIPS 2012)
- 2018 BERT-Large:约 340M(Transformer 编码器,Google,24 层,d_model=1024)
- 2020 GPT-3:约 175B(稠密 Transformer 解码器,OpenAI,96 层,d_model=12288)
- 2022 Chinchilla:约 70B(稠密 Transformer,DeepMind,2022 年 3 月,强调“计算最优”)
- 2023 Llama 2 70B:约 70B(稠密 Transformer,Meta,2023 年 7 月)
- 2023 GPT-4:参数量未公开披露(OpenAI,2023 年 3 月,业内推测为 MoE 架构,总参数量约 1.8T,激活约 280B,此数据未获官方确认,出处系网络社区推测)
- 2023 Mixtral 8×7B:总参数量 46.7B,激活 12.9B(MoE,Mistral AI,2023 年 12 月)
- 2024 DeepSeek-V2:总参数量 236B,激活 21B(MoE,DeepSeek,2024 年 5 月技术报告)
- 2024 Llama 3.1 405B:约 405B(稠密 Transformer,Meta,2024 年 7 月)
上述数据表明,参数量在 2018-2022 年经历了爆发式增长,年均增长约 10 倍。2023 年后,MoE 架构普及使得总参数量与激活参数量出现显著分化,成为行业关注的焦点。
技术路线
路线一:极致稠密规模化(Dense Scaling)
持续增加 Transformer 层数 L、隐藏维度 d_model、前馈层中间维度 d_ff,构建同构的稠密模型。代表:GPT-3 (175B)、PaLM (540B)(Google,2022)、Llama 3.1 (405B)。
- 优势:架构简单,训练无需复杂的路由和负载均衡机制;前向传播行为完全可预测,延迟确定。
- 劣势:所有参数均在每次前向中激活,计算量与参数量呈线性增长;训练成本极高。以 540B 的 PaLM 为例,其训练使用了 6144 块 TPU v4(Google 披露,2022),单次训练成本估算高达数千万美元(基于云服务公开定价的业内推估)。
路线二:稀疏 MoE 规模化(Sparse MoE Scaling)
将部分 FFN 层用 MoE 层替换,总参数量指数级扩张,激活参数维持在相对低位。代表技术:GShard(Google,2020)、Switch Transformer(Google,2021,首次实现万亿参数)、Mixtral 系列(Mistral AI)、DeepSeek-V2/V3(DeepSeek)。
- 优势:同样推理预算下模型容量更大,同等性能下推理成本更低。DeepSeek-V2 宣称其训练成本仅约为同性能稠密模型的 1/5(DeepSeek-V2 技术报告,2024 年 5 月)。
- 劣势:路由训练引入额外复杂度(需处理专家负载不均、专家坍塌等问题);推理时需加载多个专家到显存(若全部加载则显存需求仍大,可采用专家卸载等技术);通信模式复杂(all-to-all 操作)。公开资料显示,MoE 模型在训练稳定性、超参数选择方面尚缺乏如稠密模型般成熟的工程经验积累。
路线三:计算最优边界(Compute-Optimal)
DeepMind 于 2022 年 3 月发布的 Chinchilla 论文(Hoffmann et al.)提出,在给定计算预算下,参数量与训练数据量应同等比例缩放,而非像先前那样偏向增加参数量。Chinchilla 70B 模型在 1.4T token 上训练,性能匹敌甚至超越参数量为其 4 倍的 Gopher (280B)。
- 影响:这一发现促使行业重新审视“参数堆砌”策略,部分团队转向“小模型+大数据”路线。Meta 的 Llama 2(2023 年 7 月)和 Llama 3(2024)系列均在相对适中的参数规模下(7B-70B / 8B-405B)使用远超同代模型的训练数据量(Llama 2 70B 在 2T token 上训练),可视为该理念的产业实践。
路线四:参数高效适配(PEFT-Driven Adaptation)
不追求基础模型参数量的增长,而是聚焦于如何将已有的超大模型以最低成本适配到下游任务。LoRA、QLoRA(Dettmers et al.,2023,4-bit 量化 + LoRA)等方法在开源社区广泛普及,使得单张消费级 GPU(如 RTX 3090/4090,24GB 显存)即可微调 65B 级别模型的部分适配器。
- 影响:这一路线显著降低了大模型的使用门槛,推动了“模型基座 + 轻量适配器”的生态模式,各垂直领域的适配器可快速训练和分发,而不需每次全量微调。
路线对比矩阵
| 维度 | 稠密规模化 | MoE 稀疏化 | 计算最优 | PEFT |
|---|---|---|---|---|
| 总参数量增长趋势 | 快速增长 | 快速增长(甚至更快) | 审慎增长 | 极低增长 |
| 激活参数量 | = 总参数量 | ≪ 总参数量 | = 总参数量 | 基座全部激活 |
| 推理成本走势 | 线性增长 | 亚线性增长 | 线性增长 | 接近基座,微增 |
| 训练复杂度 | 中 | 高 | 中 | 低 |
| 生态成熟度 | 高 | 中-高(快速发展) | 高 | 高 |
注:上述对比基于公开的模型架构理念与技术报告定性分析,具体实现因厂商而异。
上游
算力硬件:参数量增长的核心约束
大规模参数模型的训练和推理高度依赖高性能算力硬件,其关键瓶颈包括:
-
GPU/加速器:NVIDIA H100(2022 年发布,HBM3,显存 80GB)是当前千亿参数训练的主力。单卡 80GB 的显存结合 bf16 参数存储,仅能容纳 40B 参数的裸模型(40B×2=80GB),这意味着数百亿参数模型必须依赖张量并行(Tensor Parallelism)和流水线并行(Pipeline Parallelism)等多卡策略。NVIDIA 于 2024 年下半年推出的 B200 采用更大容量和带宽的 HBM3e,一定程度上缓解了显存瓶颈,具体产能和交付数据请以 NVIDIA 官方财报为准(FY2025 Q4 等)。公开资料未见 B200 对千亿参数模型训练效率提升的独立第三方实测数据。
-
HBM(高带宽内存):根据 SK 海力士官网(2023-2024 年)及行业分析机构 TrendForce(2024 年报告)数据,HBM 在 AI 加速器 BOM 成本中占比持续提升。HBM3e 的带宽可达 1TB/s 级别(SK 海力士产品规格页),是传统 GDDR 的数倍。三星、SK 海力士、美光均已宣布扩产 HBM,2024 年行业供给偏紧。TrendForce 2024 年 Q3 报告指出,2024 年全球 HBM 市场规模预计同比增长约 260%,主要受 AI 训练和推理需求驱动。具体产能和价格数据请以厂商最新财报及 TrendForce 更新为准。
-
网络互联:千卡以上集群训练对互联带宽要求极高。InfiniBand(NVIDIA Quantum 系列)和 RoCE(以太网 RDMA)是两大主流方案。参数同步、梯度聚合的通信量随并行规模递增,若互联带宽不足,GPU 将严重闲置等待(成为“停等”),使大规模训练的算力利用率大打折扣。
-
推理专用芯片:大参数量模型的低延迟、低成本推理需求催生了专门的推理芯片和 IP。例如 Groq 的 LPU(Language Processing Unit)采用 SRAM 存内计算架构,在 2024 年公开展示了接近瞬时的 LLM 推理延迟,但 SRAM 容量限制使得其更适用于参数量在一定规模以下的推理场景。国内外多家初创公司(如 d-Matrix、Graphcore、燧原科技、寒武纪等)均在布局推理侧芯片,具体性能参数请以各公司官方产品规格为准。
数据:参数量膨胀的必要条件
缩放定律指出,最优训练的 token 数应与模型参数量大致同比例增长。这意味着,训练一个 100B 参数的模型(在计算最优设定下),可能需要数万亿 token 的高质量训练数据。数据的可获取性、清洗成本、版权合规正成为参数量增长的隐形天花板。公开资料显示,截至 2024 年底,主流开源训练数据集的规模在数万亿 token 量级(如 CommonCrawl 子集、The Pile 等),而模型参数量已触达数百亿至数千亿,数据的增速正成为制约因素之一。
框架与分布式训练工具
PyTorch(Meta)、JAX(Google)是两大主流训练框架。分布式训练需要解决三大并行维度:
- 数据并行(Data Parallelism, DP)
- 张量并行(Tensor Parallelism, TP)
- 流水线并行(Pipeline Parallelism, PP)
此外,ZeRO(DeepSpeed,微软)通过将优化器状态、梯度和参数分片到各 GPU,极大降低单卡显存需求。Megatron-LM(NVIDIA)则是 TP 和 PP 的经典实现。2023-2024 年,FSDP(PyTorch)得到广泛采用,进一步降低了分布式训练框架的使用门槛。以上框架均为开源,具体性能曲线请以最新版本基准测试为准。
下游
基础模型服务(Model-as-a-Service, MaaS)
千亿级参数模型以 API 形式提供推理服务,是当前主流的商业分发模式。代表案例:
- OpenAI GPT-4 / GPT-4o 系列通过 Azure 和 OpenAI API 提供服务(2023-2024)
- Anthropic Claude 3 / 3.5 系列通过 AWS Bedrock 和自有 API 提供服务(2024)
- 国内:阿里百炼平台(通义系列)、百度千帆(文心系列)、字节火山引擎(豆包系列)、智谱开放平台(GLM 系列)等,均面向 B 端和 C 端提供调用服务
推理成本是 MaaS 商业模式的核心变量之一。MoE 架构、量化、推测解码(Speculative Decoding)等技术均可降低单位 Token 成本。以 DeepSeek-V2 为例,其 API 价格在 2024 年 5 月发布时定价为每百万 token 输入 1 元、输出 2 元(人民币),显著低于同期部分竞品,引发国内大模型 API 价格战。公开资料(各厂商官网定价页)显示,国内大模型 API 价格在 2024 年 H1 经历显著下行后趋于稳定。
端侧部署与模型压缩
大参数量模型的端侧(手机、PC、智能座舱等)部署面临严苛的存储和算力限制。技术路径包括:
- 量化:将参数精度降至 int4,使 7B 模型仅需约 3.5GB 显存/内存即可加载,可在高端手机和边缘设备上运行
- 蒸馏:用大模型(Teacher)指导小模型(Student)训练,保留推理能力的同时大幅压缩参数量
- 剪枝:移除冗余的参数或注意力头,降低实际计算量
高通、苹果、联发科等芯片厂商在 2024 年均已推出或预告支持端侧大模型推理的芯片(如高通第三代骁龙 8 内置的 AI Engine,苹果 A17 Pro 的 16 核 Neural Engine),但由于未检索到厂商官方公布的完整基准测试对比,此处不引具体性能数据。
行业应用与垂直适配
大参数量模型在以下垂直领域率先落地(基于公开合作公告和案例分享,未穷举):
- 金融:智能投研(报告摘要)、风控文本分析、合规知识问答。采用 PEFT 方式适配基座模型,以保护数据隐私。
- 医疗:医学文献检索、辅助诊断(影像+文本多模态)、病历结构化。强监管领域对模型可解释性要求高,激活参数量的分析有助于合规。
- 政务/法律:法规检索与解读、审判辅助、公文写作辅助。对准确性要求极高,RAG(检索增强生成)+ 大参数模型是主流方案。
- 教育:个性化学习内容生成、作文批改、编程辅导(如 GitHub Copilot、国内的通义灵码等)。
受益公司
以下列出与参数量相关的产业链主要玩家,依据公开财报、招股书、行业研报划分为基础设施层、模型层、工具与服务层、应用层,仅供产业格局梳理,不构成任何投资建议。
基础设施层(算力与云)
- NVIDIA(NVDA):据 FY2025 Q3(2024 年 11 月)财报,数据中心收入达 $30.8B(季度),同比增长 112%。其 H100/H200/B200 产品周期直接受益于大参数模型训练和推理的显存与算力需求增长。
- AMD(AMD):MI300X 系列在 2024 年开始出货,据 AMD Q3 2024 财报(2024 年 10 月),数据中心业务营收 $3.5B,同比增长 122%。公开资料可见 Meta、微软等为其公开客户。
- 云厂商:AWS(Amazon,2024 年 Q3 AWS 营收 $27.5B,YoY+19%,财报 2024 年 10 月)、Microsoft Azure(微软 FY2025 Q1 智能云收入 $24.1B,YoY+20%,2024 年 10 月)、Google Cloud(Alphabet Q3 2024 营收 $11.4B,YoY+35%,2024 年 10 月),均为大模型训练和推理的重要算力供给方。国内云厂商阿里云(阿里集团,据 2024 年 Q3 财报 AI 相关收入连续多个季度三位数同比增长,官方表述)、华为云、腾讯云也积极参与。
- HBM 供应商:SK 海力士(HBM 市场份额领先,据 TrendForce 2024 年数据)、三星电子、美光。2024 年 HBM 供不应求状态持续,具体出货量请以各公司财报为准。
模型层(基础模型厂商)
- OpenAI(非上市):据公开报道(如 The Information 2024 年报道),其年化收入在 2024 年超过 $3.5B(未获官方财务确认),主要来自 ChatGPT 订阅和 API。
- Anthropic(非上市):Claude 系列的主要厂商,2024 年获得包括亚马逊在内的多轮大额融资(公开报道合计超 $7B),估值据报超 $18B。
- Meta(META):Llama 开源系列的重要贡献者。据其 Q3 2024 财报,2024 全年资本开支指引上调至 $38-40B,其中 AI 基础设施为一大重点。
- Google DeepMind(Alphabet):Gemini 系列的开发方。
- 国内头部:智谱 AI(2024 年 12 月完成 B+轮融资,据公开报道总融资额已披露超 25 亿人民币)、月之暗面(Moonshot AI,2024 年完成多轮累计超 10 亿美元融资,公开报道)、Minimax、百川智能、零一万物等,均处于融资或商业化早期阶段。百度(文心)、阿里(通义)、字节(豆包)、腾讯(混元)等则作为平台型公司在模型层布局。
工具与服务层
- Hugging Face(非上市):开源模型库和工具链,2024 年据报完成新一轮融资(具体金额公开资料未见精确数字),月活开发者持续增长。
- Databricks:于 2023 年收购 MosaicML,将大模型训练工具集成至其数据平台中。据 2024 年公开信息,其年化收入超 $2.6B。
- 向量数据库与数据服务:Pinecone、Weaviate、Chroma 等服务于 RAG 模式,间接受益于大参数量模型对精确外部知识检索的需求。
应用层(受惠于大模型能力提升,难量化增量收益)
- Microsoft:通过 Copilot 系列将大模型集成至 Office、GitHub、Azure,据其 FY2025 Q1 财报,AI 相关转型进展为其商业云的快速增长动能之一。
- Adobe、Salesforce、ServiceNow 等企业级软件公司已发布 AI 功能。
- 国内金山办公、用友网络等亦在整合 AI 能力,具体收入贡献尚在早期,未在公开财报中单独拆分。
- 具身智能、AI PC、AI 手机等新终端领域受益公司尚不明确,商业化时间表待观察。
市场规模
本节基于第三方机构发布的市场研究数据,汇总与大参数量 AI 模型产业链相关的市场规模估计。请注意,不同机构的口径差异较大,需结合定义和边界阅读。
全球 AI 训练与推理算力市场
- AI 服务器:据 TrendForce 2024 年 7 月报告,2024 年全球 AI 服务器出货量预计同比增长约 40%,其中训练服务器增速趋缓,推理服务器增速更快。2024 年 AI 服务器占整体服务器市场比例预计超 12%(基于出货量)。
- 数据中心加速器:据 Omdia(2024 年 8 月),2024 年全球数据中心用 AI 加速器芯片市场规模约 $110B-$120B(推测值区间,以各芯片厂实际出货营收加总为基准)。NVIDIA 占据主导份额(据 Mercury Research 等,约 80-90%,详细份额数据需订阅)。
- AI 云服务(AI IaaS + AI PaaS):据 IDC 2024 年半年度全球 AI 支出指南预测,2024 年全球 AI 云服务市场(含训练和推理的公有云支出)约 $60B-$70B,2027 年预测可达约 $150B。
大模型 API 与应用市场
- 生成式 AI 市场整体:据 Bloomberg Intelligence 2024 年报告,全球生成式 AI 市场(含基础设施、模型与应用)在 2024 年规模约 $67B,预计 2032 年增长至 $1.3T,CAGR 约 42%。公开资料未提供细分至参数量维度的拆解。
- 国内大模型市场:据艾瑞咨询《2024 年中国 AI 大模型产业图谱》及赛迪顾问相关报告,2024 年中国大模型(含模型构建、MaaS、应用)市场规模估计在 200-300 亿人民币区间,预计 2026 年达 500 亿人民币以上(预测有不确定性)。具体数据请以最新报告为准。
模型压缩与优化工具市场
全球模型压缩(量化、剪枝、蒸馏)及推理优化工具的市场规模缺乏独立的权威统计。据 ABI Research 2024 年分析,可纳入边缘 AI 软件和工具市场的估算,该市场 2024 年约 $5B,2028 年预测约 $14B(定义宽泛,不仅限于大模型压缩,含传统模型优化工具)。
声明:上述数字引自公开可用的第三方机构报告摘要,未获原始全文验证。市场预测存在较大不确定性,受宏观经济、技术进步、政策等多重因素影响,不构成对未来表现的保证。
玩家对比
全球主要基础模型参数量与架构概览(截至 2024 年底)
| 模型 | 开发方 | 总参数量 | 激活参数量 | 架构 | 训练数据量 | 公布时间 |
|---|---|---|---|---|---|---|
| GPT-4 | OpenAI | 未披露(业内推测约 1.8T) | 未披露(业内推测约 280B) | MoE(业内推测) | 未披露 | 2023.03 |
| GPT-4o | OpenAI | 未披露 | 未披露 | 未披露 | 未披露 | 2024.05 |
| Gemini Ultra | Google DeepMind | 未披露 | 未披露 | 未披露(业内推测含 MoE 元素) | 未披露 | 2024.02 |
| Claude 3.5 Sonnet | Anthropic | 未披露 | 未披露 | 未披露 | 未披露 | 2024.06 |
| Llama 3.1 405B | Meta | 405B | 405B | 稠密 Transformer | 15T+ tokens | 2024.07 |
| Mixtral 8×22B | Mistral AI | 141B | 39B | MoE | 未公开 | 2024.04 |
| DeepSeek-V3 | DeepSeek | 671B | 37B(据技术报告,每 token 激活参数) | MoE(256 专家) | 14.8T tokens | 2024.12 |
| Qwen 2.5 72B | 阿里通义 | 72B | 72B | 稠密 Transformer | 18T tokens(阿里官方披露) | 2024.09 |
| 文心一言 4.0 | 百度 | 未披露 | 未披露 | 未披露 | 未披露 | 2023.10 |
| GLM-4 | 智谱 AI | 未披露(开源版 9B,闭源版未披露) | 未披露 | 未披露 | 未披露 | 2024.01 |
| 豆包大模型 | 字节跳动 | 未披露 | 未披露 | 未披露 | 未披露 | 2024.05 |
对比维度分析
- 透明度:Meta、DeepSeek、阿里、Mistral AI 等在 2024 年披露了较为具体的参数量、数据和架构信息,体现技术自信和开源策略。OpenAI、Google DeepMind、Anthropic 等出于竞争考量选择了更高的保密级别。
- 活化比(激活/总参数量):在已知具体数字的 MoE 模型中,DeepSeek-V3 展现出极低的活化比(约 5.5%),Mixtral 8×22B 约为 27.7%,体现了效率优先的设计取向。
- 训练数据规模:Meta Llama 3.1 405B 使用 15T+ tokens,阿里 Qwen 2.5 72B 使用 18T tokens,DeepSeek-V3 使用 14.8T tokens,均体现了“计算最优”思想对数据量的侧重。
- 开源/闭源分化:Meta、Mistral AI、DeepSeek、阿里(部分规模)采用开源策略,OpenAI、Anthropic、Google、百度(主力模型)采用闭源或有限开放策略。开源模型参数量在 2024 年达到 405B(Llama 3.1),2025 年或可进一步追近闭源头部水平(此句系趋势描述,不作为预测)。
注:上表中“未披露”多涉及商业机密。业内推测数据来自网络社区和第三方分析,未经官方确认,仅供定性参考。
风险
技术风险
- 缩放回报递减:Scaling Laws 暗示性能增长呈幂律而非线性,进一步增加参数量所需的算力和数据成本指数级攀升,而性能增量递减。当边际成本远超边际收益时,单纯追求参数量的商业模式将面临严峻挑战。公开资料未见明确的最佳规模理论上限。
- 训练不稳定性:超大参数模型的训练过程中,损失尖峰(Loss Spike)、梯度爆炸/消失、专家坍塌(MoE 特有问题)等稳定性风险加剧。一次训练失败的经济损失可达千万美元级别,构成显著的研发风险。
- 推理延迟与吞吐量瓶颈:即使经过 MoE 和量化等优化,大参数量模型的首 token 延迟和生成吞吐量仍逊于同性能的小模型,在实时交互场景中的用户体验可能不达预期。Transformer 架构的进一步演进(如 Mamba、RWKV 等状态空间模型,Linear Attention 等线性注意力机制)可能从根本上改变参数效率与推理速度的方程式,从而降低既有稠密或 MoE Transformer 路线的竞争优势。
市场与财务风险
- 开源冲击闭源:2024 年 Llama 3 系列的迭代速度和 DeepSeek-V3 的性能表现,显著缩小了开源模型与闭源模型的性能差距。开源模型可通过社区贡献、PEFT 适配器等方式快速覆盖长尾场景,压缩闭源 API 的溢价空间。此举可能对依赖 API 订阅收入的闭源模型厂商的营收预期构成压力,但压力的量化和时间点存在高度不确定性。
- 资本开支回报不确定性:全球 AI 基础设施资本开支在 2024-2025 年达数千亿美元量级(基于主要云厂商及 Meta 等资本开支指引加总估算),而下游应用的付费意愿和付费规模尚未完全匹配。若 2-3 年内 C 端和 B 端的货币化速度慢于预期,可能引发资本收紧,对依赖融资的模型层初创公司构成生存压力。
- API 定价恶性竞争:2024 年 H1 国内大模型 API 价格的急剧下降已拉开产业竞争序幕。以极低价格甚至免费策略换取市场份额的做法,可能在短期内压缩全行业利润空间,使中小厂商难以建立可持续的商业模式。
监管与地缘政治风险
- 算力出口管制:美国对华先进 GPU 出口管制(2022 年 10 月、2023 年 10 月、2024 年多次规则更新)限制了中国部分机构获取最高性能训练芯片的渠道,可能制约国内千亿以上稠密参数模型的训练效率和成本竞争力。具体影响程度难以量化。
- 数据隐私与版权:大规模训练数据的采集、清洗和使用涉及越来越严格的隐私法规(如 GDPR、中国《个人信息保护法》)和版权争议(如纽约时报诉 OpenAI,2024 年正在审理)。未来立法或判例可能增加数据获取成本或限制使用方式,间接抬高参数规模扩张的门槛。
- 能源与环境审批:超大规模智算中心(GW 级别)的电力消耗和碳排放受到社会关注,部分地区已收紧审批政策(如部分国家/地区对新建数据中心的能源效率和选址有更严要求,公开新闻报道)。环境合规成本可能成为大参数量训练规模的隐性约束。
误读纠偏
误读 1:“参数量越大,模型效果一定越好。” 纠偏:参数量只是模型容量的一维。数据质量和多样性、训练策略(如课程学习)、推理时的计算预算(如 Chain-of-Thought 推理深度)同样关键。过度参数化但数据不足会导致过拟合或欠训练(Undertraining)。Hoffmann et al. (2022) 已证实,给定固定计算预算,存在最优的参数量-数据配比,偏离该配比的“超大参数模型”效果反而不及计算最优的较小模型(如 Chinchilla 70B vs Gopher 280B)。
误读 2:“MoE 模型的激活参数量等于总参数量除以专家数。” 纠偏:MoE 模型通常包含共享的注意力层、路由层和非专家的前馈层;只有被替换的那部分前馈层采用“专家”形式。激活参数量 = 所有共享层参数(注意力、层归一化、非 MoE 的 FFN 等) + 被选中的少数几个专家的参数。若专家网络宽度与原始 FFN 相仿,激活参数量大致等于共享基座加 1~2 个专家的参数,这一数值远小于总参数量,绝不是简单的除法关系。Mixtral 8×7B 的活化比为 12.9/46.7≈27.6%,DeepSeek-V3 的活化比为 37/671≈5.5%,充分说明了这一点。
误读 3:“参数量直接等于模型文件大小(字节数)。” 纠偏:模型文件大小 = 参数量 × 每个参数的表示字节数 + 配置文件等元信息。若使用 bfloat16 存储,即为参数量 × 2 字节;使用 int8 量化,则为参数量 × 1 字节;使用 int4 量化,约为参数量 × 0.5 字节。因此,同样参数量下文件大小可差 2-4 倍或更多。此外,多种压缩技术(如 GGUF、AWQ、EXL2 格式)可进一步压缩,使得“参数量→文件大小”的换算不是定值。
误读 4:“用 GPU 显存除以参数量×2,就知道能否跑起来。” 纠偏:推理时的显存占用除参数外,还包括 KV Cache(随序列长度和批量大小线性增长)、中间激活缓冲区、框架开销等。实际所需显存可能 1.5-3 倍于裸参数存储。对于长上下文场景,KV Cache 可能占用与参数相当甚至更大的显存。精算显存占用需考虑上下文长度、batch size、并行策略等,不可仅凭参数量简单除法。
误读 5:“训练好的大模型参数是固定不变的,可以直接用于所有任务。” 纠偏:预训练参数捕获的是通用知识和能力,但在特定垂直领域、时效性强的信息、需要特定格式输出的任务上,往往需要微调(全量或 PEFT)、RAG 或提示工程等进一步适配手段。参数是能力的基础而非全部,部署中的持续价值捕获取决于围绕参数的完整流水线工程。
最新事件
以下为截至 2024 年底至 2025 年初与参数量及模型规模相关的代表性事件,按时间倒序排列,来源为公开科技媒体报道及官方公告(具体出处和报道详情请直接检索相关关键词):
-
DeepSeek-V3 发布(2024 年 12 月末):深度求索发布 DeepSeek-V3,总参数量 671B,激活参数量 37B(MoE,256 专家),据其公开技术报告,训练总成本约 $5.6M(仅计算租用 GPU 费用,不含人力及其他成本)。这一成本数字远低于业界对同等性能模型(如 Llama 3.1 405B 或 GPT-4 类)的预期训练成本,引发广泛讨论。同日 DeepSeek 开源了模型权重。
-
Llama 3.1 405B 发布(2024 年 7 月):Meta 发布 Llama 3.1 系列,最大版本 405B 参数,使用超 15T tokens 训练,Meta 称其为“首个公开可用的前沿级开源模型”。同时发布了 Llama Stack 标准化工具链。
-
OpenAI o1/o3 系列引入推理时扩展(2024 年 9-12 月):OpenAI 先后发布 o1-preview(9 月)、o1 正式版(12 月)及 o3 预告(12 月),引入“推理时计算扩展”(Test-Time Compute Scaling),通过链式思维强化推理性能。其参数量未披露