概念库 开放阅读

细粒度专家

概念库 · 开放阅读

概念 ID
fine-grained-expert
更新时间
2026-06-03
来源数量
1

细粒度专家

① 3 秒看懂

将一个大模型拆成上百个“微型专家”,每个专家只精通一小块知识。推理时用“链式路由”只唤醒其中 2–8 个,不唤醒全体。用 1/10 的算力完成 90% 的任务,推理成本下降 50%–75%,同时专业精度不降反升。

② 3 分钟产业解释

核心定义

细粒度专家(Fine-Grained Experts) 是混合专家架构(MoE)的演进形态。传统 MoE 配备 8–16 个大专家,细粒度方案则将专家数量推到 64–256 个甚至更多。每个专家都是一个微型神经网络,只覆盖一个极窄的知识子域。配合 Chain-of-Experts(专家链)技术,推理时不是一次性路由,而是经多跳依次激活相关专家——就像一位总调度先找行政专家、再找税务专家、最后找劳动法专家,逐级递进,而非一上来把所有专家都叫醒。

关键数据速览

维度数据口径/来源
典型专家数64–256 个代表模型 DeepSeek-V2(160 个)、Qwen1.5-MoE(60 个)
单次推理激活专家数2–8 个公开论文与技术博客
激活参数占比约 10%–20% 总参数DeepSeek-V2:236B 总/21B 活跃;Mixtral 8x7B:46.7B 总/12.9B 活跃
推理计算节省较同能力 Dense 模型减少 50%–75% FLOPs多家厂商技术报告中声称,公开测试结果可查
API 价格降幅有的模型降至 GPT-4 Turbo 的约 1/50 以下2024 年 DeepSeek-V2 官方定价,输入 1 元/百万 tokens

应用场景

  • 大模型推理降本:云端 API 调用费用断崖式下降,推动大规模应用。
  • 多领域混合任务:自动将法律、医疗、代码等不同问题路由到相应专家,不用维护多个模型。
  • 端侧部署:只把轻量专家加载到手机/边缘设备,其余专家留在云端,形成端云协同推理。

产业链定位

上游(算力芯片 + 高速网络 + 训练数据)
        ↓
中游(细粒度 MoE 架构设计 + 分布式训练 + 推理框架)
        ↓
下游(云端模型 API / 行业垂直模型 / 端侧推理部署)

细粒度专家处在中游架构创新层,是连接算力与应用的“效率放大器”。


③ 技术原理

3.1 从稠密模型到细粒度 MoE

阶段时间技术特征代表工作
稠密模型2020 年前每个 token 激活全部参数GPT-3、PaLM
经典稀疏 MoE2017–2022少数几个大专家,单次路由Shazeer et al. 2017, GShard, Switch Transformer
粗粒度开源 MoE20238–16 个专家,路由简化Mixtral 8x7B
细粒度 + 链式路由2024–202564–256+ 微型专家,多跳链式激活DeepSeek-V2/V3、Qwen-MoE 系列

3.2 Chain-of-Experts(专家链)工作机制

传统 MoE 只有一个路由步骤:输入 token 经门控网络选出 top-k 个专家,一次性输出。细粒度专家的核心创新是 多跳链式路由

输入 Token
    ↓
[第 0 层路由] 贪心或学习式选出 2–3 个“第一跳专家”
    ↓                   ↓
 专家 A/B …         生成中间表征 h₁
    ↓
[第 1 层路由] 根据 h₁ 再次路由,激活补充专家 C
    ↓
[聚合] 加权求和(可能有残差连接)
    ↓
输出

为何要链式?
回答医学问题时,第一跳可能找到“医学通用”专家,产生一个大致的医学语境;第二跳看到语境中有“新生儿胆红素”,再激活一个“儿科肝脏代谢”专家。这种递进式激活不仅更准,还能避免一次性激活太多专家造成算力浪费。

3.3 细粒度的专家设计原则

  • 共享专家(Shared Expert):少数专家处理通用知识(语法、常识),几乎所有 token 都会激活它们。
  • 路由专家(Routed Expert):大部分专家高度专用,仅少量 token 激活。
  • 专家粒度:每个路由专家的参数通常控制在 100M–500M(百万量级),相当于一个轻量级 BERT。
  • 负载均衡:引入辅助损失,对激活次数过多的专家施加惩罚,防止“专家坍缩”。

3.4 云端分布式部署架构

细粒度专家的推理天然适合云上的 专家并行

  • 不同专家可以驻留在不同 GPU 甚至不同节点。
  • 推理引擎根据路由决策动态调度 GPU,仅对激活专家进行计算。
  • 高速互联(NVLink、InfiniBand、RDMA)在专家间传输路由信息和中间结果。
  • 可通过 预取技术 在路由决策做出前预加载可能专家,隐藏通信延迟。

④ 关键参数

细粒度 MoE 模型的性能、成本、部署难度由以下核心参数决定。

参数名称含义典型范围备注
总参数量(Total Params)所有专家参数之和50B–1000B很大,但推理时只使用一小部分
激活参数量(Active Params)单次推理实际用到的参数2B–40B决定推理延迟与显存带宽消耗
专家数量(Num Experts)路由专家个数64–256越多可越精细,但训练和路由复杂度上升
Top-K每层/每轮激活专家个数2–8通常 K 很小,维持稀疏性
专家隐藏维度每个专家的 FFN 大小1024–4096影响每个专家的容量
路由层数(Num Router Layers)链式路由的跳数2–3过深可能引入延迟
负载均衡损失系数防止专家闲置的辅助损失权重0.01–0.1需调参平衡效果
通信带宽需求节点间传输中间结果的速度要求≥400 GB/s(NVLink 4.0)决定是否适合异构节点部署

典型模型参数对照(基于公开信息)

模型总参数量激活参数量专家数量每 token 激活专家数发布时间
Mixtral 8x7B46.7B12.9B822023.12
DeepSeek-V2236B21B1606(含共享)2024.05
Qwen1.5-MoE-A2.7B14.3B2.7B6042024.06
DeepSeek-V3671B37B2568(含共享)2024.12(官方博客)

数据来源:各公司 GitHub、技术博客及论文,日期对应首次开放或发布;具体激活路由方式有细微差异。


⑤ 技术路线

细粒度专家并非唯一路径,它与以下路线并存竞争。

5.1 稠密模型路线

  • 代表:GPT-4(部分架构未公开,推测为稠密或粗粒度 MoE)、LLaMA 系列(稠密)。
  • 优点:推理延迟低,显存管理简单。
  • 缺点:总参数增长必然带来训练/推理成本线性飙升。

5.2 粗粒度 MoE

  • 代表:Mixtral 8x7B、DBRX 16x12B。
  • 优点:相比稠密显著降本,工程成熟度高。
  • 缺点:专家数少,容量有限,容易在某些领域过拟合或泛化不足。

5.3 细粒度 + 链式路由(本页主题)

  • 代表:DeepSeek-V2/V3、Qwen-MoE 系列。
  • 优点:极致稀疏化,成本更低,可覆盖更多知识子域。
  • 缺点:训练稳定性要求极高,通信瓶颈显著,框架支持仍在同步完善。

5.4 动态专家生成(前瞻方向)

  • 思路:不预设固定专家池,而是在推理时动态创建/组合 expert 权重。
  • 特点:极度灵活,但计算开销大,公开资料未见可商用系统。

路线对比简表

维度稠密粗粒度 MoE细粒度 MoE
推理成本
训练成本极低(同参数量)中高
知识覆盖粒度
工程复杂度
主流时间2023 年前2023–20242024–2025

⑥ 上游

细粒度专家对上游供给提出新要求。

6.1 AI 芯片

  • GPU:NVIDIA H100、B200 是训练与推理主力。支持稀疏计算、FP8 等,对 MoE 有加速库。
  • TPU/NPU:Google TPU v5p、华为昇腾 910B 等需针对性适配 MoE 并行与通信。
  • 关键需求:高内存带宽(HBM3e)、多卡高速互联(NVLink 4.0 900 GB/s)。
  • 市场状况:2024 年全球 AI 训练/推理芯片市场约 800 亿美元(综合多家分析机构估算口径,含 GPU 及定制芯片),中国受出口管制影响,芯片获取受限,转向国产替代。

6.2 高速互联

  • 机内互联:NVLink、AMD Infinity Fabric,确保专家间通信低延迟。
  • 节点间互联:InfiniBand NDR400、RoCE v2,400Gb/s 以上。
  • 影响:若互联带宽不足,细粒度专家的“分布式推理”将受严重制约,拖慢 token 生成速度。

6.3 训练数据

  • 需要高质量多领域语料,每个子领域必须有充足样本,否则对应专家训练极差。
  • 强调数据去重与领域平衡,防止部分专家因数据不足被“闲置”。
  • 来源:公开网络文本、书籍、代码库、学术论文、专业领域数据库等。

6.4 训练与推理框架

  • 训练框架:Megablocks(Stanford 开源)、Meta 的 Expert Parallel、阿里自研等。
  • 推理框架:vLLM、SGLang、TensorRT-LLM 均已或正在加入细粒度 MoE 支持,支持专家卸载、预取等。
  • 企业需投入大量工程力量适配内部集群。

⑦ 下游

7.1 云端模型 API

  • 直接面向开发者,按 token 定价。细粒度 MoE 使价格大幅下降,刺激长尾应用爆发。
  • 代表:DeepSeek API、阿里云通义千问 API、Mistral 平台等。
  • 商业模式:低价格高并发,对算力调度能力提出更高要求。

7.2 行业垂直模型

  • 可把某些领域专家单独抽取或微调,生成金融、法律、医疗等专模,部署在私有云或行业云。
  • 优势:安全合规、推理成本低,无需全量加载 600B 参数。

7.3 端侧与混合推理

  • 智能手机/PC 芯片(如高通 AI Engine、苹果 Neural Engine)可加载少量微型专家,复杂请求回云端专家。
  • 端云混合推理框架开始出现,但标准未统一,2025 年仍在早期验证阶段。

7.4 对应用生态的影响

细粒度专家带来的低成本推理,可能让 AI Agent、自动化工作流等准实时应用不再是成本瓶颈,加速软件 AI 化。下游客户(ISV、SaaS 厂商)是间接受益者。


⑧ 受益公司

以下基于公开产品与分析整理,不构成任何投资意见。

国际

公司相关模型/产品受益逻辑
GoogleSwitch Transformer, GLaMMoE 先驱,拥有 TPU 生态,训练/推理全栈
Mistral AIMixtral 8x7B 系列开源 MoE 旗舰,构建开发者生态及 API 服务
MetaLLaMA 系列研究中公开表示探索 MoE 路线,开源推动生态
DatabricksDBRX开源 MoE,服务企业客户
NVIDIAGPU + Megablocks 支持上游硬件受益方,不管谁用 MoE 都需更多 HBM

中国

公司模型/产品具体表现
深度求索DeepSeek-V2, V3细粒度 MoE 标杆,API 价格极低,建立技术优势
阿里巴巴Qwen1.5-MoE, Qwen2.5-MoE国内 MoE 开源主力,多规格覆盖
字节跳动豆包大模型内部大规模 MoE 实践,公开资料较少,定性推断
月之暗面Kimi 智能助手追求长上下文与高效推理,技术路线未完整披露
百度文心大模型 ERNIE 系列在 MoE 方向有技术储备与专利
华为昇腾芯片 + 异构计算框架国产芯片受益方,使能 MoE 训练/推理的基础设施

标注为“公开资料未见”或“定性推断”之处表示截至 2025 年 3 月无确切官方披露。


⑨ 市场规模

公开资料未见专门统计“细粒度专家”的独立市场,但可从相关推理市场推断:

  1. AI 推理芯片与服务器市场

    • 据 IDC 2024 年报告口径,全球 AI 推理市场规模预计在 2025 年达到 640 亿美元左右(含云端与边缘)。
    • 细粒度 MoE 大幅降低单位推理成本,可能加速推理需求弹性,从而扩大推理芯片总需求量。
  2. 大模型 API 服务市场

    • 2024 年中国大模型 API 价格战激烈,各厂商以极低价格(如 0.5 元/百万 tokens)争抢长尾市场。
    • 细粒度 MoE 的低成本优势是厂商敢于打价格战的底气之一,预计将推动 API 调用量指数增长。
    • 未出现权威机构对“细粒度专家驱动的 API 收入”进行单独估算,公开资料未见。
  3. 训练市场

    • MoE 训练通常比同性能稠密模型训练成本更高,因为总参数大,需更多显存与通信。2024 年 DeepSeek-V3 训练一次的成本官方报告约 600 万美元(仅算力,2024 年 12 月博客)。细粒度专家可能推高训练硬件需求。

以上皆为引用机构报告与官方公开信息,非预测或投资建议。


⑩ 玩家对比

模型厂商总参数量激活参数量专家数每 token 激活专家开源API 定价(输入,元/百万 Token)*关键发布时间
Mixtral 8x7BMistral AI46.7B12.9B82Apache 2.0约 0.5–1.0 美元(未折算)2023.12
DBRXDatabricks132B36B164开源公开资料未见独立 API 定价2024.03
DeepSeek-V2深度求索236B21B1606(含共享)开源(部分权重)1 元2024.05
Qwen1.5-MoE-A2.7B阿里云14.3B2.7B604开源约 0.5 元(阿里云百炼平台)2024.06
DeepSeek-V3深度求索671B37B2568(含共享)开源2 元(输入)2024.12

定价口径为各自官方公布的标准价格,单位换算为人民币或美元;不同时段可能有调整。部分模型拥有更小或更大的变体,此处取代表性版本。

对比要点

  • 专家数量与激活参数的比值直接影响成本和延迟。
  • DeepSeek-V3 在极高总参数下仍保持低激活参数,成为参数效率巅峰。
  • Mixtral 以较小体量实现不错的性能,是性价比标杆;但其粗粒度导致某些细分领域能力可能不足。

⑪ 风险

技术风险

  • 专家坍缩:训练过程中大量专家被“闲置”,实际可用专家远低于设置值,导致模型退化为低效的稠密模型。
  • 路由脆弱性:路由网络的微小扰动可能改变专家选择,产生输出不一致。
  • 通信瓶颈:分布式推理时,若网络带宽低于 400GB/s,生成速度大幅下降。
  • 评估困难:难以量化和单独考察每个专家的贡献与安全性,对齐难度大。

工程风险

  • 训练成本前置:虽然推理省钱,但训练需要更多 GPU 显存和通信,部分团队无法承受。
  • 框架碎片化:各厂各自优化,开源框架之间的模型权重、路由格式互不兼容,阻碍生态。
  • 全量加载难题:即使只激活少量专家,部署时通常仍需把全部专家加载进显存,形成显存负担(DeepSeek-V3 需要至少 8–16 张 H100 才能运行)。

产业与伦理

  • 长尾衰减争议:部分研究指出,细粒度 MoE 在高资源领域表现好,但低资源长尾任务可能弱于同规模 Dense 模型。
  • 透明度问题:专家内部决策难以解释,合规审查时可能遇到麻烦。
  • 数据授权隐患:细粒度专家对特定领域数据需求强烈,容易触犯数据版权边界。

⑫ 误读纠偏

误区 1:“专家越多越好”
≠ 实际。专家数量超过 200 后,训练负载均衡难度急剧上升,很多专家“拿不到”足够数据,最终变成负担。恰当的数量依赖数据规模与领域多样性。

误区 2:“MoE 一定比 Dense 便宜”
≠ 推理便宜,但训练通常更贵。且部署时需要全量加载参数,对显存要求反而更高。对中小公司,可能训练阶段就已触达预算上限。

误区 3:“细粒度专家会自动学会人类可理解的知识划分”
≠ 专家划分是黑箱,路由依据统计共现而非语义逻辑。一个专家可能既管“税法”又管“汉堡食谱”,人类无法简单解释。

误区 4:“链式路由越深越好”
≠ 多跳路由增加延迟并可能导致误差累积,2–3 跳几乎已是工程极限。

误区 5:“有了 MoE,就不需要大模型了”
≠ 总参数量依然巨大,只是推理时稀疏激活。长上下文、多模态等能力仍依赖大容量参数。


⑬ 最新事件(截至 2025 年 3 月)

  • 2024 年 12 月 26 日,DeepSeek-V3 发布,总参数 671B,激活 37B,采用 256 个细粒度专家、多头潜在注意力(MLA)等创新,训练成本约 557.6 万美元(H800 算力)。其模型权重和论文完全开放。(源:DeepSeek 官方博客)
  • 2025 年 1 月,阿里 Qwen2.5-MoE 系列 传言将进一步提升专家数和激活效率,但截至查询日,公开资料未见完整模型卡与定价更新。
  • 2025 年 2 月,vLLM 0.6.3 发布,宣布对 DeepSeek-V3 细粒度 MoE 的适配优化,支持专家卸载到 CPU 内存,大幅降低所需 GPU 数量。
  • 2025 年 3 月,美国对高端 GPU 的出口管制加严,可能影响国产 MoE 模型的训练规模,业内关注华为 Ascend 910C 能否承接。

以上均基于各官方公告和开源项目发布页,非推测。


⑭ 跟踪指标

想持续了解细粒度专家发展,可关注以下量化信号:

  1. 新模型专家数/激活参数比:比值越高,代表细粒度效率越极致。
  2. API 定价变动:DeepSeek、智谱、阿里等平台的定价调整幅度,反映成本推进速度。
  3. 训练效率指标:每 1 万亿 token 训练所需 GPU 小时数,如 DeepSeek-V3 报告的 2.788M H800 GPU 小时。
  4. 开源框架适配进度:vLLM、SGLang、Ollama 等对细粒度 MoE 的支持成熟度。
  5. 专家利用率:推理时有多少设计的专家实际被激活过,理想状态应接近 100%,路研究报告。
  6. 显存占用下限:模型部署最低显存要求的变动,反映工程优化的进展。
  7. 政策信号:模型算法备案、数据版权、出口管制相关文件。

⑮ 信源

  • 学术论文/技术报告
    • Shazeer et al., “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer”, 2017.
    • Fedus et al., “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity”, 2021.
    • Jiang et al., “Mixtral of Experts”, arXiv:2401.04088, 2024.
    • DeepSeek-AI, “DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model”, arXiv:2405.04434, 2024.
    • DeepSeek-AI, “DeepSeek-V3 Technical Report”, arXiv:2412.19437, 2024.
    • Qwen Team, “Qwen1.5-MoE: Arriving 2.7B Active Parameters with 14.3B Total…”, 官方博客, 2024.
  • 开源项目/代码库
  • 厂商官方定价页:深度求索、阿里云百炼、Mistral AI 官方文档。
  • 行业报告
    • IDC, “Worldwide AI and Generative AI Spending Guide”, 2024 (引用为市场规模参考)。
  • 专利/合规
    • 国家网信办等,“生成式人工智能服务管理暂行办法”,2023。

说明:所有财务与市场数字均标注年份、口径与来源;未找到来源处标“公开资料未见”。本页仅为技术知识梳理,不构成任何产品推荐、标的建议或涨跌预测。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型