模型层 开放阅读

模型路由

Model Routing

概念 ID
model-routing
更新时间
2026-05-29
来源数量
待补

模型路由

3秒看懂

模型路由是决定“由哪个模型/模块处理当前输入”的智能分发机制。它既存在于单一模型内部(混合专家模型MoE中,路由器将每个词元分配到最合适的“专家”子网络),也贯穿于多模型服务系统(根据请求的难度、类型或成本,将其导向不同规格或不同领域的模型)。其核心目标是以更低的计算成本换来更大的模型容量或更好的服务质量。

3分钟产业解释

想象一个巨型图书馆:前台会根据读者的问题,自动将其引导到文学、科技或法律分馆,而不是让读者在整栋楼里乱找。模型路由就是AI世界里的这位“前台”——它快速阅读你的输入(一段文本、一张图或一个任务描述),实时判断该由庞大模型中的哪几个“专家”来处理,或在部署的众多微调模型中选择最合适的一个。

这一概念在产业中分为两条并行的主线:

  1. 模型内部路由(MoE路由):大语言模型(如Mistral的Mixtral、Databricks的DBRX,以及据传的GPT-4)内部不再是密不透风的单一网络,而是包含数十甚至数百个小“专家”网络。每次计算只激活其中极小一部分,总参数量可达数万亿,但实际激活参数只有数百亿,极大节约了训练和推理的算力。
  2. 模型服务路由(请求路由):当企业同时部署一个超大通用模型、一个擅长数学的模型、几个专用于文本摘要或情感的轻量模型时,一个智能路由器作为入口,根据查询意图和难度,自动选择性价比最高的模型来处理,甚至可以在多个模型间级联或投票,平衡延迟、成本和准确性。

产业界正快速拥抱这两种路由技术:前者是攀登模型能力高峰的阶梯,后者是让大模型落地的精算师。它们共同改写了“大模型越强越贵”的旧剧本。

15分钟专家深入

概念的双层内核

模型路由在技术上指代两个截然不同却可组合使用的机制:

A. 模型内路由:稀疏混合专家(MoE)的门控网络 在Transformer架构中,传统的前馈网络(FFN)层被替换为一个专家集合 {E_1, E_2, ..., E_N} 和一个门控路由网络 G。对于输入的每个词元(token)表示 x,路由器计算选择概率并激活最相关的Top-k个专家:

y = sum_{i=1}^{N} (G(x)_i * E_i(x)),其中 G(x)_i 不为0仅当i属于Top-k

这门“路由”完全是离散的、动态的,每一个词元、每一层都重新决策,实现了条件计算(conditional computation)。

B. 模型间路由:多模型请求调度器 在AI服务平台(如模型即服务MaaS)中,同一个API端点背后可能连接着不同尺寸的通用LLM、垂直领域精调模型、量化版本甚至缓存。一个路由器(通常是一个小型快速的语言模型或嵌入匹配器)分析提示词,并依据规则、成本预算或强化学习策略,将请求转发到最合适的执行器。这可以是1:1的确定路由,也可以是多个模型竞标结果(如奖励模型打分),最终返回最佳答案。

为什么需要路由?

稠密模型的参数量与计算量呈严格线性关系——要获得更强能力,必须同步等比例增加每次推理的FLOPs。路由打破了这一刚性约束:在MoE中,每词元激活的参数量仅为总参数的1/5甚至1/10,这使万亿参数模型的理论推理成本与千亿稠密模型相当。而在多模型服务中,相较于所有请求都冲向昂贵的大模型,路由可以用不到十分之一的成本处理80%的简单请求,将稀缺的高端GPU留给人机对话、复杂推理等硬核场景。

路由机制的分类学

  • 按对象:词元级路由(MoE的标准粒度,每个token独立路由)、句子级/请求级路由(整个序列选择同一个专家)、任务级路由(预先按任务分配模块)。
  • 按决策方式
    • 基于规则:预定义关键词映射(如“翻译”请求发送至翻译模型),实现简单,但泛化弱。
    • 基于内容嵌入:将请求编码为向量,与各候选模型的描述向量计算相似度,类似检索。
    • 基于学习的门控:MoE路由器本身就是一个可训练的线性层加上Softmax,其参数与专家网络联合优化,通过梯度下降学习如何分配。
    • 基于强化学习:将路由决策视为一个动作,以最终答案的质量或推理效率作为奖励,训练一个策略网络在多个模型间动态选择,常用于多模型路由,可面对未知分布自适应调优。
  • 按拓扑:树形路由(多层路由器,逐级细化选择)、扁平Top-k路由(所有专家平等竞争)、哈希路由(通过固定的哈希函数分配,避免通信开销但牺牲灵活性)。

技术原理

混合专家路由的数学与机制

标准门控路由

一个MoE层的核心计算如下(以Transformer FFN层为例):

  1. 输入隐藏状态 x ∈ ℝ^{d_model} 对于每个token。
  2. 门控网络:logits = W_g · xW_g∈ℝ^{d_model×N}),产生N个专家的对数几率。
  3. 门控值:g = Softmax(TopK(logits, k)),其中TopK操作将非Top-k的logits置为-∞,使得其softmax值为0。通常k=1或2,仅激活极少数专家。
  4. 专家输出:被激活的专家E_i接收x并产生输出E_i(x)
  5. 加权组合:y = Σ g_i * E_i(x)。因为极少的g_i非零,计算量约为稠密FFN的k/N。

负载均衡:容量因子与辅助损失

直接训练上述Top-k路由会导致“赢者通吃”——少数专家迅速变得擅长,路由器倾向于反复选择它们,而大部分专家闲置,利用率低下且容易过拟合。解决手段包括:

  • 专家容量:为每个专家设定一个最大可处理token数上限:capacity = (tokens_per_batch / N) × capacity_factor。若路由至某专家的token数超过容量,多余token被丢弃(或在某些实现中跳过FFN,或通过残差连接直接传递)。capacity_factor通常设为1.0~1.5,是防止溢出的超参数。溢出会损害模型质量,因此路由必须兼顾分散性。
  • 辅助负载损失:在总训练损失上添加一项,鼓励token均匀分配。例如,Switch Transformer使用的损失:loss_aux = N · Σ f_i · P_i,其中f_i是分配给专家i的token比例,P_i是门控分配给专家i的概率均值。当f_iP_i相同时损失最小。
  • 专家选择路由(Expert Choice):不同于token选择专家,BASE层中的思路是由每个专家主动选择其容量内最匹配的Top-C token,通过计算匹配度矩阵并执行一个双侧匹配,天然保证负载均衡,在训练稳定性和性能上有优势,但实现更复杂。

分布式通信:All-to-All 是心脏

在专家并行(Expert Parallelism)模式下,不同的专家被放置在不同的GPU/TPU上。路由过程引入所有设备间的All-to-All通信:

1. 设备d收集本地的所有token,路由器计算出每个token的目标专家设备t。
2. 执行一次All-to-All散射:根据target设备,重新排列分发token,使每个设备获得所有向它专家路由来的token。
3. 本地执行专家计算。
4. 执行第二次All-to-All收集:将计算结果按原始token顺序回到原设备。

这完全不同于数据并行(AllReduce参数梯度)或张量并行(内部的AllReduce/ReduceScatter)。All-to-All是每个参与者向所有其他参与者发送不同数据块,通信量正比于令牌数量×专家数量,极易成为瓶颈。因此,高带宽、低延迟的互联(如NVLink、InfiniBand)是MoE大规模训练的基础设施命门。

模型服务路由的技术架构

一个完整的智能路由器可能包含:

  • 意图分类器:使用小型BERT或蒸馏模型将提示词分类为“闲聊”“代码生成”“翻译”“事实查询”等标签。
  • 难度评估器:通过提示词长度、复杂度指标、甚至调取轻量模型预生成并计算困惑度,判定是否需要大模型。
  • 成本-质量调度器:维护一个模型池的性能剖面(如平均延迟、价格、特定基准得分),根据用户设定的延迟SLA或成本预算进行优化选择。
  • 缓存层:语义缓存能识别语义相同的问题,直接返回缓存结果,如同“路由到缓存”。

高级形态中,路由可以动态级联:先用小模型生成,若不满足置信度阈值再调用大模型;或者并行调用多个模型,使用奖励模型或一致性投票决定最终输出,这种“路由即集成”的方式已在一些产品中可见雏形。

技术演进史

  • 1990年代–2010年代初:混合专家思想的早期萌芽。Jacobs等人1991年提出“混合专家”作为多个神经网络的组合,但彼时各专家共享同一输入,路由简单,主要用于回归和分类,没有实现深层条件计算。
  • 2017年 决定性突破:Shazeer等发表《Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer》,首次在LSTM中引入稀疏门控路由器,Top-k选专家,并辅以负载均衡损失。验证了数千专家规模的可行性,但未大规模落地。
  • 2020年 GShard:Google将MoE扩展到Transformer,在机器翻译中实现6000亿参数,使用Top-2门控。提出专家并行与All-to-All的软件工程实践,为后续所有大规模MoE模型打下基础。
  • 2021年 Switch Transformer:将Top-2简化为Top-1(每个token仅选一个专家),进一步降低计算量和通信,简化负载均衡,并训练至万亿参数级别,展示了MoE的惊人伸缩性。
  • 2022–2023年 稳定化与多样路由:出现ST-MoE(通过router z-loss等方法提升训练稳定性)、Expert Choice路由(BASE层)、Hash Layers(完全无需学习的固定路由)以及多种解决离散路由不可微问题的手段(如将路由输出作为软权重或通过强化学习)。MoE从研究走向工程成熟。
  • 2023年底–2024年 开源大爆发:Mistral AI发布Mixtral 8x7B(46.7B总参,12.9B激活),以开源之姿达到可比肩更大稠密模型的性能,掀起MoE实用化浪潮;Databricks发布DBRX;微软/OpenAI据信GPT-4使用MoE(官方未明确说明);同时,模型服务路由成为LLMOps热点,Cloudflare Workers AI、OpenRouter等平台提供通用模型路由API,学术论文如RouteLLM、HybridFlow等将请求路由作为独立研究方向推进。

技术路线对比(量化表)

路线代表方法/系统路由粒度负载均衡机制训练/推理开销优势劣势
Token级Top‑k门控GShard, Mixtral (k=2), DBRX (k=4)Token级辅助负载均衡损失 + 容量因子中等(每token需路由计算,多专家输出求和)精细条件计算,大容量通信All-to-All开销大;负载仍可能不完美
Token级Top-1门控Switch TransformerToken级辅助负载均衡损失 + 容量因子较低(k=1简化计算与通信)极高效率,极致稀疏一个专家可能不够表达,需要更深或更多专家
专家选择路由BASE LayersToken级,但由专家选Token天然均衡(每个专家选固定Top-C token)略高于Top-k(需计算匹配矩阵)训练极稳定,负载绝对均衡实现复杂,可能引入额外的近似匹配损失
哈希路由Hash LayersToken级,基于哈希哈希函数自然均匀分配极低(无学习,无通信直到专家计算)零路由开销,确定性语义无关,路由质量随机,模型表达能力受限
模型服务路由RouteLLM, OpenRouter, Martian请求级(整个对话/查询)权重式分配、级联或预算约束基于策略网络或嵌入匹配的额外推理延迟可组合异构模型,降本增效需要额外调优,路由错误会导致质量下降
强化学习路由自定义RL策略请求级奖励信号包含成本/质量权衡训练RL策略有一定成本可自动适配动态环境和多目标训练不稳定,可能需要大量探索

上述对比基于公开论文设计原理。具体数值表现视训练数据、模型规模和硬件环境而定,不宜直接跨实现比较。

上下游

上游:基础设施与工具链

  • 计算硬件:GPU(如H100)和TPU v5等,需支持高速All-to-All集合通信;NVSwitch、InfiniBand NDR400等提供节点内/间带宽。
  • 分布式训练框架:Megatron-LM与DeepSpeed集成专家并行(DeepSpeed-MoE),配置容量因子、辅助损失,支持灵活路由函数;PyTorch FSDP/Fairscale提供基础组件。
  • 通信库:NCCL、RCCL针对All-to-All原语优化;自研硬件如Google的TPU ICI互联专门加速。
  • 编译器与推理引擎:如TensorRT-LLM、vLLM、SGLang,为MoE开发专用的融合算子,如grouped GEMM,优化稀疏激活;同时支持多模型路由的调度器。
  • 路由器逻辑库:开源实现如huggingface transformers的Sparse MoE模块,以及fairscale的experts模块,简化原型开发。

下游:应用场景

  • 巨型语言模型服务:作为聊天API(ChatGPT、Claude等可能采用)的核心架构,支撑数十亿日调用量。
  • 多模态模型:将视觉/音频/语言作为不同模态专家,路由选择融合。
  • 企业AI平台:在统一API下集成多个领域模型,路由用户请求至最佳模型,兼顾成本与安全合规。
  • 边缘-云协同推理:路由器判断任务复杂度,简单任务留在端侧设备,复杂任务卸载到云。
  • A/B测试和蓝绿部署:路由百分比流量到不同模型版本。

关键指标

  • 路由延迟:门控计算耗时或因路由策略引起的额外通信时间,对整体推理延迟的占比应控制在小个位数百分比内。
  • 专家利用率:在一段时期内每个专家被激活的频次分布,可通过基尼系数或变异系数衡量,理想值趋近均等分布。
  • 负载失衡率:被丢弃/溢出的token占总token的比例(因超出专家容量),越低越好,通常应低于1-2%。
  • 模型困惑度/下游任务得分:与同参数规模稠密模型的性能对比,衡量路由选择的质量——路由越精准,同等激活参数下性能越高。
  • 成本加权效果:对于服务路由,通常以(\alpha \cdot \text{Latency} + \beta \cdot \text{Cost}) 加权,考察端到端任务成功率与性价比。
  • 吞吐量:每秒处理查询数(QPS)或每秒生成token数,受All-to-All通信带宽和专家矩阵计算双重约束。

供需与市场数据

由于本次研究无法获取实时数据库,以下仅为定性趋势概述:

  • 需求端:大模型竞赛正在由单纯扩大稠密参数转向混合专家架构。2024年以Mixtral、DBRX等开源MoE模型为标志,产业界对MoE训练和推理工具的需求井喷。云服务客户越来越多要求提供“多模型路由”以降低推理总成本,尤其是面向海量简单请求的聊天机器人、内容审核等场景。
  • 供给端:主流AI芯片和系统均加强All-to-All支持。NVIDIA H100的Transformer Engine使MoE推理加速,DGX SuperPOD集群配合InfiniBand为MoE训练提供高吞吐。软件侧,DeepSpeed、Megatron-Core等开源框架持续完善专家并行能力;推理引擎如vLLM已支持MoE模型的高效服务。
  • 市场参与者:除头部云厂自研外,独立的模型路由API层崭露头角,如OpenRouter、Together AI的混合推理服务、Martian等,他们聚合不同厂商模型,通过路由算法提供最优性价比选择,催生一种新型MaaS中介经济形态。

代表公司与资本映射

  • Google/DeepMind:自研GShard、Switch Transformer、PaLM(部分版本可能用MoE)等,持有大量MoE训练与路由核心专利,并以TPU及Pathways系统构建软硬一体生态。
  • Microsoft/OpenAI:据外媒报道与代码泄露分析,GPT-4内部采用MoE架构(8个专家);微软的DeepSpeed-MoE框架成为开源社区基石,Azure云也推出基于MoE的模型服务。
  • Meta:公开发表NLLB MoE模型(用于翻译)及多项稀疏训练研究,PyTorch生态对MoE支持力度大。
  • Mistral AI:开源Mixtral 8x7B模型,以卓越的成本效率引爆商业关注,其估值在2024年迅速攀升,成为欧洲AI新星。
  • Databricks:收购MosaicML后发布DBRX,定位企业级MoE,展示全栈能力。
  • 创业公司
    • 模型路由中间件:如OpenRouter提供统一API访问50+模型并带路由功能;Martian在此领域深耕,获多轮融资。
    • MoE优化软件:CentML、Fireworks.ai等专注推理优化,利用路由思想混合小模型实现超低成本推理。
    • TPU/IPU等替代硬件:Graphcore(虽然商业模式遇挑战,但其IPU的设计天然适合细粒度稀疏通信),体现了硬件对路由的计算图优化。

资本逻辑:MoE虽然缓解了算力边际成本,但也驱动模型总规模持续膨胀,因此长期看算力总需求依然激增,硬件和互联供应商受益。同时,能掌握拓扑感知的路由调度算法的团队,既赋能自家模型也作为中间件服务变现,是风投青睐的新方向。

投资逻辑

  1. 架构换效率,算力需求仍结构性增长:MoE使模型规模轻松突破万亿,训练所需算法FLOPs虽然随参数线性增长,但收敛所需step可能减少,且激进的大厂仍会追求更大的集群,带动高性能计算互联(InfiniBand/以太网)和大型交换机芯片需求。然而,单位推理成本显著下降,推理芯片的总需求增长可能由应用爆发量补足。
  2. 模型服务路由开启降本空间:对于AI应用公司,推理成本占据收入的50%以上。智能路由能进一步大幅压缩成本,边际改善盈利能力,可能会加剧AI应用商业化,利好有丰富应用场景和数据积累的ISV。
  3. 路由技术成为云厂差异化竞争力:如果某云平台能提供自动路由、自适应质量的最优调度,其模型调用的性价比将明显优于竞争对手,客户粘性增强。关注各云厂开源或闭源的路由技术组件更新。
  4. 软硬件协同创新:针对All-to-All通信的硬件加速、Sparse MoE的图编译器优化、多模型池的异构调度器等,可能滋生一批中间件企业。围绕NVLink/InfiniBand生态的产业链公司持续收益。

仍需注意风险:MoE训练的不稳定性(离散路由)可能导致研发进度延迟;模型服务路由若匹配失准,会让客户体验波动,影响商誉。此外,学术界正在探索无需离散路由的结构化稀疏方法,长期可能颠覆现有路线。

常见误读纠偏

误读1:“MoE路由就是哈希映射,将token随机分配给专家。” 纠正:目前最常用的门控路由是可学习参数的网络(一个全连接层),输出的logits经过Softmax和Top-k选择专家。哈希路由只是探索的一个极端分支,仅用于研究负载均衡对路由学习的必要性,实际应用较少,因为完全随机的分配无法利用语义进行有效计算。

误读2:“模型路由仅指混合专家模型内部的门控,多模型请求分发只是负载均衡。” 纠正:模型服务中的多模型路由(有时称“推理路由”或“请求路由”)同样是模型路由的重要组成。它涉及内容理解、成本规划和质量评估的复杂策略,绝非简单的轮询或最少连接负载均衡。比如,它可以分析一个翻译请求并发送到擅长目标语言的专业模型,而非通用模型,这是智能决策而非流量分发。

误读3:“MoE中All-to-All通信就是张量并行的AllReduce。” 纠正:两者截然不同。张量并行使用AllReduce或ReduceScatter进行归约操作(例如将每个设备的部分和相加并广播),通信量与模型层大小、并行切片数强相关。而MoE专家并行中的All-to-All是置换重分布(scatter/gather),每个设备向所有其他设备发送可能不同的令牌数据,通信量与令牌数量和专家拓扑直接关联,延迟敏感且数据量可远大于归约操作。混淆会误导硬件选型(All-to-All对网络非均匀接入更敏感)。

学习路径

  1. 奠基论文

    • Shazeer et al. (2017) “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer” (ICLR) – 现代稀疏MoE的原点。
    • Lepikhin et al. (2020) “GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding” – 首个Transformer+MoE的成功大规模实现。
    • Fedus et al. (2021) “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity” – Top-1路由与负载均衡损失的经典阐述。
  2. 进阶阅读

    • Zoph et al. (2022) “ST-MoE: Designing Stable and Transferable Sparse Expert Models” – 深入分析路由稳定性和技巧。
    • Lewis et al. (2021) “BASE Layers: Simplifying Training of Large, Sparse Models” – 对专家选择路由的详细介绍。
    • Jiang et al. (2024) “Mixtral of Experts” – 当前最知名的开源MoE语言模型技术报告。
  3. 工程教程与代码

    • Hugging Face transformers 库中Mixtral等MoE模型的源代码(modeling_mixtral.py),可直观看到门控函数的实现。
    • DeepSpeed-MoE教程:了解专家并行的设置、容量因子调整。
    • vLLM官方文档中关于MoE支持的章节(关注其融合的Grouped GEMM内核)。
  4. 模型服务路由相关

    • 论文“RouteLLM: Learning to Route LLMs with Preference Data” (2024) – 经典多模型路由方法。
    • 博客与开源项目:如LMSYS的Chatbot Arena中可能涉及的混合推理调度;OpenRouter的API文档;Lit-GPT中的“Router”概念验证。
    • 系统会议(MLSys, OSDI)中有关“Model Serving at Scale”的论文,常有请求调度与自适应路由的最新设计。

一句话总结

模型路由是让AI系统在“庞大而稀疏”与“多样而经济”之间动态平衡的智能中枢,它通过离散的条件计算将模型能力从单一巨型矩阵压缩为按需激活的专家联盟,正在重塑大模型的成本结构与部署哲学。

延伸阅读与来源

本概念学习页依据公开学术文献和工业技术公告撰写,未使用实时特定数据检索,所有具体数值样例均来自论文模型卡片(如Mixtral 8x7B参数由Mistral AI公布)。因检索服务暂时不可用,一些实时市场数据未列出,建议读者通过以下渠道获取最新信息:

  • 基础文献:Shazeer et al. (2017), GShard (2020), Switch Transformer (2021) - arXiv.org
  • 模型与博客:Mistral AI Blog for Mixtral; Databricks Blog for DBRX; Google AI Blog for Switch Transformer & BASE.
  • 行业分析:SemiAnalysis有关MoE推理成本的深度文章;各大投资机构发布的AI基础设施报告。
  • 社区资源:Hugging Face 模型卡片及讨论区;r/MachineLearning关于MoE路由的讨论帖。
  • 会议追踪:ICLR, NeurIPS, ICML每年关于稀疏模型和条件计算的最新论文;MLSys中涉及模型调度和路由的工业应用论文。

注意:本文中涉及对GPT-4等产品使用MoE的描述来自多方公开报道和分析师推演,未得到官方彻底证实,请谨慎参考。同时,任何具体路由器的性能数据因硬件环境差异巨大,需按官方基准为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型