模型层 开放阅读

稀疏 MoE

Sparse MoE

概念 ID
sparse-moe
更新时间
2026-05-29
来源数量
待补

稀疏 MoE

1 3 秒看懂

稀疏 MoE 是将一个超大模型拆解为大量“专家”子网络,每个输入 token 仅激活其中极少数专家参与计算。其结果是:总参数量可达万亿级别,但单次推理的计算量仅相当于一个小得多的稠密模型,在参数容量与算力消耗之间实现了“剪刀差”。

2 3 分钟产业解释

当大语言模型的参数量从千亿迈向万亿时,若仍采用每一层都全量激活的稠密架构,训练与推理的成本将触及商业可行性的天花板。稀疏混合专家(Sparse Mixture of Experts,简称 Sparse MoE)正是为解决这一矛盾而生的系统级架构方案。

  • 运作机制:将 Transformer 中的前馈网络(FFN)替换为多个并行排列的专家子网络,并引入一个轻量级的门控网络(Router)。对于每一个输入的 token,Router 会计算所有专家的选择概率,并最终只激活得分最高的 k 个专家(通常 k=1 或 2)。该 token 的计算结果由被激活的少数专家加权求和得出。
  • “稀疏”的本质:模型的总参数量是所有专家参数之和,可以做到极其庞大;然而,对于任意一个 token,仅有一小部分参数被激活并参与计算。激活参数规模通常不到总参数量的 5% 甚至 1%,这是稀疏 MoE 实现算力与容量解耦的根本原因。
  • 产业驱动力:它允许 AI 实验室在相近的算力预算下,训练出知识容量远超稠密模型的基座,或在同等智能水平下显著降低推理延迟与单位 token 成本。Google 的 GShard (2020)、Switch Transformer (2021) 以及 Mistral AI 的 Mixtral 系列 (2023-2024) 均验证了此路线的工程可行性。
  • 结构性代价:架构的复杂性直接转化为系统工程挑战——专家间的负载不均、跨节点 All-to-All 通信风暴、路由网络在训练中趋向“懒惰”的塌缩风险,都使得稀疏 MoE 的训练与部署门槛远高于稠密模型。

3 技术原理

稀疏 MoE 并非简单的集成学习,而是将“条件计算”深度嵌入神经网络结构的一种设计哲学。其技术本质是利用额外的路由网络,在每一轮前向传播中对计算图进行动态剪枝。

3.1 核心运算流

标准的稀疏 MoE 层替代的是 Transformer Block 中的 FFN 层,单 token 的前向计算可分为四个阶段:

  1. 路由打分:输入 token 的隐层向量 $x$(维度 $d$)进入门控网络 $G$,输出维度为专家总数 $E$ 的 logits。
  2. 稀疏选择:对 logits 施加 Softmax 得到概率分布 $P$,随后执行 Top-k 选取,得到得分最高的 $k$ 个专家索引及对应的门控权重 g_i。未入选的专家在此 token 的计算中被完全旁路。
  3. 专家计算:$x$ 被分别送入被选中的 $k$ 个专家(各自均为独立的 FFN 或更复杂的子网),各专家输出维度为 $d$ 的计算结果。
  4. 加权合并:将各专家输出与对应的门控权重加权求和,作为该 MoE 层的最终输出,并经由残差连接与原始输入相加。
输入 Token 隐层表示 x (dim: d)
           |
    [ 门控网络 G (d → E) ]
           |
    Softmax → 概率分布 P
           |
    Top-k 选取 → 选中专家索引 i₁, i₂
           |
    +------+------+
    |              |
专家 i₁(x)    专家 i₂(x)
    |              |
    +------+------+
           |
加权求和:∑ g_i * 专家_i(x)
           |
    输出 (dim: d),与残差连接相加

注:以上为逻辑流示意,未包含辅助损失及容量因子等训练时特有的控制回路。

3.2 训练中的特有挑战与对策

稀疏路由引入了与稠密模型截然不同的训练动力学,需要一系列专门的技巧来保障收敛。

  • 专家容量与 Token 丢弃:为防止某专家因被过度集中选择而导致显存溢出(Out of Memory),需设定“专家容量”(Expert Capacity)。其定义为 (批次总 token 数 / E) × 容量因子 C。当路由至某专家的 token 数超过其容量时,超出部分会被丢弃或通过残差连接旁路。这会直接损失模型效果,因此容量因子 $C$ 是工程折衷的关键参数(通常 C \ge 1.25)。Switch Transformer 等工作中对此有详细讨论(Fedus et al., 2021)。
  • 负载均衡损失:路由网络天然倾向于收敛到少数“通才”专家,导致大量专家闲置,丧失扩展意义。通用解法是在主损失函数上附加负载均衡损失项。该辅助损失通常基于专家接收 token 的分布与理想均匀分布的差异(如基尼系数、方差)来设计,以推力迫使 Router 进行更均匀的分配。
  • 数值不稳定性:路由 logits 过大容易导致 Softmax 输出趋向独热向量,加剧负载不均和梯度消失。实践中常引入 z-loss,通过惩罚 logits 的平方最大值来促使数值分布更平滑。

3.3 并行策略的范式转移

传统稠密模型的分布式训练主要围绕数据并行、张量并行和流水线并行,通信原语以 AllReduce 或 ReduceScatter 为主。稀疏 MoE 则引入了专家并行这一新维度。

  • 专家放置:不同的专家被物理放置在不同的计算设备(如 GPU)上。
  • All-to-All 通信:一个 token 从当前设备被路由到它所选专家所在的设备进行计算,计算完成后结果需传回原设备。这要求集群执行全互联的 All-to-All 集合通信。该通信模式的数据量与每步的动态路由结果强相关,带宽和延迟直接成为大规模 MoE 训练的瓶颈,对网络架构(如 NVLink、InfiniBand)提出了极高要求。

4 关键参数

理解稀疏 MoE 的行为与效率,需要关注以下几个核心参数指标。公开资料中这些参数的确切值因模型实现而异,多作为定性概念和调优抓手存在。

  • 专家总数($E$):模型容量扩展的杠杆。从几十到数千不等(如 Switch Transformer 在实验中曾配置 2048 个专家)。
  • Top-k 值:每次激活的专家数量。目前工业界以 1(Switch Transformer)和 2(GShard, Mixtral 8x7B)最为常见。更大的 $k$ 提升模型表达能力,但线性增加计算开销。
  • 容量因子($C$):直接影响 Token 丢弃率与计算效率。$C$ 越大,丢弃越少,但填充(padding)带来的无效计算越多,对显存的压力也越大。
  • 负载均衡损失系数(\alpha:控制路由均匀度强制力大小的超参数。\alpha 过低会导致路由崩溃;过高则会压制 Router 的有益偏好,限制专家专精化带来的收益。
  • 激活参数比:即“激活参数量 / 总参数量”。这是评测 MoE 效率最直观的指标,该比值越小,说明系统用越少的计算撬动了越大的参数容量。

5 技术路线

稀疏 MoE 的技术演进,折射出 AI 产业从“堆叠层数”到“条件计算”的思路变迁。

  • 萌芽期(1990s-2013):Jacobs 等人提出混合专家(Mixture of Experts)框架,其本质是多个子模型的软性集成,所有专家均参与计算。该方法未触及稀疏激活,主要应用于局部模型组合。
  • 稀疏化突破(2017):Shazeer 等人在 ICLR 2017 发表工作,首次将 Top-k 稀疏门控引入大规模 LSTM 语言模型,证明了用数千个专家构建近万亿参数模型的可能。其提出的 Sparsely-Gated MoE 层成为后续所有工作的基石,但也首次披露了负载不均等挑战。
  • Transformer 融合与工业化(2020-2021):Google 的 GShard 将 MoE 嵌入 Transformer 的编码器-解码器结构,实现大规模多语言翻译模型训练;Switch Transformer 进一步将路由简化为 Top-1,证明了万亿参数级别 MoE 可在简化的 T5 架构上稳定训练,并系统化地给出了容量因子、辅助损失等工程化方案。这两项工作标志着稀疏 MoE 从学术探索走向工业落地。
  • 开源繁荣与推理优化(2023-2024):Mistral AI 推出 Mixtral 8x7B 并采用 MoE 架构,虽总参数量为 47B,但推理时仅激活约 13B 参数,其在行业基准上的表现匹敌甚至超越了更大体量的稠密模型。此举极大推动了开源社区对 MoE 的采用。同期,DeepSpeed-MoE 等框架将专家并行与 ZeRO 冗余消除深度融合,大幅降低了训练门槛。
  • 当前前沿(2024-今):研究热点转向动态路由(根据 token 难度或模型层级自适应调整激活的专家数量)、细粒度专家共享、多模态 MoE(如视觉-语言模型中使用不同模态专家),以及面向端侧部署的专家卸载与弹性尺度推理。

6 上游

稀疏 MoE 的产业链上游核心是支撑其极致通信和庞大数据吞吐的硬件与基础软件。

  • 高带宽通信硬件:MoE 的 All-to-All 操作使得节点间通信带宽成为核心瓶颈。高性能 GPU/NPU 之间的直连技术(如 NVIDIA 的 NVLink 和 NVSwitch)、节点间的高速网络接口(如支持 RDMA 的 InfiniBand 及超以太网网卡)以及高基数交换机,构成了 MoE 训练集群的成本重心。若无这些基础设施,专家并行的效率会急剧下降。
  • 并行训练框架:深度学习框架必须原生支持灵活的多维混合并行编排。微软的 DeepSpeed、英伟达的 Megatron-LM 以及 Meta 的 Fairscale 等,提供了将专家并行与数据、张量、流水线并行深度耦合的 API 与优化策略。这是模型算法落地的关键软件栈。
  • 高带宽内存与存储:所有专家的参数在推理时需完全驻留在显存(HBM)或节点内存中,训练时则涉及大量临时缓存的读写。HBM 的容量决定了单节点可容纳的专家数量上限,而高速节点间存储方案则影响专家状态的加载与恢复速度。

7 下游

稀疏 MoE 作为一种架构范式,其影响外溢至模型能力的各个方面。

  • 通用大语言模型:这是最直接的落地场景。在对话、翻译、代码生成、长文本理解等任务中,稀疏 MoE 使模型能够存储远超稠密架构的海量知识与模式,同时将推理时延控制在可接受范围内。
  • 多领域融合模型:企业或机构可以在不显著增加每个 token 推理成本的前提下,训练覆盖医疗、法律、金融、工程等多个高壁垒领域的统一基座模型。各个领域的知识被有效地隔离在不同的专家中,有望缓解“灾难性遗忘”和领域间冲突。
  • AI Agent 与工具使用:不同专家可以学习并封装不同的 API 调用模式或规划策略。一个 Agent 模型在推理时,可由 Router 动态决定是调用负责检索的专家、负责 Python 代码解释器的专家,还是负责逻辑推理的专家,使得复杂任务拆解更具模块性。
  • 端侧 AI:通过知识蒸馏、专家裁剪或动态加载等后处理技术,可将庞大 MoE 模型中的部分专家能力压缩或迁移至手机、PC 等端侧设备,在离线、低功耗场景下提供特定的高级认知能力。

8 受益公司

以下分析基于公开产业动态与披露,不构成任何投资建议,也不指向特定证券的交易方向。

  • 算力基础设施供应商:英伟达(NVIDIA)的 GPU 及其 NVLink/NVSwitch 互联技术,是当前 MoE 训练事实上的高端方案。其网络业务(如 InfiniBand 及 Spectrum-X 以太网方案)直接受益于 MoE 场景下激增的东西向流量。博通(Broadcom)等为云厂商定制 ASIC 的厂商,也开始将专家并行通讯优化纳入设计考量。华为昇腾系列及其 HCCS 互联、星河 AI 集群解决方案,同样构成了国产 MoE 训练的基础设施层。公开信息显示,这些厂商在2024-2025年的AI网络收入呈现高双位数增长。
  • 云服务提供商:微软 Azure、谷歌云、亚马逊 AWS 以及国内主流云厂商,是提供 MoE 训练及推理服务(MaaS)的核心平台。它们凭借对大规模集群的网络调优、框架集成(如 DeepSpeed on Azure)和规模化运营能力,构成了模型创业公司上层的PaaS/SaaS价值层。
  • 模型层创业公司:Mistral AI 是凭借稀疏 MoE 路线确立差异化优势的标杆性创业公司,其开源和商业模型获得的评价使其成为欧洲最具价值的 AI 初创公司之一(据其2023-2024年多轮融资披露)。业内分析普遍认为,采用 MoE 架构是其在有限资本开支下,模型性能快速逼近头部稠密巨模型的关键技术选择。国内亦有多个头部大模型团队将 MoE 作为核心架构,但由于多数未单独披露架构细节,不方便在此处无证据指明。

9 市场规模

本节旨在描述趋势与结构,精确的数字预测因统计口径、估值模型和预测基线的差异而充满不确定性。我们尽力标明年份、口径及来源。若特定细分数据未公开披露,则明确标注为“公开资料未见”。

  • 训练市场的算力消耗:稀疏 MoE 模型因其总参数规模庞大,单次全量训练所需的算力总投入(以 GPU 小时计)仍极其高昂。然而,与同等智能水平的稠密模型相比,其训练所需的单位智能提升算力(Computational Efficiency)在业界实践中被观察到有显著改善。据公开信息,一个万亿参数 MoE 模型的训练集群,其网络基础设施(交换机、光模块、线缆)的成本占比,可能从传统集群的不足10%跃升至15%-20%(来源:行业技术白皮书与分析师估算,2024年口径)。
  • 推理市场的成本结构:在云端推理(Inference as a Service)市场,MoE 模型的定价模式因“激活参数少、但总参数驻留要求高”而呈现出独特形态。用户侧,提供同等服务质量时,MoE 模型 API 的单 token 价格通常低于稠密模型。例如,某海外主流模型供应商的 MoE 模型与上一代稠密模型相比,输入单价可降低约30%-50%(来源:2024年各厂商公开API定价页对比)。服务商侧,其硬件成本由多卡驻留的固定成本与 token 计算的可变成本组成,因此单位经济效益对模型并发量和负载均衡极度敏感。第三方机构(如 Liftr Insights, 2024年Q4报告)追踪显示,支撑 MoE 推理的云实例规模正在快速增长。
  • 公开的第三方市场规模预估:公开资料可见,有不少咨询机构对广义的“大模型效率优化市场”(包含稀疏化、蒸馏、量化等技术)给出了预测。例如,有分析认为该市场在2027-2028年将达到百亿美元级别(具体来源已不可考,仅提示存在此类预估)。然而,专门针对“稀疏 MoE 架构”的独立、可审计市场规模预测,“公开资料未见”。这主要是因为稀疏 MoE 更多作为一种技术架构而非独立产品,其价值渗透在算力、框架和模型服务之中。

10 玩家对比

以下对比基于各公司已公开发表的技术报告、论文及开源模型信息,定性而非定量,不涉及未披露的内部项目细节。

维度Google (GShard/Switch)Mistral AI (Mixtral系列)Meta (Fairscale/NLLB)国内厂商 (泛指)
主要技术贡献最早工业化验证万亿级MoE,奠定容量因子、load balance loss等工程范式的基石。在较小的激活参数体量下,通过MoE实现与更大稠密模型匹敌的性能,极大推动了开源社区的MoE应用。通过Fairscale库将MoE与SOTA并行策略整合,并成功应用于千亿参数级多语言翻译模型(NLLB-MoE)。多支团队已将MoE应用于千亿至万亿参数的生产模型,并在架构上探索如共享专家、动态路由等变体。
路由策略Top-1 (Switch) / Top-2 (GShard),均采用辅助负载均衡损失。Top-2路由,具体负载均衡机制细节在公开技术报告中着墨不多。Top-2路由,在Fairscale框架中实现可配置的容量因子与均衡策略。公开报道中多见Top-2或Top-p策略。部分团队已公开探讨对浅层与深层施行不同路由策略的方案。
开源程度论文全面,但大参数版本模型大多未开源。开放模型权重(如Mixtral 8x7B, 8x22B),对学术研究和应用开发产生巨大推动。开源了核心框架Fairscale及部分模型,降低了MoE的训练门槛。部分厂商开源了框架组件或特定阶段的模型,但完整生产级模型通常以API服务形式提供。
生态位技术路径开拓者,为全球该领域提供了公共知识基础。高效智能的标杆,证明了创业公司在大模型竞赛中的架构差异化路径是可行的。开源基础设施的关键供给方,其框架工作惠及整个社区。快速跟进并工程化优化的主力军,在自主基础设施与海量数据上实现规模部署。

11 风险

稀疏 MoE 技术路线本身及其产业生态面临多方面的结构性风险,需持续审视。

  • 架构替代风险:这是最根本的风险。若状态空间模型(SSM)或其变体(如 Mamba、RWKV)在长序列建模中证明可以同等或更低的计算代价,达到接近乃至超越 MoE 模型的扩展性与智能水平,当前围绕 MoE 构建的硬件优化与系统生态可能面临价值重定价。不过截至2025年初,MoE与SSM的混合架构正成为研究热点,而非单边替代。
  • 工程实现的高门槛与人才瓶颈:MoE 的训练和调优涉及分布式系统、网络通信与算法的深度耦合,能端到端掌握并优化该技术栈的工程师极度稀缺。如果一个团队无法解决复杂且动态的负载均衡与通信问题,其训练出的 MoE 模型可能实际利用率低下,无法兑现架构的理论效率。
  • 推理部署成本的结构性刚性:尽管单 token 计算量低,但 MoE 模型推理时,全体专家参数必须常驻在某个存储层级(显存或主机内存)以便随时调用。这导致其最小部署单元(哪怕是处理极低并发请求)也需要多张高显存 GPU 或专门的异构内存管理方案,这在缺乏规模效应的场景下,单位成本可能高于部署一个小型稠密模型。这一特性在边缘计算或低流量应用中可能构成障碍。
  • 负载均衡的动态不可控性:生产环境中的用户查询分布是不断变化的,远比训练语料复杂。训练时设定的路由策略和负载均衡,可能在新数据分布上失效,导致某些专家被请求“打爆”,触发级联延迟。这要求服务商具备在线监测和可能的热切换路由策略能力,运维复杂性极高。

12 误读纠偏

  1. 误读:“稀疏 MoE 模型推理一定很慢,因为它体积太大了。” 纠偏:模型推理延迟主要约束于激活参数量和计算图长度,而非总参数体量。稀疏 MoE 单个 token 只让极少专家参与计算,其理论计算量可能远低于同等智能的稠密模型。真正的工程挑战在于处理器需要等待通信、以及为应对路由不可预测性而引入的批量处理与内存管理开销。因此,MoE 推理慢不是绝对的“计算慢”,而是“系统工程难度高导致容易变慢”,优秀实现可以很快。

  2. 误读:“只要总参数大,就是 MoE 模型,效果就一定好。” 纠偏:参数规模不等于智能。一个设计糟糕的 MoE 模型(例如负载均衡失效、路由塌缩至少数几个专家)其实际发挥效用的“有效参数容量”可能很小,甚至可能不如一个训练充分的更小稠密模型。MoE 是一种将参数容量高效转化为智能的潜在机会,而非保障。评估模型的关键应是激活参数比与实际任务评测表现。

  3. 误读:“激活参数量可以用总参数除以专家数再乘 k 来简单估算。” 纠偏:此公式忽略了两大块核心参数:所有专家共享的稠密层(如注意力层、词嵌入层)以及可能存在的共享专家。完整公式应为:激活参数 = 共享稠密层参数 + k × 单专家平均参数。若模型存在专家分组或分层式路由,结构更复杂,简单的除法是不准确的。

13 最新事件

  • 头部模型供应商的加速部署(2024Q4–2025Q1 持续动态):多个主流闭源和开源的大语言模型 API 服务,其最新版本已明确或普遍被业界分析扫描确认为基于 MoE 架构。这标志着该技术从实验室和论文中彻底走出,成为生产级商业服务的核心支撑,其单位 token 的推理定价也多次下调,直接反映了其成本结构优势。
  • 硬件厂商的针对性优化(2024–2025):英伟达在其 Blackwell 平台及后续路线图中,公开强调了针对专家并行(Expert Parallelism)的网络计算一体化(In-Network Computing)增强,以及对 FP4、FP6 等精度下 All-to-All 通信的加速支持。AMD 和 Intel 也在其 AI 加速器及网络产品的公开材料中提及对稀疏模型通信模式的优化。这说明硬件迭代正将 MoE 作为第一等公民场景进行原生适配。(来源:各公司GTC、Computex及官方产品发布博客)
  • 训练系统框架的重大更新(2024H2):DeepSpeed、Megatron-LM 等主流训练框架相继发布重大版本,核心更新普遍包含对大规模 MoE 训练稳定性和吞吐量的显著改进。例如,在通信-计算重叠(Overlap)、动态专家容量、内存零冗余策略上有了新的工程实践被公开。
  • 开源社区的专家合并创新(持续至今):Hugging Face 社区涌现了大量基于已训练 MoE 模型的“专家合并”实验。开发者将不同微调任务的适配器或模型通过“魔改”的方式替换或插入原有 MoE 架构的专家层,创造出功能混合的新模型,这已成为一种新型低成本的模型能力组合范式。

14 跟踪指标

要持续判断稀疏 MoE 产业的发展阶段与竞争力,建议长期跟踪以下维度的公开信号,而非单一数据点。

  • 活跃开源模型的“参数效率”:持续关注 Hugging Face 的 Open LLM Leaderboard 以及 LMSYS Chatbot Arena 等独立榜单。关键不是看总排名,而是观察 MoE 模型与同等排名的稠密模型相比,其总参数量、激活参数量和理论最大计算量的比值关系。这个比值的变化趋势是衡量该技术架构进步速度的核心指标。
  • 头部云厂商的模型服务定价:观察提供模型即服务(Model-as-a-Service)的厂商(如 Google Cloud Vertex AI、Microsoft Azure AI、国内互联网云等),其旗舰模型 API 的公开输入/输出每千 token 定价。若采用 MoE 的模型价格持续走低且输出质量稳定,这是其商业化正循环确立的强烈信号。
  • AI 加速器厂商的网络产品营收结构:跟踪英伟达、博通、Marvell 等在财报或重大产品发布中,与 AI 网络相关的业务(如 InfiniBand、高速以太网网卡/DPU、PCIe Switch/CXL 等)的营收增速,以及有无明确将其增长归因于 MoE 或专家并行带来的东西向流量增量。
  • 重要学术会议的论文话题分布:观察 NeurIPS、ICML、ICLR 上与 MoE 相关的论文,关注点是否已从“证明有效”完全转向“解决通信瓶颈”、“动态稀疏性理论”、“与其它架构融合”等深水区问题。这能反映该技术是否还有持续的学术生命力。
  • 相关技术岗位的招聘需求:在主要招聘平台上,追踪与“稀疏训练”、“专家并行”、“All-to-All 通信优化”、“DeepSpeed MoE”相关的岗位数量和所属公司范围。这比市场报告更能灵敏地反映产业渗透的真实广度与瓶颈所在。

15 信源

由于本次任务在封闭环境中执行,无法进行实时互联网检索,故无法提供具体URL。以下列出获取此类高质量信息的推荐渠道与检索关键词,以供读者自行验证与深化。

  • 核心学术论文
    • Shazeer et al. (2017), “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.” ICLR 2017. (奠基之作)
    • Lepikhin et al. (2020), “GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding.” ICLR 2021. (系统化工业实践)
    • Fedus et al. (2021), “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity.” Journal of Machine Learning Research. (万亿参数里程碑)
    • Jiang et al. (2024), “Mixtral of Experts.” arXiv preprint. (Mistral AI的技术报告,是当前最具影响力的开源MoE模型文档)
  • 开源框架与文档
    • Megatron-LM 的 GitHub 仓库中关于 MoE 的配置文档与示例。
    • DeepSpeed 官方教程中“Mixture of Experts”章节。
    • Hugging Face 模型库中搜索 “MoE”,按下载量与趋势排序,观察社区模型的表现与技术卡片。
  • 行业分析平台与媒体
    • SemiAnalysis 的深度付费订阅报告,对算力芯片、网络架构与模型算法的交叉分析有全球领先的洞察。
    • Next Platform 对于面向 AI 加速的高性能网络、服务器系统架构有详尽的技术商业分析。
    • 财经终端(如 Bloomberg, Reuters)追踪关键芯片和云服务商的高管在财报电话会上关于 AI 网络、下一代互联技术的陈述。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型