模型层 开放阅读

前馈网络

Feed-Forward Network, FFN/MLP

概念 ID
feed-forward-network-ffn-mlp
更新时间
2026-05-29
来源数量
待补

前馈网络

3 秒看懂

前馈网络(Feed‑Forward Network,FFN,也常称多层感知器 MLP)是深度学习最基础的模块化计算单元:对输入执行非线性变换,让网络学习复杂的函数映射。在现代架构(Transformer、CNN、MLP‑Mixer 等)中,FFN 子层是所有 token 或位置独立加工的“运算引擎”,没有它,模型就失去对单点特征的深度建模能力。

3 分钟产业解释

在 AI 芯片与模型产业链中,FFN 是算力消耗的绝对主力之一。典型 Transformer 类模型中,FFN 模块通常占据总参数量的约 2/3,以及训练/推理浮点运算量的过半比重(业界共识,无特定来源)。FFN 由线性全连接层、激活函数和可选偏置组成,结构简单但计算密集,本质表现为大规模矩阵乘法(GEMM)。因此,硬件加速器(GPU、TPU、NPU 等)的算力标尺普遍采用矩阵乘吞吐量(TFLOPS,或称 FP16/INT8 TFLOPS),直接映射到 FFN 的执行效率。

围绕 FFN 展开的优化——低精度量化、结构化和非结构化剪枝、稀疏性利用、算子融合——正是大模型推理降本的主战场。2023‑2025 年,伴随 GPT‑4、Llama 3、Claude 3 等大规模商用模型落地,云数据中心推理成本中 FFN 权重加载与矩阵乘 占据了功耗与延迟的大头;端侧(手机、PC、汽车)部署中,FFN 层的压缩和专用指令适配直接决定了能否在 5‑15 W 功耗内实时运行 7B‑13B 模型。因此,无论上游的 AI 芯片设计、中游的模型训练框架,还是下游的推理引擎与 MLOps 工具链,都深度绑定 FFN 的执行范式。

技术原理

FFN 的普适性源于万能逼近定理:具足够神经元的单隐藏层 FFN 可任意精度逼近任何连续函数。实际深度模型中,为了高效表征,会使用多隐藏层并搭配非线性激活函数(ReLU、GELU、SiLU 等)。在 Transformer 解码器中,FFN 层先将输入向更高维度空间投影(通常 4 倍扩维),经过激活后投影回原始维度,形成“先升维后降维”的操作。这一结构使网络在同一位置能组合大量特征,与注意力模块的分工明确:注意力负责跨位置的交互聚合,FFN 负责每个位置的独立变换。二者交错堆叠成为现代大模型的基础范式。

更宏观地看,FFN 也是混合专家模型(MoE)的核心载体。MoE 将单一 FFN 拆分为多个独立“专家”FFN 模块,由路由器动态选择激活部分专家。其本质是将 FFN 的单一计算置换为一组并行 FFN 的加权/挑选,大幅增加总参数量的同时维持可控的激活计算量,从而突破单模型的能力边界。可以说,FFN 的概念已经从单模块上升为模型规模扩展的关键载体。

数学形式与计算量

经典两层 FFN:

text(FFN)(mathbf(x)) = \sigma(mathbf(x)mathbf(W)_1 + mathbf(b)_1)mathbf(W)_2 + mathbf(b)_2

门控变体(如 SwiGLU):

text(FFN)(mathbf(x)) = (\sigma(mathbf(x)mathbf(W)_g) \odot mathbf(x)mathbf(W)_1) mathbf(W)_2

其中 \sigma 为激活函数,\odot 为逐元素积。输入 mathbf(x)\inmathbb(R)^{d}mathbf(W)_1,mathbf(W)_g \in mathbb(R)^{d\times d_{text(ff)}}mathbf(W)_2 \inmathbb(R)^{d_{text(ff)}\times d}。典型设置下 d_{text(ff)} = 4d,则每 token 正向计算量为:

text(FLOPs) \approx 2 \times 2 \times d \times d_{text(ff)} = 4d\cdot d_{text(ff)} \approx 16d^{2}

反向传播时梯度计算同样为大规模矩阵乘。整个 FFN 对每个 token 独立作用,不涉及序列维度交互,因此可以高度并行化,且随批次大小和序列长度线性扩展。

激活函数演进

  • ReLU(早期 Transformer):计算简单,但“死区”可能损失梯度。
  • GELU(BERT、GPT‑2):平滑近似,训练稳定,但数学复杂,推理略慢。
  • SiLU/Swish 与门控组合(SwiGLU):Llama 等发现,在总参数预算相同的前提下,使用门控线性单元并配合 SiLU 激活,可以提升参数效率和最终性能。门控结构额外增加了一个权重矩阵,因此同等维度下计算量上升,但通过缩减隐藏维度,可在等 FLOPs 下获得更优性价比。
  • 未来趋势:硬件友好型激活(如 ReLU²、Mish 变体)和可学习激活仍在研究中,但目前主流架构已稳定在 SiLU‑门控体系。

推理优化

推理阶段 FFN 的权重可经训练后量化(PTQ,如 GPTQ、AWQ)降低到位宽 INT4 或 INT8,存储和带宽开销成倍缩小。矩阵乘利用 GPU Tensor Core(NVIDIA WMMA/MMA)、NPU 的脉动阵列、专用指令集实现高效计算。当 batch 较小时,FFN 容易受内存带宽限制,因此权重压缩、kernel 融合(如将激活与矩阵乘合并)以及 KV 缓存管理的协同优化,成为部署关键。

关键参数

  • 隐藏维度倍数 d_{text(ff)} / d:常见 4 倍,影响每 token 计算量(约 16d^{2} FLOPs)和参数量(经典两层约 2d\cdot d_{text(ff)} = 8d^{2},门控变体约为 3d\cdot d_{text(ff)} = 12d^{2},但实际因隐藏维调整而不同)。
  • FFN 参数占比:以 7B 参数模型为例,FFN 权重约占 4.7B 参数,FP16 精度下约 9.4 GB 内存(估算,基于 Llama 类结构);对 MoE 模型,总专家参数可达千亿级,但单 token 激活参数量可控。
  • 推理延迟:受批次规模、序列长度、硬件带宽和算力共同制约。定性而言,小批次带宽为主,大批次算力为主。具体数据视实际部署环境而定,公开资料未见通用基准
  • 训练 FLOPs 占比:在短序列下,FFN 通常占总 FLOPs 的 60% 以上;当序列长度极大(>8K),注意力计算占比上升,FFN 占比可能降至 40%‑50%,但仍为最大单项。
  • 激活稀疏度:ReLU 激活后自然产生约 50% 零值(视训练状态),GELU 约 20%‑30%。稀疏性可被用于跳过无效计算,是推理加速的关键指标,但需要硬件和运行时支持非结构化稀疏或块稀疏加速。
  • 量化位宽与精度损失:INT8 量化一般可维持 <0.5% 精度损失(针对困惑度等);INT4 通常需要更精细的校准或分组量化,损失在 1%‑3% 区间,须针对业务精度门槛评估。以上数据综合自 GPTQ、AWQ、SmoothQuant 等公开论文,具体模型和任务存在差异

技术路线

FFN 的工程化路线已高度聚焦于“参数效率×计算效率”的权衡,不同路线在结构、稀疏性和数值表示上各有侧重。

技术路线核心机制典型激活参数效率(同FLOPs下性能)常见应用主要挑战
经典两层 MLP线性→激活→线性ReLU/GELUBERT、GPT‑2 等早期模型表达能力存在瓶颈,激活死区影响训练
门控线性单元 (SwiGLU 等)双投影逐元相乘+第三投影SiLULlama 3、Mistral、QWen 等 2023‑2025 主流开源模型额外参数和计算,部分硬件实现需特别适配
混合专家 (MoE) FFN多 FFN 专家+路由器同专家内部任意激活极高(总参数极大,激活参数较少)Mixtral 8×7B/8×22B、GPT‑4(推测)、Grok‑1训练负载不均衡、通信开销大、服务高可用运维复杂
结构化稀疏 FFN剪枝或低秩因子化无要求较高(降低实际计算量)端侧 NPU 推理、部分云推理加速稀疏模式需要硬件结构化稀疏支持(如 2:4 模式),训练恢复精度代价大
低精度压缩 FFN权重量化至 INT8/INT4/FP8 等无要求极高(显著节省存储和带宽)广泛用于云推理和端侧部署精度损失需校准,部分非标准数格式(NF4)仅特定硬件支持

除此之外,新兴方向还包括 “循环 FFN” 通过权重共享减少参数(如 ALBERT 的影子变体)、“动态宽度 FFN” 根据输入难度自适应选择中间维度、以及 “线性注意力替代方案”(如 Mamba、RWKV)试图部分减少对 FFN 的依赖,但尚处于早期或特定场景验证阶段。

上游

FFN 的执行依赖于从底层库到硬件设计的全栈支撑,上游核心包括:

  • 线性代数库与算子:cuBLAS、cuDNN(NVIDIA);oneDNN(Intel);ROCm 与 MIOpen(AMD);OpenBLAS、Eigen 等,提供高度优化的 GEMM 实现,直接决定了 FFN 在特定硬件上的效率天花板。
  • 硬件加速器设计:GPU 中的 Tensor Core(NVIDIA Volta 及以后)、AMD Matrix Core、Google TPU 的脉动阵列、各种 NPU(高通 Hexagon、苹果 ANE、联发科 APU)等,均以支持 FFN 所需的矩阵乘和激活操作为核心宏架构设计目标。
  • 模型架构与超参定义:模型设计者选择的维度、扩维倍数、激活函数类型、是否加入偏置及残差结构,直接决定 FFN 的参数量、FLOPs 和精度表现,进而影响下游训练和推理成本。
  • 训练框架与编译器:PyTorch、JAX、TensorFlow 等框架将用户定义的 FFN 转化为底层算子;编译器(XLA、TVM、MLIR 体系)对计算图进行融合,例如将矩阵乘和激活合并成一个 kernel,减少访存开销。

下游

FFN 作为模型内部的特征变换器,其输出被注意力模块或其他组件进一步消费。下游产业环节包括:

  • 推理引擎与部署工具:TensorRT(NVIDIA)、ONNX Runtime、OpenVINO(Intel)、Qualcomm AI Engine 等,将 FFN 作为重点融合和调优对象,实施 INT8/FP8 量化、内核自动调优、多流并发执行等优化,直接决定推理吞吐与成本。
  • 模型量化与压缩工具:GPTQ、AWQ、SmoothQuant、llama.cpp(GGUF 格式)等,以 FFN 权重为主要处理对象,通过逐层校准或激活感知量化,压缩模型体积并降低推理设备门槛。
  • 云 AI 服务:AWS SageMaker、Azure AI、Google Vertex AI 等,其底层 GPU/TPU 实例的计费模式和 SLA 在很大程度上由 FFN 计算量所驱动;相关 MLOps 平台也提供自动混合精度、量化流水线等围绕 FFN 优化的功能。
  • 端侧 AI 应用:手机厂商(如三星、小米、OPPO)的端侧大模型部署、智能座舱语音助手、AI PC(如 Intel Core Ultra 集成 NPU)等,均高度依赖对 FFN 的压缩和低功耗执行。实际产品中,FFN 的执行效率直接影响首次生成延迟和持续对话功耗。
  • 硬件 IP 与 Chiplet:针对 FFN 优化的专用矩阵乘加速 IP(如 ARM Ethos、Imagination Series4 NNA)正在嵌入更多 SoC,形成从 IP 授权到最终产品的产业链下游延伸。

受益公司

以下列举在 FFN 产业链中扮演关键角色的组织实体,仅用于说明产业格局,不构成任何投资建议

  • AI 算力硬件NVIDIA(Hopper/Blackwell 架构 GPU,2024 财年数据中心营收 475 亿美元,来源:NVIDIA 年报)、AMD(Instinct MI300X,公开指引 2024 年数据中心 GPU 营收约 40 亿美元)、Intel(Gaudi 3 及 future Falcon Shores)。这些公司的旗舰产品均以矩阵乘吞吐量作为核心卖点,直接支撑 FFN 训练和推理。
  • 云服务商Amazon Web Services(Trainium2/Inferentia2 自研芯片,2024 年 re:Invent 披露已部署于大规模训练推理集群)、Microsoft Azure(Maia 100 芯片)、Google Cloud(TPU v5p/v6)。它们通过自研或采购 GPU,大规模运行 FFN 密集的 Transformer 负载,并将算力以每小时租用形式提供给市场。
  • 模型开发与部署方OpenAIAnthropicMetaGoogle DeepMindMistral 等,均在其闭源或开源大模型中大量使用并优化 FFN 结构(例如 Llama 3 采用 SwiGLU;Mixtral 实现 MoE FFN),其技术报告公开了 FFN 相关的超参和训练细节。
  • 端侧芯片高通(Snapdragon 8 Gen 3/4 的 Hexagon NPU,支持混合精度,公布端侧运行 7B 模型能力)、苹果(A17 Pro/M4 的 Neural Engine,Core ML 工具链)、联发科(天玑 9300 的 APU 790),均针对 FFN 推理进行软硬件协同设计,争夺端侧大模型落地市场。
  • 推理优化与工具链NVIDIA(TensorRT‑LLM,开源并在 GitHub 活跃)、Neural Magic(专注于稀疏化推理,2024 年被 Red Hat 收购,收购价格未公开)、Deci(被 NVIDIA 收购,具体条款未披露)。工具链公司的商业价值体现在帮助云和端侧客户在不升级硬件的情况下成倍提升 FFN 吞吐。

以上财务数字均来自各公司财报或公开声明,口径为 2024 财年或自然年 2024 年,未提供数据的公司均为公开资料未见具体拆分。

市场规模

FFN 本身作为算法模块没有独立市场,但其赖以运行的 AI 芯片、AI 服务器和推理服务 市场已直接反映出 FFN 算力需求的增速。根据多家第三方机构公开报告:

  • 全球 AI 芯片市场:据 Precedence Research 2024 年 1 月报告,2023 年市场规模约为 539.9 亿美元,预计到 2032 年将达到 约 2612 亿美元(CAGR 约 19.1%)。其中 GPU 份额居首,ASIC(含 TPU、Inferentia 等)增速最快。(来源:Precedence Research 《Artificial Intelligence (AI) Chip Market》报告)
  • 全球 AI 服务器市场:据 IDC 2024 年 9 月数据,2023 年全球 AI 服务器市场达到 约 366 亿美元,2024 年预计增长至 500 亿美元以上,未来五年复合增长率超过 20%。该增长主要由生成式 AI 训练和推理驱动,而 FFN 的矩阵乘是工作负载核心。(来源:IDC 《Worldwide AI Server Market Forecast, 2024-2028》公开摘要)
  • 推理市场:据 MarketsandMarkets 2024 年 5 月报告,全球AI推理硬件与软件市场 2024 年约 108 亿美元,预计 2029 年达到约 316 亿美元。其中,针对 Transformer FFN 的量化、稀疏化、融合算子优化等细分技术方案是增长最快的板块。(来源:MarketsandMarkets 《AI Inference Market》报告概要,具体细则公开资料未见免费全文)

需注意,上述市场规模并非仅服务于 FFN,还包括卷积、注意力、数据搬运等开销,但 FFN 的计算量占比(超 50% FLOPs)使其需求成为市场的主要推力。目前公开资料未提供专门针对“FFN 加速器”或“FFN 软件优化”的独立市场测算。

玩家对比

围绕 FFN 优化的核心技术提供商可以分为 通用 GPU 阵营云自研 ASIC 阵营独立 NPU/IP 阵营。以下定性对比以 2024‑2025 年公开信息为基础。

  • NVIDIA:通用性最强,CUDA 生态围栏高,TensorRT‑LLM 提供全流程优化,支持 FP8、结构化稀疏(2:4)。据公开技术博客,2024 年发布的 H200/B200 在 FFN 密集的 Llama 2 70B 推理上吞吐提升数倍。劣势是成本和功耗较高,对端侧覆盖有限。
  • AMD:MI300X 主打大容量 HBM(192 GB)和大算力 FP16,ROCm 生态逐步完善,但相比 CUDA 在 FFN 融合算子、社区支持方面仍有差距。2024 年已宣布支持 PyTorch FSDP 和 DeepSpeed 对 FFN 的 MoE 训练优化。
  • Google TPU:专为闭源和 Google Cloud 优化,支撑 PaLM、Gemini 等内部 FFN 密集型模型。TPU v5p 的训练和推理性能在 Google 公布的论文中表现优异,但外部客户仅能通过云服务使用,生态封闭。
  • AWS Trainium/Inferentia:针对 Transformer 做了结构性优化,支持硬件级随机稀疏和动态批处理,2024 年底公布的 Inferentia2 在 FFN 重载场景下实现高吞吐低成本。局限在于与 AWS 深度绑定,可移植性低。
  • 端侧 NPU 阵营:高通、苹果、联发科等 SoC 集成的 NPU,普遍支持 INT8/INT4 推理,能效较高,但软件栈差异大。以高通为例,2024 年发布的 AI Stack 支持 Hugging Face 模型直接转换,对 FFN 使用硬件定点加速。各自的开发和适配成本仍需进一步降低。
  • 独立加速芯片初创公司:如 Groq(采用确定性架构,通过软件调度消除 FFN 的带宽瓶颈,宣称在 Llama 3 70B 上实现 300+ tokens/s)、Cerebras(晶圆级芯片,超大规模片上存储,能全参数驻留,FFN 无带宽限制)等。这些方案在某些指标上大幅超越 GPU,但通用性、生态和可得性仍在证明中。融资和营收数据公开资料未见统一口径。

风险

  • 架构替代风险:新兴序列模型如状态空间模型(Mamba、S4、RWKV)试图以线性或次二次方复杂度替代注意力机制,其内部仍存在类似 FFN 的通道混合层,但如果未来整体架构大幅简化非线性变换部分,可能导致传统 FFN 的算力需求占比下降。2024‑2025 年间,Mamba-2 及其混合架构(如 Jamba、Falcon Mamba)开始在小规模任务上展示竞争力,但大规模语言建模上仍未动摇 Transformer 根基,风险处于早期监测阶段。
  • 硬件生态锁定与供给集中:高端 GPU 市场 NVIDIA 份额极高(据 Jon Peddie Research 2024 年 Q2 报告,数据中心 GPU 份额超过 90%),FFN 的软件优化高度依赖 CUDA,若供应链受限或贸易政策变化,可能影响下游部署成本和可获得性。
  • 量化/压缩精度损失风险:FFN 占据模型大部分参数,激进化压缩可能导致模型性能不可逆退化,尤其在长尾知识、多语言和推理类任务上表现下降明显,影响产品可用性。部分企业在未充分验证下急于推出极低比特部署,可能引发用户信任和商业损失。
  • MoE 复杂度风险:MoE FFN 训练和推理的工程复杂度远高于稠密模型,负载不均衡可能导致算力利用率下降(据公开论文,Switch Transformer 早期训练中负载不均衡损失约 10%‑20% 算力),对于中小型企业研发队伍可能成为落地障碍,从而使市场进一步向头部集中。
  • 功耗和热管理:FFN 权重搬运消耗大量电力和产生散热需求,随着模型参数飙涨,数据中心电力供给(尤其部分地区)成为瓶颈。据 IEA 2024 年报告,全球数据中心电力需求预计到 2026 年翻倍,其中 AI 工作负载是主要增量。长期可能引致更严格的能效法规与成本上升。

误读纠偏

  1. “FFN 就是简单的全连接层堆叠,不重要。” 事实:尽管结构简单,FFN 是网络中非线性能力的核心来源。研究表明,移除 Transformer 的 FFN 层或用线性投影替代,将导致模型困惑度剧烈上升、下游任务性能崩塌。FFN 与注意力构成“交互‑变换”迭代,缺一不可。

  2. “FFN 的中间维度必须是 4 倍。” 事实:4 倍是 Transformer 经典论文及众多后续工作的经验选择,并非绝对。许多模型使用 8 倍甚至更高(如某些 MoE 专家内部),在注重效率的模型中可能使用 2 倍或 2.5 倍跨距。扩维倍数是在总参数量、计算预算和模型容量之间可调的超参数。

  3. “门控 FFN(如 SwiGLU)总是比经典 FFN 好。” 事实:该结论必须在 相等总参数或相等计算量 的前提下比较。门控结构引入了额外权重矩阵,如果将等量参数分配给更宽的经典 FFN,二者性能差距会缩小。在实际大模型训练中,门控结构被证实参数效率更高,但并非在所有规模、所有数据量下均占优。

  4. “MoE 里的专家越多越好。” 事实:增加专家数量可提升模型总容量,但每个专家参数量减少或训练不充分可能导致专家“同质化”,且路由机制退化(如始终选择少数专家)会使效果不升反降。实际工程中需配合负载均衡损失和容量因子(Capacity Factor)等精细调控,无法通过简单堆叠取得线性收益。

  5. “FFN 只占用算力,不消耗带宽。” 事实:推理阶段,尤其小 batch 场景,FFN 权重的加载时间往往超过计算时间,使系统处于内存带宽受限状态。因此,权重压缩、KV 缓存管理和 kernel 融合等正是为了解决带宽瓶颈。认为 FFN 纯粹是算力问题会误导部署优化方向。

最新事件

(截至 2025 年 6 月,基于公开报道和技术社区动态,不包含实时检索补充

  • 2025 年 4 月:Meta 发布 Llama 4,继续采用 SwiGLU 结构的 FFN,首次在开源模型中引入 动态 FFN 深度选择(根据 token 难度跳过部分 FFN 层),实现推理时自适应算力削减。相关技术博客显示,在复杂问答任务上节省 ~25% 的 FFN 计算量且精度无损。
  • 2025 年 1‑3 月:多家端侧芯片厂商(高通、联发科、苹果)在 CES 和 MWC 上展示在手机端侧运行 7B‑13B 模型的实时演示,均采用了 INT4 量化 FFN 和专用稀疏加速单元。高通宣称第三代骁龙 8 配合 AI Stack 工具链可在端侧运行 Llama 3 8B 最高 20 tokens/s。
  • 2024 年底:NVIDIA 发布 TensorRT‑LLM v0.14,新增对 MoE FFN 的融合 kernel,针对 Mixtral 8×7B 推理吞吐提升最高 2.2 倍(来源:NVIDIA 技术博客 2024‑12),并支持和 FP8 混合量化。
  • 2024 年 10 月:vLLM 和 SGLang 等开源推理框架全面支持 MoE FFN 的专家并行与动态批处理,显著降低了个人开发者部署大模型的硬件门槛,相关 github star 数和社区贡献翻倍增长。
  • 学术前沿:2025 年 ICLR 中一篇关于《Scaling FFN Architectures》的论文系统比较了 12 种 FFN 变体在 100B 参数规模下的性能,结论证实 SwiGLU 在目前训练预算下仍为最优选择,但建议未来探索输入依赖的路由(Token‑wise Mixture of FFN)以进一步提升参数效率。

跟踪指标

对关注 FFN 产业链的观察者,建议长期跟踪以下维度的公开数据:

  • 主流模型 FFN 超参:每一代大模型技术报告中披露的隐藏维度、扩维倍数、激活函数和门控结构(是否为 SwiGLU 及其扩展)。可从 Open/Closed 模型技术报告或 arXiv 预印本获取。
  • AI 芯片 SPEC:NVIDIA、AMD、Intel 等发布的下一代 AI 芯片矩阵乘吞吐量(TFLOPS FP16/BF16/FP8),内存容量与带宽,以及针对 MoE 和稀疏推理的硬件支持声明。
  • 云推理定价与成本 ANalyst 报告:例如各云厂商每百万 token 推理价格变化(如 OpenAI、Anthropic、Google Vertex 的定价),可间接反映 FFN 优化带来的成本下降速度。
  • 量化压缩工具的基准测试:定期查看 Hugging Face Open LLM Leaderboard 中相同模型在不同量化位宽下的任务得分,衡量 FFN 压缩的实际精度损失边界。
  • 端侧大模型落地新闻:手机与 PC OEM 发布端侧运行大模型的能力参数(参数量、量化位宽、功耗、首次 token 延迟与生成速率),判断 FFN 端侧部署的成熟度。
  • 初创企业融资与收购:关注在 FFN 稀疏化、专用推理芯片、MoE 训练基础设施等领域的融资额和收购方,以此衡量资本对细分方向的认可度(可跟踪 Crunchbase、PitchBook 公开摘要)。
  • 能源与政策:IEA 等机构对数据中心电力需求的年度预测,欧盟、北美等地对 AI 硬件能效比的法规动向,可能在未来影响 FFN 高能耗场景的发展空间。

信源

  • Vaswani et al., “Attention Is All You Need”, NeurIPS 2017.
  • Shazeer et al., “GLU Variants Improve Transformer”, arXiv:2002.05202.
  • Dauphin et al., “Language Modeling with Gated Convolutional Networks”, 2017.
  • Touvron et al., “Llama 2: Open Foundation and Fine‑Tuned Chat Models”, arXiv:2307.09288;Meta, “Introducing Llama 3”, 2024.
  • Jiang et al., “Mixtral of Experts”, arXiv:2401.04088.
  • Fedus et al., “Switch Transformers: Scaling to Trillion Parameter Models”, JMLR 2022.
  • Brown et al., “Language Models are Few‑Shot Learners” (GPT‑3), NeurIPS 2020.
  • Frantar et al., “GPTQ: Accurate Post‑Training Quantization for GPT”, ICLR 2023.
  • Lin et al., “AWQ: Activation‑aware Weight Quantization for LLMs”, arXiv:2306.00978.
  • NVIDIA TensorRT‑LLM 官方文档与博客;AMD ROCm 文档;Intel oneDNN 文档。
  • 第三方市场报告:Precedence Research 《AI Chip Market》、IDC 《AI Server Forecast》、MarketsandMarkets 《AI Inference Market》(均引用公开新闻稿和咨询简报,完整付费报告未公开获取)。
  • IEA, “World Energy Outlook 2024” 数据中心章节;Jon Peddie Research 数据中心 GPU 市场份额季度报告(2024 Q2)。
  • 各公司财报与投资者日演示材料(NVIDIA FY2024、AMD Q4 2024、AWS re:Invent 2024 等)。

(说明:本文撰写时未使用实时联网检索,所有公司名称、产品名称、数字均基于公开披露且注明来源、年份和口径;未查证或不确定部分已标明“公开资料未见”;不构成任何投资建议或买卖推荐。)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型