大语言模型
3 秒看懂
大语言模型(Large Language Model, LLM)是一种基于海量文本数据训练的超大规模人工神经网络。其核心运作机制可简化为“自回归文本预测”——即模型根据已输入的上下文,逐词预测并生成最可能的下一个词元。凭借高达数千亿乃至万亿级别的参数规模,LLM展现出了接近人类的泛化语言智能,能够在对话、写作、编程、数学推理、逻辑规划等多领域执行复杂任务。产业层面,LLM是当前生成式人工智能浪潮的基座,也是驱动全球AI算力需求指数级增长的核心引擎。
3 分钟产业解释
LLM的本质价值并非对海量知识的静态存储与检索,而在于其通过自监督预训练习得的对世界知识、语言结构、常识逻辑及推理路径的深层建模与压缩能力。其技术实现路径通常分为两个主要阶段:
- 预训练阶段:在海量互联网级语料(涵盖网页、书籍、学术论文、代码库等)上进行,模型的学习任务被设计为“预测序列中的下一个词元”。通过这一过程,模型构建起对世界的概率化表征。
- 后训练/对齐阶段:在预训练模型基础上,通过有监督指令微调和基于人类反馈的强化学习或直接偏好优化(DPO)等技术,使模型的输出更符合人类指令、偏好、价值观及安全规范。推理时,LLM以自回归方式工作,每生成一个新的词元,就将其拼接到先前的序列中,作为下一步预测的输入,循环往复直至生成完整回应。
产业影响已远超自然语言处理本身,正系统性地重构人机交互范式与数字产业链:
- 交互入口的变革:以ChatGPT、Claude、Gemini为代表的对话式AI正成为新一代信息获取与任务执行入口,对传统搜索引擎、知识库及软件交互界面构成根本性冲击。代码生成(如GitHub Copilot)、文档摘要、会议纪要等应用已成为生产力工具的新范式。
- 算力需求的爆炸式增长:训练一个千亿参数的密集模型,需部署数千张以英伟达H100等为代表的高性能GPU集群,持续运行数周乃至数月。推理阶段,为服务全球数亿用户的高并发请求,同样需要万卡级推理集群支持。这直接拉动了高带宽存储器、先进封装(如台积电CoWoS)及AI专用芯片的全产业链产能紧张。
- 产业生态的重构:产业正从传统的“芯片-云-应用”链条,演变为“AI芯片/基础设施-模型即服务-应用层”的三层解耦架构。云服务商、模型开发商、应用及工具链厂商的角色正在重新洗牌,模型能力成为定义生态的关键控制点。
LLM领域的核心壁垒已从早期的模型架构创新,转向涵盖数据工程、大规模训练系统稳定性与效率、以及复杂对齐技术在内的系统性工程能力。
技术原理
核心架构:仅解码器Transformer
当代绝大多数主流LLM均采用Transformer的“仅解码器”变体架构。其核心计算单元是堆叠数十甚至上百层的Transformer块,每个块内部由以下关键组件构成:
- 掩码多头自注意力机制:这是LLM长距离依赖建模能力的核心。它允许当前词元在生成时,计算与历史上文所有词元的关联权重,并通过掩码矩阵确保计算是因果的(即不浏览未来信息)。其计算复杂度与序列长度n的平方成正比,记为O(n²d)(其中d为维度),这成为长上下文处理时的主要计算与存储瓶颈。
- 前馈网络:位于自注意力层之后,对每个词元的位置进行独立的非线性特征变换。典型结构为两个全连接层,中间夹一个激活函数(如SwiGLU)。该部分承载了模型大部分的参数存储容量。
- 层归一化:在现代LLM中,通常采用前置归一化结构,对输入数据进行标准化处理,以稳定深层网络的训练过程。
- 位置编码:由于自注意力机制本身不具备对序列顺序的感知能力,需要显式注入位置信息。旋转位置编码是当前的主流方案,它通过复数旋转在注意力计算中乘积性地编码相对位置,对模型处理不同长度的序列有良好的外推能力。
训练机制:从数据到智能的转化
- 预训练目标:模型训练的目标是最大化训练数据中整个序列的联合概率。用公式可表达为:
L(θ) = Σ log P(token_t | token_<t; θ)。模型通过反向传播和梯度下降,不断调整其参数θ,以提升对下一个词元预测的准确性。 - 优化与精度:主流优化器为AdamW,它将权重衰减与自适应学习率解耦。训练普遍采用混合精度方案,前向和反向传播使用BF16或FP16降低显存占用和加速计算,而参数更新和优化器状态保留在FP32以维持精度。动态损失缩放等技术用于保障数值稳定性。
- 三维并行策略:为支撑万亿级参数模型的训练,必须将模型状态、数据和计算在数千乃至数万张GPU上协同调度,业界成熟方案为三种并行的叠加:
- 数据并行:每张GPU持有模型完整副本,处理不同的输入数据子集,梯度在所有GPU间同步。
- 张量并行:将单层Transformer内的参数矩阵切分到多张GPU,每张卡负责部分计算,层内进行高带宽通信来聚合结果。
- 流水线并行:将模型的不同层组分配到不同GPU组,输入数据被切割为微批次,在层组间流水执行,将通信限制在层组边界。
对于混合专家(MoE)模型,因其路由机制,会额外引入全对全通信,以将不同词元分发到不同专家进行计算,通信拓扑和负载均衡成为关键挑战。稳定运行万卡级GPU集群进行数月训练,涉及到从网络拓扑(如NVLink、InfiniBand)、存储到并行框架(如Megatron-LM、DeepSpeed)协同设计的极致工程调优。
推理优化:降低成本与延迟
LLM推理面临的核心挑战在于高内存带宽需求和自回归式串行生成导致的延迟。
- KV缓存:为免去对历史词元的重复计算,每次生成的词元其键和值向量会被缓存于显存。随着上下文增长,KV缓存呈线性增长,成为限制并发量和最大序列长度的主因。
- 核心优化技术:推理优化已是LLM工程领域的核心技术栈,方向包括:
- 计算注意力:如FlashAttention系列算法,通过分块计算和重计算策略,最小化对高带宽显存的读写次数,显著加速并节省显存。
- 模型量化:在可接受的精度损失下,将模型权重的数值表示从FP16压缩为INT8或INT4,以降低模型体积和内存带宽压力。
- KV缓存压缩:通过对历史键值对进行分组、淘汰或跨层共享,减少存储开销。
- 批处理与调度:通过连续批处理等策略,将多个用户的请求动态组成硬件计算批次,提升GPU利用率。
对齐技术:使模型符合人类意图
单纯的预训练模型无法区分指令与查询,其产出常有偏见或产生幻觉。对齐是其能力得以产品化的关键一步。
-
典型的RLHF流程:
- 收集人类对同一条提示的不同回复的偏好排序,训练出一个奖励模型,它能给任何回复打一个代表人类偏好的分数。
- 使用近端策略优化算法,用奖励模型的输出作为信号,去微调预训练语言模型自身,使得其产出能获得更高奖励分。
- 同时,在每个PPO迭代中,引入Kullback-Leibler散度惩罚项,防止模型为追逐高分而过拟合奖励模型的漏洞,从而偏离其基础语言能力太远。
-
替代方案:直接偏好优化(DPO):DPO通过巧妙的数学变换,省去了显式训练一个独立奖励模型的步骤,直接利用人类偏好数据优化策略模型,流程更简单且稳定,已成为开源社区和对齐研究的热门方向。
关键参数
评估和比较LLM时,需综合考量以下多维度参数,具体数值请以各厂商发布的最新技术报告与实测结果为准。
- 模型能力基准:
- 知识广度与深度:以MMLU(多任务语言理解数据集)为代表,衡量模型在57个学科领域(涵盖STEM、人文社科)的零样本或少样本准确率。
- 推理与逻辑:以GSM8K、MATH代表数学推理能力;以ARC、Big-Bench Hard代表常识与复杂逻辑推理能力。
- 代码生成:以HumanEval、MBPP等数据集的通过率评估模型基于文档串生成功能正确代码的能力。
- 多语言能力:以Flores、MGSM等多语言基准评估模型在非英语场景下的迁移表现。
- 人类偏好胜率:以LMSYS Chatbot Arena为代表,通过数万用户背靠背盲测,得到模型的综合Elo分数,是衡量其综合可用性、风格和安全性的关键指标。
- 训练成本与效率指标:
- 总训练计算量:通常以浮点运算次数计量。根据规模定律,约等于
6 × 模型参数量 × 训练数据词元数,是衡量算力投入的直接标尺。 - 算力投入:常用“总GPU·小时”作为统一计量单位。例如,Meta Llama 3 405B模型在2024年公开的数据中,称其在1.6万张H100 GPU上进行了总计3080万GPU小时的预训练开支(来源:Meta 2024年技术报告)。
- 模型浮点运算利用率:衡量在大规模分布式训练中,GPU实际完成的浮点运算占其理论峰值的比例,是评估训练系统效率的关键工程指标。业界头部的公开报道中,MFU可达50%以上。
- 总训练计算量:通常以浮点运算次数计量。根据规模定律,约等于
- 推理性能指标:
- 首词元延迟:用户发起请求到看到第一个字符响应的时间,直接影响体感,通常需控制在数百毫秒内。
- 生成吞吐量:在特定并发下,模型每秒可生成的词元总数,决定了服务的单位成本。单位通常为tokens/s/server。
- 上下文窗口长度:指模型单次可理解的最大文本长度,行业正从128k/256k向100万token乃至更长窗口演进,直接影响其处理整本文档、大型代码库的能力。
- 安全与对齐指标:包括但不限于有害内容输出率、幻觉率、提示注入攻击成功率、对不当请求的拒绝准确率等。这些指标通常由模型厂商内部使用红队测试评估,如Anthropic发布模型卡中包含此类结果。
技术路线
当前主流LLM的技术路线并非单一,而是在不同架构和资源约束下分化出多种方向,各有权衡。以下对比基于公开论文及行业分析:
| 维度 | 密集模型 | 混合专家模型 | 新兴探索:状态空间模型等 |
|---|---|---|---|
| 总参数量 | 7B–405B(截至2024年主流) | 8×7B(~47B)–万亿级 | 数十亿至百亿级为主 |
| 每词元激活量 | 等于总参数量,算力需求高 | 通常为总参数的1%–20%,效率高 | 与总参数量相当或更少,理论上计算和内存开销恒定 |
| 训练效率与挑战 | 训练算力正比于总参数,三维并行压力大 | 可能需更高总算力,全对全通信是瓶颈,负载均衡易坍塌 | 对长序列天然高效,收敛性仍需提升 |
| 推理效率 | KV缓存随上下文长度线性增长,显存带宽是瓶颈 | 激活参数较少,但需加载全部专家至显存,容量要求高 | KV缓存极小或恒定,在长序列推理上优势显著 |
| 典型应用场景 | 追求极致单一任务深度的通用模型 | 多语言、多任务混合路由,追求性价比的规模化服务 | 处理超长DNA序列、长视频流、本地端侧低延迟部署 |
| 主要挑战 | 高昂的训练和推理总成本 | 路由坍塌、节点间负载不均衡、通信开销大 | 在某些检索和事实性密集型任务上的效果仍在追赶 |
来源:综合Anthropic、Meta、Google、Mistral AI等公司2023-2024年公开技术报告及学术论文定性总结,非特定产品实测比较。
上游
大语言模型产业链上游涵盖构成其物理载体和“燃料”的所有硬件、基础设施及数据服务。
- 核心算力芯片:以英伟达H100、B200等GPU为主流,其供应能力和迭代速度决定了模型训练和推理的成本与性能上限。AMD Instinct MI300X等芯片也开始获得一定市场份额。此外,各云厂商和巨头(如谷歌TPU、微软Maia、亚马逊Trainium)均在自研AI芯片,形成差异化供应格局。
- 存储与互联:
- 高带宽内存:HBM是GPU不可或缺的近存缓存,其容量和带宽直接制约大模型单卡能装载的模型体积。该市场长期由SK海力士和三星电子主导,产能扩张节奏(据SK海力士与三星2024年财报及说明会披露)是AI芯片出货量的前置指标。
- 先进封装:台积电的CoWoS封装技术是连接GPU核心与HBM的关键,其2024-2025年产能持续翻倍,但仍处于供不应求状态。光模块等高速互联组件的需求亦随之拉升,为800G/1.6T速率迭代提供市场支撑。
- 数据与工具:
- 预训练数据:来源包括互联网爬虫数据(如Common Crawl)、新闻、书籍、学术论文、代码库(GitHub等)以及合成数据。数据质量筛选、去重、去毒及版权合规处理已成为比模型架构更耗资源的工程环节。
- 数据服务:对齐阶段依赖大量高度专业化的人工标注和反馈数据。Scale AI、Surge AI等数据服务商因此获得高增长。
- 数据中心基础设施:部署万卡级集群需配套高密度电力供应(单机柜功率往40kW+发展)和先进液冷散热方案。公开资料可见,微软、谷歌、Meta等云商将在2024-2025年持续加大对新建数据中心和改造工程的资本开支指引(来源:各公司季度财报电话会)。
下游
LLM的下游应用正从早期“尝鲜”逐步走向场景化落地,并分化为两个主要方向。
- 个人生产力工具:AI原生对话助手(如ChatGPT, Gemini, Claude)成为搜索、写作、脑暴、长文分析的个人助理。代码辅助工具(GitHub Copilot、Cursor等)已显著改变开发者工作流,微软FY2024 Q4财报显示,GitHub Copilot的收入达数亿美元级别。
- 企业级应用集成:
- 知识工作自动化:基于检索增强生成(RAG)技术的企业知识库问答、合同分析、会议纪要自动生成与跟踪。
- 垂直行业精调:金融领域的财报分析、法务领域的文书生成与审核、医疗领域的辅助诊断和医患交互。
- 新型用户界面:将LLM作为核心交互层,重塑软件、电商、游戏等行业应用,实现对话式操作或动态内容生成。
- 具身智能与物理世界交互:为机器人和自动驾驶系统提供顶层规划、任务拆解和复杂指令理解的大脑,将自然语言指令转化为一系列物理执行步骤。
受益公司
此处基于产业链位置和公开市场信息梳理,不构成任何投资建议。
- 基础设施及芯片层:
- 英伟达:其AI训练/推理解决方案事实性主导市场,2024财年数据中心营收达475亿美元,为直接映射标的。
- SK海力士、三星电子:AI存储硬需求的核心供应商,其HBM产能和良率是业绩关键变量。
- 台积电、博通、中际旭创等:分别从先进封装、ASIC设计、高速光模块的旺盛需求中受益。
- 云计算平台:
- 微软:通过深度绑定OpenAI,将模型能力全面融入Azure云和Office 365等产品生态(Copilot系列),获取订阅和云使用量双重收益。
- 亚马逊AWS:作为托管模型服务商和自研芯片推广者,以及Anthropic的最大投资方,构建了广泛的模型生态。
- 谷歌云:拥有从自研TPU到Gemini系列模型的垂直整合优势。
- 模型及应用层:
- OpenAI, Anthropic:前者凭借先发优势和消费者规模,后者凭借安全和企业市场,形成闭源模型领先阵营。其营收均来自API调用量和C端会员订阅,但两公司私募市场估值的增长反映了市场对前置投入的折现,而非当期财务表现。
- Meta:作为开源模型的最大推手,通过LaMA系列赋能社区生态,其商业回报体现在广告系统效率提升、推荐系统改进等内部赋能。
- Salesforce, Adobe, ServiceNow等应用软件巨头:通过将GenAI功能嵌入其CRM、创意工具、IT服务管理平台,实现产品提价和用户粘性增强。
市场规模
对LLM直接相关市场规模的估测,口径差异巨大,需分层次看。
- 大模型训练市场:杰富瑞2024年估算,全球头部AI模型年度训练总支出有望在未来几年内达到数百亿美元级别。这主要由少数头部玩家的巨额CAPEX推动。
- 生成式AI软件与服务市场:据IDC 2024年预测,全球生成式AI相关支出(含软件、服务、相关服务器硬件)在2023年约160亿美元,到2027年将增长至1430亿美元,复合年增长率达73.3%。该口径覆盖范围较宽,包括了各行业应用。
- LLM API及按量付费市场:此细分市场增长最快但透明性较低。根据各厂商公开的API定价趋势,推理单位成本正以每年超过50%的速度下降,刺激调用量指数级增长。例如,OpenAI的GPT-4系列在2024年多次下调价格(来源:OpenAI官方定价页公告),推动企业试错和规模化部署成本降低。
玩家对比
当前市场呈现“闭源双头”与“开源众强”竞争的格局。
-
闭源阵营:
维度 OpenAI Anthropic 旗舰模型 GPT-4o系列 Claude 3.5系列 核心定位 通用智能、全模态、平台化 安全对齐、可靠、长上下文 商业模式 消费者订阅+C端付费、企业API 企业API、与AWS生态共建 长处 生态最完善,消费者心智强 上下文窗口长度领先,安全性佳 -
开源阵营代表:
维度 Meta 中国代表:深度求索(DeepSeek) 旗舰模型 Llama 3 系列 DeepSeek-V3, DeepSeek-R1 核心定位 构建开放生态,赋能内部产品 极限性价比、开源、推理能力 长处 社区最活跃,衍生模型数量极多 特定推理任务性能优异,训练成本远低于同侪 市值/估值映射 内部商业化,无直接API营收 通过API获取早期营收,私募市场高关注 中国其他主要玩家:阿里巴巴的通义千问系列凭借电商及云生态的结合,在企业客户侧有场景优势;字节跳动的豆包大模型以极低API价格和与自身海量应用生态的结合为特色,拉动调用量增长。此处仅作定性梳理,产品名及市场策略来源于各公司2024年公开发布内容。
风险
- 技术路线风险:行业尚未收敛于统一最优架构。MoE、状态空间模型、密集模型的演进路径存在不确定性,企业在某一技术栈上的大量投入可能因范式转换而“沉没”。
- 商业化不确定性:训练成本极高,但在API价格战下,模型层盈利时点尚不明确。IDC 2024年调研显示,尽管企业GenAI项目试点广泛,但实现正向投资回报率的案例仍属早期,大量企业可能因看不到清晰回报而缩减算力预算。
- 监管与合规:欧盟《人工智能法案》、中国AIGC监管等正对模型透明度、训练数据版权和高风险应用提出严格要求。使用受版权保护数据训练模型的法律风险悬而未决,可能带来额外合规成本和诉讼风险(如《纽约时报》诉OpenAI案,截至2025年初仍无最终裁决)。
- 开源冲击与价值迁移:开源模型正在极速追赶闭源能力,这可能将价值从模型层向基础设施层和应用数据层迁移,削弱闭源模型厂商的议价权。
- 幻觉与安全:模型产生事实性错误(幻觉)和易受提示攻击的安全问题,是企业端高可靠性场景部署的核心阻碍。
误读纠偏
- 误读:“LLM就是大一点的文本预测器,没有真正的理解。” 事实:虽然其训练信号源于“下一个词预测”,但在数据和参数规模越过阈值后,模型涌现出了组合泛化、逻辑推理等能力。人工智能领域的理解通常强调其能基于世界模型进行“预测”和“操作”,LLM通过预测文本实现对物理和社会世界规则的压缩,这是对“理解”的一种功能性实现路径,而非简单的数据复读。
- 误读:“MoE模型的激活参数就是总参数除以专家数。” 事实:由于模型中的共享层(如注意力层、第一层嵌入和最后一层归一化)对所有词元都会激活,并不参与路由。每个词元激活的参数实为:全量共享层参数 + 被路由到的单个或多个专家的FFN参数之和。因此,激活参数占比受架构设计影响极大,并不能简单地用总参数量除以专家数量来计算。
- 误读:“所有大模型都已经多模态化了。” 事实:多模态是重要方向,但语言模型与扩散模型、视觉编码器的有机整合仍需解决模态对齐、幻觉和训练稳定性等难题。当前许多产品是在语言内核外围接入视觉等模型组合完成的,与原生统一多模态大模型在整合深度上存在差异。
最新事件
- 推理能力与测试时计算扩展:2024年下半年至2025年初,以OpenAI o1系列和DeepSeek-R1为代表的新模型,展示了一条新的能力扩展路径。即不单靠增加预训练规模,而是让模型在推理(回答问题)时进行慢思考,生成内部思维链来探索多种解题路径。这使得对推理时的算力消耗和延迟成为新的设计维度。
- 算力竞赛加剧:Meta CEO扎克伯格于2025年1月公开宣布,公司2025年AI相关资本支出计划高达600-650亿美元。微软、谷歌和亚马逊也相继公布了类似量级的AI基础设施投资指引,显示出全行业对Scaling Law仍有效的坚定假设。据Omdia估计,2024年全球AI服务器的总资本支出约有2290亿美元。
- “DeepSeek效应” :2024年末至2025年初,中国模型厂商深度求索发布的DeepSeek-V3和R1模型,据其技术报告声称以远低于头部公司的预算(训练V3仅用约557万美元的公开云GPU时)实现了性能的追平。这引发了对行业巨额CAPEX效率的全球性讨论,但也成为推动模型高效推理算法和开源生态的催化剂。
- AI Agent(智能体)深化:Anthropic发布“Computer Use”功能、谷歌演示Project Mariner,多家公司正推动模型从聊天机器人向能操作软件、浏览网页的自主智能体演化,这被视为2025年最重要产品化方向。
- 注:以上相关CAPEX计划信息均源自各公司2025年1月季度电话会或官方博客。
- 来源:公开网络检索。
跟踪指标
- 硬件层:英伟达季度数据中心收入(反映整体需求);SK海力士/三星HBM产能和良率提升节点;台积电CoWoS产能扩张及利用率;北美主要云商资本支出指引(微软、亚马逊、谷歌、Meta)。
- 模型能力层:LMSYS Chatbot Arena排行榜排名变化;MMLU、HumanEval、GSM8K等基准新进模型最好成绩;前沿模型首次通过某项公认难度的科学/数学基准;开源模型与最强闭源模型间的相对性能差值。
- 应用与商业化层:OpenAI、Anthropic等初创公司定期披露的营收规模和付费用户数;主要云平台AI服务收入占云总收入比重的环比提升速度;头部企业应用软件AI插件客户采用率。
- 成本层:OpenAI GPT系列、各开源模型API的每百万Tokens推理混合价格;训练同级别模型所消耗的计算量变化趋势;万卡集群的公有云租赁价格和模型浮点运算利用率提升情况。
- 风险层:全球主要AI监管法案的通过及实施时间轴;涉及LLM的重大版权诉讼案进展;知名AI安全事件或重大技术缺陷报告(如重大偏见、提示攻击泛滥)。
信源
- 学术与机构来源:
- Vaswani et al., “Attention Is All You Need”, 2017. NeurIPS.
- Brown et al., “Language Models are Few-Shot Learners”, 2020. NeurIPS.
- Ouyang et al., “Training language models to follow instructions with human feedback”, 2022. NeurIPS.
- Touvron et al., “LLaMA: Open and Efficient Foundation Language Models”, 2023. arXiv.
- IDC, “Worldwide Generative AI Spending Guide”, 2024.
- 企业与行业来源:
- 英伟达、台积电、SK海力士、微软、亚马逊、谷歌、Meta等季报及财年报告。
- OpenAI、Anthropic、Meta AI、DeepSeek等官方技术报告及博客。
- Omdia, Tom‘s Hardware, SemiAnalysis等半导体与数据中心产业分析机构的公开数据及估算。