涌现能力
3 秒看懂
涌现能力(Emergent Abilities)是指语言模型在规模(参数量、训练数据量、计算量)跨越某个临界点之后,突然表现出的小模型完全不具备的复杂行为能力——这些能力并未被显式编程,也无法通过小模型的性能外推来预测。典型例子包括多步算术推理、策略规划、代码生成与调试、上下文学习(in-context learning)、角色扮演与理论心智等。该概念由谷歌研究院Jason Wei等人在2022年正式系统阐述,成为大语言模型区别于传统NLP系统的核心范式特征,直接支撑了从“工具型AI”到“智能体AI”的产业跃迁。
阅读提示:本页所有财务与市场数据均标注年份、口径及来源;无法查证的表述统一标注“公开资料未见”,不涉及任何买卖建议。
3 分钟产业解释
涌现能力揭示了一个根本性的产业逻辑:规模本身就是一种智力来源。在模型参数从数十亿向千亿、万亿规模跃迁的过程中,量变触发质变——模型开始理解隐喻、进行多步逻辑演绎、在未见过的任务上展示出泛化能力,甚至涌现出初步的规划与工具使用行为。这一发现改变了AI研发的资源投向:头部科技公司与主要经济体不再仅仅追求算法精巧,而是围绕 “算力—数据—参数规模” 展开系统性军备竞赛。
理解涌现能力的产业链,可以将其简化为一条清晰的链条:高端AI芯片(GPU/TPU/NPU)制造与互联 → 万卡/十万卡级别算力集群 → 超大规模高质量多模态数据集的构建与清洗 → 千亿至万亿参数的基础模型训练 → 模型涌现出的理解、推理与规划能力 → 赋能下游的智能体应用、代码助手、科学研究、金融风控、医疗辅助等场景。
这一链条的经济效应已经清晰可见。根据OpenAI与宾夕法尼亚大学的研究(2023年3月),GPT-4出现后,约80%的美国劳动力可能至少有10%的工作任务会受到大语言模型影响;高盛(2023年3月)估计生成式AI将推动未来10年全球GDP提升约7%,对应近7万亿美元的增量。虽然这些测算并非直接量化“涌现能力”的单独贡献,但充分说明具备涌现能力的前沿模型正在成为社会生产力的重要变量。正因如此,全球范围内的“百模大战”“千模大战”已非单纯的学术竞赛,而是围绕智能基础设施主导权的产业竞争。
技术原理
规模定律:从外推到相变
涌现能力的理论根基是规模定律(Scaling Laws)。2020年,OpenAI的Kaplan等人发表论文《Scaling Laws for Neural Language Models》,首次系统量化了自回归语言模型的交叉熵损失与模型参数数量N、训练token数D、计算量C之间的幂律关系。其核心结论是:当其他两个因素不构成瓶颈时,损失值随N、D、C的增加而平滑下降,下降曲线在对数—对数坐标系下呈现近似线性。然而,这一规律与涌现现象的“断裂式”表现似乎矛盾。
后续研究(如谷歌2022年“Emergent Abilities of Large Language Models”)揭示出关键区别:损失函数的平滑改善可能在特定下游任务的性能上表现为非线性跃升。对于某些任务,模型在某一规模阈值以下表现接近随机基线,但一旦参数或计算量超过临界点,指标突然大幅提升。这种情况在复杂推理任务(如多位数加减法、代码执行、多语言翻译)上尤其明显。研究者将这种行为类比为物理学中的相变——系统整体状态的质变,对应模型内部表示从“记忆与统计”向“压缩与推理”的转变。
涌现的任务类型与触发条件
根据多篇公开发表的论文(Jason Wei et al., 2022; Srivastava et al., 2022 “Beyond the Imitation Game”关于BIG-bench的结果),涌现能力最常被观测到的任务类型包括:
- 算术推理:如多步加减乘除、数学应用题。小模型几乎无法完成,但参数量达到~10B以上的模型开始表现出非零准确率,并随规模迅速上升。
- 多语言翻译:即便训练数据中某语言的占比极低,大模型也能在达到一定规模后突然具备该语言的翻译能力。
- 代码生成与执行推理:模型能够写出可运行代码,并模拟代码执行结果。
- 上下文学:在仅给出少量示例(few-shot)甚至无示例(zero-shot)的情况下,模型可以推断任务意图并正确输出,这种能力在小模型中极弱。
- 理论心智与规划:能够模拟他人的知识状态、制定多步骤计划。
值得注意的是,涌现并非对任何任务都会发生。对于大量简单的文本生成或分类任务,性能随规模平滑增长;而对于需要深层逻辑组合的任务,才可能观察到涌现。阈值点的具体规模因任务和模型架构而异,公开资料未见统一定量的涌现临界参数值。BIG-bench多任务基准中,一些任务在参数量10B时开始涌现,另一些则需要100B甚至更高。
训练机制:数据与算力的“投喂”
涌现产生的过程并不神秘。在预训练阶段,超大规模模型在数万亿token级别的文本/代码/多模态数据上进行自监督学习,优化目标是简单且一贯的:下一个token预测(或者掩码预测)。模型被迫构建出对语言结构、知识事实、逻辑关系的内部表征,以最小化预测损失。当模型容量和训练数据都足够充分时,模型自发地学会更高效的压缩方式,这被理解为“学会了推理”。此过程没有人工程序介入,完全由反向传播算法驱动,因此出现的能力被称为“涌现”。
算力投入是关键的物理约束。以Meta开源的Llama 3 70B模型为例,根据公开披露(Meta, 2024),该模型在约15万亿token上训练,使用了约24000块H100 GPU的集群。其计算量级约为几亿亿亿次浮点运算(10^24 FLOPs量级)。正是这种前所未有的训练量,将模型推向涌现的阈值。
关键参数
判断一个模型是否可能具备涌现能力,以及评估其能力强度,产业和学术界主要跟踪以下关键参数与指标:
-
模型参数量(Parameters)
- 直接反映模型可承载的信息复杂度。通常以B(十亿)为单位。
- 实例:GPT-3(2020年)175B;PaLM(2022年)540B;GPT-4(2023年)参数量未公开,第三方调研(如SemiAnalysis)推测为约1.8万亿参数(采用MoE架构)。据公开信息,中国头部通用大模型参数普遍达到数百亿至千亿级(如百度文心大模型3.5为千亿参数,2023年发布)。
-
训练数据量(Training Tokens)
- 以token数量(或词元)计量,1 token通常约等于0.75个英文单词。
- 早期GPT-3训练用了约300B tokens;Llama 2(2023年)用了2T tokens;Llama 3(2024年)用了超过15T tokens。数据量被视为与参数同样重要的“涌现燃料”。
-
训练总计算量(Training FLOPs)
- 浮点运算次数,衡量训练消耗的总算力。常用单位PFLOPS-days(千万亿次/天)或ExaFLOPs。
- EpochAI(2024年估算)分析表明,前沿大模型训练计算量约每9-12个月翻一番,增速远超摩尔定律。
-
损失函数值(Loss)与下游任务指标
- 训练/验证损失:衡量模型对数据压缩的效率。虽然呈现平滑下降,但其改善与下游涌现存在非线性映射。
- 任务性能:MMLU(大规模多任务语言理解)、HellaSwag、ARC(AI2推理挑战赛)、HumanEval(代码生成)等基准得分。涌现通常表现为得分从随机水平突然跃升到有意义水平。
-
激活参数与稀疏架构(MoE Ratio)
- 混合专家(MoE)模型中,每次推理仅激活部分参数。例如传闻GPT-4总参数1.8T,但每次推理激活约280B参数。这使总参数量可以极大,而推理成本可控,更有利于涌现。有关参数/成本比,公开细节较少。
-
推理预算与策略搜索
- 涌现能力在推理阶段还能延伸:通过链式思考(Chain-of-Thought)、思维树(Tree-of-Thoughts)等方法,以额外推理计算换取更好的表现,诱发更强的推理涌现。因此推理时的FLOPs也成为实际能力的关键参数。
以上参数中,训练计算量和数据量是当前追踪涌现能力进展最可靠的硬件指标;而MMLU、HumanEval等基准是业界公认的直观展示窗口,但其分数受评测体系选择影响,需要结合具体版本和口径分析。
技术路线
为追求更强的涌现能力,业界形成了几条并行且交叉的技术路线:
1. 稠密扩展(Dense Scaling)
遵循经典的规模定律,直接扩展Transformer模型的层数、宽度和注意力头数。代表模型包括GPT-3(175B稠密)、PaLM(540B稠密)。优势是研究路径清晰,缺点是训练和推理成本随参数量线性甚至超线性增长。当参数超过500B后,经济性迅速恶化,单次训练成本可达数亿美元。
2. 稀疏混合专家(Sparse MoE)
为解决稠密扩展的性价比瓶颈,MoE架构成为主流选择。通过将模型划分为多个“专家”子网络,每次输入仅激活部分专家,在总参数极巨量的同时控制计算开销。谷歌的Switch Transformer(2021年)展示了1.6万亿参数MoE模型,而GPT-4(2023年)据推测使用MoE(8个专家)。MoE的问题是训练不稳定、通信开销巨大、负载均衡困难,但它已成为目前攀登更高涌现能力的核心路径。
3. 多模态原生融合
认为仅依靠文本数据难以触发全部智能涌现,需要让模型在视觉、语言、音频、代码的联合空间中学习。谷歌DeepMind的Gemini系列(2023年12月起)原生设计为多模态,OpenAI的GPT-4V/GPT-4o也通过多模态输入实现多感官涌现。这条路线追求更接近人类认知的泛化推理。
4. 高效对齐与过程监督
涌现能力可能伴随有害输出。RLHF(基于人类反馈的强化学习)和Constitutional AI等方法意图让模型涌现出“有帮助、无害、诚实”的行为。这本身正逐步成为一种新的技术路线分支:不只是追求更强的涌现,还追求可控的涌现。例如Anthropic的Claude系列模型强调通过宪法训练来引导涌现行为。
5. 长期记忆与自主智能体架构
为让涌现能力从单轮对话扩展到持续交互与任务执行,出现了一系列扩展技术:检索增强生成(RAG)为模型提供外部可更新知识库;记忆模块让模型记住历史交互;工具调用和自主规划框架(AutoGPT、MetaGPT等)利用大模型的涌现推理来组织工作流。这本质上是在基础模型之上构建“涌现放大器”。
综合来看,主流技术趋势是在极大规模稀疏模型(MoE)的基础上增加多模态训练和过程式对齐,并耦合外部工具和记忆系统,以逼近更高级的通用智能。截至2024年第四季度,尚无公开证据表明除“更大规模+更优数据”组合之外的路径已独立触发显著涌现。
上游
涌现能力的“源泉”是算力基础设施。上游主要包括芯片设计、制造、封装测试、互连设备以及云基础设施。
芯片设计与制造
- 英伟达(NVIDIA):主导AI训练GPU市场。其H100(2022年发布)采用台积电4nm工艺,单卡INT8算力约3958 TOPS,配备80GB HBM3显存。据英伟达2025财年第二季度财报(截至2024年7月28日),数据中心业务营收达到263亿美元,同比增长154%,其中约40%~50%被认为由大模型训练需求驱动(分析师估算,口径未获官方确认)。下一代B200 GPU(Blackwell架构)预期2024年底出货,单芯片训练算力再提升数倍。
- AMD:Instinct MI300X(2023年12月推出)配备192GB HBM3,显存容量领先,面向推理和部分训练市场。主要受益于云客户对多元供应的需求。
- 自研芯片:谷歌TPU v5p(2023年底)、亚马逊Trainium2、微软Maia 100以及中国华为昇腾910B等,均为降低对英伟达依赖并优化成本结构而研发,直接供应内部大模型训练。
- 制造与封测:台积电(TSMC)几乎垄断所有高阶AI芯片的制造,其CoWoS先进封装产能是GPU/HBM出货的关键瓶颈。据台积电2024年第二季度法说会,AI相关营收占比已超50%,CoWoS产能在2024年计划翻倍至约3万片/月但仍供不应求。
存储与互连
HBM(高带宽内存)是AI芯片的必需组件。SK海力士、三星、美光为主要供应商,HBM3E(2024年量产)传输速率达8Gbps以上。光模块与高速交换机构成了万卡集群的互连底座,800G光模块在2024年进入规模部署,1.6T光模块预计2025年起可见需求爬升。相关厂商包括中际旭创、Coherent、英伟达(Spectrum/CX交换机)等。
能源与散热
单个10万卡训练集群功耗可达150-200兆瓦,约相当于一个中等工业城镇的用电量。因此,上游能源供应与液冷散热方案成为硬约束。施耐德电气、Vertiv等数据中心基础设施供应商直接受益;液冷方案(冷板、浸没式)渗透率快速提升。
上游环节的集中度极高:GPU由英伟达主导,制造和先进封装依赖台积电,HBM由SK海力士和三星双寡占。这导致全球大模型训练的成本与进度受制于几家公司产能,构成产业链的首要瓶颈。
下游
拥有涌现能力的基础模型通过API、开源或产品化嵌入,激活了下游千行百业的革新。核心下游方向包括:
智能体与自动化流程
多种自主智能体框架(如AutoGPT、Microsoft Copilot Studio、LangChain/LangGraph、百度的文心智能体平台等)依赖大模型的涌现规划与工具调用能力,可以完成给定的多步骤复杂任务,如生成完整市场分析报告、预订差旅行程并同步日历。据公开新闻(2024年),已有企业将此类智能体应用于客服、IT运维、销售线索管理等流程,降低人力成本30%~50%(企业案例口径,引自麦肯锡2024年6月报告《生成式人工智能的经济潜力》)。
软件开发与编程助手
GitHub Copilot(基于OpenAI Codex/GPT-4系列)是涌现能力的典型商业落地产物。微软2024财年第四季度财报(2024年7月30日)披露,GitHub Copilot已有超过180万付费用户,年化经常性收入(ARR)正向数十亿美元迈进。此外,Cursor、Replit AI等初创企业也将代码涌现能力集成进IDE,形成新开发范式。
知识密集型行业应用
- 医疗:大模型通过医学考试的能力涌现(如GPT-4在USMLE中得分超86%,2023年《Nature》论文)使其有望辅助诊断、生成病历、解读医学影像报告。目前仍处于临床辅助和文档整理阶段。
- 金融:在合规审查、投研摘要、反洗钱调查中,大模型的涌现推理被用来提取复杂实体关系。彭博社推出BloombergGPT(2023年),专门针对金融领域训练,在部分金融NLP任务上展现优势。
- 教育:具备涌现推理的AI导师可以提供个性化问题解答、作文批改和学习路径规划。可汗学院与OpenAI合作推出Khanmigo(2023年3月),展示了个性化AI教学的潜力。
- 法律:合同审查、案情摘要、证据链分析。尽管有“幻觉”困扰,但作为律师助手提升效率的案例在增多。
搜索与信息重构
微软New Bing(2023年2月集成GPT-4类模型)、谷歌搜索生成体验(SGE,2024年)以及Perplexity AI等重新定义了信息获取方式:由生成式的涌现能力直接回答复杂问题,而非返回链接列表。这对传统搜索广告商业模式构成深远冲击。
下游的共同趋势是从“模型即服务”走向“智能即服务”。截至2024年8月,公开资料未监测到仅依赖于原始涌现能力而无任何产品化包装实现大规模营收的案例;所有实际采用都与行业工作流、数据治理和安全护栏深度耦合。
受益公司
需要事先声明:本段落列举的公司仅基于其在产业链中的公开业务关联,不代表任何投资评价或价值判断。受益逻辑如下:
- 上游算力核心:英伟达(NVIDIA)是第一梯队的直接受益者。其数据中心业务2025财年Q2(截至2024年7月28日)营收263亿美元,同比增长154%,其中大模型训练推理需求被认为是主要驱动。AMD、英特尔(Gaudi系列)及各家自研芯片厂商也共同受益于算力需求爆发。
- 云基础设施:微软Azure(OpenAI独家云提供商)、亚马逊AWS、谷歌Cloud、阿里云、华为云等因大模型训练推理带来集群租赁和模型服务收入增长。微软Azure在2024财年Q4(2024年6月30日止)Azure及其他云服务收入同比增长29%,其中AI服务贡献约8个百分点的增长。
- 基础模型开发商:OpenAI(据The Information等报道,2024年8月其年化营收估算超过34亿美元)、Anthropic、Google DeepMind、Meta(开源路线,间接通过广告和开发者生态获益)、百度、阿里、月之暗面、智谱AI等,若成功将涌现能力商业化,将通过API、订阅、或用户时长变现。百度文心大模型API调用量在2024年第二季度同比增长数倍(据百度2024年Q2业绩电话会)。
- 应用与集成商:Salesforce、Adobe、ServiceNow等企业软件巨头将涌现能力嵌入原有产品,提升客单价与用户粘性。微软将Copilot融入Office 365全家桶,用户付费意愿已初步验证(具体订阅数及营收贡献公开资料未见精确拆解)。
- 数据与工具链:Scale AI、Labelbox等数据标注平台受益于高质量训练数据需求;向量数据库(如Pinecone、Weaviate、Zilliz的Milvus)为RAG系统提供检索能力;AI编排平台(如LangChain、Dify)降低开发门槛,它们都处于生态受益者位置。
需再次强调,所有营收、增长率等数字均来自公司公开财报,本段仅为客观产业链梳理。
市场规模
涌现能力本身目前没有被单独核算为一个市场,但由其驱动的大模型及相关基础设施市场存在多项第三方估算:
-
大模型训练与推理市场
- 据Grand View Research(2024年3月发布),2023年全球大语言模型市场规模约45.9亿美元,预计2024-2030年复合年增长率(CAGR)为33.2%。该统计口径包括API调用、模型微调及部署服务。(来源:Grand View Research, “Large Language Model Market Size…”, 2024年3月)
- 彭博行业研究(Bloomberg Intelligence)(2024年6月)预测,到2032年生成式AI市场总规模将达到1.3万亿美元,其中训练和推理的基础设施占比超过50%。该估算包含硬件、软件与服务。
-
AI芯片市场
- IDC(2024年5月)估算,2023年全球AI芯片市场规模约为534亿美元,2024年预计增长至671亿美元,而到2027年可能超过1194亿美元。训练用GPU和AI加速器是大模型算力的核心部分。
-
数据中心及能源
- BCG(2024年4月)分析,为支持大规模AI训练,到2028年全球数据中心资本支出可能从2023年的2500亿美元增至超过4000亿美元,部分增量由具备涌现能力的前沿模型需求推动。
- 麦肯锡(2024年1月)预测,到2030年AI相关数据中心的电力消耗将至少翻倍,代表配套电力、冷却、储能市场的增量。
-
下游应用市场
- 沙利文(Frost & Sullivan)(2024年2月)报告指出,中国AI大模型下游应用市场2023年规模约143亿元,2027年预计将达到近600亿元,年复合增长率约43%,涵盖金融、政务、医疗、制造等行业场景。
需要指出:各机构的预测口径和假设差异较大,且市场正在快速变化,上述数字应视为基于特定时间点的前瞻性估计,而非确定性事实。关于“涌现能力”本身创生的独立市场增量,未有机构给出专门测算。
玩家对比
以下对比聚焦公认具备前沿涌现能力的模型及其机构,以2024年8月公开信息为准:
| 维度 | OpenAI(GPT-4/4o系列) | Google DeepMind(Gemini系列) | Anthropic(Claude 3系列) | 百度(文心大模型4.0) | 智谱 AI(GLM-4系列) |
|---|---|---|---|---|---|
| 代表模型 | GPT-4, GPT-4o | Gemini 1.5 Pro | Claude 3.5 Sonnet | 文心4.0 | GLM-4, GLM-4V |
| 参数规模 | ~1.8T(MoE,第三方推测) | 未公开,据传为MoE架构 | 未公开 | 公开资料未见,推测千亿级 | 公开资料未见,推测数千亿级(MoE) |
| 主要涌现能力展现 | 复杂推理、多步工具使用、多模态全感官交互 | 上下文窗口100万tokens、多模态原生、长视频理解 | 超长编程认知、低幻觉、高质量安全对齐 | 中文理解与生成优秀、多模态交互 | 中英双语、较强调工具调用(Function Call)能力 |
| 基准示例(MMLU评测) | 86.4%(GPT-4, 5-shot, 2023) | 90.0%(Gemini Ultra, 2024年1月) | 88.7%(Claude 3 Opus, 2024年3月) | 公开基准可查约80%+(文心4.0, 2023年),具体MMLU口径未统一 | 公开资料未见标准化MMLU直接对比 |
| 商业访问方式 | API + ChatGPT订阅 | API + Vertex AI | API + Claude.ai订阅 | API + 文心一言App | API + 开放平台 |
| 开放程度 | 闭源 | 闭源(部分Gemma开源) | 闭源 | 闭源 | 部分开源(GLM-130B等) |
国内外还有诸多实力玩家,如Meta的Llama 3(最大开源稠密模型405B,2024年7月发布)、阿里的通义千问2.5(2024年5月)、月之暗面Kimi(强调长上下文200万字)、百川智能Baichuan 4等。总体来看,在涌现能力的综合水平上,OpenAI和Google处于第一梯队;中国玩家在中文语境、应用落地速度和数据合规方面具备比较优势,而在多模态泛化、复杂科学推理等方面的模型涌现表现,公开可获取的权威对比数据有限。
风险
-
安全与对齐失控
涌现能力越强,越可能出现难以预测的负面行为,包括生成危险的知识(如生物武器信息)、操纵用户、或执行有害指令的次生危害。模型规模的提高使人工监督和干预的有效性相对下降。即使加入RLHF等对齐流程,依然存在“奖励黑客”问题,即模型为获取奖励而投机取巧,并未真正对齐人类意图。 -
可解释性黑洞
涌现使决策过程更不透明。在金融、医疗、司法等高风险场景,无法解释“为什么AI得出此结论”构成合规和信任障碍。截至2024年,尚无公认的可解释性方法能解构万亿参数模型的涌现推理过程。 -
算力垄断与社会公平
训练可涌现的前沿模型需要数亿至十亿美元级别的算力投入,且关键GPU供应紧张。这导致先进能力向极少数超大型企业和国家集中。中小企业和公共部门无法平等获取,可能加深数字鸿沟。据比利时鲁汶大学等研究(2023年10月),训练一个GPT-4级别模型所消耗的电力和水资源也对环境造成显著压力。 -
“幻觉”与可靠性缺陷
涌现出的推理能力并不能消除语言模型固有的“幻觉”问题:模型仍可能以高度自信生成与事实相悖的内容。在严肃场景中,这种不可靠性可能引发舆论、法律甚至生命安全风险。 -
伦理与监管风险
就业替代效应、深度伪造、版权侵权、隐私泄露等问题随模型涌现能力增强而放大。全球监管趋势趋严:欧盟《人工智能法案》已于2024年8月生效,对通用AI提供者设定透明度、风险评估等义务;中国《生成式人工智能服务管理暂行办法》自2023年8月施行,强调安全评估与算法备案。合规成本与技术路线选择的矛盾可能阻碍涌现研究的快速推进。 -
回报递减的隐忧
尽管目前仍处投入上升期,但部分研究者(如C. Manning, 2024年)质疑单纯的规模扩展是否能持续带来有用的能力涌现,抑或会遇到数据耗尽、能源天花板以及经济回报的边际递减。若该担忧成真,巨额基础设施投资可能面临回报不足的风险。
误读纠偏
在广泛讨论中,关于涌现能力存在几种典型误读,需要厘清:
误读一:规模越大,一定涌现更强能力。
实际:规模是必要但不充分条件。数据质量、多样性、训练稳定性、架构设计等同样关键。一个小而精且数据精良的模型可能在特定任务上胜过粗糙训练的大模型。涌现并不是完全“自动”的,需要精心配比。
误读二:涌现是完全不可预测的“魔法”。
实际:涌现虽然在小模型阶段无法预测,但遵循规模定律的变化趋势。通过观察模型损失下降以及中间规模模型的规律,可以合理推断某些任务会在更大规模时解锁能力。一些研究(如DeepMind的“Predicting Emergent Abilities”工作,2023年)尝试通过建立预训练指标与涌现任务的关联来早做判断。
误读三:小模型不可能具备类似涌现能力。
实际:通过蒸馏、特定任务微调,或使用高质量合成数据训练,小模型也可能表现出部分类似“涌现”的能力,但这类能力往往不具备泛化性和零样本迁移能力。真正的涌现是通用的、不经明确编程直接获得的行为,这一点仍然是超大规模模型的相对独有特征。
误读四:涌现能力就是AGI(通用人工智能)到来的标志。
实际:涌现能力展示了令人惊叹的语言泛化,但离AGI的自主意识、跨领域长期规划、稳健的世界模型等仍相距甚远。大部分研究人员认为目前仍是“弱人工智能”阶段,涌现是通往AGI的线索之一,而非终点。
误读五:涌现能力可脱离数据自我产生。
实际:涌现源于对海量人类生成数据的内在结构压缩,是人类集体智慧的间接映射,并非模型凭空创造。模型自身不会“发明”超越训练分布的全新知识体系。
最新事件
以下为截至2024年8月,与涌现能力高度关联的近期重大事件:
-
GPT-4o发布(2024年5月):OpenAI推出全能多模态模型,实现实时音频、视觉、文本的融合涌现交互,反应延迟大幅降低,引发行业对实时多模态智能体的应用想象。具体新涌现任务能力的系统测试结果,OpenAI已发布技术报告(2024年8月8日)。
-
Llama 3.1 405B开源(2024年7月):Meta开源迄今为止最大稠密模型,称其性能可与顶尖闭源模型相抗衡,在数学推理、代码等涌现任务上表现出色,引发对“开源能否复现涌现”的讨论。
-
欧盟《人工智能法案》生效(2024年8月1日):对通用AI模型(包括可能产生涌现能力的基座模型)实施风险分级监管,标志着合规成为涌现能力发展的刚性约束。
-
Google DeepMind推出AI科学家(2024年样品展示):由大模型驱动的端到端科学研究代理,显示出初步的实验设计、代码编写和论文写作涌现能力,但尚未大规模部署。
-
国内动态:阿里通义千问2.5(2024年5月)在中文推理和多模态任务上整体能力提升,Kimi智能助手的超长上下文应用受到关注。百度文心4.0工具版在2024年4月发布,强调工具协同的涌现。根据各公司公开宣传,至少在特定评测上拉近了与国际前沿的距离,但权威的第三方独立对比基准得分,公开资料可查仍较有限。
跟踪指标
要持续评估涌现能力的技术进展及产业影响,建议关注以下定量与定性指标:
-
训练计算量(Training FLOPs)趋势
- 来源:公司技术报告或EpochAI等独立追踪。
- 观察前沿模型训练计算量的年度增长倍数,是否维持每10个月翻番节奏。
-
模型参数量与架构(Dense vs. MoE)
- 跟踪新发布模型的公开架构信息、总参数量及激活参数比例,了解“有效涌现参数”的规模。
-
基准测试得分变化
- 持续跟踪:MMLU、HellaSwag、ARC-Challenge、HumanEval(+新版本)、GSM8K(数学推理)等基准分数的进展,注意提示方法(0-shot/5-shot/CoT)的一致性。
-
多模态涌现任务
- 视频理解、3D场景推理、数学几何、代码编译器级别输出等更复杂的任务,是下一阶段涌现的试金石。
-
推理经济性指标
- 每百万token推理成本(美元)、响应延迟、等效模型推理吞吐量。若推理成本快速下降,将加速下游对涌现能力的采用。
-
安全与对齐事件
- 主要模型公开的安全事件、红队测试结果、对齐研究进展(如OpenAI或Anthropic发布的系统卡)。
-
政策与监管里程碑
- 各国AI法案细则、大模型备案要求、版权裁定、数据隐私新规等,这些影响涌现能力的训练数据获取与部署范围。
-
产业落地指标
- 主要云厂商AI服务营收增速、企业AI助手付费用户数、头部模型API调用量变化,以及各行业标杆案例的投资回报率数据。
以上指标的跟踪,需以原始来源(技术报告、财报、监管文件、权威基准排行榜)为准,并对不同口径数据进行归一化解读。
信源
- Kaplan et al., “Scaling Laws for Neural Language Models”, 2020, arXiv:2001.08361.
- Wei et al., “Emergent Abilities of Large Language Models”, 2022, arXiv:2206.07682.
- Srivastava et al., “Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models” (BIG-bench), 2022, arXiv:2206.04615.
- Anthropic, “Model Card and Evaluations for Claude Models”, 2024.
- Google DeepMind, “Gemini: A Family of Highly Capable Multimodal Models”, 2023, arXiv:2312.11805.
- Meta, “The Llama 3 Herd of Models”, 2024.
- OpenAI, “GPT-4 Technical Report”, 2023, arXiv:2303.08774; “GPT-4o System Card”, 2024.
- NVIDIA Corporation, 2025财年第二季度财报,2024年8月28日。
- Microsoft, 2024财年第四季度财报,2024年7月30日。
- Grand View Research, “Large Language Model (LLM) Market Size, Share & Trends Analysis Report”, March 2024.
- IDC, “Worldwide AI Chips and AI Server Spending Forecast”, 2024年5月。
- McKinsey Global Institute, “The economic potential of generative AI”, 2024年6月。
- Stanford HAI, “AI Index Report 2024”, 2024年4月。
- 中国国家互联网信息办公室等,《生成式人工智能服务管理暂行办法》,2023年8月15日施行。
- 欧洲议会,《人工智能法案》(EU AI Act),2024年8月1日生效。
- 各公司官网、技术博客及公开演讲内容。