概念库 开放阅读

世界模型 (World Model)

概念库 · 开放阅读

概念 ID
world-model
更新时间
2026-06-03
来源数量
1

世界模型 (World Model)

核心理念:构建能够理解、模拟并预测现实世界动态规律的AI系统,使其具备因果推理、物理直觉与长期规划能力,被视为通往通用人工智能(AGI)的核心路径之一。

1. 3 秒看懂

  • 一句话定义:AI的“内心模拟器”,能像人一样在脑中推演“如果…会怎样”,从而预测未来、做出决策。
  • 核心能力:理解物理规律、具备因果推理、进行长期规划。
  • 与大模型关系:大语言模型(LLM)是“文科生”,理解文本知识;世界模型是“理工科生”,理解物理世界如何运转。两者融合是AGI的关键。
  • 代表应用:自动驾驶汽车在脑中的虚拟世界里预测行人轨迹;人形机器人在脑中的模拟器里反复练习抓取动作。

2. 3 分钟产业解释

2.1 问题本质:从“统计关联”到“因果理解”

当前主流AI,特别是大语言模型,本质上是基于海量文本数据的“超级联想家”,它们学到了词与词、概念与概念之间的统计关联,但往往缺乏对物理世界因果链条和底层规则的深刻理解。一个LLM可以流畅地描述“杯子从桌上掉落会摔碎”,但它并不真正“理解”重力、加速度、材质脆性这些物理过程。世界模型的目标就是填补这一空缺,它旨在创造一个能够内化物理规律、时间动态和空间结构的系统。

2.2 核心运行逻辑:“感知-建模-模拟-规划”

世界模型的工作流是一个闭环:

  1. 感知:通过多模态数据(视频、点云、传感器)接收原始世界信号。
  2. 建模:将高维、嘈杂的感官输入压缩成一个抽象、结构化的内部表征(即“世界状态”)。
  3. 模拟:在这个内部表征的基础上,根据可能的行动(如“左转30度”、“施加10N的力”),推演未来状态的演变(“会发生什么?”)。
  4. 规划:通过在模拟器中快速、大量地“试错”,找到能够达成目标的最优行动序列,再执行于真实世界。这被称为模型预测控制 (MPC),是智能体决策的经典范式。

2.3 产业链宏观结构

  • 上游 – 基础设施:提供构建和运行世界模型所需的算力基座(AI芯片、超算中心)和训练燃料(海量、高质量的多模态数据集及物理仿真环境)。
  • 中游 – 模型与平台:进行核心技术研发,构建世界模型算法框架,并提供用于训练和部署的中间件与平台。
  • 下游 – 应用与垂直领域:将世界模型的能力集成到具体产品或解决方案中,解决自动驾驶、机器人、科学研究等领域的实际问题。

3. 技术原理

世界模型的技术演进正从单帧预测向构建“感知-建模-规划-行动”的闭环系统发展。其核心技术栈构成了一个分层解构的体系:

3.1 感知与表征学习

如何将原始感官输入(如一段连续视频流)压缩为对预测未来有用的、去噪的、结构化的潜在状态向量(latent state)?这是世界模型的第一个关键步骤。

  • 核心目标:剥离冗余信息(如光照变化),保留对任务至关重要的几何、物理和语义信息。
  • 主流方法
    • 变分自编码器 (VAE):向经典方法,生成一个概率性的潜在表征,是早期世界模型的基石。
    • Vision Transformer (ViT) / 掩码自编码器 (MAE):将图像/视频分块处理,通过大规模预训练提取鲁棒的表征,是当前主流。
    • 联合嵌入预测架构 (JEPA):由Meta AI首席科学家Yann LeCun力推。其核心思想不是在像素空间进行预测(这很昂贵且充满噪声),而是在高维、抽象的“表征空间”进行预测。这是对传统生成式预测方法的重大修正。

3.2 动态建模与未来预测

在获得紧凑的内部表征后,模型需要在表征空间里学习环境的“转移函数”,即如何从一个状态演变到下一个状态。

  • 序列化模型
    • 循环神经网络/状态空间模型 (RNN/SSM):将历史信息编码进一个隐状态,按时间步递归更新。效率高但难以处理极长序列。代表为“World Models”(Ha & Schmidhuber, 2018)等早期工作。新一代状态空间模型Mamba在长序列上展现出超越Transformer的潜力。
    • Transformer:将整个历史状态序列视为一个无时间差的集合,通过自注意力机制学习任意两时间步间的关系。建模长期依赖的能力极强,是目前的事实标准。
  • 生成式模型
    • 扩散模型 (Diffusion Models):在潜在空间进行迭代去噪,以生成高保真、多样化的未来场景。已成为视频生成领域的主流,代表如Sora,被OpenAI称为“世界模拟器”的早期形态。
    • 自回归模型 (Autoregressive Models):将视频token化,像生成文本一样逐个预测下一个token,如Google的VideoPoet。

3.3 物理归纳偏置的注入

纯数据驱动的方法往往需要天文数字的数据才能学到常识物理。将人类已知的物理定律作为“先验知识”注入模型,是提升样本效率和预测精度的关键。

  • 硬约束:在神经网络结构中加入满足物理规律的不可变层,如哈密顿网络(HNNs)、拉格朗日网络。
  • 软约束:在损失函数中加入物理方程(如纳维-斯托克斯方程)的残差项进行惩罚,如物理信息神经网络(PINNs)。
  • 混合系统(神经+符号):使用神经网络处理感知,使用物理引擎(如MuJoCo, Isaac Sim)处理动力学模拟,两者进行端到端或分工式的协作。

3.4 学习与规划框架

世界模型建成后,如何被“使用”?

  • 基于模型的强化学习(MBRL):智能体在世界模型中“想象”并评估各种行为后果,模型充当了无限免费的试错场地。这是最高效的学习范式之一。
  • 规划算法:在习得的世界模型中,使用蒙特卡洛树搜索(MCTS)、交叉熵方法(CEM)等算法来搜索最优行动序列,不依赖于显式的价值网络。

4. 关键参数

当前业界尚无统一的世界模型评估基准,以下为衡量其性能和规模的关键参数维度:

  • 模型规模与计算量
    • 参数量(Parameters):从数亿到数千亿不等,反映模型容量,公开资料未见统一最佳实践。
    • 训练算力(FLOPS):训练所需的总浮点运算次数,是衡量其计算成本的核心指标。一个先进视频生成式世界模型(如Sora)的训练算力通常远超同等参数量的LLM。
  • 预测精度与时长
    • 均方误差(MSE)/ 结构相似性指数(SSIM)/ LPIPS:评估未来单帧或多帧图像预测质量的经典指标,但均存在局限性(如MSE倾向模糊预测)。
    • 有效预测时长(Effective Prediction Horizon):在误差累积到不可用之前,模型能进行多长时间的合理预测,以秒或分钟计。对自动驾驶,3-5秒是常见要求;对气候变化,则需以年为尺度。
  • 模拟与推理性能
    • 物理规律符合度:通过特定设计的评测集(如物体恒存性、运动一致性、碰撞合理性)来衡量,但公开资料未见行业统一指标。
    • 实时推理速度(帧/秒,FPS):对自动驾驶和机器人等在线应用至关重要,通常要求远高于24 FPS。
    • Sim-to-Real迁移成功率:在真实世界中执行在模拟器中训练好的策略的成功率,是具身智能领域的“黄金指标”,但高度任务特定化。

5. 技术路线

当前世界模型存在两条泾渭分明、同时又相互交织的技术路线,其根本分歧在于是否显式构建3D/物理结构。

5.1 端到端数据驱动派(“暴力美学”)

  • 核心主张:只要有足够多的数据和足够大的模型,智能和世界理解就会从数据中涌现出来。无需显式建模3D几何或物理方程。
  • 代表架构:视频生成式大模型,如Sora、VideoPoet。它们直接处理展平的视频Patch或Token,让自注意力和梯度下降去自行发现其中的时空规律。
  • 优势:无上限的模型扩展潜力;能处理极其复杂、难以用显式规则描述的“软性”物理现象(如烟雾、流体)以及大量常识性视觉逻辑(如物体遮挡、光影关系)。
  • 局限:可解释性差;长链条因果推理能力弱;容易产生“幻觉”(如物体无故消失或穿模);物理交互的长期一致性难以保证;计算成本极高。

5.2 结构化先验注入派(“现实主义”)

  • 核心主张:应将3D几何、物理规律作为强先验注入模型结构,使模型在“理解规则”的基础上进行学习,大幅提升效率。
  • 代表架构
    • 3D高斯泼溅(3D Gaussian Splatting, 3DGS)+ 物理引擎:用3DGS显式表征场景的几何与外观,将其刚体动力学、流体力学参数输入传统物理引擎进行模拟,再用神经网络优化和渲染。
    • 神经辐射场(NeRF)家族:隐式3D表征,通过体渲染实现高保真新视角合成,是构建静态或动态数字孪生的关键技术。
    • JEPA架构:在抽象语义空间中预测,规避了像素级预测的难题,是上述路线的折中与升华。
  • 优势:样本效率高;物理行为更可靠;内在的3D结构使其天然适合与游戏引擎、设计软件打通。
  • 局限:显式结构限制了它学习超出人类定义范围之外“未知规律”的能力;模型容量和复杂度有自然上限。

6. 上游

世界模型的技术实现高度依赖于上游基础设施的供给,主要包括算力、数据和仿真平台。

6.1 算力基础设施

训练和运行大规模世界模型需要异构、高通的算力集群。

  • AI训练芯片:高吞吐、大显存是核心需求。
    • GPU:NVIDIA是绝对主导者,其H100/H200系列GPU是训练模型的事实标准。AMD的MI300X系列是主要替代选择。
    • TPU:Google自研的张量处理器,专为TensorFlow/JAX框架优化,是其内部大模型训练的核心。
    • 国产芯片:华为昇腾910B、寒武纪思元系列、海光信息深算系列等。据公开报告,2024年华为昇腾已在国内大模型训练市场实现规模性替代,市场份额持续增长(来源:IDC, 2024中国AI芯片市场报告)。
  • 超算/智算中心:集成了数千乃至数万张AI芯片,并提供高速互联网络。
    • 特斯拉Dojo:专为处理海量视频数据和训练自动驾驶世界模型设计的自研ExaPOD超算系统。据特斯拉2024年Q2财报,其算力已达约35 EFLOPS(exaFLOPS)。
    • 国内智算中心:根据中国信通院《中国综合算力指数(2024年)》报告,截至2024年上半年,中国在建和已建智算中心项目超百个,总算力规模超200 EFLOPS。

6.2 数据资源与仿真引擎

“世界燃料”的规模和质量是决定模型能力的上限。

  • 多模态数据集
    • 行业私有数据:自动驾驶公司(如Waymo、特斯拉、华为、小鹏)通过百万级别量产车队持续采集的真实路况视频、雷达点云数据,是构建驾驶世界模型的核心壁垒。据公开数据,截至2024年中,特斯拉车队已累计行驶超16亿英里(FSD数据)。
    • 开源/研究数据集:Open X-Embodiment(OXE)项目由Google发起,汇集了来自全球60多个研究机构的超过100万个机器人操作轨迹,是具身智能领域的“ImageNet时刻”式基础资源。
  • 高保真仿真平台
    • NVIDIA Omniverse/Isaac Sim:基于OpenUSD格式,提供物理级精确的3D世界构建与仿真能力,是工业数字孪生和机器人训练的领先平台。
    • Google DeepMind MuJoCo / dm_control:广为学术界采用的物理引擎,以速度和准确著称。
    • Unreal Engine / Unity:以其强大的渲染能力,常用于构建交互式、视效逼真的模拟环境,常与AirSim、Habitat等模拟器集成。

7. 下游

世界模型作为基础性技术,其能力正在重塑众多下游应用领域。

7.1 自动驾驶

这是当前世界模型商业价值最清晰、竞争最激烈的领域。模型用于预测周边交通参与者的未来轨迹,并规划自车安全、高效的行驶路径。

  • 高级行为预测:不再假设独立运动,而是理解多智能体(车、人、自行车)间的微妙交互(博弈、礼让),在复杂十字路口等长尾场景中表现更优。
  • 端到端规划:以特斯拉FSD v12为代表,从感知输入直接输出控制信号,其内部“模拟器”隐式承担了世界模型的功能。国内公司如小鹏(XNet+XPlanner+XBrain)、华为ADS(GOD网络)也在该路径上深度布局。

7.2 具身智能

世界模型是机器人从“预编程指令的执行者”进化为“通用任务规划者”的核心大脑。

  • “思维-行动”环:机器人看到一杯水,世界模型帮助它理解:水是无定形的液体,受重力影响倒出时会下落,玻璃杯易碎需要轻拿轻放。基于这些理解,可自主规划抓取、转移、倾倒等复杂动作。
  • 训练范式革新:在GPU加速的模拟器(如Isaac Sim)中进行百万级小时计的“虚拟训练”,再利用Sim-to-Real技术迁移到真实机器人,极大降低了训练成本和试错风险。代表公司包括Figure AI、傅利叶智能、智元机器人等。

7.3 AI for Science (科学发现)

在科学领域,世界模型本质上是“可微分的地球/材料/生物体模拟器”,用于加速假设验证和规律发现。

  • 生命科学:Google DeepMind的AlphaFold 3能以前所未有的精度预测蛋白质、DNA、RNA等生物分子的3D结构及其相互作用,这是“生物世界模型”的巨大成功。
  • 气象预测:华为盘古气象大模型、Google GraphCast等,通过学习海量历史气象数据的内在动态,实现了在数秒内完成7-10天全球天气预测,且精度媲美欧洲中期天气预报中心(ECMWF)的数值计算模型。
  • 新材料研发:材料基因组计划(MGI)的核心思想就是利用高通量计算和模拟,在合成之前预测材料属性,筛选候选材料。

7.4 内容创作与媒体

从“绘制像素”走向“导演世界”,创作者通过设定规则和状态,让AI自主生成符合物理规律的动态3D场景。

  • 3D资产生成:一句话描述(汽车沿着泥泞路行驶),世界模型可自动生成动态的、高保真、并由物理驱动的3D环境,适用于电影、游戏、建筑可视化。

8. 受益公司

注:以下仅为基于公开信息的技术与产业链角色分析,不构成任何投资建议。

  • NVIDIA (英伟达):作为“卖铲人”,它是世界模型浪潮最确定的底层受益者。其GPU(H100/B100)是训练必需品,CUDA生态构筑了强大护城河,而Omniverse平台则卡位了高保真仿真与工业数字孪生的入口。
  • 特斯拉 (Tesla):将世界模型思想系统性地工程化落地于FSD和Optimus人形机器人。其Dojo超算、海量真实驾驶数据、端到端模型策略形成了垂直整合的飞轮效应。
  • Google (谷歌):旗下DeepMind是世界模型的学术前沿和工程实现重镇(从AlphaGo到AlphaFold、Gato到RT-2、Genie)。Google拥有的TPU、海量多模态数据(YouTube、安卓传感器)和基础研究能力构成其综合优势。
  • Meta (元宇宙平台):在学术上通过Yann LeCun推动JEPA架构,在应用上通过FAIR(基础人工智能研究)实验室发布Habitat模拟器等关键工具链,服务于其长期构建虚拟世界的战略目标。
  • 微软 (Microsoft):通过与OpenAI的深度绑定,掌握了Sora等尖端模型。同时,在工业端提供Azure智能制造仿真云服务,在游戏端拥有强大的运营基础和IP。
  • 华为:是国内少数兼具自研升腾AI芯片、自研盘古科学计算大模型、自研ADS自动驾驶系统和通信基座的全栈技术公司,正在构建其“云-管-端”统一的世界模型应用生态。
  • 商汤科技 (SenseTime):将“日日新”大模型体系与第二代AI基础设施(SenseCore)结合,在生成式AI、自动驾驶(绝影)和具身智能上有全面布局,是国内该方向的重要探索者。

9. 市场规模

由于世界模型是使能技术,其市场价值分散在多个下游应用中。可通过相关应用市场的规模来间接反映其经济潜力。

  • 核心驱动力市场 – 自动驾驶与机器人
    • 全球自动驾驶汽车市场规模:据Fortune Business Insights报告,2023年为1.9千亿美元,预计到2030年将达到2.7万亿美元(CAGR约45.6%),感知与决策系统是核心增长点。
    • 全球机器人流程自动化与智能机器人市场:据Grand View Research数据,2023年全球机器人市场规模约521亿美元,其中具身智能相关的人形机器人、协作机器人是新兴且增速最快的子领域。
  • 上游驱动力市场 – AI芯片与算力
    • 全球AI芯片市场规模:AMD在2024年底发布的指引中,将2027年全球AI芯片市场规模预期从1500亿美元大幅上调至4000亿美元。该数值是支撑包括世界模型在内的所有前沿大模型训练的底层需求总和,口径为TAM(可获取市场总规模),来源:AMD官方投资者报告。
    • 中国智算市场:多个省份在中国将“十四五”末(2025年)的智算规模目标设定在300-500 EFlops,据公开新闻报道,相应的直接投资和带动产业规模预计达数千亿元人民币级别。具体数值以国家数据局后续官方发布为准。
  • 间接影响市场 – 数字孪生与工业仿真
    • 全球数字孪生市场:据MarketsandMarkets预测,将从2024年的约200亿美元增长至2029年的约1000亿美元,CAGR超35%。该市场的核心需求之一正是构建高保真、可交互的世界模型。
  • 总结:公开市场未见“世界模型”的直接独立市场规模测算,但其作为底层能力正在渗透和驱动一个合计达万亿级美元的TAM(技术可寻址市场),其长期商业价值在于开启下一代智能系统的交互与决策范式。

10. 玩家对比

选取有代表性的三类玩家进行对比,聚焦其在技术路线和商业化策略上的差异。

  • 科技巨头:Google DeepMind vs. 特斯拉 vs. NVIDIA

    • Google DeepMind:走“学术深度+多模态广度”路线。优势在于强大的基础研究能力和跨领域科学发现(AlphaFold系列)的标杆效应。风险在于商业化节奏相对缓慢,将实验室突破转化为稳固的商业模式是长久以来的挑战。
    • 特斯拉:走“垂直整合、应用驱动”路线。优势在于拥有其他公司无法匹敌的、从真实世界车队获取的海量闭环驾驶数据和自研Dojo超算,形成了数据和算力的双重飞轮。风险在于技术路线相对封闭,不对外赋能,战略风险高度集中。
    • NVIDIA:走“平台赋能”路线。不直接开发终端世界模型应用,而是提供从底层芯片、上层CUDA软件栈到终端Omniverse仿真平台的“全栈式铲子”。优势在于确定性最强,受益于所有下游竞争。风险则在于未来若出现颠覆性的非冯·诺依曼计算架构,可能危及其硬件护城河。
  • 核心创业公司:Covariant (AI机器人) vs. Wayve (自动驾驶)

    • Covariant:由UC伯克利教授Pieter Abbeel创办,推出了机器人基础模型RFM-1。其核心思路类似LLM,但在多模态传感器和机器人动作数据上进行训练,旨在为机械臂提供一个通用的“世界模型”大脑,以理解并执行各种仓配任务。
    • Wayve:英国自动驾驶初创公司(微软、NVIDIA投资),高调提出“AI Driver”概念,完全摒弃高精地图和手写规则,采用与特斯拉类似的端到端数据驱动方案,使用纯视觉和世界模型实现在复杂的、未映射的城市环境中的泛化驾驶,已在伦敦等城市进行路测。
  • 中国公司:华为 vs. 小鹏汽车

    • 华为:采用基础研究与应用双轨战略。基础层通过盘古科学计算大模型上天入地;应用层通过ADS和鸿蒙生态贯穿智能汽车、终端和机器人,利用自研芯片和通信能力打造端-边-云协同的闭环。
    • 小鹏汽车:All-in端到端智驾的汽车公司先行者。公开宣布已切换至纯端到端大模型架构,且明确提及构建“世界模型”是其核心长期战略,将其作为解决物理世界不确定性的终极方案。

11. 风险

世界模型的发展面临多重技术、伦理与商业风险。

11.1 技术风险

  • 误差累积与长尾崩溃:这是所有预测模型最根本的致命弱点。模型在推测过程中,微小的预测误差会随时间步长指数级累积,最终导致长期预测完全不可用。同时,对罕见、危险的“长尾”场景(如高速公路上出现倒塌的树木),模型缺乏学习样本,预测能力极弱。自动驾驶领域的绝大多数Corner Case都源于此。
  • “Sim-to-Real”鸿沟:在干净、简化的虚拟模拟器中学到的策略,直接迁移到充满噪声、摩擦和不可预测性的真实世界时,经常会失效。例如,模拟中完美抓取1000次物体的机器人,现实中可能因为光照条件变化而屡屡失败。如何消除这道鸿沟,是从理论到产品的“死亡之谷”。
  • 数据瓶颈:不同于可以从互联网无限获取的文本数据,与物理世界交互的高质量数据(尤其是有精确动作标签的机器人操作、力反馈数据)获取成本极高,而基于合成数据训练的模型,其泛化能力天花板未知。

11.2 伦理与社会风险

  • 深度伪造与虚假现实:一个足以模拟真实世界的模型,也必然能生成以假乱真的虚假动态世界。这不仅会加剧视频证据的可信度危机,还可能被用于构建定制化的、栩栩如生的“信息茧房”或进行社会工程攻击。由世界模型驱动的虚假信息是“深度伪造”的终极形态。
  • 安全对齐与责任归属:世界模型在进行自主规划和决策时,如何确保其内部奖励函数与人类社会的价值观和安全准则对齐?在真实世界决策(如医疗方案推荐、自动驾驶避撞)中,模型的行动建议产生了灾难性后果时,法律责任应由数据提供方、算法开发者还是部署方承担?Sim-to-Real迁移带来的不可预测性使这一问题更难回答。现有法律体系对此公开资料未见有清晰的界定。

11.3 商业与路径风险

  • 巨额投入与回报不确定:构建前沿级世界模型的算力投入动辄数十亿甚至上百亿人民币,但距离产生规模化的正向现金流道阻且长。初创公司随时面临资金链断裂风险。
  • 实现路径的根本性分歧:是否必须创建统一、通用的世界模型?还是可以优先发展专用领域的世界模拟器,再寻求融合?LLM是否会通过某种方式涌现出物理理解能力,从而“奇袭”世界模型路线?学术界和产业界对此存在巨大争议。黄仁勋与Yann LeCun分别代表了“算力驱动生成式”和“结构化先验”两种截然不同的哲学,未来的正确技术路径存在不确定性。

12. 误读纠偏

  • 误读1:“世界模型就是要100%复刻真实世界的数字孪生”

    • 纠偏:这是不必要且不可能的。世界模型学习的是理解世界动态的因果结构和规律(“世界如何运转”),而非每一个原子。就像人类大脑,我们感知的是简化和抽象的因果世界,而非一个像素级的副本。一个好的世界模型,应能抓住关键特征,剥离冗余噪声以实现高效预测和规划。
  • 误读2:“Sora/视频生成模型就是世界模型”

    • 纠偏:Sora等视频生成模型展现了涌现出物理直觉的巨大潜力,是“世界模拟器”的雏形或强力候选。但它目前更多是基于大量训练数据的统计外推,仍然会在简单的因果交互(如破碎后的形态)或物体恒存性上出现严重违背物理规律的幻觉。严格意义上的世界模型,必须能够进行可信的物理交互和反事实推理(“如果当时不那样做会怎样”)。两者并非等价,而是演进关系。
  • 误读3:“世界模型就是LLM加上视觉输入”

    • 纠偏:这是对架构根本区别的混淆。多模态LLM的核心仍然是文本生成,它通过将视觉映射到文本空间(token)来获得描述能力。而世界模型的核心是动态的、内部的、以规划和推理为目标的模拟。它们处理的是完全不同的任务:一个(多模态LLM)是“描述世界”,一个(世界模型)是“预测世界如何演变并在其中行动”。两者可能在未来融合,但技术起点和哲学内核完全不同。
  • 误读4:“有了世界模型,自动驾驶就能100%安全”

    • 纠偏:世界模型可以极大地提升AI应对意外的能力上限,但无法保证绝对的安全。因为它本身是基于有限数据训练的模型,会受到“长尾效应”的制约,总会遇到从未见过的、超出模型理解的未知场景。此外,传感器失效、对抗攻击等问题是独立于世界模型的其他故障源。安全是一个系统工程问题,而非单点模型问题。

13. 最新事件

  • 2025年3月:Yann LeCun在GTC 2025上抨击生成式世界模型路线

    • 事件:Meta首席AI科学家Yann LeCun在NVIDIA GTC 2025大会上,继续强调生成式模型(如Sora)在构建世界模型上的根本性缺陷,并重申其基于“联合嵌入预测架构(JEPA)”的路线,更能实现高效、准确的抽象世界理解。
    • 影响:进一步激化了世界模型领域“生成派”与“JEPA派”的技术路线争论,业界关注Meta后续能否拿出有说服力的基于该架构的具身智能或自动驾驶产品。
  • 2025年2月:特斯拉FSD v12.5.x推送“反向投影”能力,世界模型逻辑初显

    • 事件:根据海外车主测试视频,特斯拉FSD(完全自动驾驶)最新版本已能基于视频流实时重建周围环境的3D几何与语义场景,并正确预测其他车辆数秒后的轨迹,在无保护左转等高难度场景中决策频率大幅提升。该版本内被分析师广泛认为内置了较为成熟的、以空间和运动为核心的世界模型模块。
    • 影响:进一步验证了“从真实海量数据中端到端学习世界模型”商业落地的可行性,对其销量和智能驾驶技术护城河具有积极巩固作用。华为、小鹏等竞品预计将加快在端到端世界模型方向的研发与宣传投入。
  • 2024年11月:OpenAI的Sora正式面向部分创作者开放,引发“世界模拟”大讨论

    • 事件:OpenAI的Sora虽因算力爆满和优化原因错失年初原定发布日期,但在年底终于向部分申请者开放。评测显示其一致性惊人但也频繁出现物理逻辑崩坏。
    • 影响:向公众和产业界直观展示了视频生成模型作为“世界模拟器”的潜力与当前局限,加速了资本和人才涌向视频生成和世界模型结合领域。
  • 中国最新进展

    • 2025年1月:智元机器人等发布通用操作大模型原型:多家国内头部具身智能公司(据公开报道包括智元等)展示了基于大量仿真数据和少量真实数据训练的通用抓取与放置操作大模型,尝试用世界模型思想解决机器人操作的数据难题。具体参数和开放平台细节仍待更多披露。
    • 2024年H2:多地智算中心明确“物理世界大模型”为算力招标重点:据公开招标公告,北京、上海、深圳等地新建或扩容智算中心的算力采购需求中,首次明确将“物理世界大模型”、“具身智能大模型”的训练与推理列为典型应用场景。

14. 跟踪指标

为了持续观察世界模型的技术进步和产业化进程,以下是关键信号和指标:

  • 技术层指标

    • 学术界SOTA刷榜:关注在CATER(物体恒存性)、PHYRE(物理推理)、IntPhys(直觉物理)等专门用来衡量物理理解能力的基准测试上新模型的得分提升。
    • 论文发表与架构变化:跟踪顶会(CVPR, NeurIPS, ICML, ICLR, CoRL)上关于JEPA、扩散模型、3DGS、PINNs等关键技术路线的高引论文数量和趋势,尤其关注“混合架构”的创新。
    • 有效预测时长:在无监督情况下,最新模型能在视频预测基准上生成多少秒逻辑合理的未来帧。这是直接评价模拟器“深度”的指标。
  • 产业层指标

    • “端到端”智驾系统渗透率:跟踪小鹏、理想、华为等主要新能源品牌其“端到端”智驾系统(世界模型的直接工程落地形态)在新车型中的交付搭载率和MPI(平均每次干预里程数)的提升速度。MPI已取代NCA/NOP里程成为衡量L2+级智驾有效性的核心指标。
    • 人形机器人操作成功率与泛化能力:观察如Figure AI、特斯拉Optimus、傅利叶等最新演示视频的商业任务(如电池分拣、叠衣)成功率,尤其是否展示了从没“见过”的任务的泛化操作能力(Zero-Shot操作)。
    • NVIDIA Omniverse生态合作里程碑:关注综合性汽车制造商(丰田、宝马等)在其“数字孪生”工厂建设中是否大规模采用Omniverse平台,这是世界模型进入传统工业化流程的核心风向标。
  • 资本层指标

    • 头部初创公司估值与融资额:重点跟踪专注于世界模型、具身智能大脑、Sim-to-Real技术的创业公司(如Covariant, Wayve,国内的银河通用等)在一级市场的融资频率、金额和估值变化。这是衡量资本对该赛道技术兑现信心的高频指标。
    • 企业内部研发支出R&D:关注特斯拉、华为、Meta、Google等在季度财报电话会议或年报中,关于“全自动驾驶”、“具身智能”、“AI基础设施”相关研发费用的投入变化和增速。具体支出占比以各公司官方季报/年报口径为准。

15. 信源

  • 学术论文与机构报告

    • Ha, D., & Schmidhuber, J. (2018). World Models.
    • LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence. (JEPA相关阐述)
    • AlphaFold 3 / GraphCast / Genie / Sora 等相关原始论文。
    • IDC:《中国AI芯片市场半年度跟踪报告,2024H1》
    • 中国信通院:《中国综合算力指数(2024年)》
  • 公司官方信息与财报

    • 特斯拉官方投资者报告及季度更新(重点关注FSD里程、算力、Dojo进展)。
    • NVIDIA GTC 2024、GTC 2025大会主题演讲及投资者关系文件。
    • 华为、小鹏、商汤等公司官网与官方媒体渠道。
  • 第三方分析及媒体

    • Fortune Business Insights, 自动驾驶市场规模报告。
    • Grand View Research, MarkesandMarkets,全球机器人、数字孪生市场报告。
    • AMD 2024年度投资者关系材料(AI芯片TAM展望)。
    • TechCrunch, The Verge,机器之心,量子位等科技媒体对里程碑事件的报道。

免责声明:本文仅为对“世界模型”这一技术概念及产业链的知识性梳理与介绍。文中提及的所有公司、技术、产品及市场份额数据均基于特定日期前的公开信息,不构成任何投资建议、买卖指令或对未来技术趋势的预测。所有财务数据、市场预测请以相关公司官方公告及权威机构的最新报告为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型