世界模型 (World Model)
核心理念:建置能夠理解、模擬並預測現實世界動態規律的AI系統,使其具備因果推論、物理直覺與長期規劃能力,被視為通往通用人工智慧(AGI)的核心路徑之一。
1. 3 秒看懂
- 一句話定義:AI的“內心模擬器”,能像人一樣在腦中推演“如果…會怎樣”,從而預測未來、做出決策。
- 核心能力:理解物理規律、具備因果推論、進行長期規劃。
- 與大型模型關係:大語言模型(LLM)是“文科生”,理解文本知識;世界模型是“理工科生”,理解物理世界如何運轉。兩者融合是AGI的關鍵。
- 代表應用:自動駕駛汽車在腦中的虛擬世界裡預測行人軌跡;人形機器人在腦中的模擬器裡反覆練習抓取動作。
2. 3 分鐘產業解釋
2.1 問題本質:從“統計關聯”到“因果理解”
當前主流AI,特別是大語言模型,本質上是基於海量文本資料的“超級聯想家”,它們學到了詞與詞、概念與概念之間的統計關聯,但往往缺乏對物理世界因果鏈條和底層規則的深刻理解。一個LLM可以流暢地描述“杯子從桌上掉落會摔碎”,但它並不真正“理解”重力、加速度、材質脆性這些物理過程。世界模型的目標就是填補這一空缺,它旨在創造一個能夠內化物理規律、時間動態和空間結構的系統。
2.2 核心執行邏輯:“感知-建模-模擬-規劃”
世界模型的工作流是一個閉環:
- 感知:通過多模態資料(影片、點雲端、感測器)接收原始世界訊號。
- 建模:將高維、嘈雜的感官輸入壓縮成一個抽象、結構化的內部表徵(即“世界狀態”)。
- 模擬:在這個內部表徵的基礎上,根據可能的行動(如“左轉30度”、“施加10N的力”),推演未來狀態的演變(“會發生什麼?”)。
- 規劃:通過在模擬器中快速、大量地“試錯”,找到能夠達成目標的最優行動序列,再執行於真實世界。這被稱為模型預測控制 (MPC),是智慧代理決策的經典範式。
2.3 產業鏈宏觀結構
- 上游 – 基礎設施:提供建置和執行世界模型所需的算力基座(AI晶片、超算中心)和訓練燃料(海量、高質量的多模態資料集及物理模擬環境)。
- 中游 – 模型與平台:進行核心技術研發,建置世界模型演算法架構,並提供用於訓練和部署的中介軟體與平台。
- 下游 – 應用與垂直領域:將世界模型的能力整合到具體產品或解決方案中,解決自動駕駛、機器人、科學研究等領域的實際問題。
3. 技術原理
世界模型的技術演進正從單幀預測向建置“感知-建模-規劃-行動”的閉環系統發展。其核心技術棧構成了一個分層解構的體系:
3.1 感知與表徵學習
如何將原始感官輸入(如一段連續影片流)壓縮為對預測未來有用的、去噪的、結構化的潛在狀態向量(latent state)?這是世界模型的第一個關鍵步驟。
- 核心目標:剝離冗餘資訊(如光照變化),保留對任務至關重要的幾何、物理和語義資訊。
- 主流方法:
- 變分自編碼器 (VAE):向經典方法,生成一個機率性的潛在表徵,是早期世界模型的基石。
- Vision Transformer (ViT) / 掩碼自編碼器 (MAE):將影像/影片分塊處理,通過大規模預訓練提取魯棒的表徵,是當前主流。
- 聯合嵌入預測架構 (JEPA):由Meta AI首席科學家Yann LeCun力推。其核心思想不是在畫素空間進行預測(這很昂貴且充滿噪聲),而是在高維、抽象的“表徵空間”進行預測。這是對傳統生成式預測方法的重大修正。
3.2 動態建模與未來預測
在獲得緊湊的內部表徵後,模型需要在表徵空間裡學習環境的“轉移函式”,即如何從一個狀態演變到下一個狀態。
- 序列化模型:
- 迴圈神經網路/狀態空間模型 (RNN/SSM):將歷史資訊編碼進一個隱狀態,按時間步遞迴更新。效率高但難以處理極長序列。代表為“World Models”(Ha & Schmidhuber, 2018)等早期工作。新一代狀態空間模型Mamba在長序列上展現出超越Transformer的潛力。
- Transformer:將整個歷史狀態序列視為一個無時間差的集合,通過自注意力機制學習任意兩時間步間的關係。建模長期依賴的能力極強,是目前的事實標準。
- 生成式模型:
- 擴散模型 (Diffusion Models):在潛在空間進行迭代去噪,以生成高保真、多樣化的未來場景。已成為影片生成領域的主流,代表如Sora,被OpenAI稱為“世界模擬器”的早期形態。
- 自迴歸模型 (Autoregressive Models):將影片token化,像生成文本一樣逐個預測下一個token,如Google的VideoPoet。
3.3 物理歸納偏置的注入
純資料驅動的方法往往需要天文數字的資料才能學到常識物理。將人類已知的物理定律作為“先驗知識”注入模型,是提升樣本效率和預測精度的關鍵。
- 硬約束:在神經網路結構中加入滿足物理規律的不可變層,如哈密頓網路(HNNs)、拉格朗日網路。
- 軟約束:在損失函式中加入物理方程(如納維-斯托克斯方程)的殘差項進行懲罰,如物理資訊神經網路(PINNs)。
- 混合系統(神經+符號):使用神經網路處理感知,使用物理引擎(如MuJoCo, Isaac Sim)處理動力學模擬,兩者進行端到端或分工式的協作。
3.4 學習與規劃架構
世界模型建成後,如何被“使用”?
- 基於模型的強化學習(MBRL):智慧代理在世界模型中“想像”並評估各種行為後果,模型充當了無限免費的試錯場地。這是最高效的學習範式之一。
- 規劃演算法:在習得的世界模型中,使用蒙特卡洛樹搜尋(MCTS)、交叉熵方法(CEM)等演算法來搜尋最優行動序列,不依賴於顯式的價值網路。
4. 關鍵引數
當前業界尚無統一的世界模型評估基準,以下為衡量其效能和規模的關鍵引數維度:
- 模型規模與計算量
- 引數量(Parameters):從數億到數千億不等,反映模型容量,公開資料未見統一最佳實踐。
- 訓練算力(FLOPS):訓練所需的總浮點運算次數,是衡量其計算成本的核心指標。一個先進影片生成式世界模型(如Sora)的訓練算力通常遠超同等引數量的LLM。
- 預測精度與時長
- 均方誤差(MSE)/ 結構相似性指數(SSIM)/ LPIPS:評估未來單幀或多幀影像預測質量的經典指標,但均存在侷限性(如MSE傾向模糊預測)。
- 有效預測時長(Effective Prediction Horizon):在誤差累積到不可用之前,模型能進行多長時間的合理預測,以秒或分鐘計。對自動駕駛,3-5秒是常見要求;對氣候變化,則需以年為尺度。
- 模擬與推論效能
- 物理規律符合度:通過特定設計的評測集(如物體恆存性、運動一致性、碰撞合理性)來衡量,但公開資料未見行業統一指標。
- 即時推論速度(幀/秒,FPS):對自動駕駛和機器人等線上應用至關重要,通常要求遠高於24 FPS。
- Sim-to-Real遷移成功率:在真實世界中執行在模擬器中訓練好的策略的成功率,是具身智慧領域的“黃金指標”,但高度任務特定化。
5. 技術路線
當前世界模型存在兩條涇渭分明、同時又相互交織的技術路線,其根本分歧在於是否顯式建置3D/物理結構。
5.1 端到端資料驅動派(“暴力美學”)
- 核心主張:只要有足夠多的資料和足夠大的模型,智慧和世界理解就會從資料中湧現出來。無需顯式建模3D幾何或物理方程。
- 代表架構:影片生成式大型模型,如Sora、VideoPoet。它們直接處理展平的影片Patch或Token,讓自注意力和梯度下降去自行發現其中的時空規律。
- 優勢:無上限的模型擴充套件潛力;能處理極其複雜、難以用顯式規則描述的“軟性”物理現象(如煙霧、流體)以及大量常識性視覺邏輯(如物體遮擋、光影關係)。
- 侷限:可解釋性差;長鏈條因果推論能力弱;容易產生“幻覺”(如物體無故消失或穿模);物理互動的長期一致性難以保證;計算成本極高。
5.2 結構化先驗注入派(“現實主義”)
- 核心主張:應將3D幾何、物理規律作為強先驗注入模型結構,使模型在“理解規則”的基礎上進行學習,大幅提升效率。
- 代表架構:
- 3D高斯潑濺(3D Gaussian Splatting, 3DGS)+ 物理引擎:用3DGS顯式表徵場景的幾何與外觀,將其剛體動力學、流體力學引數輸入傳統物理引擎進行模擬,再用神經網路最佳化和渲染。
- 神經輻射場(NeRF)家族:隱式3D表徵,通過體渲染實現高保真新視角合成,是建置靜態或動態數字孿生的關鍵技術。
- JEPA架構:在抽象語義空間中預測,規避了畫素級預測的難題,是上述路線的折中與昇華。
- 優勢:樣本效率高;物理行為更可靠;內在的3D結構使其天然適合與遊戲引擎、設計軟體打通。
- 侷限:顯式結構限制了它學習超出人類定義範圍之外“未知規律”的能力;模型容量和複雜度有自然上限。
6. 上游
世界模型的技術實現高度依賴於上游基礎設施的供給,主要包括算力、資料和模擬平台。
6.1 算力基礎設施
訓練和執行大規模世界模型需要異構、高通的算力叢集。
- AI訓練晶片:高吞吐、大視訊記憶體是核心需求。
- GPU:NVIDIA是絕對主導者,其H100/H200系列GPU是訓練模型的事實標準。AMD的MI300X系列是主要替代選擇。
- TPU:Google自研的張量處理器,專為TensorFlow/JAX架構最佳化,是其內部大型模型訓練的核心。
- 國產晶片:華為昇騰910B、寒武紀思元系列、海光資訊深算系列等。據公開報告,2024年華為昇騰已在國內大型模型訓練市場實現規模性替代,市場份額持續增長(來源:IDC, 2024中國AI晶片市場報告)。
- 超算/智算中心:集成了數千乃至數萬張AI晶片,並提供高速網際網路絡。
- 特斯拉Dojo:專為處理海量影片資料和訓練自動駕駛世界模型設計的自研ExaPOD超算系統。據特斯拉2024年Q2財報,其算力已達約35 EFLOPS(exaFLOPS)。
- 國內智算中心:根據中國信通院《中國綜合算力指數(2024年)》報告,截至2024年上半年,中國在建和已建智算中心專案超百個,總算力規模超200 EFLOPS。
6.2 資料資源與模擬引擎
“世界燃料”的規模和質量是決定模型能力的上限。
- 多模態資料集:
- 行業私有資料:自動駕駛公司(如Waymo、特斯拉、華為、小鵬)通過百萬級別量產車隊持續採集的真實路況影片、雷達點雲端資料,是建置駕駛世界模型的核心壁壘。據公開資料,截至2024年中,特斯拉車隊已累計行駛超16億英里(FSD資料)。
- 開源/研究資料集:Open X-Embodiment(OXE)專案由Google發起,彙集了來自全球60多個研究機構的超過100萬個機器人操作軌跡,是具身智慧領域的“ImageNet時刻”式基礎資源。
- 高保真模擬平台:
- NVIDIA Omniverse/Isaac Sim:基於OpenUSD格式,提供物理級精確的3D世界建置與模擬能力,是工業數字孿生和機器人訓練的領先平台。
- Google DeepMind MuJoCo / dm_control:廣為學術界採用的物理引擎,以速度和準確著稱。
- Unreal Engine / Unity:以其強大的渲染能力,常用於建置互動式、視效逼真的模擬環境,常與AirSim、Habitat等模擬器整合。
7. 下游
世界模型作為基礎性技術,其能力正在重塑眾多下游應用領域。
7.1 自動駕駛
這是當前世界模型商業價值最清晰、競爭最激烈的領域。模型用於預測周邊交通參與者的未來軌跡,並規劃自車安全、高效的行駛路徑。
- 高階行為預測:不再假設獨立運動,而是理解多智慧代理(車、人、腳踏車)間的微妙互動(博弈、禮讓),在複雜十字路口等長尾場景中表現更優。
- 端到端規劃:以特斯拉FSD v12為代表,從感知輸入直接輸出控制訊號,其內部“模擬器”隱式承擔了世界模型的功能。國內公司如小鵬(XNet+XPlanner+XBrain)、華為ADS(GOD網路)也在該路徑上深度版面配置。
7.2 具身智慧
世界模型是機器人從“預程式設計指令的執行者”進化為“通用任務規劃者”的核心大腦。
- “思維-行動”環:機器人看到一杯水,世界模型幫助它理解:水是無定形的液體,受重力影響倒出時會下落,玻璃杯易碎需要輕拿輕放。基於這些理解,可自主規劃抓取、轉移、傾倒等複雜動作。
- 訓練範式革新:在GPU加速的模擬器(如Isaac Sim)中進行百萬級小時計的“虛擬訓練”,再利用Sim-to-Real技術遷移到真實機器人,極大降低了訓練成本和試錯風險。代表公司包括Figure AI、傅利葉智慧、智元機器人等。
7.3 AI for Science (科學發現)
在科學領域,世界模型本質上是“可微分的地球/材料/生物體模擬器”,用於加速假設驗證和規律發現。
- 生命科學:Google DeepMind的AlphaFold 3能以前所未有的精度預測蛋白質、DNA、RNA等生物分子的3D結構及其相互作用,這是“生物世界模型”的巨大成功。
- 氣象預測:華為盤古氣象大型模型、Google GraphCast等,通過學習海量歷史氣象資料的內在動態,實現了在數秒內完成7-10天全球天氣預測,且精度媲美歐洲中期天氣預報中心(ECMWF)的數值計算模型。
- 新材料研發:材料基因組計劃(MGI)的核心思想就是利用高通量計算和模擬,在合成之前預測材料屬性,篩選候選材料。
7.4 內容創作與媒體
從“繪製畫素”走向“導演世界”,創作者通過設定規則和狀態,讓AI自主生成符合物理規律的動態3D場景。
- 3D資產生成:一句話描述(汽車沿著泥濘路行駛),世界模型可自動生成動態的、高保真、並由物理驅動的3D環境,適用於電影、遊戲、建築視覺化。
8. 受益公司
注:以下僅為基於公開資訊的技術與產業鏈角色分析,不構成任何投資建議。
- NVIDIA (輝達):作為“賣鏟人”,它是世界模型浪潮最確定的底層受益者。其GPU(H100/B100)是訓練必需品,CUDA生態構築了強大護城河,而Omniverse平台則卡位了高保真模擬與工業數字孿生的入口。
- 特斯拉 (Tesla):將世界模型思想系統性地工程化落地於FSD和Optimus人形機器人。其Dojo超算、海量真實駕駛資料、端到端模型策略形成了垂直整合的飛輪效應。
- Google (Google):旗下DeepMind是世界模型的學術前沿和工程實現重鎮(從AlphaGo到AlphaFold、Gato到RT-2、Genie)。Google擁有的TPU、海量多模態資料(YouTube、安卓感測器)和基礎研究能力構成其綜合優勢。
- Meta (元宇宙平台):在學術上通過Yann LeCun推動JEPA架構,在應用上通過FAIR(基礎人工智慧研究)實驗室釋出Habitat模擬器等關鍵工具鏈,服務於其長期建置虛擬世界的戰略目標。
- 微軟 (Microsoft):通過與OpenAI的深度繫結,掌握了Sora等尖端模型。同時,在工業端提供Azure智慧製造模擬雲端服務,在遊戲端擁有強大的運營基礎和IP。
- 華為:是國內少數兼具自研升騰AI晶片、自研盤古科學計算大型模型、自研ADS自動駕駛系統和通訊基座的全棧技術公司,正在建置其“雲端-管-端”統一的世界模型應用生態。
- 商湯科技 (SenseTime):將“日日新”大型模型體系與第二代AI基礎設施(SenseCore)結合,在生成式AI、自動駕駛(絕影)和具身智慧上有全面版面配置,是國內該方向的重要探索者。
9. 市場規模
由於世界模型是使能技術,其市場價值分散在多個下游應用中。可通過相關應用市場的規模來間接反映其經濟潛力。
- 核心驅動力市場 – 自動駕駛與機器人
- 全球自動駕駛汽車市場規模:據Fortune Business Insights報告,2023年為1.9千億美元,預計到2030年將達到2.7萬億美元(CAGR約45.6%),感知與決策系統是核心增長點。
- 全球機器人流程自動化與智慧機器人市場:據Grand View Research資料,2023年全球機器人市場規模約521億美元,其中具身智慧相關的人形機器人、協作機器人是新興且增速最快的子領域。
- 上游驅動力市場 – AI晶片與算力
- 全球AI晶片市場規模:AMD在2024年底釋出的展望中,將2027年全球AI晶片市場規模預期從1500億美元大幅上調至4000億美元。該數值是支撐包括世界模型在內的所有前沿大型模型訓練的底層需求總和,口徑為TAM(可獲取市場總規模),來源:AMD官方投資者報告。
- 中國智算市場:多個省份在中國將“十四五”末(2025年)的智算規模目標設定在300-500 EFlops,據公開新聞報道,相應的直接投資和帶動產業規模預計達數千億元人民幣級別。具體數值以國家資料局後續官方釋出為準。
- 間接影響市場 – 數字孿生與工業模擬
- 全球數字孿生市場:據MarketsandMarkets預測,將從2024年的約200億美元增長至2029年的約1000億美元,CAGR超35%。該市場的核心需求之一正是建置高保真、可互動的世界模型。
- 總結:公開市場未見“世界模型”的直接獨立市場規模測算,但其作為底層能力正在滲透和驅動一個合計達萬億級美元的TAM(技術可定址市場),其長期商業價值在於開啟下一代智慧系統的互動與決策範式。
10. 玩家對比
選取有代表性的三類玩家進行對比,聚焦其在技術路線和商業化策略上的差異。
-
科技巨頭:Google DeepMind vs. 特斯拉 vs. NVIDIA
- Google DeepMind:走“學術深度+多模態廣度”路線。優勢在於強大的基礎研究能力和跨領域科學發現(AlphaFold系列)的標杆效應。風險在於商業化節奏相對緩慢,將實驗室突破轉化為穩固的商業模式是長久以來的挑戰。
- 特斯拉:走“垂直整合、應用驅動”路線。優勢在於擁有其他公司無法匹敵的、從真實世界車隊獲取的海量閉環駕駛資料和自研Dojo超算,形成了資料和算力的雙重飛輪。風險在於技術路線相對封閉,不對外賦能,戰略風險高度集中。
- NVIDIA:走“平台賦能”路線。不直接開發終端世界模型應用,而是提供從底層晶片、上層CUDA軟體棧到終端Omniverse模擬平台的“全棧式鏟子”。優勢在於確定性最強,受益於所有下游競爭。風險則在於未來若出現顛覆性的非馮·諾依曼計算架構,可能危及其硬體護城河。
-
核心創業公司:Covariant (AI機器人) vs. Wayve (自動駕駛)
- Covariant:由UC伯克利教授Pieter Abbeel創辦,推出了機器人基礎模型RFM-1。其核心思路類似LLM,但在多模態感測器和機器人動作資料上進行訓練,旨在為機械臂提供一個通用的“世界模型”大腦,以理解並執行各種倉配任務。
- Wayve:英國自動駕駛初創公司(微軟、NVIDIA投資),高調提出“AI Driver”概念,完全摒棄高精地圖和手寫規則,採用與特斯拉類似的端到端資料驅動方案,使用純視覺和世界模型實現在複雜的、未對映的城市環境中的泛化駕駛,已在倫敦等城市進行路測。
-
中國公司:華為 vs. 小鵬汽車
- 華為:採用基礎研究與應用雙軌戰略。基礎層通過盤古科學計算大型模型上天入地;應用層通過ADS和鴻蒙生態貫穿智慧汽車、終端和機器人,利用自研晶片和通訊能力打造端-邊-雲端協同的閉環。
- 小鵬汽車:All-in端到端智駕的汽車公司先行者。公開宣佈已切換至純端到端大型模型架構,且明確提及建置“世界模型”是其核心長期戰略,將其作為解決物理世界不確定性的終極方案。
11. 風險
世界模型的發展面臨多重技術、倫理與商業風險。
11.1 技術風險
- 誤差累積與長尾崩潰:這是所有預測模型最根本的致命弱點。模型在推測過程中,微小的預測誤差會隨時間步長指數級累積,最終導致長期預測完全不可用。同時,對罕見、危險的“長尾”場景(如高速公路上出現倒塌的樹木),模型缺乏學習樣本,預測能力極弱。自動駕駛領域的絕大多數Corner Case都源於此。
- “Sim-to-Real”鴻溝:在乾淨、簡化的虛擬模擬器中學到的策略,直接遷移到充滿噪聲、摩擦和不可預測性的真實世界時,經常會失效。例如,模擬中完美抓取1000次物體的機器人,現實中可能因為光照條件變化而屢屢失敗。如何消除這道鴻溝,是從理論到產品的“死亡之谷”。
- 資料瓶頸:不同於可以從網際網路無限獲取的文本資料,與物理世界互動的高質量資料(尤其是有精確動作標籤的機器人操作、力反饋資料)獲取成本極高,而基於合成數據訓練的模型,其泛化能力天花板未知。
11.2 倫理與社會風險
- 深度偽造與虛假現實:一個足以模擬真實世界的模型,也必然能生成以假亂真的虛假動態世界。這不僅會加劇影片證據的可信度危機,還可能被用於建置定製化的、栩栩如生的“資訊繭房”或進行社會工程攻擊。由世界模型驅動的虛假資訊是“深度偽造”的終極形態。
- 安全對齊與責任歸屬:世界模型在進行自主規劃和決策時,如何確保其內部獎勵函式與人類社會的價值觀和安全準則對齊?在真實世界決策(如醫療方案推薦、自動駕駛避撞)中,模型的行動建議產生了災難性後果時,法律責任應由資料提供方、演算法開發者還是部署方承擔?Sim-to-Real遷移帶來的不可預測性使這一問題更難回答。現有法律體系對此公開資料未見有清晰的界定。
11.3 商業與路徑風險
- 鉅額投入與回報不確定:建置前沿級世界模型的算力投入動輒數十億甚至上百億人民幣,但距離產生規模化的正向現金流量道阻且長。初創公司隨時面臨資金鍊斷裂風險。
- 實現路徑的根本性分歧:是否必須建立統一、通用的世界模型?還是可以優先發展專用領域的世界模擬器,再尋求融合?LLM是否會通過某種方式湧現出物理理解能力,從而“奇襲”世界模型路線?學術界和產業界對此存在巨大爭議。黃仁勳與Yann LeCun分別代表了“算力驅動生成式”和“結構化先驗”兩種截然不同的哲學,未來的正確技術路徑存在不確定性。
12. 誤讀糾偏
-
誤讀1:“世界模型就是要100%復刻真實世界的數字孿生”
- 糾偏:這是不必要且不可能的。世界模型學習的是理解世界動態的因果結構和規律(“世界如何運轉”),而非每一個原子。就像人類大腦,我們感知的是簡化和抽象的因果世界,而非一個畫素級的副本。一個好的世界模型,應能抓住關鍵特徵,剝離冗餘噪聲以實現高效預測和規劃。
-
誤讀2:“Sora/影片生成模型就是世界模型”
- 糾偏:Sora等影片生成模型展現了湧現出物理直覺的巨大潛力,是“世界模擬器”的雛形或強力候選。但它目前更多是基於大量訓練資料的統計外推,仍然會在簡單的因果互動(如破碎後的形態)或物體恆存性上出現嚴重違揹物理規律的幻覺。嚴格意義上的世界模型,必須能夠進行可信的物理互動和反事實推論(“如果當時不那樣做會怎樣”)。兩者並非等價,而是演進關係。
-
誤讀3:“世界模型就是LLM加上視覺輸入”
- 糾偏:這是對架構根本區別的混淆。多模態LLM的核心仍然是文本生成,它通過將視覺對映到文本空間(token)來獲得描述能力。而世界模型的核心是動態的、內部的、以規劃和推論為目標的模擬。它們處理的是完全不同的任務:一個(多模態LLM)是“描述世界”,一個(世界模型)是“預測世界如何演變並在其中行動”。兩者可能在未來融合,但技術起點和哲學核心完全不同。
-
誤讀4:“有了世界模型,自動駕駛就能100%安全”
- 糾偏:世界模型可以極大地提升AI應對意外的能力上限,但無法保證絕對的安全。因為它本身是基於有限資料訓練的模型,會受到“長尾效應”的制約,總會遇到從未見過的、超出模型理解的未知場景。此外,感測器失效、對抗攻擊等問題是獨立於世界模型的其他故障源。安全是一個系統工程問題,而非單點模型問題。
13. 最新事件
-
2025年3月:Yann LeCun在GTC 2025上抨擊生成式世界模型路線
- 事件:Meta首席AI科學家Yann LeCun在NVIDIA GTC 2025大會上,繼續強調生成式模型(如Sora)在建置世界模型上的根本性缺陷,並重申其基於“聯合嵌入預測架構(JEPA)”的路線,更能實現高效、準確的抽象世界理解。
- 影響:進一步激化了世界模型領域“生成派”與“JEPA派”的技術路線爭論,業界關注Meta後續能否拿出有說服力的基於該架構的具身智慧或自動駕駛產品。
-
2025年2月:特斯拉FSD v12.5.x推送“反向投影”能力,世界模型邏輯初顯
- 事件:根據海外車主測試影片,特斯拉FSD(完全自動駕駛)最新版本已能基於影片流即時重建周圍環境的3D幾何與語義場景,並正確預測其他車輛數秒後的軌跡,在無保護左轉等高難度場景中決策頻率大幅提升。該版本內被分析師廣泛認為內建了較為成熟的、以空間和運動為核心的世界模型模組。
- 影響:進一步驗證了“從真實海量資料中端到端學習世界模型”商業落地的可行性,對其銷量和智慧駕駛技術護城河具有積極鞏固作用。華為、小鵬等競品預計將加快在端到端世界模型方向的研發與宣傳投入。
-
2024年11月:OpenAI的Sora正式面向部分創作者開放,引發“世界模擬”大討論
- 事件:OpenAI的Sora雖因算力爆滿和最佳化原因錯失年初原定釋出日期,但在年底終於向部分申請者開放。評測顯示其一致性驚人但也頻繁出現物理邏輯崩壞。
- 影響:向公眾和產業界直觀展示了影片生成模型作為“世界模擬器”的潛力與當前侷限,加速了資本和人才湧向影片生成和世界模型結合領域。
-
中國最新進展
- 2025年1月:智元機器人等釋出通用操作大型模型原型:多家國內頭部具身智慧公司(據公開報道包括智元等)展示了基於大量模擬資料和少量真實資料訓練的通用抓取與放置操作大型模型,嘗試用世界模型思想解決機器人操作的資料難題。具體引數和開放平台細節仍待更多揭露。
- 2024年H2:多地智算中心明確“物理世界大型模型”為算力招標重點:據公開招標公告,北京、上海、深圳等地新建或擴容智算中心的算力採購需求中,首次明確將“物理世界大型模型”、“具身智慧大型模型”的訓練與推論列為典型應用場景。
14. 追蹤指標
為了持續觀察世界模型的技術進步和產業化程序,以下是關鍵訊號和指標:
-
技術層指標
- 學術界SOTA刷榜:關注在CATER(物體恆存性)、PHYRE(物理推論)、IntPhys(直覺物理)等專門用來衡量物理理解能力的基準測試上新模型的得分提升。
- 論文發表與架構變化:追蹤頂會(CVPR, NeurIPS, ICML, ICLR, CoRL)上關於JEPA、擴散模型、3DGS、PINNs等關鍵技術路線的高引論文數量和趨勢,尤其關注“混合架構”的創新。
- 有效預測時長:在無監督情況下,最新模型能在影片預測基準上生成多少秒邏輯合理的未來幀。這是直接評價模擬器“深度”的指標。
-
產業層指標
- “端到端”智駕系統滲透率:追蹤小鵬、理想、華為等主要新能源品牌其“端到端”智駕系統(世界模型的直接工程落地形態)在新車型中的交付搭載率和MPI(平均每次干預里程數)的提升速度。MPI已取代NCA/NOP里程成為衡量L2+級智駕有效性的核心指標。
- 人形機器人操作成功率與泛化能力:觀察如Figure AI、特斯拉Optimus、傅利葉等最新演示影片的商業任務(如電池分揀、疊衣)成功率,尤其是否展示了從沒“見過”的任務的泛化操作能力(Zero-Shot操作)。
- NVIDIA Omniverse生態合作里程碑:關注綜合性汽車製造商(豐田、寶馬等)在其“數字孿生”工廠建設中是否大規模採用Omniverse平台,這是世界模型進入傳統工業化流程的核心風向標。
-
資本層指標
- 頭部初創公司估值與融資額:重點追蹤專注於世界模型、具身智慧大腦、Sim-to-Real技術的創業公司(如Covariant, Wayve,國內的銀河通用等)在一級市場的融資頻率、金額和估值變化。這是衡量資本對該賽道技術兌現信心的高頻指標。
- 企業內部研發支出R&D:關注特斯拉、華為、Meta、Google等在季度財報電話會議或年報中,關於“全自動駕駛”、“具身智慧”、“AI基礎設施”相關研發費用的投入變化和增速。具體支出佔比以各公司官方季報/年報口徑為準。
15. 信源
-
學術論文與機構報告
- Ha, D., & Schmidhuber, J. (2018). World Models.
- LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence. (JEPA相關闡述)
- AlphaFold 3 / GraphCast / Genie / Sora 等相關原始論文。
- IDC:《中國AI晶片市場半年度追蹤報告,2024H1》
- 中國信通院:《中國綜合算力指數(2024年)》
-
公司官方資訊與財報
- 特斯拉官方投資者報告及季度更新(重點關注FSD里程、算力、Dojo進展)。
- NVIDIA GTC 2024、GTC 2025大會主題演講及投資者關係檔案。
- 華為、小鵬、商湯等公司官網與官方媒體渠道。
-
第三方分析及媒體
- Fortune Business Insights, 自動駕駛市場規模報告。
- Grand View Research, MarkesandMarkets,全球機器人、數字孿生市場報告。
- AMD 2024年度投資者關係材料(AI晶片TAM展望)。
- TechCrunch, The Verge,機器之心,量子位等科技媒體對里程碑事件的報道。
免責宣告:本文僅為對“世界模型”這一技術概念及產業鏈的知識性梳理與介紹。文中提及的所有公司、技術、產品及市場份額資料均基於特定日期前的公開資訊,不構成任何投資建議、買賣指令或對未來技術趨勢的預測。所有財務資料、市場預測請以相關公司官方公告及權威機構的最新報告為準。