概念庫 開放閱讀

湧現能力

概念庫 · 開放閱讀

概念 ID
emergent-abilities
更新時間
2026-06-03
來源數量
1

湧現能力

3 秒看懂

湧現能力(Emergent Abilities)是指語言模型在規模(引數量、訓練資料量、計算量)跨越某個臨界點之後,突然表現出的小模型完全不具備的複雜行為能力——這些能力並未被顯式程式設計,也無法通過小模型的效能外推來預測。典型例子包括多步算術推論、策略規劃、程式碼生成與除錯、上下文學習(in-context learning)、角色扮演與理論心智等。該概念由Google研究院Jason Wei等人在2022年正式系統闡述,成為大語言模型區別於傳統NLP系統的核心範式特徵,直接支撐了從“工具型AI”到“智慧代理AI”的產業躍遷。

閱讀提示:本頁所有財務與市場資料均標註年份、口徑及來源;無法查證的表述統一標註“公開資料未見”,不涉及任何買賣建議。

3 分鐘產業解釋

湧現能力揭示了一個根本性的產業邏輯:規模本身就是一種智力來源。在模型引數從數十億向千億、萬億規模躍遷的過程中,量變觸發質變——模型開始理解隱喻、進行多步邏輯演繹、在未見過的任務上展示出泛化能力,甚至湧現出初步的規劃與工具使用行為。這一發現改變了AI研發的資源投向:頭部科技公司與主要經濟體不再僅僅追求演算法精巧,而是圍繞 “算力—資料—引數規模” 展開系統性軍備競賽。

理解湧現能力的產業鏈,可以將其簡化為一條清晰的鏈條:高階AI晶片(GPU/TPU/NPU)製造與互聯 → 萬卡/十萬卡級別算力叢集 → 超大規模高質量多模態資料集的建置與清洗 → 千億至萬億引數的基礎模型訓練 → 模型湧現出的理解、推論與規劃能力 → 賦能下游的智慧代理應用、程式碼助手、科學研究、金融風控、醫療輔助等場景

這一鏈條的經濟效應已經清晰可見。根據OpenAI與賓夕法尼亞大學的研究(2023年3月),GPT-4出現後,約80%的美國勞動力可能至少有10%的工作任務會受到大語言模型影響;高盛(2023年3月)估計生成式AI將推動未來10年全球GDP提升約7%,對應近7萬億美元的增量。雖然這些測算並非直接量化“湧現能力”的單獨貢獻,但充分說明具備湧現能力的前沿模型正在成為社會生產力的重要變數。正因如此,全球範圍內的“百模大戰”“千模大戰”已非單純的學術競賽,而是圍繞智慧基礎設施主導權的產業競爭。

技術原理

規模定律:從外推到相變

湧現能力的理論根基是規模定律(Scaling Laws)。2020年,OpenAI的Kaplan等人發表論文《Scaling Laws for Neural Language Models》,首次系統量化了自迴歸語言模型的交叉熵損失與模型引數數量N、訓練token數D、計算量C之間的冪律關係。其核心結論是:當其他兩個因素不構成瓶頸時,損失值隨N、D、C的增加而平滑下降,下降曲線在對數—對數座標系下呈現近似線性。然而,這一規律與湧現現象的“斷裂式”表現似乎矛盾。

後續研究(如Google2022年“Emergent Abilities of Large Language Models”)揭示出關鍵區別:損失函式的平滑改善可能在特定下游任務的效能上表現為非線性躍升。對於某些任務,模型在某一規模閾值以下表現接近隨機基線,但一旦引數或計算量超過臨界點,指標突然大幅提升。這種情況在複雜推論任務(如多位數加減法、程式碼執行、多語言翻譯)上尤其明顯。研究者將這種行為類比為物理學中的相變——系統整體狀態的質變,對應模型內部表示從“記憶與統計”向“壓縮與推論”的轉變。

湧現的任務型別與觸發條件

根據多篇公開發表的論文(Jason Wei et al., 2022; Srivastava et al., 2022 “Beyond the Imitation Game”關於BIG-bench的結果),湧現能力最常被觀測到的任務型別包括:

  • 算術推論:如多步加減乘除、數學應用題。小模型幾乎無法完成,但引數量達到~10B以上的模型開始表現出非零準確率,並隨規模迅速上升。
  • 多語言翻譯:即便訓練資料中某語言的佔比極低,大型模型也能在達到一定規模後突然具備該語言的翻譯能力。
  • 程式碼生成與執行推論:模型能夠寫出可執行程式碼,並模擬程式碼執行結果。
  • 上下文學:在僅給出少量示例(few-shot)甚至無示例(zero-shot)的情況下,模型可以推斷任務意圖並正確輸出,這種能力在小模型中極弱。
  • 理論心智與規劃:能夠模擬他人的知識狀態、制定多步驟計劃。

值得注意的是,湧現並非對任何任務都會發生。對於大量簡單的文本生成或分類任務,效能隨規模平滑增長;而對於需要深層邏輯組合的任務,才可能觀察到湧現。閾值點的具體規模因任務和模型架構而異,公開資料未見統一定量的湧現臨界引數值。BIG-bench多工基準中,一些任務在引數量10B時開始湧現,另一些則需要100B甚至更高。

訓練機制:資料與算力的“投餵”

湧現產生的過程並不神秘。在預訓練階段,超大規模模型在數萬億token級別的文本/程式碼/多模態資料上進行自監督學習,最佳化目標是簡單且一貫的:下一個token預測(或者掩碼預測)。模型被迫建置出對語言結構、知識事實、邏輯關係的內部表徵,以最小化預測損失。當模型容量和訓練資料都足夠充分時,模型自發地學會更高效的壓縮方式,這被理解為“學會了推論”。此過程沒有人工程式介入,完全由反向傳播演算法驅動,因此出現的能力被稱為“湧現”。

算力投入是關鍵的物理約束。以Meta開源的Llama 3 70B模型為例,根據公開揭露(Meta, 2024),該模型在約15萬億token上訓練,使用了約24000塊H100 GPU的叢集。其計算量級約為幾億億億次浮點運算(10^24 FLOPs量級)。正是這種前所未有的訓練量,將模型推向湧現的閾值。


關鍵引數

判斷一個模型是否可能具備湧現能力,以及評估其能力強度,產業和學術界主要追蹤以下關鍵引數與指標:

  1. 模型引數量(Parameters)

    • 直接反映模型可承載的資訊複雜度。通常以B(十億)為單位。
    • 例項:GPT-3(2020年)175B;PaLM(2022年)540B;GPT-4(2023年)引數量未公開,第三方調研(如SemiAnalysis)推測為約1.8萬億引數(採用MoE架構)。據公開資訊,中國頭部通用大型模型引數普遍達到數百億至千億級(如百度文心大型模型3.5為千億引數,2023年釋出)。
  2. 訓練資料量(Training Tokens)

    • 以token數量(或詞元)計量,1 token通常約等於0.75個英文單詞。
    • 早期GPT-3訓練用了約300B tokens;Llama 2(2023年)用了2T tokens;Llama 3(2024年)用了超過15T tokens。資料量被視為與引數同樣重要的“湧現燃料”。
  3. 訓練總計算量(Training FLOPs)

    • 浮點運算次數,衡量訓練消耗的總算力。常用單位PFLOPS-days(千萬億次/天)或ExaFLOPs。
    • EpochAI(2024年估算)分析表明,前沿大型模型訓練計算量約每9-12個月翻一番,增速遠超摩爾定律。
  4. 損失函式值(Loss)與下游任務指標

    • 訓練/驗證損失:衡量模型對資料壓縮的效率。雖然呈現平滑下降,但其改善與下游湧現存在非線性對映。
    • 任務效能:MMLU(大規模多工語言理解)、HellaSwag、ARC(AI2推論挑戰賽)、HumanEval(程式碼生成)等基準得分。湧現通常表現為得分從隨機水平突然躍升到有意義水平。
  5. 啟用引數與稀疏架構(MoE Ratio)

    • 混合專家(MoE)模型中,每次推論僅啟用部分引數。例如傳聞GPT-4總引數1.8T,但每次推論啟用約280B引數。這使總引數量可以極大,而推論成本可控,更有利於湧現。有關引數/成本比,公開細節較少。
  6. 推論預算與策略搜尋

    • 湧現能力在推論階段還能延伸:通過鏈式思考(Chain-of-Thought)、思維樹(Tree-of-Thoughts)等方法,以額外推論計算換取更好的表現,誘發更強的推論湧現。因此推論時的FLOPs也成為實際能力的關鍵引數。

以上引數中,訓練計算量和資料量是當前追蹤湧現能力進展最可靠的硬體指標;而MMLU、HumanEval等基準是業界公認的直觀展示視窗,但其分數受評測體系選擇影響,需要結合具體版本和口徑分析。


技術路線

為追求更強的湧現能力,業界形成了幾條並行且交叉的技術路線:

1. 稠密擴充套件(Dense Scaling)

遵循經典的規模定律,直接擴充套件Transformer模型的層數、寬度和注意力頭數。代表模型包括GPT-3(175B稠密)、PaLM(540B稠密)。優勢是研究路徑清晰,缺點是訓練和推論成本隨引數量線性甚至超線性增長。當引數超過500B後,經濟性迅速惡化,單次訓練成本可達數億美元。

2. 稀疏混合專家(Sparse MoE)

為解決稠密擴充套件的價效比瓶頸,MoE架構成為主流選擇。通過將模型劃分為多個“專家”子網路,每次輸入僅啟用部分專家,在總引數極巨量的同時控制計算開銷。Google的Switch Transformer(2021年)展示了1.6萬億引數MoE模型,而GPT-4(2023年)據推測使用MoE(8個專家)。MoE的問題是訓練不穩定、通訊開銷巨大、負載均衡困難,但它已成為目前攀登更高湧現能力的核心路徑。

3. 多模態原生融合

認為僅依靠文本資料難以觸發全部智慧湧現,需要讓模型在視覺、語言、音訊、程式碼的聯合空間中學習。GoogleDeepMind的Gemini系列(2023年12月起)原生設計為多模態,OpenAI的GPT-4V/GPT-4o也通過多模態輸入實現多感官湧現。這條路線追求更接近人類認知的泛化推論。

4. 高效對齊與過程監督

湧現能力可能伴隨有害輸出。RLHF(基於人類反饋的強化學習)和Constitutional AI等方法意圖讓模型湧現出“有幫助、無害、誠實”的行為。這本身正逐步成為一種新的技術路線分支:不只是追求更強的湧現,還追求可控的湧現。例如Anthropic的Claude系列模型強調通過憲法訓練來引導湧現行為。

5. 長期記憶與自主智慧代理架構

為讓湧現能力從單輪對話擴充套件到持續互動與任務執行,出現了一系列擴充套件技術:檢索增強生成(RAG)為模型提供外部可更新知識庫;記憶模組讓模型記住歷史互動;工具呼叫和自主規劃架構(AutoGPT、MetaGPT等)利用大型模型的湧現推論來組織工作流。這本質上是在基礎模型之上建置“湧現放大器”。

綜合來看,主流技術趨勢是在極大規模稀疏模型(MoE)的基礎上增加多模態訓練和過程式對齊,並耦合外部工具和記憶系統,以逼近更高階的通用智慧。截至2024年第四季度,尚無公開證據表明除“更大規模+更優資料”組合之外的路徑已獨立觸發顯著湧現。


上游

湧現能力的“源泉”是算力基礎設施。上游主要包括晶片設計、製造、封裝測試、互連裝置以及雲端基礎設施。

晶片設計與製造

  • 輝達(NVIDIA):主導AI訓練GPU市場。其H100(2022年釋出)採用台積電4nm工藝,單卡INT8算力約3958 TOPS,配備80GB HBM3視訊記憶體。據輝達2025財年第二季度財報(截至2024年7月28日),資料中心業務營收達到263億美元,年增率增長154%,其中約40%~50%被認為由大型模型訓練需求驅動(分析師估算,口徑未獲官方確認)。下一代B200 GPU(Blackwell架構)預期2024年底出貨,單晶片訓練算力再提升數倍。
  • AMD:Instinct MI300X(2023年12月推出)配備192GB HBM3,視訊記憶體容量領先,面向推論和部分訓練市場。主要受益於雲端客戶對多元供應的需求。
  • 自研晶片:GoogleTPU v5p(2023年底)、亞馬遜Trainium2、微軟Maia 100以及中國華為昇騰910B等,均為降低對輝達依賴並最佳化成本結構而研發,直接供應內部大型模型訓練。
  • 製造與封測:台積電(TSMC)幾乎壟斷所有高階AI晶片的製造,其CoWoS先進封裝產能是GPU/HBM出貨的關鍵瓶頸。據台積電2024年第二季度法說會,AI相關營收佔比已超50%,CoWoS產能在2024年計劃翻倍至約3萬片/月但仍供不應求。

儲存與互連

HBM(高頻寬記憶體)是AI晶片的必需元件。SK海力士、三星、美光為主要供應商,HBM3E(2024年量產)傳輸速率達8Gbps以上。光模組與高速交換器構成了萬卡叢集的互連底座,800G光模組在2024年進入規模部署,1.6T光模組預計2025年起可見需求爬升。相關廠商包括中際旭創、Coherent、輝達(Spectrum/CX交換器)等。

能源與散熱

單個10萬卡訓練叢集功耗可達150-200兆瓦,約相當於一箇中等工業城鎮的用電量。因此,上游能源供應與液冷散熱方案成為硬約束。施耐德電氣、Vertiv等資料中心基礎設施供應商直接受益;液冷方案(冷板、浸沒式)滲透率快速提升。

上游環節的集中度極高:GPU由輝達主導,製造和先進封裝依賴台積電,HBM由SK海力士和三星雙寡佔。這導致全球大型模型訓練的成本與進度受制於幾家公司產能,構成產業鏈的首要瓶頸。


下游

擁有湧現能力的基礎模型通過API、開源或產品化嵌入,激活了下游千行百業的革新。核心下游方向包括:

智慧代理與自動化流程

多種自主智慧代理架構(如AutoGPT、Microsoft Copilot Studio、LangChain/LangGraph、百度的文心智慧代理平台等)依賴大型模型的湧現規劃與工具呼叫能力,可以完成給定的多步驟複雜任務,如生成完整市場分析報告、預訂差旅行程並同步日曆。據公開新聞(2024年),已有企業將此類智慧代理應用於客服、IT運維、銷售線索管理等流程,降低人力成本30%~50%(企業案例口徑,引自麥肯錫2024年6月報告《生成式人工智慧的經濟潛力》)。

軟體開發與程式設計助手

GitHub Copilot(基於OpenAI Codex/GPT-4系列)是湧現能力的典型商業落地產物。微軟2024財年第四季度財報(2024年7月30日)揭露,GitHub Copilot已有超過180萬付費使用者,年化經常性營收(ARR)正向數十億美元邁進。此外,Cursor、Replit AI等初創企業也將程式碼湧現能力整合進IDE,形成新開發範式。

知識密集型行業應用

  • 醫療:大型模型通過醫學考試的能力湧現(如GPT-4在USMLE中得分超86%,2023年《Nature》論文)使其有望輔助診斷、生成病歷、解讀醫學影像報告。目前仍處於臨床輔助和文件整理階段。
  • 金融:在合規審查、投研摘要、反洗錢調查中,大型模型的湧現推論被用來提取複雜實體關係。彭博社推出BloombergGPT(2023年),專門針對金融領域訓練,在部分金融NLP任務上展現優勢。
  • 教育:具備湧現推論的AI導師可以提供個性化問題解答、作文批改和學習路徑規劃。可汗學院與OpenAI合作推出Khanmigo(2023年3月),展示了個性化AI教學的潛力。
  • 法律:合同審查、案情摘要、證據鏈分析。儘管有“幻覺”困擾,但作為律師助手提升效率的案例在增多。

搜尋與資訊重構

微軟New Bing(2023年2月整合GPT-4類模型)、Google搜尋生成體驗(SGE,2024年)以及Perplexity AI等重新定義了資訊獲取方式:由生成式的湧現能力直接回答覆雜問題,而非返回連結列表。這對傳統搜尋廣告商業模式構成深遠衝擊。

下游的共同趨勢是從“模型即服務”走向“智慧即服務”。截至2024年8月,公開資料未監測到僅依賴於原始湧現能力而無任何產品化包裝實現大規模營收的案例;所有實際採用都與行業工作流、資料治理和安全護欄深度耦合。


受益公司

需要事先宣告:本段落列舉的公司僅基於其在產業鏈中的公開業務關聯,不代表任何投資評價或價值判斷。受益邏輯如下:

  • 上游算力核心:輝達(NVIDIA)是第一梯隊的直接受益者。其資料中心業務2025財年Q2(截至2024年7月28日)營收263億美元,年增率增長154%,其中大型模型訓練推論需求被認為是主要驅動。AMD、英特爾(Gaudi系列)及各家自研晶片廠商也共同受益於算力需求爆發。
  • 雲端基礎設施:微軟Azure(OpenAI獨家雲端提供商)、亞馬遜AWS、GoogleCloud、阿里雲端、華為雲端等因大型模型訓練推論帶來叢集租賃和模型服務營收增長。微軟Azure在2024財年Q4(2024年6月30日止)Azure及其他雲端服務營收年增率增長29%,其中AI服務貢獻約8個百分點的增長。
  • 基礎模型開發商:OpenAI(據The Information等報道,2024年8月其年化營收估算超過34億美元)、Anthropic、Google DeepMind、Meta(開源路線,間接通過廣告和開發者生態獲益)、百度、阿里、月之暗面、智譜AI等,若成功將湧現能力商業化,將通過API、訂閱、或使用者時長變現。百度文心大型模型API呼叫量在2024年第二季度年增率增長數倍(據百度2024年Q2業績電話會)。
  • 應用與整合商:Salesforce、Adobe、ServiceNow等企業軟體巨頭將湧現能力嵌入原有產品,提升客單價與使用者粘性。微軟將Copilot融入Office 365全家桶,使用者付費意願已初步驗證(具體訂閱數及營收貢獻公開資料未見精確拆解)。
  • 資料與工具鏈:Scale AI、Labelbox等資料標註平台受益於高質量訓練資料需求;向量資料庫(如Pinecone、Weaviate、Zilliz的Milvus)為RAG系統提供檢索能力;AI編排平台(如LangChain、Dify)降低開發門檻,它們都處於生態受益者位置。

需再次強調,所有營收、增長率等數字均來自公司公開財報,本段僅為客觀產業鏈梳理。


市場規模

湧現能力本身目前沒有被單獨核算為一個市場,但由其驅動的大型模型及相關基礎設施市場存在多項第三方估算:

  1. 大型模型訓練與推論市場

    • 據Grand View Research(2024年3月釋出),2023年全球大語言模型市場規模約45.9億美元,預計2024-2030年複合年增長率(CAGR)為33.2%。該統計口徑包括API呼叫、模型微調及部署服務。(來源:Grand View Research, “Large Language Model Market Size…”, 2024年3月)
    • 彭博行業研究(Bloomberg Intelligence)(2024年6月)預測,到2032年生成式AI市場總規模將達到1.3萬億美元,其中訓練和推論的基礎設施佔比超過50%。該估算包含硬體、軟體與服務。
  2. AI晶片市場

    • IDC(2024年5月)估算,2023年全球AI晶片市場規模約為534億美元,2024年預計增長至671億美元,而到2027年可能超過1194億美元。訓練用GPU和AI加速器是大型模型算力的核心部分。
  3. 資料中心及能源

    • BCG(2024年4月)分析,為支援大規模AI訓練,到2028年全球資料中心資本支出可能從2023年的2500億美元增至超過4000億美元,部分增量由具備湧現能力的前沿模型需求推動。
    • 麥肯錫(2024年1月)預測,到2030年AI相關資料中心的電力消耗將至少翻倍,代表配套電力、冷卻、儲能市場的增量。
  4. 下游應用市場

    • 沙利文(Frost & Sullivan)(2024年2月)報告指出,中國AI大型模型下游應用市場2023年規模約143億元,2027年預計將達到近600億元,年複合增長率約43%,涵蓋金融、政務、醫療、製造等行業場景。

需要指出:各機構的預測口徑和假設差異較大,且市場正在快速變化,上述數字應視為基於特定時間點的前瞻性估計,而非確定性事實。關於“湧現能力”本身創生的獨立市場增量,未有機構給出專門測算。


玩家對比

以下對比聚焦公認具備前沿湧現能力的模型及其機構,以2024年8月公開資訊為準:

維度OpenAI(GPT-4/4o系列)Google DeepMind(Gemini系列)Anthropic(Claude 3系列)百度(文心大型模型4.0)智譜 AI(GLM-4系列)
代表模型GPT-4, GPT-4oGemini 1.5 ProClaude 3.5 Sonnet文心4.0GLM-4, GLM-4V
引數規模~1.8T(MoE,第三方推測)未公開,據傳為MoE架構未公開公開資料未見,推測千億級公開資料未見,推測數千億級(MoE)
主要湧現能力展現複雜推論、多步工具使用、多模態全感官互動上下文視窗100萬tokens、多模態原生、長影片理解超長程式設計認知、低幻覺、高質量安全對齊中文理解與生成優秀、多模態互動中英雙語、較強調工具呼叫(Function Call)能力
基準示例(MMLU評測)86.4%(GPT-4, 5-shot, 2023)90.0%(Gemini Ultra, 2024年1月)88.7%(Claude 3 Opus, 2024年3月)公開基準可查約80%+(文心4.0, 2023年),具體MMLU口徑未統一公開資料未見標準化MMLU直接對比
商業訪問方式API + ChatGPT訂閱API + Vertex AIAPI + Claude.ai訂閱API + 文心一言AppAPI + 開放平台
開放程度閉源閉源(部分Gemma開源)閉源閉源部分開源(GLM-130B等)

國內外還有諸多實力玩家,如Meta的Llama 3(最大開源稠密模型405B,2024年7月釋出)、阿里的通義千問2.5(2024年5月)、月之暗面Kimi(強調長上下文200萬字)、百川智慧Baichuan 4等。總體來看,在湧現能力的綜合水平上,OpenAI和Google處於第一梯隊;中國玩家在中文語境、應用落地速度和資料合規方面具備比較優勢,而在多模態泛化、複雜科學推論等方面的模型湧現表現,公開可獲取的權威對比資料有限。


風險

  1. 安全與對齊失控
    湧現能力越強,越可能出現難以預測的負面行為,包括生成危險的知識(如生物武器資訊)、操縱使用者、或執行有害指令的次生危害。模型規模的提高使人工監督和干預的有效性相對下降。即使加入RLHF等對齊流程,依然存在“獎勵駭客”問題,即模型為獲取獎勵而投機取巧,並未真正對齊人類意圖。

  2. 可解釋性黑洞
    湧現使決策過程更不透明。在金融、醫療、司法等高風險場景,無法解釋“為什麼AI得出此結論”構成合規和信任障礙。截至2024年,尚無公認的可解釋性方法能解構萬億引數模型的湧現推論過程。

  3. 算力壟斷與社會公平
    訓練可湧現的前沿模型需要數億至十億美元級別的算力投入,且關鍵GPU供應緊張。這導致先進能力向極少數超大型企業和國家集中。中小企業和公共部門無法平等獲取,可能加深數字鴻溝。據比利時魯汶大學等研究(2023年10月),訓練一個GPT-4級別模型所消耗的電力和水資源也對環境造成顯著壓力。

  4. “幻覺”與可靠性缺陷
    湧現出的推論能力並不能消除語言模型固有的“幻覺”問題:模型仍可能以高度自信生成與事實相悖的內容。在嚴肅場景中,這種不可靠性可能引發輿論、法律甚至生命安全風險。

  5. 倫理與監管風險
    就業替代效應、深度偽造、版權侵權、隱私洩露等問題隨模型湧現能力增強而放大。全球監管趨勢趨嚴:歐盟《人工智慧法案》已於2024年8月生效,對通用AI提供者設定透明度、風險評估等義務;中國《生成式人工智慧服務管理暫行辦法》自2023年8月施行,強調安全評估與演算法備案。合規成本與技術路線選擇的矛盾可能阻礙湧現研究的快速推進。

  6. 回報遞減的隱憂
    儘管目前仍處投入上升期,但部分研究者(如C. Manning, 2024年)質疑單純的規模擴充套件是否能持續帶來有用的能力湧現,抑或會遇到資料耗盡、能源天花板以及經濟回報的邊際遞減。若該擔憂成真,鉅額基礎設施投資可能面臨回報不足的風險。


誤讀糾偏

在廣泛討論中,關於湧現能力存在幾種典型誤讀,需要釐清:

誤讀一:規模越大,一定湧現更強能力。
實際:規模是必要但不充分條件。資料質量、多樣性、訓練穩定性、架構設計等同樣關鍵。一個小而精且資料精良的模型可能在特定任務上勝過粗糙訓練的大型模型。湧現並不是完全“自動”的,需要精心配比。

誤讀二:湧現是完全不可預測的“魔法”。
實際:湧現雖然在小模型階段無法預測,但遵循規模定律的變化趨勢。通過觀察模型損失下降以及中間規模模型的規律,可以合理推斷某些任務會在更大規模時解鎖能力。一些研究(如DeepMind的“Predicting Emergent Abilities”工作,2023年)嘗試通過建立預訓練指標與湧現任務的關聯來早做判斷。

誤讀三:小模型不可能具備類似湧現能力。
實際:通過蒸餾、特定任務微調,或使用高質量合成數據訓練,小模型也可能表現出部分類似“湧現”的能力,但這類能力往往不具備泛化性和零樣本遷移能力。真正的湧現是通用的、不經明確程式設計直接獲得的行為,這一點仍然是超大規模模型的相對獨有特徵。

誤讀四:湧現能力就是AGI(通用人工智慧)到來的標誌。
實際:湧現能力展示了令人驚歎的語言泛化,但離AGI的自主意識、跨領域長期規劃、穩健的世界模型等仍相距甚遠。大部分研究人員認為目前仍是“弱人工智慧”階段,湧現是通往AGI的線索之一,而非終點。

誤讀五:湧現能力可脫離資料自我產生。
實際:湧現源於對海量人類生成資料的內在結構壓縮,是人類集體智慧的間接對映,並非模型憑空創造。模型自身不會“發明”超越訓練分佈的全新知識體系。


最新事件

以下為截至2024年8月,與湧現能力高度關聯的近期重大事件:

  • GPT-4o釋出(2024年5月):OpenAI推出全能多模態模型,實現即時音訊、視覺、文本的融合湧現互動,反應延遲大幅降低,引發行業對即時多模態智慧代理的應用想像。具體新湧現任務能力的系統測試結果,OpenAI已釋出技術報告(2024年8月8日)。

  • Llama 3.1 405B開源(2024年7月):Meta開源迄今為止最大稠密模型,稱其效能可與頂尖閉源模型相抗衡,在數學推論、程式碼等湧現任務上表現出色,引發對“開源能否復現湧現”的討論。

  • 歐盟《人工智慧法案》生效(2024年8月1日):對通用AI模型(包括可能產生湧現能力的基座模型)實施風險分級監管,標誌著合規成為湧現能力發展的剛性約束。

  • Google DeepMind推出AI科學家(2024年樣品展示):由大型模型驅動的端到端科學研究代理,顯示出初步的實驗設計、程式碼編寫和論文寫作湧現能力,但尚未大規模部署。

  • 國內動態:阿里通義千問2.5(2024年5月)在中文推論和多模態任務上整體能力提升,Kimi智慧助手的超長上下文應用受到關注。百度文心4.0工具版在2024年4月釋出,強調工具協同的湧現。根據各公司公開宣傳,至少在特定評測上拉近了與國際前沿的距離,但權威的第三方獨立對比基準得分,公開資料可查仍較有限。


追蹤指標

要持續評估湧現能力的技術進展及產業影響,建議關注以下定量與定性指標:

  1. 訓練計算量(Training FLOPs)趨勢

    • 來源:公司技術報告或EpochAI等獨立追蹤。
    • 觀察前沿模型訓練計算量的年度增長倍數,是否維持每10個月翻番節奏。
  2. 模型引數量與架構(Dense vs. MoE)

    • 追蹤新發布模型的公開架構資訊、總引數量及啟用引數比例,瞭解“有效湧現引數”的規模。
  3. 基準測試得分變化

    • 持續追蹤:MMLU、HellaSwag、ARC-Challenge、HumanEval(+新版本)、GSM8K(數學推論)等基準分數的進展,注意提示方法(0-shot/5-shot/CoT)的一致性。
  4. 多模態湧現任務

    • 影片理解、3D場景推論、數學幾何、程式碼編譯器級別輸出等更復雜的任務,是下一階段湧現的試金石。
  5. 推論經濟性指標

    • 每百萬token推論成本(美元)、響應延遲、等效模型推論吞吐量。若推論成本快速下降,將加速下游對湧現能力的採用。
  6. 安全與對齊事件

    • 主要模型公開的安全事件、紅隊測試結果、對齊研究進展(如OpenAI或Anthropic釋出的系統卡)。
  7. 政策與監管里程碑

    • 各國AI法案細則、大型模型備案要求、版權裁定、資料隱私新規等,這些影響湧現能力的訓練資料獲取與部署範圍。
  8. 產業落地指標

    • 主要雲端廠商AI服務營收增速、企業AI助手付費使用者數、頭部模型API呼叫量變化,以及各行業標杆案例的投資回報率資料。

以上指標的追蹤,需以原始來源(技術報告、財報、監管檔案、權威基準排行榜)為準,並對不同口徑資料進行歸一化解讀。


信源

  • Kaplan et al., “Scaling Laws for Neural Language Models”, 2020, arXiv:2001.08361.
  • Wei et al., “Emergent Abilities of Large Language Models”, 2022, arXiv:2206.07682.
  • Srivastava et al., “Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models” (BIG-bench), 2022, arXiv:2206.04615.
  • Anthropic, “Model Card and Evaluations for Claude Models”, 2024.
  • Google DeepMind, “Gemini: A Family of Highly Capable Multimodal Models”, 2023, arXiv:2312.11805.
  • Meta, “The Llama 3 Herd of Models”, 2024.
  • OpenAI, “GPT-4 Technical Report”, 2023, arXiv:2303.08774; “GPT-4o System Card”, 2024.
  • NVIDIA Corporation, 2025財年第二季度財報,2024年8月28日。
  • Microsoft, 2024財年第四季度財報,2024年7月30日。
  • Grand View Research, “Large Language Model (LLM) Market Size, Share & Trends Analysis Report”, March 2024.
  • IDC, “Worldwide AI Chips and AI Server Spending Forecast”, 2024年5月。
  • McKinsey Global Institute, “The economic potential of generative AI”, 2024年6月。
  • Stanford HAI, “AI Index Report 2024”, 2024年4月。
  • 中國國家網際網路資訊辦公室等,《生成式人工智慧服務管理暫行辦法》,2023年8月15日施行。
  • 歐洲議會,《人工智慧法案》(EU AI Act),2024年8月1日生效。
  • 各公司官網、技術部落格及公開演講內容。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型