模型層 開放閱讀

HellaSwag

HellaSwag

概念 ID
hellaswag
更新時間
2026-05-29
來源數量
待補

HellaSwag

title: "HellaSwag: 衡量大型模型常識推論能力的黃金標尺"
type: "deep research"
category: "AI Benchmark"
tags: ["HellaSwag", "常識推論", "LLM", "基準測試", "對抗性生成"]

### 1. 摘要:常識,大型模型的阿克琉斯之踵

HellaSwag 是一個專門用於評測大語言模型常識推論能力的基準測試,其全稱“Harder Endings, Longer contexts, and Low-shot Activities for Situations With Adversarial Generations”已經揭示了它全部的野心:不是考察模型記住了多少事實,也不是測試模型能否進行復雜的符號邏輯推演,而是通過一個看似極其簡單的“句子續寫”任務,精準檢驗模型是否真正“理解”了物理世界和人類社會的執行常識。測試給出一段日常場景的上下文描述,例如“一個女人在廚房裡切菜”,然後提供四個可能的後續句子,其中只有一個是符合人類常識的合理發展,另外三個都是由早期先進模型生成的、語法流暢甚至主題相關但內容荒謬的“對抗性干擾項”。模型必須從這四個選項中選出唯一正確的續寫。

這個任務之所以嚴苛,是因為那些錯誤選項並非胡亂拼湊,它們完美地模擬了語言模型容易犯的“一本正經地胡說八道”的型別——主題匹配、句式自然,卻在關鍵細節上違背了最基本的物理規律或社會共識。HellaSwag 因此成為衡量模型是否形成了內在世界模型的試金石。它的核心價值在於,能夠以極高的分辨力有效區分真正的“理解”和表面上的“模仿”,從而在一眾傳統自然語言處理基準中脫穎而出,成為基礎模型能力評估中不可或缺的“健康檢查”。自2019年釋出以來,HellaSwag 從最初讓最先進模型僅略超隨機猜測的刁鑽難題,逐步轉變為模型進入實用門檻的基礎能力驗證,完整地見證了大型模型從弱到強的技術演進,也深刻地影響了產業界對人工智慧“智慧”二字的認知標準。本報告將從歷史語境、技術構造、實驗發現、產業對映及未來進路等多個維度,對HellaSwag進行一次全景式的深度剖析。

### 2. 引言:當“流暢”欺騙了我們

在自然語言處理發展的漫長曆程中,人類設計的大多數評測基準都集中在對語言形式本身的掌握之上——句法分析、情感分類、命名實體識別、文本蘊含等。這些傳統任務無疑推動了計算語言學的發展,但它們共同存在一個根本侷限:不要求模型真正“知道”椅子是用來坐的、太陽是從東方升起的、人們不會將叉子插進電源插座。長期以來,研究者們預設只要模型能夠在大規模文本資料上習得統計規律,就能順帶捕捉到隱含在這些文本中的常識知識。然而,深度學習,尤其是Transformer架構的橫空出世,將這一假設推向了危機邊緣。

2018年至2019年間,BERT、GPT-2等預訓練語言模型相繼問世,生成文本的流暢度以肉眼可見的速度提升,大量的科技媒體和產業巨頭開始用“接近人類水平”“具備常識推論能力”等話語來包裝自己的產品。然而,在那些令人驚歎的連貫段落裡,細心的研究者觀察到一種微妙卻致命的異常現象:模型在聊天對話或故事生成任務中,並不是在真正地“思考”下一個合理的事件,而是在機率意義上選擇那些與上下文統計上最常共現的詞彙序列。這種統計模仿產生了一種所謂的“語義滑坡”——文本在絕大多數表面特徵上無可挑剔,但放在現實世界場景中卻稍顯荒誕甚至完全不可能。例如,模型可能在“他走進浴室”之後自然地續寫“然後他打開了冰箱”,而不會察覺空間設定上的根本矛盾。HellaSwag 正是在這種“流暢性幻覺”蔓延的技術語境下誕生的,它的目標是用最樸素、最難以欺騙的方式,將常識推論這一隱藏在大型模型語言能力背後的暗礁暴露在陽光之下。

### 3. 誕生背景:GPT時代的常識焦慮

HellaSwag 的誕生絕非偶然。2018年,OpenAI釋出了第一代GPT,其單向語言建模的方式展現出驚人的文本續寫能力。隨後,BERT以掩碼語言模型的形式重新整理了大多數自然語言理解排行榜。然而,華盛頓大學和艾倫人工智慧研究所的研究者在深入分析GPT的輸出行為時發現了一個系統性的模式:當模型被要求預測一個場景的下一個事件時,它更傾向於生成那些在訓練語料中與給定上下文經常共現的一般性敘述,而非那個場景下唯一合理的具體動作。換句話說,模型學會了“關聯”,但沒有學會“因果”和“物理約束”。

例如,對於上下文“一名體操運動員在平衡木上起跳”,人類會期待一個諸如“她完成了一個後空翻並穩穩落地”之類的合理續寫。但早期的GPT模型卻可能給出“她開始哭泣”或“觀眾席上有人賣爆米花”,這些語句雖然在語言上通順且與體操主題相關,卻完全無視了正在進行的高難度動作序列的即時連貫性。這表明模型缺乏一種對物理世界即時狀態(如身體在空中的動量、重力約束)的表徵能力,而僅僅是在進行一種高階的話題維持。這種失敗模式被Rowan Zellers等人系統性地加以捕捉,併成為HellaSwag資料集設計的核心動機。他們意識到,要真正衡量智慧,就需要創造一種任務,其錯誤答案不是隨機的噪聲,而是精確模擬模型最典型的“合理但錯誤”的思維軌跡。於是,對抗性生成的思想被引入基準建置之中,HellaSwag應運而生。

### 4. 任務定義:句子續寫的簡單與複雜

從表面上看,HellaSwag的任務形式極其樸素,甚至可以說是原始:它是一個嚴格的多項選擇題。給定一個上下文,通常由1-3句話組成,描述一個日常生活或特定活動的場景,以及4個候選結尾句子,模型需要選出唯一一個符合人類常識的合理續寫。上下文和候選結尾均來自兩個領域:日常活動(如做飯、收拾庭院)和特定活動(如玩滑板、做普拉提)。這些場景被精心挑選,以確保它們需要呼叫豐富的物理常識、社會規範、意圖推論等深層認知能力。

然而,這種簡單性的背後隱藏著精密的構造哲學。HellaSwag的上下文並不是隨意擷取的文本片段,而是從WikiHow等帶有明確步驟展望的語料中提取並進行人工重寫的活動描述。WikiHow的文章天然具有“目標-步驟”的結構,提供了一個強時序性和因果關係的活動架構。原始研究者從這些文章中抽取一個正在進行中的步驟作為上下文,然後將下一步驟的合理描述作為正確答案。因此,正確答案具備高度的物理邏輯連貫性,而這一點恰恰是純語言模型難以僅憑統計共現習得的特性。這種設計確保了任務對“常識”的要求是內生的、無法繞過的。一個模型若想在此任務上得高分,必須真正地對活動序列的因果約束和物理狀態變化進行建模,而無法僅僅依靠上下文中詞彙的簡單主題延續來矇混過關。

### 5. 對抗性生成:製造高迷惑性干擾項的藝術

HellaSwag 最核心的創新,也是它名字中“Adversarial Generations”的由來,在於其錯誤選項的生成方式。傳統的多選題基準,其干擾項通常由人工手寫或通過隨機替換詞彙產生,這些干擾項要麼在語法上不自然,要麼在主題上明顯偏離上下文,模型很容易通過淺層模式識別將其排除。而HellaSwag的干擾項,全部由當時最先進的GPT模型(具體為GPT-1或GPT-2的早期版本)在特定條件下生成,並經過嚴格的對抗性篩選。

生成流程如下:對於每一個上下文,研究者使用一個早期的語言模型,以束搜尋或採樣方式生成大量可能的結尾句子。這些機器生成的結尾通常會呈現出多樣化的“錯誤模式”——有的保持了主題卻違背了物理順序(如“將生雞肉端上餐桌”),有的將步驟中涉及的工具用在了錯誤的物件上,有的引入了完全無關的常識實體但措辭卻非常自然。然後,研究者在這海量候選中,利用一組自動化指標和人工驗證的混合策略,篩選出三個最具誤導性的選項作為干擾項。其中的關鍵是,篩選器會優先選擇那些讓當時的模型(如GPT等)給出高機率,但對人類來說明顯不合理的句子。這個過程被稱為“對抗性過濾”,它確保了最終的資料集不會因為語言質量低劣而被輕易攻破。由於這些干擾項天生出自語言模型的“大腦”,它們完美地模擬了模型內部最可能發生的常識性錯誤型別,從而使HellaSwag成了一面精準對映模型思維盲區的鏡子,任何後來者想要在這面鏡子前偽裝“理解”都變得極其困難。

### 6. 資料集構造:規模、分佈與質量控制的嚴謹性

HellaSwag 資料集並非小規模實驗玩具,而是一個經過精心設計、具有足夠統計穩健性的大規模基準。其最終版本包含約1萬個上下文,並劃分為訓練集、驗證集和測試集。雖然任務本身被當作零樣本或少樣本能力的測試,但提供訓練集的本意是允許模型進行領域適應。然而,實際上多數頂尖模型是直接進行零樣本評估的,這也更貼合測試常識推論“泛化”能力的初衷。

在資料分佈上,HellaSwag覆蓋了極其廣泛的日常活動場景,從“如何換輪胎”到“如何製作義大利麵”,從“如何在滑雪板上轉彎”到“如何進行瑜伽下犬式”。這種廣度保證了任務不是偏向某一狹窄領域的專用知識,而是真正測量普通成年人類所共享的通用常識。為了確保資料集本身的質量,研究者投入了大量人工進行驗證。每個上下文-正確答案對都經過人工撰寫或改寫,確保來自WikiHow的原始文本被徹底去除生硬的指導性口吻,而是變成自然的口語化敘事。干擾項也經過了多輪人工剔除——那些雖然由機器生成但碰巧合理,或者因文化差異可能存在歧義的選項都被嚴格移除。這種近乎苛刻的清洗最終使得HellaSwag的人類基準準確率超過了95%,為後續所有模型提供了一個極其清晰的能力上限參照,也從根本上奠定了其作為“黃金標尺”的地位。

### 7. 技術原理深度解析:生成式常識推論的本質

HellaSwag 評測的是一種被作者定義為“生成式常識推論”的能力。這與傳統的閱讀理解或自然語言推論有著微妙但本質的區別。傳統自然語言推論通常給定前提和假設,讓模型判斷假設是否可以從前提中推斷出來,這測試的是模型對文本本身包含資訊的邏輯關聯能力。而 HellaSwag 要求模型做到的則是一個跨越:它需要從一個開放式的場景描述中,想像出“接下來最符合世界規律地會發生什麼”,這要求模型呼叫儲存在引數中的關於物理世界運作方式、人類的意圖、文化習慣以及因果關係的大量內隱知識。

從認知科學的角度,這一任務觸及了人類“預測加工”理論的核心。人類理解世界的一個基本機制是不斷對下一刻的感覺輸入進行預測,並基於預測誤差來調整內部模型。HellaSwag 將這一機制壓縮到了一個文本選擇題中:從“一個女人在廚房裡切菜”這個上下文,大腦會自然而然地預測接下來可能的動作——繼續切下一刀,或者把切好的菜放入碗中,但絕不會預測“她開啟窗戶飛了出去”。這種預測能力依賴於一個豐富的、內部一致的“世界模型”。大語言模型在HellaSwag上的準確率,本質上就是在衡量其內部狀態表徵在多大程度上能夠維持這種物理和社會的連貫性。因此,該基準超越了單純的“語言能力”範疇,進入了“具身認知”與“世界建模”的交叉地帶。模型必須學會文本與物理狀態之間的對映,即便這種物理狀態從未以模態資料(如影像、力反饋)直接輸入過,而僅僅是從海量文本的間接描述中蒸餾出來的。

### 8. 人類基準與早期模型慘敗的震撼性對比

HellaSwag 資料整合為了對當時AI研究界衝擊最大的排行榜之一,其原因在於人類表現與模型表現之間存在著令人震撼的巨大鴻溝。在原始論文中,人類眾包工作者的準確率高達95.6%,這證實了資料集本身的問題對於普通人類而言是極其簡單直接的——幾乎不需要任何深思熟慮,僅憑直覺就能瞬間辨別出哪個續寫“對勁”。然而,2019年時,最強的通用語言模型,如BERT-Large,其零樣本準確率僅為約45-47%,僅僅略高於隨機猜測的25%。即便是經過在該資料集訓練集上進行微調的模型,準確率也只能提升到60-70%左右,仍然遠低於人類水平。

這一發人深省的對比構成了HellaSwag的“名片效應”。它直白地告訴全世界:那些在GLUE、SuperGLUE等傳統基準上已接近甚至超越人類分數的模型,在常識推論面前幾乎還是“瞎子”。尤其值得注意的是,GPT-2等模型雖然在文本生成流暢度上令人拍案叫絕,但在HellaSwag上的得分卻低得可憐,這恰恰說明了“說話流利”與“說話在理”是兩種截然不同的能力。這一對比結果在當時製造了巨大的學術震動,迅速將研究界的注意力從單純的提高語言困惑度或文本蘊涵分數,引向了更深層次的常識建模問題。它為後來一系列試圖將知識圖譜、物理模擬器、視覺資訊與語言模型相結合的研究工作提供了強有力的動機,也促使模型開發者將HellaSwag作為必測的核心指標之一。

### 9. 規模效應的勝利:從GPT-2到GPT-4的能力湧現

如果說HellaSwag的誕生是對早期模型的一次“羞辱”,那麼隨後幾年大規模語言模型的演進則在該基準上書寫了一部驚心動魄的逆襲史。最初,提升HellaSwag得分的嘗試聚焦於精巧的模型架構或知識增強手段,例如將常識知識圖譜嵌入模型,但效果有限。真正的轉折點來自模型規模的急劇膨脹。2019年底,OpenAI釋出的GPT-2 1.5B版本將零樣本準確率提升到了約62%,而2020年推出的GPT-3 175B直接將這一數字推高到約78-79%,實現了對之前所有精心微調模型的大幅超越。這種不經過任何專門微調,僅靠擴大引數和資料規模就在常識推論上產生質變的現象,正是後來被廣泛稱為“湧現能力”的典型體現。

隨後,GPT-3.5、InstructGPT、PaLM、Chinchilla、LLaMA等一系列更強更大的模型繼續重新整理紀錄。到2024年,最先進的模型如GPT-4、Claude 3等在HellaSwag上的零樣本準確率已經普遍達到95%以上,甚至超過了原始的人類基準,接近飽和狀態。這一軌跡深刻揭示了兩個科學事實:第一,常識推論能力可以大部分從海量文本的統計學習中湧現,而不一定需要顯式的符號知識或具身經驗,只要模型足夠大,文本中隱含的物理規律和社會規範就能被足夠精細地引數化。第二,HellaSwag的角色已經悄然發生轉變——從一個高不可攀的“聖盃式挑戰”變成了基礎模型智慧的“准入門檻”。如今,任何新發布的大型模型如果在HellaSwag上不能突破90%,幾乎相當於公開承認其基礎能力存在嚴重缺陷。該基準的演進史,本身就是大型模型智慧演進史的一個精確縮影。

### 10. 產業影響:價值數十億美元的入場券

在產業層面,HellaSwag 具備了遠超學術基準的深遠影響力,它已經進入了大型模型商業競爭的核心話語體系。當今,基礎模型賽道是一個動輒投入數十億美元計算資源的競技場,雲端服務商、明星初創公司和科技巨頭每釋出一款新的模型,都會在一系列公開基準上公佈成績單,其中HellaSwag幾乎從不缺席。原因在於,API呼叫者或企業客戶在選擇基座模型來建置自己的應用時,常識推論的可靠性是一個非功能性的優先順序指標。

試想以下場景:一個基於大型模型的客服機器人,如果缺乏常識推論,在回答“我買的冰箱不製冷了,門關得很好”時,可能會一本正經地教導使用者“請確認冰箱門是否關好”;一個自動新聞摘要系統,在提煉“男子用雨傘阻擋落石受傷”的新聞時,可能會丟失雨傘不可能有效阻擋落石的常識線索,從而生成事實性錯誤。這些應用場景對物理規律、人類意圖和社會慣例的精準把握有著極高的要求,而HellaSwag正是目前公認為最能簡潔有效衡量此類能力的通用代理指標。因此,它成了一款“信任標尺”。對於企業而言,一個HellaSwag高分模型意味著下游應用更少的幻覺、更強的指令跟隨和更低的災難性風險。可以說,HellaSwag為百億美元級別的產業應用加上了一層基礎的安全墊和可解釋性背書,這也是其被稱為“黃金標尺”的世俗含義。

### 11. HellaSwag 的侷限性與批判性審視

儘管HellaSwag地位尊崇,但它也並非完美無瑕的試金石,來自學界和業界的批判與侷限性討論自其誕生起就不絕於耳。首要批評指向其任務形式的表面化。一些研究者質疑,即便是完美的HellaSwag成績,也可能僅僅反映模型學會了如何在一個固定的多項選擇範式中進行“去偏”和“模式匹配”,而非真正具備開放式場景下的常識推論能力。畢竟,四項選擇本身為模型提供了排錯的可能,而在真實世界中,模型需要自主生成而不僅僅是判別。此外,HellaSwag的對抗性干擾項源自早期GPT模型,隨著模型代際更替,後來者可能會利用與干擾項生成模型相似的歸納偏置,從而在一定程度上以“同族免疫”的方式輕易排除干擾,但這並不代表其常識推論本質上更強。

資料集本身的偏狹也被反覆提及。HellaSwag的活動場景主要源自英文WikiHow,不可避免地帶有西方文化和英語語言習慣的烙印。對於非英語原生環境或非西方文化背景的使用者,某些“常識”可能並不通用。例如,一個涉及棒球場景的續寫,對不熟悉該項運動的模型來說是一個知識問題而非推論問題。最後,有研究指出HellaSwag主要測試的是“動作序列的即時物理合理性”,而對更長時間跨度、涉及情感變化、社會博弈或反事實推論的深層常識覆蓋不足。這意味著,一個在HellaSwag上拿到100分的模型,仍可能在更微妙的常識任務中(如社會智慧、道德判斷)出錯。這些侷限性共同提醒我們,黃金標尺只是工具箱中的一把好尺,而非智慧的全部。

### 12. 後續演進與變體:從HellaSwag到常識推論家族

HellaSwag的成功催生了一大批在方法論和精神上受其啟發的常識推論基準。其中最直系的變體是“Social IQa”和“Physical IQa”等資料集,它們將常識拆分為社會常識和物理常識兩個獨立維度,同樣採用對抗性生成來製造迷惑選項,但更聚焦於特定類別。另一個重要的演進方向是由HellaSwag團隊自己提出的“Adversarial NLI”,將對抗生成思想引入自然語言推論,以建置更難被統計模式攻破的蘊涵資料集。

與此同時,為了響應模型能力的增長並延續基準的生命週期,研究者們還嘗試過“動態對抗”方法,即使用最新的模型來持續生成新的干擾項,建立類似“不斷進化的考試”這樣的迴圈基準。然而,這種動態方式的標準化和可比性面臨巨大挑戰。另一個趨勢是將HellaSwag的思想擴充套件到多模態領域,例如文本到影片的模型需要預測影片序列的後續幀,其常識錯誤可能表現為物體違反物理規律的運動,這與文本續寫中的常識錯誤存在深層的對應關係。這些後續發展表明,HellaSwag不只是一個數據集,它更重要的遺產是開創了一種基準建置的哲學:即必須根據當前AI最容易犯的微妙錯誤來設計對抗樣本,從而持續壓榨模型的真實能力,避免評測本身退化為一種通過資料集偏差即可刷分的過時儀式。

### 13. HellaSwag 與深層認知科學的對話

將HellaSwag僅僅看作一個工程評測工具會嚴重低估它的深層意義。實際上,這個基準無意間搭建了一座通往認知科學和哲學人工智慧討論的橋樑。它迫使研究者直面一個根本問題:僅從文本中學習,能夠獲得真正的“意義”嗎?傳統符號主義和早期聯結主義的爭論中,一方認為符號接地必須依賴感知和動作,另一方則認為統計學習足以從形式上提取符號間的關係。HellaSwag為這場爭論提供了一個定量的擂臺。當GPT-4等純文本模型最終超越人類水平時,一種強有力的論據浮現:足夠豐富的語言語料庫本身就對物理世界和社會互動進行了高度壓縮的編碼,語言模型通過預測千萬個“女人在廚房裡切菜”的下文,實際上已經反向學習到了一個內部的“廚房物理模擬器”的某種雛形。

然而,認知科學家也保持謹慎。一些研究者指出,HellaSwag高分可能僅僅代表模型學會了非常精細的文本指令碼知識,而不是真正的因果理解。一個經典反駁是,如果模型真正理解了重力,那麼它在需要更復雜推論的物理場景(比如積木倒塌的序列預測)中應該也能表現出色,但實際情況往往並非如此。因此,HellaSwag記錄的準確率曲線更像是智慧黑箱的一條外部行為軌跡,它揭示了“那裡面”正發生一些深刻的事情,但並沒有直接告訴我們它的內部運算是否與人類的常識推論同構。這種張力使得HellaSwag成為了一個既讓人興奮又讓人不安的存在,它不斷誘惑我們去重新定義什麼是“理解”,什麼是“智慧”。

### 14. 未來展望:超越多項選擇的常識測量

站在當前大型模型能力井噴的歷史節點,HellaSwag正面臨著“登頂後的困惑”。當最先進的模型已經達到或超過人類基準準確率,這項基準還有持續運營的價值嗎?答案是肯定的,但其形式和內涵必須演進。未來的HellaSwag測度可能會從以下三個方向尋求突圍。

第一,從判別式到生成式的轉變。未來的常識評估不應僅讓模型從四個選項中挑出正確答案,而應要求模型在開放生成中直接續寫合理結尾,並採用自動化常識違例檢測器(可能由另一個強大的判別網路或形式化驗證工具)來評估生成文本的物理邏輯一致性。這將極大地提高作弊難度。第二,跨模態擴充套件。結合影片、觸覺等感知模態的資訊,構造多模態常識推論場景,要求模型在理解視覺世界的基礎上續寫文本,從而檢驗其知識是否真的跨越了符號和感知的鴻溝。第三,長鏈因果推論。將單一的句子續寫擴充套件為多步敘事,要求模型在更長的依賴鏈條上保持常識一致性,例如預測一個複雜烹飪活動的完整10步序列,每一步的可能失敗和補救措施,這將為測試規劃與常識的結合開啟新的大門。HellaSwag的本質精神——用模型自身的弱點來測試模型——將永遠有效,只是具體表現形式必將隨著AI能力的成長而持續進化。

### 15. 結論:一把尺測出的智慧進化史

HellaSwag 的故事,就是一部微縮的大型模型智慧進化史。它誕生於對“流暢幻覺”的洞察,通過開創性地引入對抗性生成,將常識推論這道無形的高牆矗立在了早期語言模型面前。它不考驗博聞強記,不考察複雜推論,只通過最樸素的選擇題,赤裸裸地揭示出統計模仿與真實理解之間的天壤之別。而後,它又親眼見證了規模化帶來的能力湧現,從BERT的踉蹌起步,到GPT-3的一躍而過,再到GPT-4的輕鬆超越,它自己的角色已經從高不可攀的尖端挑戰,沉靜地轉變為模型世界的入門“健康檢查”。今天,HellaSwag仍是每一場大型模型釋出會清單上不可或缺的分數,它將繼續作為衡量一個模型是否值得被稱作“有常識”的黃金標尺,同時也不斷提醒我們:智慧的終極秘密,也許就隱藏在那些我們人類毫不費力便能理解的、物體會落下、工具自有其用、人不會飛入窗外的樸素世界的背後。未來,隨著基準本身的演化,HellaSwag所開啟的對抗性常識評估範式必將繼續照亮通往真正通用人工智慧的道路。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型