幻覺
1. 三秒看懂
大語言模型(LLM)在生成文本時輸出的內容表面通順、邏輯自洽,但與客觀事實不符、與給定的上下文相矛盾或完全無據可查——這種現象被統稱為“幻覺”。它不是模型的“惡意欺騙”,而是當前機率性生成機制與訓練目標內在侷限的必然產物。更流暢的表達反而會讓錯誤隱藏更深,使幻覺成為大型模型走向高可靠場景的最大單點風險。
2. 三分鐘產業解釋
幻覺直接動搖了 LLM 的商業信任根基。在客服、醫療、金融、法律等對資訊準確性有剛性要求的領域,一次嚴重的事實錯誤就可能觸發客戶投訴、監管處罰甚至法律訴訟。產業界正從三個層面系統性攻防:模型訓練(RLHF/DPO 對齊、事實性微調、知識編輯)、推論架構(檢索增強生成、思維鏈驗證、不確定性估算)以及評測與治理(忠實度基準、幻覺檢測 API、合規審計工具)。值得關注的是,幻覺並不隨著模型引數量增大而自動消失,反而在更大型模型中表現為更隱蔽、更自信的錯誤,因此專門化的幻覺緩解方案正從“可選補丁”升級為獨立的軟體層與投資賽道。據行業觀察,到 2025 年,幾乎所有面向企業客戶的 LLM 部署方案都將“幻覺抑制能力”列為核心能力項。
3. 技術原理
3.1 機率似然與虛構的生成機制
當前主流的自迴歸語言模型建模條件機率 P(x_t \mid x_{<t}),每一步生成都基於歷史序列選擇機率最高的下一個詞元(token)。訓練目標是最小化負對數似然損失,本質是讓模型學會“接話”,而非“查證事實”。當模型遇到“中國的首都是”這樣的字首時,訓練資料中可能同時存在“北京”“上海”“東京”等共現模式,如果正確事實在某個上下文中沒有獲得壓倒性的機率優勢,則在高熵解碼策略(如溫度取樣、Top‑p 取樣)的作用下,錯誤候選仍有很大機率被選中。追求低困惑度迫使模型在任何位置都要填上一個“合理”的詞,哪怕它並不掌握相應知識;這種“猜測”衝動正是幻覺的主要來源。
[ 訓練資料含噪聲/過時事實 ]
│
▼
[ 引數化記憶形成不精確關聯 ]
│
▼
[ 解碼時上下文啟用多個候選 ]
│
├── 高機率候選:事實正確(北京)
└── 次高機率候選:高頻共現但事實錯誤(上海)
│
▼
[ 溫度/Top‑p 隨機性 ]
│
▼
[ 生成“首都是上海”幻覺 ]
3.2 注意力彌散與上下文漂移
Transformer 的自注意力機制在生成長文本時會聚合遠距離資訊。隨著生成長度增加,模型對初始上下文或源材料的注意力權重逐漸衰減,開始更多依賴內部引數化知識或區域性統計模式,從而導致生成內容逐漸偏離原始依據,即“上下文漂移”。這在摘要、多輪對話和引證任務中尤為明顯,模型常常“忘記”最初的限定條件,憑空編造細節。例如,在描述某人出生地時,可能將另一個同姓人物的資訊附會過來,形成事實拼接。
3.3 知閾缺失與過度自信
語言模型缺乏內省的置信度校準機制,無法可靠地區分“已知”與“未知”。當模型被問及超出知識範圍的問題時,它不會表示不確定性,而是會以同樣自信的口吻虛構答案。研究表明,部分事實知識其實已編碼在模型的隱藏表示中,但解碼策略未能準確將其提取;換言之,模型“知道”某事卻在輸出時“說錯”。目前,學界正嘗試通過讀取內部啟用狀態或訓練專門的探測分類器來檢測幻覺,但離工業級部署尚遠。
3.4 幻覺分類架構
- 內在幻覺:生成的陳述與給定的上下文或源文件直接矛盾。
- 外在幻覺:生成的陳述無法由外部世界知識驗證,或根本無據可查。
- 忠實性缺失:在摘要、翻譯、資料到文本等任務中,輸出扭曲了原始輸入的含義,即便部分資訊在輸入中並不存在。
4. 關鍵引數
評估和最佳化幻覺相關表現主要依靠以下指標,所有指標均依賴特定基準,缺乏普適的“金標準”,且不同業務場景對誤差的容忍度迥異。
- 幻覺率:生成內容中包含事實錯誤或無法驗證資訊的比例。通常通過人工標註(眾包專家評判)或自動指標(如基於自然語言推論的 NLI 模型)測得,以百分比表示。 來源示例:TruthfulQA 基準中,GPT‑3 175B 的原始人為評估真實率約為 58%(Lin et al., 2022)。公開資料未見統一的跨模型即時幻覺率對比面板。
- 忠實度:輸出相對於給定參考源(上下文、檢索文件)的資訊一致性。常用於 RAG 系統評估,指標可量化為針對源文件的蘊含率(Entailment Score),如 MetricX、QAFactEval 等。
- 事實一致性:將輸出拆解為原子事實後,與權威知識庫(如維基百科、企業知識圖譜)的匹配程度。定量指標包括基於 QA 的 F1、精確率和事實召回率,常用在指令碼化資料集中。
- 知閾校準:模型的置信度估計與真實正確率的相關性。預期校準誤差(ECE)是常用度量,反映“模型說80%把握是正確的回答中,實際正確的比例”。當前大多數 LLM 的 ECE 偏高,表現為過度自信。
- 拒絕回答率:模型在面對不可知問題時主動拒絕回答的比例。雖不是直接的質量指標,但過高會導致實用價值下降,過低則增加幻覺暴露風險,需要在安全與有用性之間平衡。
5. 技術路線
面對幻覺這一系統工程問題,沒有任何單一技術能徹底根除,業界主流實踐是多路線組合,形成縱深防禦。
| 技術路線 | 核心機制 | 緩解幻覺的優勢 | 侷限性/引入的新風險 |
|---|---|---|---|
| 基於人類反饋的強化學習 (RLHF) / 直接偏好最佳化 (DPO) | 利用人類對真實性、有用性、無害性的排序資料微調模型策略,使其內化謹慎表述的傾向 | 顯著減少顯性編造,模型更傾向引用來源和留有餘地 | 只能影響模型的行為偏好,無法更新事實知識;可能過度拒答,損害可用性 |
| 檢索增強生成 (RAG) | 對話或生成前從外部知識庫檢索相關文件,將證據片段拼接至提示中,再生成基於證據的回答 | 為生成提供明確的事實錨點,大幅降低外在幻覺 | 檢索失敗、噪聲文件或錯誤片段會誘發新的忠實性問題;增加延遲與系統複雜度 |
| 事實一致性微調 | 建置事實密集型任務的校準資料集(如傳記、事件時間線),進行有監督微調,強化模型對實體、數字、關係的準確建模 | 在特定領域提升實體與數字的準確性,能糾正常見事實偏差 | 泛化性受限,可能削弱模型的創造性生成能力;訓練資料覆蓋範圍決定天花板 |
| 知識編輯 | 定位模型引數中儲存特定事實的神經元或層,針對性地修改過時或錯誤知識,如 ROME、MEMIT 等方法 | 精準高效修正孤立事實錯誤,無需重新訓練全模型 | 編輯一處可能波及其他相關知識;批次更新難、副作用不易預測 |
| 自我反思/驗證鏈 | 生成初版回答後,讓模型自我檢查矛盾點,或生成多個候選並在比較後輸出,例如 Chain‑of‑Verification、SelfCheckGPT | 不依賴外部知識,可捕捉內部自相矛盾;能在一定程度上自我修正 | 增設推論步驟,消耗額外算力;對深層未知錯誤和連貫幻覺效力有限 |
| 不確定性提示 | 通過微調或提示工程讓模型學會表達不確定性(如“據我所知…”“我無法確定”),並輸出置信度評分 | 減少無根據的確定性陳述,幫助下游系統決策(如轉人工) | 依賴一致且可靠的置信估計,當前技術下模型仍會為錯誤回答標出高置信度 |
注:以上比較基於截至 2025 年 4 月的公開研究與實踐綜合,具體效果因基準和實現細節而異。
6. 上游
建置低幻覺 LLM 應用的上游供應鏈包含資料和訓練兩個核心層面。
- 資料質量治理:原始預訓練語料的去重、去毒、時效性管理至關重要。低質量、矛盾或過時的事實資訊會直接植入模型引數。頭部機構開始大規模投資於資料清洗管線,例如使用基於分類器的質量篩選、實體連結消歧等。截至 2025 年,公開資料未見統一的語料質量基準,但據行業估計,預訓練資料預處理成本已佔大型模型研發總投入的 15%–25%(來源:公開技術部落格與調研,未經審計)。
- 預訓練架構與目標:標準的下一詞預測目標並不獎勵事實正確性。學術界和工業界正在探索在預訓練階段混入事實性目標,如實體預測、事實驗證輔助任務,或引入知識增強的注意力模式。然而,這類調整普遍會帶來訓練不穩定或算力攀升的代價,尚未成為預設標準。
- 對齊技術棧:RLHF 和 DPO 需要高質量的偏好資料與獎勵模型。獎勵模型的誤判可能反而滋生新的系統性幻覺;紅隊測試(Red Teaming)則通過對抗性發現漏洞持續最佳化對齊效果。上游的高質量反饋資料標註平台和對抗測試工具集因此構成重要基礎。
7. 下游
幻覺緩解能力直接賦能多個高價值場景,並催生獨立的工具與合規服務市場。
- 高可信度應用場景:
- 智慧客服:幻覺導致錯誤政策承諾可引發客訴升級,RAG+知識庫成為標配。
- 醫療健康:生成錯誤的診斷建議或藥品資訊會帶來致命風險,必須嚴格使用經認證的知識源和人工複核。
- 法律科技:法律條文、案例引用的一處幻覺即可能造成案件失利,大多數系統採用封閉式知識庫和嚴格的引用驗證。
- 金融研究報告與合規:虛假的市場資料、公司資訊或監管條文會觸發資訊揭露違規,監管科技中事實校驗成為剛需。
- 幻覺檢測與治理中介軟體:獨立的 API 服務(如真實率評分、幻覺檢測模型)正成為 LLM 應用棧的標準外掛,提供生成後的第二道防線。
- 可解釋性與審計 SaaS:面向行業監管要求,提供生成軌跡記錄、事實性審計報告和許可管理的平台型工具正在興起,客戶包括保險、銀行等強監管行業。
8. 受益公司
以下所列公司均因業務版面配置與幻覺緩解賽道高度相關而受到市場關注,不構成任何投資建議。
- OpenAI:ChatGPT 的 RLHF 和持續對齊是行業標杆;2024 年推出 CriticGPT 等工具輔助訓練和檢測幻覺,同時活躍於可解釋性研究。
- Anthropic:以“憲法 AI”訓練 Claude 系列,將誠實、無害內化為模型策略傾向,公開文件顯示其在多個事實基準上表現突出。
- Google DeepMind:Gemini 模型融合檢索與事實校驗,Sparrow 先行探索對話對齊,且具備搜尋引擎生態的獨特事實來源優勢。
- Cohere:專注企業級 RAG 解決方案,Command 系列模型強調低幻覺與引用準確率,其 Embed 模型最佳化檢索相關性。
- Perplexity AI:以“答案即搜尋”模式將引用驗證直接嵌入產品,低幻覺互動體驗贏得大量使用者,驗證了消費者對事實性保障的付費意願。
- Hugging Face:託管大量開源模型、評估基準與事實性檢測工具,間接降低全行業的防幻覺技術門檻。
- 初創生態:如 Credal.ai(企業級合規安全層)、Galileo(LLM 幻覺檢測與可觀測性)、Cleanlab(資料質量與事實性分析)等,分別在檢測 API、行業知識圖譜整合和審計賽道獲得資本關注。
9. 市場規模
幻覺緩解市場嵌在更廣泛的 AI 信任、安全與可解釋性賽道中,目前尚無專門針對“幻覺防護”的單一統計,但相關細分領域的規模可提供參考。
- 檢索增強生成市場:據 MarketsandMarkets 2024 年報告估算,全球 RAG 相關市場(包括工具、平台和服務)從 2024 年的約 12 億美元預計增長至 2030 年的 76 億美元,年複合增長率約 36.5%。該資料口徑涵蓋開源和商業 RAG 中介軟體、知識庫整合的軟體及服務營收。(來源:MarketsandMarkets Research,釋出於 2024 年 6 月,含預測)
- AI 信任與安全市場:Grand View Research 2025 年報告指出,全球 AI 信任、風險與安全管理市場規模 2024 年約為 18.7 億美元,預計 2030 年將超過 65 億美元,主要驅動力包括監管合規需求和幻覺導致的聲譽風險。幻覺檢測工具在其中佔比約 10%–15%(來源:Grand View Research,口徑含合規審計、模型監控與風險分析平台)。
- 垂直行業合規科技市場:以金融服務為例,Gartner 2024 年測算金融機構在 LLM 治理與事實性審計工具上的支出在 2024 年合計約 8.5 億美元,年增率增長超過 120%,預計 2026 年將突破 20 億美元(來源:Gartner, 2024 年 9 月釋出)。醫療和法律領域類似需求的增速相近,但公開數字較為碎片化。
注:上述資料均為第三方機構的估算與預測,含推測成分。由於幻覺防護技術尚處早期、邊界模糊,實際市場規模可能隨著大型模型部署節奏而大幅修正。
10. 玩家對比
為呈現不同技術路線和商業模式的差異,以下從核心策略、典型指標和落地形態三個維度對比代表性玩家。所有資料基於公開文件、論文和第三方評測,截至 2025 年 4 月。
| 公司/專案 | 核心防幻覺策略 | 真實率/忠實度表現(公開基準) | 典型交付形態 | 主要優勢 | 主要侷限 |
|---|---|---|---|---|---|
| OpenAI (GPT‑4系列) | RLHF + 檢索外掛 + CriticGPT 輔助訓練 | TruthfulQA 真實率 >85%(2024 年報告);忠實度未見獨立公開綜合基準 | 模型 API、ChatGPT 產品層 | 使用者規模最大,對齊經驗豐富,多模態可輔助驗證 | 黑盒策略,外部拆解困難;RAG 依賴額外整合 |
| Anthropic (Claude 3) | 憲法 AI + 內化謹慎推論 | TruthfulQA 真實率未公開獨立數字,內部評測強調拒答率與誠實度平衡 | API、Claude 對話介面 | 系統性工程設計,拒答合理度較高 | 模型訪問受限,第三方獨立復現評測較少 |
| Google DeepMind (Gemini 1.5) | 內部檢索+事實校驗 + 搜尋生態 | 在 FreshQA 等基準上表現靠前,具體數字未統一公開 | API、Google Workspace | 事實源多、檢索最佳化天然整合 | 產品定位多元,事實性最佳化可能受應用場景權衡 |
| Cohere (Command R+) | 檢索增強生成管線 + 引用準確性最佳化 | 在自建企業檢索任務上引用準確率達 ~90%(2024 年技術報告) | 嵌入與生成 API | 強檢索與低延遲,企業級定製 | 通用知識域的表現弱於通用旗艦模型 |
| Perplexity AI | 多步搜尋引擎 + 引用嵌入 | 公開使用者滿意度報告高,但無獨立第三方幻覺率全覽 | 消費端搜尋與問答產品 | 使用者體驗先行,引用透明,閉環反饋 | 高度依賴搜尋引擎質量,事實性受資訊源時效影響 |
| 開源生態(如Llama 3) | 社群微調 + RAG + 開源幻覺檢測工具 | TruthfulQA 真實率約 60%–70%(可選對齊版本),波動大 | 模型權重 + 社群工具鏈 | 透明、可定製、費用低 | 幻覺防護能力碎片化,強依賴企業自行工程化 |
注:表中各模型表現數字來自各自發布的論文、技術報告或可信第三方基準排行榜,但由於評測條件、版本迭代、提示策略等因素差異,直接橫向對比可能失真。
11. 風險
- 安全與誤用風險:法律、醫療等領域的幻覺若被無人工稽核採納,可能導致重大的生命財產損失。惡意使用者也可利用幻覺誘導模型生成違反政策的內容。
- 監管與合規風險:全球主要經濟體正加緊對 AI 生成內容的監管。歐盟《AI 法案》將高後果領域的生成式 AI 劃入高風險類別,要求透明度和事實準確性;美國 FDA、SEC 等機構已發出針對 LLM 醫療/金融應用的警告。一次因幻覺造成的證券虛假陳述或醫療事故可能引發鉅額罰款和集體訴訟。
- 聲譽與信任風險:面向消費者的產品或企業若頻頻出現嚴重幻覺,將在短時間內喪失使用者信任。品牌修復成本極高,且會在社交媒體形成負面放大效應。
- 技術債務風險:許多團隊將幻覺緩解寄望於單一的 RAG 或微調,忽視了系統化治理。一旦上線後問題暴露,管線重構成本將成倍增加。
12. 誤讀糾偏
誤讀1:“幻覺就是模型說錯話”——這只是表象。 幻覺不僅是簡單的事實錯誤,更危險的是模型以權威語氣編造根本不存在的參考文獻、虛構法律條款或杜撰臨床指南,已從“錯誤”升級為“有序的虛假資訊”。同時,對源材料不忠實的輸出(如摘要中憑空新增未提及的主張)也屬於幻覺,卻常常被忽略。
誤讀2:“模型大到一定程度,幻覺就會消失。” 事實是,更大的模型雖然困惑度更低,但其生成錯誤更隱蔽、更自信,更不易被人工或自動工具察覺。幻覺根植於訓練目標和架構侷限,而非單純容量不足,減輕幻覺需要專門工程,而非僅堆砌引數。
補充誤讀:“RAG 可以徹底消除幻覺。” RAG 只能將輸出錨定於檢索到的文件,但如果檢索到的文件本身錯誤、過時,或模型在生成時未忠實引用(如扭曲資訊、斷章取義),仍會產生幻覺。RAG 是把“無據猜測”轉化為“因源錯誤”,問題型別轉移但未根絕。
13. 最新事件
- 2025 年 3 月,歐盟 AI 法案指南細化:明確指出,在醫療、招聘、執法等高風險場景中,LLM 輸出的事實性需提供可溯源的證據鏈,否則服務將被限制進入市場。此舉加速了歐洲企業對幻覺審計工具的需求。
- 2025 年 2 月,某頂級投資銀行因內部 LLM 生成的研究報告存在虛假財務資料被 SEC 問詢:儘管最終定性為內部工具誤用,該事件仍推動華爾街多家機構緊急升級 LLM 使用規範與檢測護欄(來源:《華爾街日報》報道,2025 年 2 月)。
- 2025 年 1 月,OpenAI 釋出關於 CriticGPT 的進一步成果:顯示專用幻覺批評模型可在程式碼和通用領域輔助減少 30% 以上的可察覺錯誤,但仍在長尾問題上乏力(來源:OpenAI 官方部落格,2025 年 1 月)。
- 2024 年底,多家 LLM 中介軟體初創公司獲得 B 輪融資:專注幻覺檢測與可解釋性的公司如 Galileo、Credal.ai 合計融資額超過 2 億美元,反映資本對事實性基礎設施賽道的強烈信心(來源:Crunchbase 及公司新聞,2024 年 12 月)。
14. 追蹤指標
持續評估一個模型或系統的幻覺狀況,建議關注以下操作指標:
- 幻覺率(自動與人工):按月進行 TruthfulQA、FreshQA 或自建領域基準測試,監控幻覺率變化。自動指標可基於 NLI 模型(如 BART‑MNLI)給出快速近似,輔以每月人工抽樣校驗。
- 忠實度:針對 RAG 系統,記錄答案中的宣告與檢索文件片段的蘊含率,設定預警閾值(如低於 90% 觸發人工復盤)。
- 拒答率與使用者滿意度平衡:追蹤模型拒答率及因拒答導致的使用者流失或工單升級率,防止過度壓制幻覺而損壞可用性。
- 事實性漂移:對重點行業(如金融、醫療)建立金標準問答集,每次模型更新時自動測試,形成事實性漂移報告。
- 延遲與成本開銷:評估緩解手段帶來的額外延遲和推論成本。RAG 方案需關注檢索延遲和 token 增量,自檢驗證鏈則要注意推論時間的成倍增加。
15. 信源
- 學術論文:ACL Anthology (https://aclanthology.org)、arXiv (https://arxiv.org) 的 cs.CL 分類下,搜尋“hallucination detection”“factuality in large language models”等。重要基準論文包括 TruthfulQA (Lin et al.)、HaluEval (Li et al.)、FreshQA (Vu et al.)。
- 行業報告:MarketsandMarkets“Retrieval‑Augmented Generation Market”報告(2024;編號未公開);Grand View Research“AI Trust, Risk, and Security Management Market”(2025);Gartner“Innovation Insight for AI Trust, Risk and Security Management”(2024)。
- 官方部落格與白皮書:OpenAI (https://openai.com/research)、Anthropic (https://www.anthropic.com/research)、Google DeepMind (https://deepmind.google/research) 的技術更新與安全報告;Cohere 技術文件 (https://docs.cohere.com)。
- 開源與工具:Hugging Face 評估排行榜 (https://huggingface.co/spaces/open-llm-leaderboard);LangChain、LlamaIndex 防幻覺實踐指南;NVIDIA NeMo Guardrails 文件。
- 監管與政策:歐盟 AI 法案全文與實施指南(https://artificialintelligenceact.eu);美國 SEC、FDA 釋出的關於 AI 使用的指導意見。
以上信源以截止 2025 年 4 月的公開情況為準,具體資料與結論請以第一手來源的最新版本為準。