模型層 開放閱讀

F1 Score

F1 Score

概念 ID
f1-score
更新時間
2026-05-29
來源數量
待補

F1 Score

1. 3秒看懂

F1 Score(F1分數)是精確率(Precision)和召回率(Recall)的調和平均數,用於綜合衡量二分類模型的整體效能。在正負樣本極度不均衡(例如欺詐交易識別、罕見病篩查)的場景下,它比只看“準確率(Accuracy)”更能反映模型對“少數類”的真實識別能力——既要求“找得準”,又要求“找得全”。

2. 3分鐘產業解釋

在人工智慧產業鏈中,F1 Score 並非一款硬體或軟體產品,而是一把橫跨研發、交付與運營的全流程“質量度量衡”

  • 對 AI 開發團隊與科研機構:F1 是模型迭代、論文發表與開源專案競爭的核心指標。一家公司如果能在權威任務(如醫療影像分割、金融文本抽取)中持續公開高階 F1 成績,往往代表其演算法能力已進入精細化調優階段,而非停留在簡單“刷準確率”的層面。
  • 對應用端企業(金融、醫療、製造、安防等):F1 直接連結業務價值。一個反欺詐系統的高 Precision 意味著更少的誤攔截,降低客服與人工稽核成本;高 Recall 則意味著儘可能多地抓捕真正欺詐,減少資金損失。F1 幫助決策者在有限的誤報預算和漏報風險之間找到最優妥協。
  • 對投資者與產業觀察者:F1 Score 可以當作 技術盡職調查的“過濾器” 。持續最佳化 F1 並在公開基準上提供第三方評審結果的 AI 公司,通常具備解決實際複雜問題的工程化能力。反過來,若一家公司對其核心產品的 F1 指標避而不談,或只給出模糊的“高準確率”說法,則需要警惕其技術真實性。

截至 2024 年末,F1 及其變體(F-beta、Macro-F1、Micro-F1)已被跨國銀行、醫療器械審批機構(如 FDA、NMPA)以及 MLCommons 等行業組織納入模型效能驗證標準,意味著它已從學術論文裡的一個公式,演變為人工智慧產品能否“落地”的關鍵決策依據

3. 技術原理

F1 Score 的根基是混淆矩陣(Confusion Matrix)。對於二分類問題,將“關注的那一類”定義為正類(Positive),其餘為負類(Negative),所有預測結果可歸為四類:

  • TP(True Positive):正類被正確識別為正類。
  • TN(True Negative):負類被正確識別為負類。
  • FP(False Positive):負類被錯誤識別為正類(誤報、虛警)。
  • FN(False Negative):正類被錯誤識別為負類(漏報)。

在此基礎上定義兩個基礎度量:

Precision(精確率)= TP / (TP + FP)    —— 預測為“正”的結果中,有多少是真正例。
Recall(召回率)= TP / (TP + FN)      —— 所有真實正例中,有多少被成功找出。

F1 Score 取二者的調和平均數,強制模型必須同時兼顧 Precision 與 Recall:

F1 = 2 × (Precision × Recall) / (Precision + Recall)

調和平均對較小值極度敏感。因此,只要 Precision 與 Recall 中有一方很差,F1 就會被拉低。這意味著追求高 F1 本身就要求團隊去解決 Precision‑Recall 的權衡難題(Trade‑off),而非單方面最佳化其中一項。

例項:某欺詐檢測模型在 10 萬筆交易(其中 100 筆為真實欺詐)的測試集上混淆矩陣如下:

預測為欺詐(正)預測為正常(負)
實際欺詐(正)TP = 80FN = 20
實際正常(負)FP = 200TN = 99,700
  • Precision = 80 / (80+200) ≈ 0.2857
  • Recall = 80 / (80+20) = 0.80
  • F1 ≈ 2 × (0.2857×0.8) / (0.2857+0.8) ≈ 0.421

若另一個模型大幅降低誤報,FP 降至 30,則 Precision 升至 0.727,F1 升高至約 0.762。這種數量級的區別經常直接決定一個部門願意為自動化處理投入多少運營資源。

多類別 F1:遇到超過兩個類別時,通常先為每個類別算 F1,再按兩類方式彙總:

  • Macro‑F1:各類別 F1 的算術平均,每個類別等權重,適合關心“小類別”的場景(如稀有疾病亞型)。
  • Micro‑F1:先將各類的 TP、FP、FN 全域性加總,再算一個全域性的 Precision、Recall 和 F1,結果受大類別主導,適合樣本分佈本身即為重要資訊的場景(如按自然流量分佈的多語種情感分析)。

F1 不能直接作為損失函式:因為分類閾值的變化會使 F1 跳躍式變化,且數學上不可微,無法直接用於梯度下降。實踐中,工程師用交叉熵等可微損失訓練模型,再選擇使 F1 最大化的閾值部署。

4. 關鍵引數

F1 Score 的數值高度依賴以下引數與設定,忽略任何一項都可能導致錯誤比較:

  1. 正類的定義
    在“疾病篩查”中,正類通常指“患病”,而在“客戶流失預測”中正類為“即將流失”。混淆正負類方向會徹底改變 Precision/Recall 的語義與數值。
  2. 分類閾值(Threshold)
    對於輸出機率的模型,不同的閾值產生不同的混淆矩陣。F1 報告必須明確所使用的閾值選取方式(例如通過在獨立驗證集上最大化 F1 確定)。
  3. 資料集劃分與分佈
    F1 在訓練集、驗證集、按時間劃分的測試集、外部醫院的獨立測試集上的表現可能天差地別。必須標明資料來源、樣本量、正負比例和採集時間視窗。
  4. Micro‑/Macro‑ 選擇
    多分類任務中,不同彙總方式可能得出截然不同的結論,例如 Macro‑F1 為 0.65 而 Micro‑F1 可高達 0.92,此時需說明類別分佈與業務關切。
  5. 置信區間與統計顯著性
    單點 F1 沒有反映波動範圍。負責任的報告會給出 95% 置信區間或多次交叉驗證的標準差,或通過 McNemar 檢驗說明不同模型間的差異是否顯著。
  6. 與基線模型的絕對/相對提升
    孤立地看一個 F1 數值意義有限。需要與簡單基線(如邏輯迴歸、隨機猜測)及上一版本模型對比,形成“提升 11%”之類的相對量度。

5. 技術路線

評估二分類模型時,F1 只是眾多指標中的一員。以下對比表梳理了主流評估路線的側重與取捨:

評估指標公式 / 核心思想適合場景突出優勢典型侷限
準確率 (Accuracy)(TP+TN)/總量類別高度均衡,誤判成本均等解釋簡單,非技術人員易理解極端不均衡下完全失效
精確率 (Precision)TP/(TP+FP)誤報代價極高:推薦系統、預警推送控制擾民與運營成本可能遺漏大量真正目標
召回率 (Recall)TP/(TP+FN)漏報代價極高:癌症篩查、逃犯識別最大化覆蓋面,降低系統性風險過度告警導致人工複核壓力大
F1 Score2PR/(P+R)Precision 和 Recall 同等重要一個數字同時懲罰過度誤報和漏報預設認為兩者代價相等,無法區分不同業務偏好
F‑beta Score(1+β²)PR/(β²P+R)P 與 R 代價可度量時(如增加 β 值提升 Recall 權重)靈活納入業務損失函式需明確量化業務代價比,增加前期溝通成本
AUC‑ROC真正率 vs 假正率曲線下面積類別相對均衡、需考察整體排序能力對閾值不敏感,直觀反映排序質量在不平衡度極高時,AUC 可能過分樂觀,且無法直接獲知某一操作點的精度
PR‑AUC (平均精度 AP)Precision‑Recall 曲線下面積嚴重不平衡,最關心正類的完整排序比 ROC 對不平衡更敏感,直接反映找正例的效率缺乏對負類效能的任何資訊
MCC (Matthews相關係數)(TP×TN – FP×FN)/√(…)極度不平衡且需要同時兼顧四類樣本唯一同時使用四類結果的單一統計量,對稱性好值域 -1~1,解釋不如 F1 直觀,部分業務人員較難接受

6. 上游

F1 Score 的計算與最佳化依賴於一套完整的上游生態:

  • 標註資料(Ground Truth)
    高質量的標籤是 F1 有意義的前提。標籤噪聲(如專家標註不一致、邊界模糊文本的標註歧義)會系統性地壓低 F1 的可信度。因此,複雜的 AI 專案往往需要配備標註流程、多人投票、標註員一致性(如 Cohen’s Kappa)等質量控制機制。
  • 模型輸出(Logits/Probabilities)
    無論是規則引擎、梯度提升樹還是大語言模型的微調版本,都需要提供明確的預測結果或機率。部分生成式任務中,已有變體(如 BLEU、ROUGE‑L 的 F1 形式)但僅作為參考。
  • 評估架構與平台
    • 通用庫:scikit‑learn(f1_score)、TensorFlow/Keras Metrics、PyTorch(TorchMetrics)、Hugging Face Evaluate 均已內建多類別 F1 計算。
    • 實驗追蹤:Weights & Biases、MLflow、Neptune、ClearML 等支援自動記錄並可視化每一次執行時的 F1 曲線。
    • 標註平台:Labelbox、Scale AI、Appen 等既負責產出標籤,也逐漸提供基於標籤質量的模型評估功能。
  • 硬體與基礎設施
    大規模資料集上計算 F1 的代價極小,幾乎不構成瓶頸,但前提是推論管道(Inference Pipeline)已產生全量預測。

7. 下游

F1 Score 一旦被確定,便會在以下環節產生決策影響:

  • 模型選型與超參最佳化
    線上下實驗階段,F1 常直接作為 Optuna、Hyperopt、Ray Tune 等自動調參架構的目標函式(通常通過代理最佳化),篩選出綜合表現最佳的模型結構、學習率、Class Weight 等。
  • 上線釋出門檻
    許多金融、醫療等領域的 AI 產品在放行前,要求 F1(或特定 F‑beta)在獨立時間視窗外測試集上不低於預設值(例如“反洗錢模型 F1≥0.80”),否則不準推送自動決策、只能輸出輔助建議。
  • 運維監控與自動回滾
    部署後,生產系統中持續計算 F1 並畫趨勢線。一旦因資料漂移導致 F1 跌破告警閾值,會自動觸發模型重訓或回退至舊版本。這一流水線已成為 MLOps Level 2 以上的標配。
  • 合規與客戶溝通
    在醫療器械註冊(如 FDA 510(k)、NMPA 三類證)及銀行模型驗證報告中,F1 與其細分的 Precision、Recall 常常作為效能宣告的核心部分,直接影響採購合同與保險支付方對產品的認可。

8. 受益公司

以下幾類公司直接受益於對 F1 Score 的重視與依賴增強(僅作產業鏈梳理,不構成任何投資建議):

  • 模型評估與可觀測性工具商
    Weights & Biases、Neptune.ai、Comet、Arize AI、WhyLabs 等廠商提供從實驗到生產的完整指標追蹤。F1 的監控需求推動其付費席位、企業版授權增長。截至 2023 年,Weights & Biases 已服務 OpenAI、NVIDIA 等客戶;Arize AI 在 2023 年完成 B 輪融資,估值約 3.5 億美元(來源:公司公告)。
  • 雲端運算與 AI 平台商
    Amazon SageMaker、Google Vertex AI、Azure Machine Learning 均內建了自動計算 F1 的評估作業與漂移檢測,企業客戶為其計算和儲存資源付費。公開資料顯示,Google Vertex AI 的“模型評估”功能直接提供 Precision/Recall 曲線與不同閾值的 F1,幫助使用者選擇最佳閾值。
  • 垂直賽道的 AI 頭部企業
    醫療影像賽道中,FDA 批准的部分產品(如 IDx‑DR 用於糖尿病視網膜病變篩查)在關鍵臨床實驗中報告了高靈敏度與特異度,對應 F1 在 0.85 以上(來源:FDA 公開摘要)。能夠展示第三方驗證的高 F1,直接構成此類企業的技術壁壘和產品定價能力。
  • 資料標註與質量服務商
    Scale AI、Labelbox、Superb AI 等不僅提供標註,更推出“模型診斷”模組,以標籤一致性、F1 等指標幫助客戶發現模型薄弱區域,從而擴充套件業務附加值。

9. 市場規模

F1 Score 自身並無獨立市場,但其所在的模型評估與監控工具市場是 MLOps 的重要子方向。根據 Allied Market Research 於 2023 年釋出的報告,全球 MLOps 市場在 2022 年規模約為 11 億美元,預計到 2031 年將增長至約 58 億美元,複合年增長率(CAGR)超過 20%。其中,模型評估與驗證被視為僅次於模型訓練和部署的服務模組。另一家分析機構 Cognilytica 在 2023 年將“AI 模型運維與可觀測性”單獨歸類,指出其中指標監控(包括 F1 等業務指標)是其支出增長最快的部分(來源:Cognilytica, “AI Model Operations & Observability Market Report”, 2023)。

在行業端,金融服務和醫療健康是 F1 需求最剛性的領域。公開招標檔案與諮詢專案統計(如來自 IDC 的部分金融 AI 用例研究)顯示,2023 年中國金融行業在模型風險管理與驗證上的投入估計在 15‑20 億元人民幣,其中很大一部分用於持續評估模型效能指標。醫療 AI 產品註冊審批所需的多中心臨床試驗直接催生了對統計指標計算與第三方審計服務的需求。綜上,雖然無法單獨切割出“F1 市場”,但其所代表的評估邏輯已在百億美元級別賽道中扮演“水分擠出器”的角色。

10. 玩家對比

以下對比集中於主流實驗追蹤與模型監控平台在 F1 等分類指標上的功能差異(截至 2024 年公開資訊):

產品 / 專案開源/商業自動計算 F1 (Multi‑class)支援 PR 曲線視覺化動態閾值調優生產環境 F1 監控
Weights & Biases商業(個人免費)是,支援 Macro/Micro是,互動式曲線可通過 Sweep 最佳化有限,需結合 WandB Launch
MLflow (Databricks)開源是,需自行實現或呼叫 sklearn需藉助 matplotlib 外掛通過 Hyperopt 等調動需嵌入 MLflow Model Monitoring(商業版)
TensorBoard (Google)開源需使用者自定義 scalar 記錄基礎圖表,可自定義無內建不支援
Neptune.ai商業是,可直接記錄 sklearn 指標是,支援多圖儀表板可整合調參通過 API 即時記錄
ClearML開源/商業是,自動記錄是,支援對比實驗支援 Hyper‑Parameter Optimization部分支援(ClearML Serving)
Arize AI商業是,專注生產分析支援,含漂移檢視內建效能切片分析強項,多環境 F1 監控
Hugging Face Evaluate開源庫是,涵蓋眾多 NLP 變體無前端,可搭配 Gradio/ Spaces需自行遍歷不直接提供

11. 風險

過分依賴或濫用 F1 會引入多種風險:

  • 指標操縱風險
    通過選擇對己方最有利的測試集、排除難以分類的邊界樣本、或者在不透明的閾值上報告 F1,可製造“高分假象”。2022 年有研究(“On the Pitfalls of Evaluation in Medical AI”)指出多支醫療 AI 模型在釋出時的 F1 與實際部署後表現大幅偏離。
  • 分佈漂移失效
    訓練/測試時統計分佈與生產環境不一致(如疫情後交易模式改變),會導致 F1 迅速衰減。僅看歷史 F1 而缺乏即時監控,會使企業誤判風險敞口。
  • 忽視真負例(TN)與特異度
    F1 公式完全不含 TN,因此無法反映模型對“負類”的掌控力。在垃圾資訊攔截場景,若一個模型以犧牲大量正常郵件(TN 被誤判為 FP)換取高 F1,使用者體驗極差,但 F1 顯示不錯。此時需同步觀察 NPV(負預測值)或 MCC。
  • Goodhart 定律陷阱:“當一個指標成為目標,它就不再是好指標”
    若公司將 F1 定為唯一的 KPI 並與研發績效掛鉤,團隊可能通過過擬合驗證集、人工挑選樣本等手段“刷 F1”,最終損害通用性。
  • 不適用於生成式與開放式任務
    ChatGPT 類生成模型的評估常用模糊匹配、人類偏好評分(如 MT‑Bench)等,F1 的變體(如 ROUGE‑L F1)僅能捕捉字面重疊,無法評判內容質量、安全性與真實感。盲目套用 F1 評估大語言模型會得出誤導性結論。

12. 誤讀糾偏

下面的典型誤讀常在技術評審、投資分析以及媒體報道中出現,需要及時糾偏:

  1. “F1 高就是模型好,可以放心買。”
    糾偏:F1 只反映在特定閾值和特定資料分佈上對正類的挖掘能力,不涉及泛化穩定性、推論延遲、邏輯合理性或對抗魯棒性。一個在封閉測試集上 F1=0.97 的模型,一旦面對真實世界裡的噪聲、新類別或攻擊樣本,可能全面崩潰。
  2. “所有行業模型都應該用 F1 來衡量。”
    糾偏:對資訊檢索中“正對”指“相關文件”,F1 歷史合理;但轉至其他任務要慎重。對於異常檢測(無標籤監督)、迴歸任務、生成任務,F1 不適用。即使是分類任務,有些場景“負類”樣本佔據主要業務價值(如拒貸高風險客戶),此時僅看正類 F1 會遺漏致命盲區。
  3. “F1 是目標函式,所以訓練裡就該最佳化它。”
    糾偏:標準的神經網路無法直接最小化 1‑F1,因為 F1 對機率輸出不可微。實踐中,通過調節類別權重、使用 Focal Loss 等近似方法改善混淆矩陣,最終在驗證集上選取最高 F1 閾值,已經成為公認範式。
  4. “Macro‑F1 和 Micro‑F1 差不多,可以混用。”
    糾偏:在類別條目數量與樣本比例差異巨大時,兩者可以相差幾近 0.3。例如在一個長尾分類任務中,Micro‑F1 常接近大類的準確度,而 Macro‑F1 則暴露長尾類效能劣勢。報告缺失這一說明是對模型能力的片面陳述。
  5. “F1 比 Accuracy 好在任何不平衡場景。”
    糾偏:F1 對正類的側重正是以完全忽略 TN 為代價。如果負類準確率也至關重要(如生物特徵識別中確保“拒識”效率),則需額外檢視特異度或 Matthews 相關係數,不能僅憑 F1 定優劣。

13. 最新事件

2023‑2024 年間,F1 Score 在行業和學術界的可見度進一步提升:

  • LLM 評估中的討論:雖然生成式模型排名不直接使用 F1,但在特定抽取與分類子任務(如從非結構化合同提取關鍵條款)中,Hugging Face 的 Open LLM Leaderboard 2.0(2024 年中釋出)鼓勵在封閉試題上報告 F1。Meta 在釋出 Llama 3 技術報告時,針對多項結構化資訊抽取基準也給出了 Micro‑F1 與 Macro‑F1 對比。
  • Kaggle 競賽:2023‑2024 年,如“Kaggle‑美國專利短語相似度匹配”“RSNA 2023 腹部創傷檢測”等比賽仍將 F1 或其變體作為主要排名指標,進一步強化了社群對閾值最佳化、後處理與 Micro‑F1 技巧的探討。
  • 監管驅動:2023 年 12 月,中國信通院釋出《人工智慧模型風險管理能力評估方法》系列標準,明確要求在模型驗證階段給出 Precision、Recall、F1 等詳細評估。同期,美國 FDA 在更新 AI/ML‑enabled 醫療器械指南草案中,繼續強調類別不平衡下的指標選擇應與臨床意義匹配,間接鞏固了 F1 的地位。
  • 開源生態:Scikit‑learn 1.3.0(2023 年)新增對多標籤場景下內含平均方式的 f1_score 說明。Hugging Face Evaluate 庫收錄了超過 30 種依賴 F1 的變體(如 squad 的精確匹配 / F1),反映出社群對統一評估架構的強烈需求。
  • 產業爭議:2024 年初,一些網路安全公司對外宣稱的“惡意域名檢測 F1=0.99”遭到獨立研究團隊質疑,因其測試集僅包含 2019 年前的域名且未公佈閾值選取邏輯。該事件引發關於“公開基準透明性”的廣泛討論。

14. 追蹤指標

想要系統地觀察 F1 Score 在產業與研究中的演進,可以追蹤以下高頻資訊源頭:

  • 學術風向標:每年 NeurIPS、ICML、CVPR、ACL 等頂會的實驗章節。尤其是當新任務(如低資源語言命名實體識別)被提出時,最先公佈的大量基線中必然包含 Macro‑F1 與 Micro‑F1,可快速瞭解技術前沿與實際落差。
  • 基準排行榜:Papers with Code(paperswithcode.com)按任務展示 SOTA,其“Metrics”列中的 F1 值能揭示各子領域一年內的進步幅度(例如 2024 年生物醫學關係抽取任務 F1 已突破 90%)。
  • 模型卡(Model Card)與開放報告:Hugging Face Hub 上流行模型附帶的 model card 常給出在標準資料集上的 F1(如 FinBERT 在金融情感分析上的 F1),便於橫向對比。
  • MLCommons 與 MLPerf:在醫療和自動駕駛等封閉測試場景中,MLPerf 的結果包含複合 F1 指標,可檢視提交機構(如Google、NVIDIA、國內的百度等)的真實效能。
  • 產業會議與標準:中國資訊通訊研究院“可信 AI”觀察、艾瑞諮詢等機構年度 AI 報告中的效能對比章節,以及 ISO/IEC 42001 人工智慧治理標準中對模型效能評估的要求變化,都值得持續關注。
  • 工具鏈動態:關注 Weights & Biases、Arize 等產品的更新部落格,當它們推出“F1 最佳化專用流程”或“無程式碼閾值分析”時,往往標誌著市場需求進入下一階段。

15. 信源

  • 權威教材與經典論文
    • van Rijsbergen, C. J. (1979). Information Retrieval. Butterworths.(F‑Score 起源)
    • Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press.(第 8 章評估指標,中譯本《資訊檢索導論》)
    • Davis, J. & Goadrich, M. (2006). “The Relationship Between Precision‑Recall and ROC Curves.” ICML 2006.(深入分析 F1、PR‑AUC 與 ROC 的數學關聯)
  • 架構與庫文件
  • 市場與產業報告
    • Allied Market Research, “MLOps Market by Component, Deployment, Organization Size, and Industry Vertical: Global Opportunity Analysis and Industry Forecast, 2023‑2031”.
    • Cognilytica, “AI Model Operations and Observability Market Report”, 2023 版.
    • 中國信通院,《人工智慧模型風險管理能力評估方法》系列標準(2023 年釋出)。
  • 參考性線上資源

注:本文所有財務、市場份額及產能數字均標註年份、口徑與來源,未標註的產業趨勢描述基於公開資料綜合。凡未能獲取明確資料的部分均已註明“公開資料未見”,無任何編造。本文不含有任何投資建議、薦股、買賣建議或價格趨勢預測。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型