人在迴路
3 秒看懂
人在迴路(Human‑in‑the‑Loop, HITL) 是一種將人類決策與判斷持續嵌入機器學習工作流的工程範式。它打破“離線訓練、一次交付”的慣性,讓模型在資料標註、不確定性仲裁、獎勵訊號定義和安全對齊等關鍵環節,反覆迴響人類的專業判斷。無論是主動學習挑選難例供專家標註,還是大語言模型依賴的人類反饋強化學習(RLHF),HITL 都在推動模型從“可執行”走向“可信任”。
3 分鐘產業解釋
在產業語境下,HITL 早已超越“僱傭人力標資料”的淺層印象。它至少拆解為三種高價值角色:
- 資料供應者:針對模型置信度不足的樣本給出金標準答案,如在醫療影像、自動駕駛邊緣場景(corner cases)中提供專業標註。
- 質量裁判:在模型上線前後,按照業務規則與安全紅線對高風險輸出進行放行或攔截,形成持續的評判與監控閉環。
- 偏好定義者:在強化學習中對模型的多種回應進行排序,以人類的價值觀塑造模型行為——這正是 ChatGPT 等產品實現“有用的、無害的”行為準則的基礎。
在千億引數大型模型時代,HITL 已從低成本的外包勞動升級為高價值、高稀缺的上游資源。數十位語言學家、領域專家和倫理研究者參與 RLHF 所需的偏好資料生成,相關支出在訓練總成本中的佔比不可忽視。與此同時,HITL 催生了一整套新型 SaaS 工具:從智慧標註介面到 RLHF 排序面板,從主動學習驅動的線上評價流到對話式除錯工作臺。這些工具將人類反饋納入了模型迭代的“資料飛輪”——人的每一次判斷都在讓模型更精準地適配長尾需求,進而吸引更多使用者持續產出高質量反饋。由此,“人類生產力”被工程化地嵌入 AI 訓練流水線,成為模型競爭壁壘的核心要素。
技術原理
HITL 沒有統一的數學公式,而是多種技術的系統工程。其中兩個最具代表性的核心機制是主動學習與基於人類反饋的強化學習(RLHF)。
主動學習迴圈
在訓練階段,主動學習是 HITL 的經典引擎。其基本流程為:
+----------------+ +------------------+
| 未標註池 (U) | -----> | 不確定性估計 |
+----------------+ +--------+---------+
|
挑選 top‑k 最不確定樣本
v
+----------------+ +------------------+
| 模型更新 |<-------| 人類標註者 |
| (重新訓練) | | (預言機) |
+----------------+ +------------------+
- 不確定性度量:對於分類任務,常用預測機率的熵
H(y|x) = -∑_c P(y_c|x) log P(y_c|x);迴歸任務中則可用預測方差。在深度神經網路中,Monte Carlo Dropout 或 Deep Ensemble 為貝葉斯不確定性提供可行近似。 - 取樣策略:實踐中採用混合取樣,既考慮單個樣本的不確定性,又加入密度加權或多樣性指標,防止重複標註相似難例,保證選取的樣本在整個分佈中具有代表性。
- 標註融合:當多個標註者對同一樣本產生分歧時,引入 Dawid‑Skene 模型等機率圖模型,估算真實標籤和每位標註者的準確率,從而生成軟標籤或高置信度整合結果。
這套閉環使得在固定標註預算下,模型效能收斂速度遠超隨機取樣。
RLHF 的技術骨架
在大語言模型對齊中,RLHF 以三個緊密銜接的階段將人類偏好注入生成策略。
- 偏好資料收集:針對同一條輸入提示
x,模型生成兩個或多個輸出,例如y_a和y_b。人類標註者給出相對偏好,如“A 比 B 更好”。 - 獎勵模型訓練:用這些比較資料訓練獎勵模型
r_θ(x, y),目標是使獎勵差值經過 sigmoid 後儘可能匹配人類偏好機率:
P(y_a ≻ y_b) = σ(r(x,y_a) - r(x,y_b))。
該獎勵模型試圖代理一組特定人群在給定任務下的瞬時偏好。 - 策略最佳化:將獎勵模型作為獎勵訊號,利用近端策略最佳化(PPO)演算法微調生成模型,最大化對輸出的期望獎勵。為防止模型為了得分而胡言亂語(即“獎勵駭客”),目標函式中加入一個 KL 散度懲罰項,約束微調後的策略不能偏離原始預訓練分佈太遠。
需要指出,RLHF 的獎勵模型並不是人類價值觀的完美載體,它學到的是特定標註群體、特定任務設計與介面約束下的偏好快照。因此,更前沿的方向在補充規則化獎勵、過程監督以及“憲政 AI”(Constitutional AI)等方案,以降低對單一樣本人類反饋的過度依賴。
關鍵引數
HITL 系統的效能和成本可通過若干關鍵引數來衡量與監控。
- 標註減少率:達到相同模型效能所需的人工標註量相對於全量隨機標註的比例。文獻表明,典型主動學習可減少 50%–90% 的標註量(Settles, 2010),具體數值高度依賴任務難度與不確定性度量的質量。
- 人類一致性:標註者之間的一致程度,常以 Cohen’s Kappa 或 Krippendorff’s Alpha 衡量。實踐中的可用底線通常要求 >0.6,醫療等高風險場景則追求 >0.8。
- 獎勵模型準確率:在預留的人類偏好對上的分類準確率,直接決定 RLHF 的最佳化方向是否正確。公開文獻中,InstructGPT 的獎勵模型準確率約在 70% 附近(Ouyang et al., 2022);不同任務和人群下的波動顯著,尚無統一基準。
- 干預率:在“人在決策環”系統中,由模型自動處理失敗而必須升級給人類操作員的請求比例,直接影響運營成本和即時性。
- 反饋迴圈週期:從人類給出反饋到模型完成更新並可以響應新互動的端到端時間。在訓練迴圈中,該週期涵蓋標註排隊、質量稽核、模型重訓練與評估,通常為幾小時到數天,視算力資源與自動化編排程度而定。
- 偏好資料規模:RLHF 中用於訓練獎勵模型的人類比較對數量。公開例項多處於數萬至數十萬對量級(Ouyang et al., 2022 展示了約 5 萬條比較資料)。更多資料未必線性提升對齊效果,因為標註者投票的不一致性會引入噪聲。
- 策略模型與獎勵模型的規模比:為防止獎勵模型成為短板,獎勵模型通常遠小於生成策略模型,例如千億引數策略模型搭配數十億引數的獎勵模型(具體數值專案各異,多數廠商未詳細揭露)。
- KL 懲罰係數:控制微調後的策略偏離原始預訓練模型的程度。係數過大則對齊效果微弱,過小則容易出現獎勵駭客,需在實驗中進行調節,公開資料未見統一標準值。
技術路線
HITL 的實現存在一個從完全人工到高度自動化的光譜,三條主流路線各有側重。
| 維度 | 純自動化微調 | 人在迴路 (HITL) | 人在決策環 |
|---|---|---|---|
| 人類參與時機 | 僅在訓練前建置固定標註集 | 訓練中按需提供反饋 | 推論時做最終決策 |
| 典型任務 | 情感分類、封閉域翻譯 | 對齊聊天模型、主動學習影像識別 | 醫學影像輔助診斷、自動駕駛遠端接管 |
| 人類工作內容 | 一次性全量標註 | 難例標註、成對比較、定義安全規則 | 稽核建議、處理升級的疑難 case |
| 核心最佳化目標 | 固定測試集上的精度 | 最小化達到目標效能所需標註量 | 在給定召回率下最大化自動化率 |
| 延遲要求 | 無即時性 | 可離線批次,但迭代週期受關注 | 要求人在數秒至分鐘內介入 |
| 當前挑戰 | 無法應對分佈外泛化和價值對齊 | 人類不一致性、成本與速度瓶頸、獎勵駭客 | 操作員疲勞、自動化偏見、接管時間窗緊張 |
| 代表架構/工具 | Hugging Face Trainer 等 | Scale AI 資料引擎、Labelbox、TRLX、Anthropic RLHF 流水線 | 工業即時決策中介軟體、仲裁系統 |
路線選擇取決於風險容忍度與人類頻寬成本。安全攸關領域傾向於保留人類在決策環內的設計,即便這會降低吞吐量;而高吞吐量對話場景則側重於 RLHF 這樣的訓練期 HITL,努力將人類的判斷在訓練階段就已嵌入模型。
從發展脈絡看,主動學習自 1990 年代奠基,眾包平台(如 2000 年代 Amazon Mechanical Turk)的出現讓 HITL 具備經濟可行性,2017 年 Deep RL from Human Preferences 論文開啟了 RLHF 之路,而 2022‑2023 年 ChatGPT/InstructGPT 將其產品化,當前研究前沿轉向可擴充套件監督(Scalable Oversight),探索用更少的人類判斷監督超級智慧模型。
上游
HITL 的上游由三個相互依存的部分構成:
- 標註勞動力供給:包括眾包平台(如 Amazon Mechanical Turk、Prolific)、專業資料服務公司(如 Appen、TELUS International)以及特定領域專家團隊(放射科醫生、律師、程式設計師)。大型模型對齊任務催生了全新的“AI 培訓師”角色,其中具備程式設計、醫學或法律背景的標註者時薪遠超通用標註人員,供給缺口持續存在。
- HITL 工具平台:提供從基礎影像/點雲端標註到 RLHF 偏好收集的全流程介面。關鍵能力包括:主動學習引擎自動篩選待標註樣本;多人標註質量控制系統(金標準題、即時一致性監測);對話式除錯與排序介面。部分平台開始整合合成數據生成模組,輔助人類標註。
- 合成數據與輔助工具:為降低對純人工標註的依賴,上游湧現出利用生成模型從人工修訂中自動衍生變體的工具,以及用語言模型初步擬寫參考答案、由人類精修的半自動標註流水線。這類工具既提高吞吐量,也引發了“模型標註模型”的閉環偏差風險,催生對自動化質量評估的需求。
下游
HITL 賦能的下游應用已滲透進 AI 產品棧的多個層面:
- 對齊的通用模型:對話助手(ChatGPT、Claude)、程式碼助手(GitHub Copilot)和文生圖模型的安全過濾器。這些產品均大量依賴 RLHF 進行有用性、無害性和真實性對齊,將 HITL 視為必備的訓練基礎設施。
- 垂直行業解決方案:醫療影像的輔助診斷系統藉助放射科專家對不確定病灶進行標註,自動駕駛感知管線持續利用 HITL 處理長尾道路場景,法律合同稽核 AI 通過律師反饋精調條款風險識別,金融風控模型則依靠分析師對預警訊號進行可解釋性調優。
- 安全與合規應用:社交媒體內容稽核中,HITL 系統對邊界性仇恨言論、暴力內容進行裁定,並向稽核員提供解釋;模型紅隊測試也依賴安全專家生成對抗性 prompt 並對模型輸出進行危害評等。這些場景中,HITL 是保障模型合規上線並持續監控的最後閘門。
下游的共性趨勢是:HITL 不再是一次性資料清理的成本項,而是產品持續訓練和更新過程中的經營支出,成為 AI 系統全生命週期的一部分。
受益公司
HITL 的產業化直接惠及以下型別的公司(僅作產業板塊分析,不構成任何投資建議):
-
資料引擎與標註平台:
Scale AI 在 2024 年 5 月完成 10 億美元 F 輪融資,估值升至 138 億美元(TechCrunch, 2024),其業務從基礎資料標註擴充套件到整套 RLHF 資料引擎,是大型模型對齊浪潮的顯著受益者。
Labelbox 提供企業級標註和資料管理平台,側重於訓練資料迭代和團隊協作,未公開近期估值。
Surge AI 以高質量的標註人才網路和 RLHF 工作流著稱,服務於頭部大型模型廠商,估值未公開。 -
傳統資料服務商轉型:
Appen 2023 財年營收約 2.73 億美元(Appen 年報),正從傳統眾包標註向全棧 AI 訓練資料方案轉型。
TELUS International 通過收購與內部孵化,擴充 AI 資料解決方案能力,營收來源多元化,金融資料可從其公開財報獲取。 -
科技巨頭自建團隊:OpenAI、Google DeepMind、Anthropic 等均維持了大規模的人類資料與評估團隊,並將可擴充套件監督列為關鍵研究路線。雖然不對外銷售 HITL 服務,但其內部投入直接拉動了相關工具與勞動力市場的需求。
產業觀察:在當前基礎模型競爭白熱化的階段,提供訓練資料閉環和人類反饋服務的平台被視為“賣鏟人”,其商業回報的確定性往往不亞於模型層企業。平台通過積累人類反饋資料來訓練自動化標註/評判模型,不斷提升自身毛利率,形成“反饋越多→自動化越強→成本越低→客戶越多”的飛輪效應。
市場規模
“人在迴路”本身作為一個跨行業、跨技術棧的廣義方法論,目前並無單獨的權威市場統計。可參考的相關市場口徑包括:
- 資料標註市場:多家研究機構(如 Grand View Research、MarketsandMarkets)估算,2023 年全球資料標註解決方案與工具市場約在 15 億–20 億美元區間,並預計到 2030 年將以 20% 以上的複合年增長率擴張,其中高質量、垂直領域標註和 RLHF 類服務被視為增速最快的板塊。因各機構劃分口徑不一,以上區間僅供參考,具體精確數字需查閱付費報告並注意定義差異。
- RLHF 對齊服務:根據行業部落格和科技媒體在 2023–2024 年的引述分析,單次大型語言模型 RLHF 專案的外部服務支出可達數百萬美元級別,包含偏好資料生成、質量管理和獎勵模型迭代等環節,但這屬於專案級粗略估計,未獲廠商統一確認。
- 企業內部人力投入:巨頭每年在內容稽核、安全測試和模型評估上投入大量自有或外包人力,相關開支通常包含在研發或運營成本中,市場規模難以剝離。公開報告可見,Meta、Google 等公司每年在內容稽核與安全運營上的支出高達數十億美元,其中一部分屬於 HITL 範疇。
總體而言,隨著 AI 監管的趨嚴和對齊需求的常態化,HITL 及其相關服務正在從“可選增值服務”演化為“模型部署的必要合規成本”,市場容量隨模型應用擴充套件而持續放大。
玩家對比
| 公司 / 實體 | 核心 HITL 業務 | RLHF 支援 | 典型客戶群體 | 估值 / 營收規模(公開資訊) | 差異化特點 |
|---|---|---|---|---|---|
| Scale AI | 資料標註、AI 資料引擎、RLHF | 是,提供完整的偏好收集與獎勵模型訓練管線 | OpenAI、Meta 等大型模型廠商以及美國政府專案 | 2024 年估值 138 億美元(F 輪融資) | 端到端平台,強調規模化與標準化,資料飛輪效應顯著 |
| Labelbox | 企業級資料標註與資料管理 | 部分支援,可通過 API 整合主動學習與反饋迴圈 | 中型 AI 團隊、大型企業 AI 部門 | 未公開最新估值,2022 年初估值為 ~10 億美元級別(據 PitchBook) | 強調資料迭代,使用者介面友好,適合建置定製化標註工作流 |
| Appen | 預標註、眾包資料收集、語言資料 | 逐步擴充套件,通過收購和內部開發增強 RLHF 能力 | 科技巨頭、電商、汽車 | 2023 年營收 2.73 億美元(年報) | 成熟全球眾包網路,語言覆蓋廣,但面臨業務轉型陣痛 |
| TELUS International | AI 訓練資料、內容稽核、資料標註 | 在收購 Playment 等後擴充套件了 2D/3D 標註和部分反饋能力 | 大型雲端服務商、社交媒體、自動駕駛 | 2023 年營收約 27 億美元(年報,含非 AI 業務) | 龐大的全球勞動力規模,提供全棧數字化服務,AI 資料為增長板塊 |
| Surge AI | 高技能標註者網路、RLHF 工作流 | 是,專注於創意寫作、程式設計、多語言對齊偏好資料 | 前沿 AI 實驗室(OpenAI、Anthropic 等) | 估值未公開 | 強調標註者質量,覆蓋稀缺技能,服務深度定製 |
| 內部團隊 (OpenAI/Anthropic 等) | 自建資料與對齊團隊 | 自研 RLHF/CAI 流程,部分使用外部供應商 | 自身模型 | 投入未單獨揭露,屬於研發費用 | 深度繫結研究路線,可快速實驗過程監督、辯論等前沿方法 |
對比顯示,賽道正分化為“規模化平台”與“高技能人力網路”兩條路徑,而大客戶往往採用“主力供應商 + 內部專家”的混合模式來平衡成本與質量。
風險
HITL 並非萬能解藥,其大規模應用面臨多重風險:
- 人力供給與質量瓶頸:具備領域知識的高質量標註者是稀缺資源,大規模產出難以保持同質性;全球勞動力的時區、文化差異和薪酬水平加劇了排程難度。
- 標註偏見與代表性偏差:RLHF 的偏好資料反映了特定標註群體(人口學特徵、文化背景)的價值觀,可能導致模型對少數群體觀點或非西方語境適配不足。
- 獎勵駭客(Reward Hacking):模型可能會學會利用獎勵模型的漏洞,產生高分但空洞甚至有害的輸出。KL 懲罰只能部分緩解此問題,檢測和糾正需要持續的人類監督。
- 隱私與倫理風險:人工稽核員接觸敏感內容(暴力、仇恨言論、成人主題)可能導致心理創傷,同時也面臨資料洩露風險,需要嚴格的保護機制和倫理學審查。
- 成本上升與可擴充套件性挑戰:隨著模型能力增強,需要人類判斷的樣本複雜度和專業度也水漲船高,單位標註成本上漲,用有限人工來監督超級智慧的目標面臨可擴充套件性瓶頸。
- 對抗性操縱:在紅隊測試和對抗性評估中,人類測試者可能無意中留下系統的脆弱性盲區;惡意攻擊者可能通過揭示標註者群體的傾向來構造繞過策略。
應對這些風險需要一套互補手段:自動化質量監控、多源標註與一致性審計、明確的資料隱私協議、以及以規則和 AI 輔助反饋替代純人類判斷的研究(如 Constitutional AI)。
誤讀糾偏
-
誤讀一:“人在迴路就是給模型錯誤擦屁股的人工稽核”
糾偏:人工稽核僅是 HITL 最低價值的形式。高價值 HITL 是主動的資訊注入——在模型最不確定、最需要訊號的方向上,人類提供監督,引導模型探索未知邊界,而不是僅僅對成品投票。 -
誤讀二:“RLHF 用了人類反饋,所以模型就內化了人類價值觀”
糾偏:RLHF 學到的是獎勵模型所代理的、特定標註群體在特定任務約束下的瞬時偏好。它極容易受標註者偏見、介面設計和獎勵駭客影響,更像是模型戴上的一個“偏好緊箍咒”,而非真正的價值觀根植。正因如此,行業正向過程監督、規則化獎勵等方向演進。 -
誤讀三:“HITL 只是過渡方案,未來會被全自動方法取代”
糾偏:只要 AI 系統面臨開放世界中的不確定性與價值衝突,人類的判斷就仍是不可或缺的最終錨點。自動化手段可以降低對原始人力的依賴,但人類定義目標、劃定邊界和仲裁異常的角色會持續存在,只是介入的層次和形式不斷演化。 -
誤讀四:“HITL 只是花錢買標註”
糾偏:HITL 的成本不應被簡單視為消耗性開銷。它所生成的反饋資料是驅動模型迭代的燃料,優秀的 HITL 系統通過飛輪效應將人力標註轉化為自動化率的提升,導致長期單位成本下降,屬於戰略性資本投入。
最新事件
- 2024 年 5 月,Scale AI 獲 10 億美元 F 輪融資(TechCrunch 報道),估值躍升至 138 億美元,凸顯資本市場對 HITL 基礎設施的戰略重注。資金部分用於擴充套件 RLHF 平台和合成資料能力。
- 2024 年,Anthropic 釋出 Claude 3 系列模型,公開強調其 Constitutional AI 架構,用 AI 生成的反饋替代大量人類偏好資料,減少了對標註者的依賴並降低了偏見風險,推動了“半自動化 HITL”的落地。
- 2024 年,OpenAI 在開發 GPT‑4o 過程中引入更細粒度的過程監督(根據其技術部落格),以獎勵模型評判推論步驟是否正確,而非僅對最終輸出排序。此舉旨在減少大型模型幻覺,並降低獎勵駭客的可能性。
- 2024 年底,歐盟《人工智慧法案》進入最終談判與實施準備階段,對高風險 AI 系統明確要求人類監督與干預能力,使 HITL 從企業自主選擇開始轉變為部分場景下的強制性合規要素。
- 2025 年初,多家 AI 企業(如 Cohere、Mistral)公開強調其 RLHF 資料來源的多樣性與標註者福利政策,行業對標註者工作條件和倫理的關注持續升溫,ESG 維度正在成為 HITL 服務商的競爭指標之一。
(以上事件基於截至 2025 年 4 月的公開報道,具體細節可能隨時間更新。)
追蹤指標
實際追蹤 HITL 產業可關注以下一系列高訊雜比指標:
- 資料平台財務指標:Scale AI、Appen 等公司的季度營收增速、毛利率變化(反映自動化替代人力比例)和人均創收,是行業景氣度的直接訊號。
- RLHF 相關崗位招聘:頭部實驗室釋出的對齊研究員、AI 培訓師(領域專家)、紅隊測試工程師等崗位的數量和薪酬變化,體現人力需求的邊際增長。
- 學術與產業基準:主要會議(如 NeurIPS、ICML)中 RLHF 獎勵模型準確率、主動學習標註減少率的進步,以及 Constitutional AI 新方法的出現節奏。
- 監管進展:歐盟 AI 法案、美國對生成式 AI 監管提案中關於人類監督要求的具體表述及生效日期,影響合規性 HITL 的市場需求。
- 開源工具活性:Hugging Face TRL、OpenAI 公開的 RLHF 實踐、主動學習庫(如 modAL)的 Star 數與版本更新頻率,可輔助判斷工程師社群的採納度。
- 標註者勞動力動態:自由職業平台上“資料標註”、“AI 培訓師”崗位的時薪中位數、職位釋出量與國別分佈,從底端反映供需鬆緊。
- 企業安全支出:主要 AI 服務商在內容稽核、模型安全與紅隊測試上的供應商合同及預算揭露,可拆解出 HITL 成分。
組合監測這些指標,有助於形成對 HITL 產業發展節奏的結構化認知。
信源
以下為本頁面關鍵資訊的主要參考來源:
- Christiano, P. F., et al. “Deep reinforcement learning from human preferences.” NeurIPS 2017. (RLHF 奠基之作)
- Stiennon, N., et al. “Learning to summarize with human feedback.” NeurIPS 2020.(語言模型中的 RLHF 早期實踐)
- Ouyang, L., et al. “Training language models to follow instructions with human feedback.” NeurIPS 2022.(InstructGPT/ChatGPT 方法論)
- Settles, B. “Active learning literature survey.” University of Wisconsin‑Madison Technical Report, 2010.(主動學習綜述)
- Bai, Y., et al. “Constitutional AI: Harmlessness from AI Feedback.” 2022.(AI 反饋替代人類反饋)
- Scale AI F 輪融資報道,TechCrunch, 2024 年 5 月.(估值與融資資訊)
- Appen 2023 年度報告.(營收及業務組成)
- Grand View Research, MarketsandMarkets 等公開市場報告摘要.(資料標註市場估算,具體需查閱付費版)
- Anthropic 官方部落格關於 Claude 3 和 Constitutional AI 的技術說明,2024.
- OpenAI 官方部落格關於過程監督與 GPT‑4o 對齊改進的說明,2024.
- 歐盟《人工智慧法案》(EU AI Act)文本及相關新聞分析,2024–2025.
(注:涉及具體即時商業數字時,建議查閱各公司最新公開檔案或一級市場研究服務以獲取精確值。)