標註流程自動化:用模型做初標,人只做審核
人工從零標註太慢。模型初標加人工審核,速度通常快三到五倍。
純人工標註的成本讓多數團隊的資料集停在幾百筆。改成「模型初標、人工審核」後,同樣的人力能處理數千筆——前提是流程設計得好。
三種介入程度
- 全審:每一筆都人工看過。品質最高,適合評測集與 gold 資料。
- 抽審:只審一定比例,其餘信任模型。適合訓練資料。
- 分流審:模型信心低或彼此不一致的才送人工。效率最高。
分流審的實作
def triage(item, models):
preds = [m.predict(item) for m in models] # 2-3 個不同模型或不同提示
labels = [p['label'] for p in preds]
conf = min(p['confidence'] for p in preds)
if len(set(labels)) == 1 and conf >= 0.85:
return {'label': labels[0], 'route': 'auto', 'need_human': False}
if len(set(labels)) == 1:
return {'label': labels[0], 'route': 'spot_check', 'need_human': False}
return {'label': None, 'route': 'human', 'need_human': True,
'candidates': labels}多模型一致且高信心的樣本,錯誤率通常很低,可以直接採用;不一致的樣本則恰好是最有學習價值的,值得人工處理。
審核介面的設計重點
- 預選模型的答案,人只需確認或修改。這比從零選擇快好幾倍。
- 顯示模型的理由,幫助審核者快速判斷。
- 鍵盤操作:確認、修改、跳過都要有快捷鍵。
- 批次確認:高信心的同類樣本可以一次確認多筆。
- 顯示相似的已標註樣本,維持一致性。
品質監控
# 在待審佇列中混入已知答案的題目,量測審核者品質
inject_rate = 0.05 # 5% 是已知答案的檢查題
# 審核者在檢查題上的正確率低於 0.9 → 需要重新訓練或休息
審核疲勞是真實的:連續審核一小時後,錯誤率會明顯上升。用檢查題監控,並建議分段作業。
初標模型的選擇
初標應該用你能取得的最強模型,即使很貴——因為每筆只跑一次,而且省下的人力成本遠高於模型成本。不要用未來要上線的那個小模型來初標,那會讓資料集繼承它的偏誤。
模型初標會產生「錨定效應」:審核者傾向接受模型的答案。定期抽一批做盲標(不顯示模型答案)對照,確認錨定沒有嚴重影響品質。
訂閱後繼續閱讀全文
本篇為訂閱者專屬內容。訂閱後可取得下列權限:
- 解鎖全部內容權限
- 閱讀不限篇數
- 全站移除廣告
月卡
NT$240
開通 30 天
一次付清,開通 30 天
季卡
NT$620
開通 90 天
一次付清,開通 90 天,每天約 NT$7
年卡
NT$2,160
開通 365 天
一次付清,開通 365 天,每天約 NT$6
一次性付款,付款成功後立即開通,到期自動結束,不會再次扣款,也不需要取消訂閱。
立即訂閱
金額均為新臺幣(TWD),即實際扣款金額,不另收手續費
支援信用卡 · Apple Pay · Google Pay · WebATM · ATM 轉帳
購買須知與退款政策