VIP 專屬 資料處理與評測 實戰

處理標註分歧:什麼時候該改指南、什麼時候該接受模糊

不是所有分歧都該消除。有些分歧反映的是任務本身的模糊性。

資料處理與評測教程封面

標註一致率永遠不會是 100%。追求完全一致,往往會逼出一套僵化且脫離現實的規則。關鍵是分辨哪些分歧該解決、哪些該接受。

三種分歧

  • 指南不清:兩人對規則的理解不同。→ 修指南。
  • 注意力失誤:有人看漏了關鍵資訊。→ 改流程(例如強制顯示某欄位)。
  • 本質模糊:這個案例真的可以合理歸到兩類。→ 接受,並在設計上處理。

怎麼分辨

對每個分歧案例,請兩位標註者各自寫下理由,然後看:

  理由不同且互相矛盾  → 指南不清
  一方看到對方沒看到的資訊 → 注意力失誤
  理由都合理、只是取捨不同 → 本質模糊

處理本質模糊的三種方式

  1. 允許多標籤:一個案例可以同時屬於兩類,評測時任一符合即算對。
  2. 增加類別:把常見的模糊組合獨立成新類別。
  3. 明確定義優先順序:規定「同時符合 A 與 B 時,一律歸 A」。這不是消除模糊,是用約定處理它。

第三種最常用,也最務實。重點是把約定寫進指南,讓它成為可教、可檢查的規則,而不是各憑感覺。

評測要反映模糊性

# 對模糊案例採用寬鬆評分
def score(pred, gold):
    if isinstance(gold, list):          # 多個可接受答案
        return float(pred in gold)
    return float(pred == gold)

# 並單獨統計模糊案例的比例與表現
ambiguous = [c for c in cases if isinstance(c['gold'], list)]

一致率的合理目標

  • 客觀抽取任務(金額、日期、編號):應該接近 1.0,低於 0.95 代表流程有問題。
  • 分類任務:0.85 以上算好。
  • 主觀判斷(語氣、品質、相關性):0.7 就算不錯,強求更高通常是在逼標註者猜規則。

把一致率當成上限

模型的表現不可能穩定超過標註一致率——因為評測答案本身就有那麼多不確定性。若你的一致率是 0.85 而模型分數也是 0.85,那可能已經接近這組資料的天花板,該做的是改善標註品質而不是繼續調模型。

把分歧案例單獨存成一個集合並定期回顧。它們往往指出產品定義上真正需要澄清的問題,價值超出標註本身。
🔒

訂閱後繼續閱讀全文

本篇為訂閱者專屬內容。訂閱後可取得下列權限:

  • 解鎖全部內容權限
  • 閱讀不限篇數
  • 全站移除廣告
月卡
NT$240
開通 30 天
一次付清,開通 30 天
季卡
NT$620
開通 90 天
一次付清,開通 90 天,每天約 NT$7
年卡
NT$2,160
開通 365 天
一次付清,開通 365 天,每天約 NT$6

一次性付款,付款成功後立即開通,到期自動結束,不會再次扣款,也不需要取消訂閱。

立即訂閱

金額均為新臺幣(TWD),即實際扣款金額,不另收手續費
支援信用卡 · Apple Pay · Google Pay · WebATM · ATM 轉帳
購買須知與退款政策