免費全文 模型微調 進階

微調模型的評測:不要只看訓練指標

訓練損失是給訓練用的,上線決策要看另一組數字。

模型微調教程封面

微調完問「這個模型好不好」,答案不能是驗證損失 0.42。要能回答的是:在真實任務上,它比現況好多少、在哪裡變差。

四層評測

  1. 格式層:輸出能否被解析、欄位是否齊全。這一層應該要求 100%。
  2. 任務層:準確率、F1、或你的業務指標。
  3. 回歸層:通用能力有沒有退化。
  4. 穩健層:輸入加入錯字、超長、空白、注入語句時的表現。

一定要有對照組

# 至少四個對照,缺一個就很難做決策
baselines = {
  'base+zero_shot':  '底座模型,不加範例',
  'base+few_shot':   '底座模型,加上目前線上的提示',
  'bigger+few_shot': '更大的模型加提示(成本上限參考)',
  'finetuned':       '本次微調成果',
}

很常見的結果是:base+few_shot 已經跟微調差不多。這時就該停下來——省下的維運成本遠大於那兩三個百分點。

按切片看分數

整體準確率 90% 可能藏著「罕見類別只有 40%」。務必依類別、依輸入長度、依來源管道分別列出分數,平均值最會騙人。

把評測結果存成可比對的檔案並版控。三個月後有人問「當初為什麼選這個模型」,你要拿得出數字。
下一步

這個主題還有更深入的實戰教程

VIP 專區收錄 50 篇進階內容:架構設計、生產環境取捨、成本與合規。 每週五新增 3 篇。

看訂閱方案 → 先逛逛 VIP 專區

延伸閱讀

更多模型微調 →