微調模型的評測:不要只看訓練指標
訓練損失是給訓練用的,上線決策要看另一組數字。
微調完問「這個模型好不好」,答案不能是驗證損失 0.42。要能回答的是:在真實任務上,它比現況好多少、在哪裡變差。
四層評測
- 格式層:輸出能否被解析、欄位是否齊全。這一層應該要求 100%。
- 任務層:準確率、F1、或你的業務指標。
- 回歸層:通用能力有沒有退化。
- 穩健層:輸入加入錯字、超長、空白、注入語句時的表現。
一定要有對照組
# 至少四個對照,缺一個就很難做決策
baselines = {
'base+zero_shot': '底座模型,不加範例',
'base+few_shot': '底座模型,加上目前線上的提示',
'bigger+few_shot': '更大的模型加提示(成本上限參考)',
'finetuned': '本次微調成果',
}很常見的結果是:base+few_shot 已經跟微調差不多。這時就該停下來——省下的維運成本遠大於那兩三個百分點。
按切片看分數
整體準確率 90% 可能藏著「罕見類別只有 40%」。務必依類別、依輸入長度、依來源管道分別列出分數,平均值最會騙人。
把評測結果存成可比對的檔案並版控。三個月後有人問「當初為什麼選這個模型」,你要拿得出數字。