免費全文 模型微調 實戰

偏好對齊入門:什麼情況下需要 DPO

監督式微調教模型「怎麼做」,偏好對齊教它「兩個都對時選哪個」。多數任務不需要。

模型微調教程封面

監督式微調(SFT)需要一個標準答案。但很多任務沒有唯一正確答案,只有「這個比那個好」——語氣、詳略、風格取捨。這時才輪到偏好對齊。

資料長什麼樣

{
  "prompt":   "使用者抱怨出貨太慢,請草擬回覆。",
  "chosen":   "很抱歉讓您久等,您的訂單已於今日出貨,預計……",
  "rejected": "物流狀況我們也無法控制,請耐心等候。"
}

關鍵是 chosen 與 rejected 都要是合理的回答,只是一好一壞。拿一個正確答案配一個亂答的樣本去訓練,模型只會學到「不要亂講」,那是 SFT 就能做到的事。

什麼時候值得做

  • 已經做過 SFT,格式與正確性都穩定了。
  • 剩下的問題是主觀取捨,例如語氣、篇幅、冒犯風險。
  • 你有辦法穩定產生偏好標註——人工比較,或用強模型當裁判。

什麼時候不要做

  • 格式還會出錯——先修 SFT。
  • 偏好標準團隊內部都還沒有共識。標註者不一致時,訓練只會學到噪音。
  • 樣本數少於幾百組。

實作上的注意事項

DPO 一般在 SFT 之後接著做,學習率要比 SFT 更小(常見 5e-6 到 5e-5 這個量級),輪數也更少,通常一到兩輪。過度訓練的典型症狀是回答變得又長又客套,因為那類回答在偏好資料裡常被選中。

偏好對齊會放大標註者的偏誤。標註前先寫下明確的判準文件,並定期檢查不同標註者之間的一致率。
下一步

這個主題還有更深入的實戰教程

VIP 專區收錄 50 篇進階內容:架構設計、生產環境取捨、成本與合規。 每週五新增 3 篇。

看訂閱方案 → 先逛逛 VIP 專區

延伸閱讀

更多模型微調 →