資料飛輪:讓產品使用產生訓練資料
最好的訓練資料來自產品本身。關鍵是把回收機制設計進使用流程。
買來的資料集永遠不會完全貼合你的場景,而人工標註昂貴且無法持續。真正可持續的資料來源是產品的使用過程本身。
但這不會自動發生。要在產品設計階段就把「產生可用標註」納入考量。
四種自然產生標註的互動
- 編輯行為:使用者修改了 AI 的產出。修改前後就是一組(差、好)的偏好資料。
- 採納與否:使用者接受了三個建議中的哪一個。這是排序訊號。
- 流程完成:AI 填的表單被送出且沒被退件,等於間接確認正確。
- 明確評分:按讚倒讚,最直接但參與率最低。
編輯行為的資料化
{
"input": "...原始輸入...",
"model_output": "客戶反映商品有瑕疵,建議退換貨處理。",
"user_final": "客戶反映商品外包裝破損,內容物完好,建議補寄包材即可。",
"edit_distance": 0.42,
"edit_type": "substantive", # trivial | style | substantive
"accepted_at": "2026-08-27T09:12:00Z"
}edit_type 的分類很重要:只改錯字的編輯沒有訓練價值,實質改寫的才有。用編輯距離加上簡單規則就能自動分類。
設計上要注意的三件事
- 不要為了收資料而增加使用者負擔。要求使用者評分每一個輸出,會直接降低產品體驗。
- 取得同意:把資料用於改善模型必須在服務條款中明確揭露,並提供退出選項。
- 避免偏誤累積:只收集被編輯的樣本,會讓資料集偏向失敗案例。要混入隨機抽樣的成功案例。
品質分層
TIERS = {
'gold': '人工審核過的修正樣本,可直接用於訓練與評測',
'silver': '使用者採納但未經審核,可用於訓練',
'bronze': '間接訊號(流程完成),僅用於分析,不直接訓練',
}飛輪的量化
要能回答:本月新增多少 gold 樣本、模型分數提升多少、標註成本降低多少。沒有這些數字,「資料飛輪」就只是說法而不是機制。
每月報表:
新增 gold 樣本 312 筆(人工審核 4 小時)
新增 silver 樣本 2,140 筆(零人工成本)
評測集擴充 48 題
重訓後任務分數 0.891 → 0.907
資料飛輪也會放大偏誤:模型偏好某種輸出 → 使用者較少修改 → 訓練資料強化該偏好。定期用隨機抽樣的人工評估校準,是必要的。
訂閱後繼續閱讀全文
本篇為訂閱者專屬內容。訂閱後可取得下列權限:
- 解鎖全部內容權限
- 閱讀不限篇數
- 全站移除廣告
月卡
NT$240
開通 30 天
一次付清,開通 30 天
季卡
NT$620
開通 90 天
一次付清,開通 90 天,每天約 NT$7
年卡
NT$2,160
開通 365 天
一次付清,開通 365 天,每天約 NT$6
一次性付款,付款成功後立即開通,到期自動結束,不會再次扣款,也不需要取消訂閱。
立即訂閱
金額均為新臺幣(TWD),即實際扣款金額,不另收手續費
支援信用卡 · Apple Pay · Google Pay · WebATM · ATM 轉帳
購買須知與退款政策