AI 實作學院
AILAB
首頁
教程總覽
VIP 專區
訂閱方案
關於
Catalog
資料處理與評測
清洗、去重、合成資料與離線/線上評測,模型好不好要有數字說話。
全部主題
提示工程
RAG 檢索增強
Agent 開發
模型微調
部署與推理優化
資料處理與評測
多模態應用
工具與工作流
不限
免費
VIP 專屬
全難度
入門
進階
實戰
符合條件:7 篇
免費
資料處理與評測
進階
用模型當裁判:可靠的 LLM-as-judge 怎麼設計
讓模型評分很方便,但預設做法的偏誤很大。這幾個修正能大幅提升一致性。
2026-08-25
9 分鐘
免費
資料處理與評測
進階
訓練資料去重:近似重複比完全重複更麻煩
完全相同的樣本好抓,改了兩個字的近似重複才是讓評測分數虛高的元凶。
2026-08-23
8 分鐘
免費
資料處理與評測
進階
評測集會腐化:三個月後你的分數還有意義嗎
固定的評測集用久了會失去區分度。這篇講怎麼維護它的有效性。
2026-08-19
9 分鐘
免費
資料處理與評測
進階
從線上日誌挖評測題:最便宜的高品質資料來源
最貼近真實的題目就在你的日誌裡,關鍵是知道要撈哪些。
2026-08-17
8 分鐘
免費
資料處理與評測
進階
資料集切分:隨機切分什麼時候會騙你
隨機切分很方便,但在有時間性或群組性的資料上會造成嚴重高估。
2026-08-11
8 分鐘
免費
資料處理與評測
進階
指標選擇:準確率什麼時候會誤導你
類別不平衡時,準確率 95% 可能代表模型什麼都沒學到。
2026-08-09
9 分鐘
免費
資料處理與評測
進階
監控模型輸出漂移:使用者沒抱怨不代表沒問題
模型行為可能悄悄改變。這幾個不需要標註的指標可以當早期警訊。
2026-08-05
8 分鐘