AI 實作學院
AILAB
首頁
教程總覽
VIP 專區
訂閱方案
關於
Catalog
資料處理與評測
清洗、去重、合成資料與離線/線上評測,模型好不好要有數字說話。
全部主題
提示工程
RAG 檢索增強
Agent 開發
模型微調
部署與推理優化
資料處理與評測
多模態應用
工具與工作流
不限
免費
VIP 專屬
全難度
入門
進階
實戰
符合條件:12 篇
免費
資料處理與評測
入門
離線評測與線上評測:兩者各自能回答什麼問題
離線分數漂亮但線上出事,是因為兩種評測在測不同的東西。
2026-08-28
8 分鐘
免費
資料處理與評測
進階
用模型當裁判:可靠的 LLM-as-judge 怎麼設計
讓模型評分很方便,但預設做法的偏誤很大。這幾個修正能大幅提升一致性。
2026-08-25
9 分鐘
免費
資料處理與評測
進階
訓練資料去重:近似重複比完全重複更麻煩
完全相同的樣本好抓,改了兩個字的近似重複才是讓評測分數虛高的元凶。
2026-08-23
8 分鐘
免費
資料處理與評測
入門
標註指南怎麼寫:一致率低通常不是標註者的問題
兩個人標同一批資料只有六成一致,多半是指南沒寫清楚邊界。
2026-08-21
7 分鐘
免費
資料處理與評測
進階
評測集會腐化:三個月後你的分數還有意義嗎
固定的評測集用久了會失去區分度。這篇講怎麼維護它的有效性。
2026-08-19
9 分鐘
免費
資料處理與評測
進階
從線上日誌挖評測題:最便宜的高品質資料來源
最貼近真實的題目就在你的日誌裡,關鍵是知道要撈哪些。
2026-08-17
8 分鐘
免費
資料處理與評測
實戰
A/B 測試模型改動:樣本數與統計顯著性
看到「新版好 2%」就全量上線,很可能只是雜訊。這篇給實用的判斷方法。
2026-08-15
10 分鐘
免費
資料處理與評測
入門
文本清洗的常見陷阱:全形、零寬字元與 Unicode 正規化
看起來一樣的兩個字串,在程式眼中可能完全不同。中文資料尤其容易中招。
2026-08-13
7 分鐘
免費
資料處理與評測
進階
資料集切分:隨機切分什麼時候會騙你
隨機切分很方便,但在有時間性或群組性的資料上會造成嚴重高估。
2026-08-11
8 分鐘
免費
資料處理與評測
進階
指標選擇:準確率什麼時候會誤導你
類別不平衡時,準確率 95% 可能代表模型什麼都沒學到。
2026-08-09
9 分鐘
免費
資料處理與評測
入門
資料版本控制:讓每個分數都能追回當時的資料
程式碼有 git,資料常常只有一個資料夾叫 final_v3_new。這是最小可行的做法。
2026-08-07
7 分鐘
免費
資料處理與評測
進階
監控模型輸出漂移:使用者沒抱怨不代表沒問題
模型行為可能悄悄改變。這幾個不需要標註的指標可以當早期警訊。
2026-08-05
8 分鐘