Catalog

資料處理與評測

清洗、去重、合成資料與離線/線上評測,模型好不好要有數字說話。

符合條件:18 篇
建立團隊的評測平台:從腳本到基礎設施
VIP 資料處理與評測 實戰
建立團隊的評測平台:從腳本到基礎設施
每個人各跑各的腳本,分數無法比較。這是評測平台的最小可行設計。
2026-08-29
13 分鐘
離線評測與線上評測:兩者各自能回答什麼問題
免費 資料處理與評測 入門
離線評測與線上評測:兩者各自能回答什麼問題
離線分數漂亮但線上出事,是因為兩種評測在測不同的東西。
2026-08-28
8 分鐘
資料飛輪:讓產品使用產生訓練資料
VIP 資料處理與評測 實戰
資料飛輪:讓產品使用產生訓練資料
最好的訓練資料來自產品本身。關鍵是把回收機制設計進使用流程。
2026-08-27
12 分鐘
評測的統計嚴謹性:信賴區間與多重比較
VIP 資料處理與評測 實戰
評測的統計嚴謹性:信賴區間與多重比較
200 題的評測集,91% 和 89% 的差距可能完全是雜訊。
2026-08-25
11 分鐘
用模型當裁判:可靠的 LLM-as-judge 怎麼設計
免費 資料處理與評測 進階
用模型當裁判:可靠的 LLM-as-judge 怎麼設計
讓模型評分很方便,但預設做法的偏誤很大。這幾個修正能大幅提升一致性。
2026-08-25
9 分鐘
標註流程自動化:用模型做初標,人只做審核
VIP 資料處理與評測 實戰
標註流程自動化:用模型做初標,人只做審核
人工從零標註太慢。模型初標加人工審核,速度通常快三到五倍。
2026-08-23
11 分鐘
訓練資料去重:近似重複比完全重複更麻煩
免費 資料處理與評測 進階
訓練資料去重:近似重複比完全重複更麻煩
完全相同的樣本好抓,改了兩個字的近似重複才是讓評測分數虛高的元凶。
2026-08-23
8 分鐘
處理標註分歧:什麼時候該改指南、什麼時候該接受模糊
VIP 資料處理與評測 實戰
處理標註分歧:什麼時候該改指南、什麼時候該接受模糊
不是所有分歧都該消除。有些分歧反映的是任務本身的模糊性。
2026-08-21
10 分鐘
標註指南怎麼寫:一致率低通常不是標註者的問題
免費 資料處理與評測 入門
標註指南怎麼寫:一致率低通常不是標註者的問題
兩個人標同一批資料只有六成一致,多半是指南沒寫清楚邊界。
2026-08-21
7 分鐘
合規視角的資料治理:保存期限、刪除權與跨境
VIP 資料處理與評測 實戰
合規視角的資料治理:保存期限、刪除權與跨境
AI 專案的資料治理不只是資安問題,還有法遵要求要滿足。
2026-08-19
10 分鐘
評測集會腐化:三個月後你的分數還有意義嗎
免費 資料處理與評測 進階
評測集會腐化:三個月後你的分數還有意義嗎
固定的評測集用久了會失去區分度。這篇講怎麼維護它的有效性。
2026-08-19
9 分鐘
從線上日誌挖評測題:最便宜的高品質資料來源
免費 資料處理與評測 進階
從線上日誌挖評測題:最便宜的高品質資料來源
最貼近真實的題目就在你的日誌裡,關鍵是知道要撈哪些。
2026-08-17
8 分鐘
A/B 測試模型改動:樣本數與統計顯著性
免費 資料處理與評測 實戰
A/B 測試模型改動:樣本數與統計顯著性
看到「新版好 2%」就全量上線,很可能只是雜訊。這篇給實用的判斷方法。
2026-08-15
10 分鐘
文本清洗的常見陷阱:全形、零寬字元與 Unicode 正規化
免費 資料處理與評測 入門
文本清洗的常見陷阱:全形、零寬字元與 Unicode 正規化
看起來一樣的兩個字串,在程式眼中可能完全不同。中文資料尤其容易中招。
2026-08-13
7 分鐘
資料集切分:隨機切分什麼時候會騙你
免費 資料處理與評測 進階
資料集切分:隨機切分什麼時候會騙你
隨機切分很方便,但在有時間性或群組性的資料上會造成嚴重高估。
2026-08-11
8 分鐘
指標選擇:準確率什麼時候會誤導你
免費 資料處理與評測 進階
指標選擇:準確率什麼時候會誤導你
類別不平衡時,準確率 95% 可能代表模型什麼都沒學到。
2026-08-09
9 分鐘
資料版本控制:讓每個分數都能追回當時的資料
免費 資料處理與評測 入門
資料版本控制:讓每個分數都能追回當時的資料
程式碼有 git,資料常常只有一個資料夾叫 final_v3_new。這是最小可行的做法。
2026-08-07
7 分鐘
監控模型輸出漂移:使用者沒抱怨不代表沒問題
免費 資料處理與評測 進階
監控模型輸出漂移:使用者沒抱怨不代表沒問題
模型行為可能悄悄改變。這幾個不需要標註的指標可以當早期警訊。
2026-08-05
8 分鐘