Catalog

模型微調

LoRA、QLoRA 與偏好對齊的實作流程,含資料配比與過擬合的判讀。

符合條件:17 篇
該微調還是該寫提示:先跑完這四個檢查
免費 模型微調 入門
該微調還是該寫提示:先跑完這四個檢查
微調是最後手段,不是第一步。這四個檢查能替你省下大量算力與標註成本。
2026-08-30
8 分鐘
完整微調專案:從問題定義到上線的十二週流程
VIP 模型微調 實戰
完整微調專案:從問題定義到上線的十二週流程
把微調當專案管理,而不是實驗。這是一條走得通的時程與里程碑。
2026-08-28
14 分鐘
LoRA 是什麼:用三個參數理解它在做的事
免費 模型微調 進階
LoRA 是什麼:用三個參數理解它在做的事
不用讀論文也能正確使用 LoRA。理解 rank、alpha 與目標模組這三件事就夠了。
2026-08-27
9 分鐘
多任務微調:一個介面卡處理多種任務
VIP 模型微調 實戰
多任務微調:一個介面卡處理多種任務
為每個任務訓一個介面卡,維運會爆炸。合併訓練有技巧。
2026-08-26
12 分鐘
微調資料集怎麼準備:格式、數量與品質的實際標準
免費 模型微調 進階
微調資料集怎麼準備:格式、數量與品質的實際標準
微調成敗八成取決於資料。這篇是可以直接照做的準備流程。
2026-08-25
10 分鐘
蒸餾:用大模型教出可上線的小模型
VIP 模型微調 實戰
蒸餾:用大模型教出可上線的小模型
把大模型的能力壓縮進小模型,是降低推論成本最有效的手段之一。
2026-08-24
12 分鐘
QLoRA:在單張消費級顯示卡上微調的實際配置
免費 模型微調 進階
QLoRA:在單張消費級顯示卡上微調的實際配置
4-bit 量化加 LoRA,讓 24GB 顯示記憶體就能微調中型模型。這是可跑通的設定。
2026-08-23
9 分鐘
介面卡的線上管理:熱切換與多租戶服務
VIP 模型微調 實戰
介面卡的線上管理:熱切換與多租戶服務
同一個底座掛多個 LoRA 介面卡,是自架服務最划算的架構。
2026-08-22
11 分鐘
學習率與訓練輪數:從損失曲線讀出該停在哪
免費 模型微調 進階
學習率與訓練輪數:從損失曲線讀出該停在哪
微調過擬合的速度比想像中快。看懂曲線比背誦超參數表有用得多。
2026-08-21
8 分鐘
持續微調:模型上線後怎麼跟著資料一起長
VIP 模型微調 實戰
持續微調:模型上線後怎麼跟著資料一起長
訓練一次就結束的模型會逐漸過時。這是可持續的迭代機制。
2026-08-20
11 分鐘
災難性遺忘:微調後模型變笨了怎麼辦
免費 模型微調 實戰
災難性遺忘:微調後模型變笨了怎麼辦
專項任務變好、其他能力全面退化,是微調最典型的副作用。有幾個明確的緩解手段。
2026-08-19
10 分鐘
微調的成本回收分析:什麼時候真的省到錢
VIP 模型微調 實戰
微調的成本回收分析:什麼時候真的省到錢
把一次性成本與持續成本攤開,算出真正的損益平衡點。
2026-08-18
10 分鐘
合成資料怎麼用才不會反效果
免費 模型微調 進階
合成資料怎麼用才不會反效果
用大模型生成訓練資料很方便,但直接拿來訓練通常會把錯誤一起學進去。
2026-08-17
8 分鐘
微調模型的版本管理:介面卡、底座與提示要對齊
免費 模型微調 入門
微調模型的版本管理:介面卡、底座與提示要對齊
微調上線後最容易出的事故是版本錯配。三個東西必須綁在一起管理。
2026-08-15
7 分鐘
偏好對齊入門:什麼情況下需要 DPO
免費 模型微調 實戰
偏好對齊入門:什麼情況下需要 DPO
監督式微調教模型「怎麼做」,偏好對齊教它「兩個都對時選哪個」。多數任務不需要。
2026-08-13
10 分鐘
微調模型的評測:不要只看訓練指標
免費 模型微調 進階
微調模型的評測:不要只看訓練指標
訓練損失是給訓練用的,上線決策要看另一組數字。
2026-08-11
8 分鐘
微調前的資料脫敏:不要把個資訓進權重裡
免費 模型微調 入門
微調前的資料脫敏:不要把個資訓進權重裡
資料進了權重就拿不出來。脫敏必須在訓練前完成,這是不可逆的一步。
2026-08-09
7 分鐘