Catalog

模型微調

LoRA、QLoRA 與偏好對齊的實作流程,含資料配比與過擬合的判讀。

符合條件:8 篇
完整微調專案:從問題定義到上線的十二週流程
VIP 模型微調 實戰
完整微調專案:從問題定義到上線的十二週流程
把微調當專案管理,而不是實驗。這是一條走得通的時程與里程碑。
2026-08-28
14 分鐘
多任務微調:一個介面卡處理多種任務
VIP 模型微調 實戰
多任務微調:一個介面卡處理多種任務
為每個任務訓一個介面卡,維運會爆炸。合併訓練有技巧。
2026-08-26
12 分鐘
蒸餾:用大模型教出可上線的小模型
VIP 模型微調 實戰
蒸餾:用大模型教出可上線的小模型
把大模型的能力壓縮進小模型,是降低推論成本最有效的手段之一。
2026-08-24
12 分鐘
介面卡的線上管理:熱切換與多租戶服務
VIP 模型微調 實戰
介面卡的線上管理:熱切換與多租戶服務
同一個底座掛多個 LoRA 介面卡,是自架服務最划算的架構。
2026-08-22
11 分鐘
持續微調:模型上線後怎麼跟著資料一起長
VIP 模型微調 實戰
持續微調:模型上線後怎麼跟著資料一起長
訓練一次就結束的模型會逐漸過時。這是可持續的迭代機制。
2026-08-20
11 分鐘
災難性遺忘:微調後模型變笨了怎麼辦
免費 模型微調 實戰
災難性遺忘:微調後模型變笨了怎麼辦
專項任務變好、其他能力全面退化,是微調最典型的副作用。有幾個明確的緩解手段。
2026-08-19
10 分鐘
微調的成本回收分析:什麼時候真的省到錢
VIP 模型微調 實戰
微調的成本回收分析:什麼時候真的省到錢
把一次性成本與持續成本攤開,算出真正的損益平衡點。
2026-08-18
10 分鐘
偏好對齊入門:什麼情況下需要 DPO
免費 模型微調 實戰
偏好對齊入門:什麼情況下需要 DPO
監督式微調教模型「怎麼做」,偏好對齊教它「兩個都對時選哪個」。多數任務不需要。
2026-08-13
10 分鐘