AI 實作學院
AILAB
首頁
教程總覽
VIP 專區
訂閱方案
關於
Catalog
部署與推理優化
量化、批次處理、KV 快取與服務化,把延遲與成本壓到可上線的水準。
全部主題
提示工程
RAG 檢索增強
Agent 開發
模型微調
部署與推理優化
資料處理與評測
多模態應用
工具與工作流
不限
免費
VIP 專屬
全難度
入門
進階
實戰
符合條件:12 篇
免費
部署與推理優化
入門
推理延遲的組成:先知道時間花在哪裡
優化之前先拆解。多數團隊優化錯地方,是因為沒量過各段耗時。
2026-08-29
8 分鐘
免費
部署與推理優化
進階
連續批次處理:吞吐量提升最大的一個開關
同樣的硬體,開啟連續批次後吞吐量常常翻好幾倍。理解它為什麼有效。
2026-08-26
9 分鐘
免費
部署與推理優化
進階
前綴快取:把重複的系統提示只算一次
如果你的每個請求都帶著兩千字的系統提示,前綴快取幾乎是免費的加速。
2026-08-24
8 分鐘
免費
部署與推理優化
進階
量化怎麼選:INT8、FP8 與 4-bit 的實際差異
量化能省記憶體也能加速,但不同精度的取捨很不一樣。這篇給選擇順序。
2026-08-22
9 分鐘
免費
部署與推理優化
入門
串流回應的正確實作:SSE 與中途中斷
串流不只是把字吐出來,還要處理中斷、錯誤與部分結果的保存。
2026-08-20
7 分鐘
免費
部署與推理優化
進階
模型服務的健康檢查:光看行程還活著不夠
模型服務可以「行程還在但已經不能用」。健康檢查必須做真實推論。
2026-08-18
8 分鐘
免費
部署與推理優化
實戰
自架還是用 API:把成本算清楚再決定
自架的成本不只是顯示卡租金。這篇把常被忽略的項目列出來一起算。
2026-08-16
10 分鐘
免費
部署與推理優化
進階
限流與排隊:流量尖峰時怎麼不整個垮掉
模型服務的資源無法瞬間擴充,所以入口的排隊策略比擴容更重要。
2026-08-14
8 分鐘
免費
部署與推理優化
入門
把模型服務包成 Docker:一份可用的基礎設定
GPU 容器化有幾個固定要處理的點,這是可以直接改用的骨架。
2026-08-12
7 分鐘
免費
部署與推理優化
進階
灰度發布模型版本:怎麼安全地換模型
換模型跟改程式不一樣,行為變化沒辦法用單元測試涵蓋。要靠流量分配。
2026-08-10
9 分鐘
免費
部署與推理優化
進階
語意快取:相似問題直接回舊答案,可以嗎
語意快取能省下大量成本,但誤命中的代價很高。要有明確的適用邊界。
2026-08-08
8 分鐘
免費
部署與推理優化
實戰
模型路由:用小模型接住八成流量
不是每個請求都需要最貴的模型。路由做得好,成本可以砍掉一半以上。
2026-08-06
10 分鐘