Catalog

部署與推理優化

量化、批次處理、KV 快取與服務化,把延遲與成本壓到可上線的水準。

符合條件:12 篇
推理延遲的組成:先知道時間花在哪裡
免費 部署與推理優化 入門
推理延遲的組成:先知道時間花在哪裡
優化之前先拆解。多數團隊優化錯地方,是因為沒量過各段耗時。
2026-08-29
8 分鐘
連續批次處理:吞吐量提升最大的一個開關
免費 部署與推理優化 進階
連續批次處理:吞吐量提升最大的一個開關
同樣的硬體,開啟連續批次後吞吐量常常翻好幾倍。理解它為什麼有效。
2026-08-26
9 分鐘
前綴快取:把重複的系統提示只算一次
免費 部署與推理優化 進階
前綴快取:把重複的系統提示只算一次
如果你的每個請求都帶著兩千字的系統提示,前綴快取幾乎是免費的加速。
2026-08-24
8 分鐘
量化怎麼選:INT8、FP8 與 4-bit 的實際差異
免費 部署與推理優化 進階
量化怎麼選:INT8、FP8 與 4-bit 的實際差異
量化能省記憶體也能加速,但不同精度的取捨很不一樣。這篇給選擇順序。
2026-08-22
9 分鐘
串流回應的正確實作:SSE 與中途中斷
免費 部署與推理優化 入門
串流回應的正確實作:SSE 與中途中斷
串流不只是把字吐出來,還要處理中斷、錯誤與部分結果的保存。
2026-08-20
7 分鐘
模型服務的健康檢查:光看行程還活著不夠
免費 部署與推理優化 進階
模型服務的健康檢查:光看行程還活著不夠
模型服務可以「行程還在但已經不能用」。健康檢查必須做真實推論。
2026-08-18
8 分鐘
自架還是用 API:把成本算清楚再決定
免費 部署與推理優化 實戰
自架還是用 API:把成本算清楚再決定
自架的成本不只是顯示卡租金。這篇把常被忽略的項目列出來一起算。
2026-08-16
10 分鐘
限流與排隊:流量尖峰時怎麼不整個垮掉
免費 部署與推理優化 進階
限流與排隊:流量尖峰時怎麼不整個垮掉
模型服務的資源無法瞬間擴充,所以入口的排隊策略比擴容更重要。
2026-08-14
8 分鐘
把模型服務包成 Docker:一份可用的基礎設定
免費 部署與推理優化 入門
把模型服務包成 Docker:一份可用的基礎設定
GPU 容器化有幾個固定要處理的點,這是可以直接改用的骨架。
2026-08-12
7 分鐘
灰度發布模型版本:怎麼安全地換模型
免費 部署與推理優化 進階
灰度發布模型版本:怎麼安全地換模型
換模型跟改程式不一樣,行為變化沒辦法用單元測試涵蓋。要靠流量分配。
2026-08-10
9 分鐘
語意快取:相似問題直接回舊答案,可以嗎
免費 部署與推理優化 進階
語意快取:相似問題直接回舊答案,可以嗎
語意快取能省下大量成本,但誤命中的代價很高。要有明確的適用邊界。
2026-08-08
8 分鐘
模型路由:用小模型接住八成流量
免費 部署與推理優化 實戰
模型路由:用小模型接住八成流量
不是每個請求都需要最貴的模型。路由做得好,成本可以砍掉一半以上。
2026-08-06
10 分鐘