自架還是用 API:把成本算清楚再決定
自架的成本不只是顯示卡租金。這篇把常被忽略的項目列出來一起算。
「自架比較便宜」通常是只算了 GPU 租金。把完整成本攤開之後,臨界點往往比想像中高很多。
自架的真實成本項目
- GPU 執行個體費用——要按 24 小時計,不是只算有流量的時段。
- 備援與多可用區,至少乘以 1.5 到 2。
- 模型權重的儲存與傳輸。
- 維運人力:升版、監控、值班、故障排除。
- 尖峰擴容的緩衝容量,平時是閒置成本。
粗算臨界點
# API 月費用
api_cost = 月請求數 × (平均輸入 tok × 輸入單價 + 平均輸出 tok × 輸出單價)
# 自架月費用
self_cost = GPU 台數 × 單價 × 720 小時 × 備援係數 + 人力攤提
# 自架划算的條件(且假設利用率夠高)
self_cost < api_cost自架真正的優勢常不是價錢
- 資料不出境:法遵或客戶合約要求。
- 延遲可控:不受第三方尖峰影響。
- 可以微調並自由部署介面卡。
- 版本穩定:不會被上游無預警換模型。
混合是常見解
實務上很多團隊採混合:高頻、固定格式的任務用自架小模型;低頻、需要強推理的任務打 API。這樣既壓住主要成本,又保留能力上限。
決定之前先量三個數字:日請求量、平均輸入輸出長度、尖峰與離峰的倍數。沒有這三個數字,任何比較都是猜測。