VIP 專屬 部署與推理優化 實戰

邊緣與本地部署:離線環境的模型服務

不能連外網的環境有自己的一套限制。這是實務上的取捨。

部署與推理優化教程封面

製造現場、醫療機構、政府單位常有「資料不得出網」的要求。這類環境的模型部署,限制與雲端完全不同:硬體固定、無法臨時擴容、更新困難、沒有維運人員。

設計原則因此轉向:在有限硬體上穩定運作,而不是追求最佳效能。

模型選擇的取捨

  • 優先選能在目標硬體上以充裕餘裕執行的尺寸,不要塞到極限。
  • 量化幾乎是必然選擇,但要在目標硬體上實測,不能只看規格。
  • 偏好單一模型完成多任務,而不是部署多個專用模型——維運成本是主要考量。

更新機制

# 離線更新包的結構
update-2026.08/
  manifest.json        # 版本、雜湊、相依、最低硬體需求
  model/               # 權重
  adapters/            # 介面卡
  prompts/             # 提示檔
  migrations/          # 資料庫或設定的遷移腳本
  rollback.sh          # 一鍵回滾
  CHECKSUM.sha256

離線環境的更新必須是原子的、可驗證的、可回滾的。現場沒有工程師能除錯,更新失敗就是服務中斷。

資源限制下的降級

import psutil

def pick_config():
    free_gb = psutil.virtual_memory().available / 1e9
    if free_gb > 24:  return {'model': '14b-q4', 'ctx': 8192, 'batch': 4}
    if free_gb > 12:  return {'model': '8b-q4',  'ctx': 4096, 'batch': 2}
    return                   {'model': '3b-q4',  'ctx': 2048, 'batch': 1}

沒有網路的可觀測性

  • 日誌寫本地,設定輪替與大小上限(磁碟滿了會讓整台機器掛掉)。
  • 提供一鍵匯出診斷包的功能,讓現場人員能把資料帶出來給你分析。
  • 關鍵指標寫入本地檔案,並提供簡易的本地儀表板頁面。

預期會遇到的問題

  1. 硬體老舊且不一致:每個站點的規格可能都不同,要有自動偵測與降級。
  2. 沒有 GPU:CPU 推論要接受數秒的延遲,介面設計要配合(非同步、批次)。
  3. 現場沒人懂技術:所有操作要能用一個腳本或一個按鈕完成。
  4. 難以取得日誌:診斷包的設計要在第一版就做。
離線部署前,先在一台刻意降規、斷網的機器上完整安裝一次。你會發現一堆隱藏的網路相依——套件安裝、字型下載、憑證驗證。
🔒

訂閱後繼續閱讀全文

本篇為訂閱者專屬內容。訂閱後可取得下列權限:

  • 解鎖全部內容權限
  • 閱讀不限篇數
  • 全站移除廣告
月卡
NT$240
開通 30 天
一次付清,開通 30 天
季卡
NT$620
開通 90 天
一次付清,開通 90 天,每天約 NT$7
年卡
NT$2,160
開通 365 天
一次付清,開通 365 天,每天約 NT$6

一次性付款,付款成功後立即開通,到期自動結束,不會再次扣款,也不需要取消訂閱。

立即訂閱

金額均為新臺幣(TWD),即實際扣款金額,不另收手續費
支援信用卡 · Apple Pay · Google Pay · WebATM · ATM 轉帳
購買須知與退款政策