本地跑模型的最小環境:三個選擇與各自適合的人
不必先買顯示卡。依照你的目的,選對工具就能在筆電上開始。
「想在本地跑模型」背後其實有三種不同目的,對應三種工具,選錯會浪費很多時間。
目的一:試用與日常對話
想要一個能離線使用、換模型方便的介面。選擇桌面型工具:安裝後下載模型即可使用,不需要碰命令列。適合評估模型能力、處理不方便上雲的內容。
目的二:接進自己的程式
需要一個相容 OpenAI 格式的本地端點,讓既有程式改個 base_url 就能切換。
# 啟動本地服務後,程式端幾乎不用改
from openai import OpenAI
client = OpenAI(base_url='http://localhost:11434/v1', api_key='local')
resp = client.chat.completions.create(
model='qwen3:8b',
messages=[{'role': 'user', 'content': '用一句話解釋 KV 快取'}],
)目的三:正式服務
需要高吞吐、連續批次、前綴快取的推理引擎。這類工具設定較複雜、需要 GPU,但吞吐量與前兩者不在同一個級別。開發階段不要用它。
硬體的現實
- 8GB 記憶體:可跑 3B 級別的量化模型,堪用於簡單任務。
- 16GB:7–8B 量化模型,日常任務可用。
- 24GB 顯示記憶體:14B 級別量化模型,或 8B 未量化。
- CPU 推論可行但慢,適合離線批次,不適合互動。
先用 4-bit 量化的中型模型,不要一開始就追大模型。多數學習與開發任務,8B 級別已經足夠讓你把流程跑通。