AI 實作學院
AILAB
首頁
教程總覽
VIP 專區
訂閱方案
關於
Catalog
多模態應用
影像、語音與文件理解的實作,含 OCR、版面解析與跨模態檢索。
全部主題
提示工程
RAG 檢索增強
Agent 開發
模型微調
部署與推理優化
資料處理與評測
多模態應用
工具與工作流
不限
免費
VIP 專屬
全難度
入門
進階
實戰
符合條件:3 篇
免費
多模態應用
入門
圖片進模型前該做什麼:解析度、格式與 token 成本
同一張圖,處理方式不同,成本可以差三倍。這篇講清楚前處理的取捨。
2026-08-27
8 分鐘
免費
多模態應用
入門
視覺問答的提示技巧:讓模型看它該看的地方
同一張圖,問法不同結果差很多。這幾個技巧能明顯提升準確率。
2026-08-16
7 分鐘
免費
多模態應用
入門
多模態應用的成本結構:圖片比文字貴在哪
一張圖等於多少 token?搞清楚計費邏輯,成本才控制得住。
2026-08-10
7 分鐘