免費全文 多模態應用 入門

視覺問答的提示技巧:讓模型看它該看的地方

同一張圖,問法不同結果差很多。這幾個技巧能明顯提升準確率。

多模態應用教程封面

視覺模型會被圖中最顯眼的元素吸引。如果你要問的是角落的小字,需要明確引導。

四個實用技巧

  1. 指定區域:「圖片右下角的表格中……」比「這張圖裡的數字」準得多。
  2. 先描述再回答:要求模型先列出看到的內容,再回答問題,能減少憑印象作答。
  3. 明確可以說看不到:給出「若圖片中無此資訊,回答 not_visible」的選項。
  4. 一次問一件事:一個提示問五個問題,後面幾個的品質會明顯下降。
步驟一:列出圖中所有可讀的文字,包含位置(上/中/下、左/右)。
步驟二:根據列出的文字回答問題。若問題涉及的資訊未出現在步驟一,
        answer 一律填 "not_visible"。

問題:發票的統一編號是多少?

輸出:{"observed": [...], "answer": "..."}

裁切往往比提示有效

如果你已經知道資訊在哪個區域,直接裁切那塊送進去。這比任何提示技巧都有效,而且更便宜。版面固定的單據尤其適合。

多張圖的比較

要比較兩張圖時,明確標號並要求逐項對照,例如「圖 A 與圖 B 的差異,請依項目列出」。不標號時模型常常會混淆兩張圖的內容。

observed 欄位存進日誌。答錯時你能立刻分辨是「沒看到」還是「看到了但推理錯」,這兩種問題的修法完全不同。
下一步

這個主題還有更深入的實戰教程

VIP 專區收錄 50 篇進階內容:架構設計、生產環境取捨、成本與合規。 每週五新增 3 篇。

看訂閱方案 → 先逛逛 VIP 專區