視覺模型的評測:怎麼量「看對了沒有」
視覺任務的評測比純文字難,因為錯誤更隱蔽。這是可操作的方法。
視覺任務評測的困難在於:模型會用非常肯定的語氣描述不存在的東西,而評測者若沒有仔細核對原圖,很容易放過。
按任務型別選指標
- 欄位抽取:逐欄位的精確率與召回率,外加「整筆全對率」。後者才是業務關心的。
- 是非判斷:準確率,但要注意類別平衡。
- 描述生成:不能用文字相似度。改用「事實核對」——把描述拆成主張,逐條核對是否成立。
- 定位:IoU 或點擊命中率。
整筆全對率最重要
# 八個欄位各 95% 正確,整筆全對率只有 0.95^8 ≈ 66%
# 業務流程要的是整筆可用,所以要看這個數字
def exact_match_rate(preds, golds):
return sum(p == g for p, g in zip(preds, golds)) / len(golds)描述類任務的事實核對
CHECK = '''把下列描述拆解成獨立的事實主張,每條標註是否能從圖片驗證。
描述:{desc}
對每條主張輸出:
{"claim": "...", "verdict": "supported|contradicted|not_verifiable"}
注意:只依據圖片內容判斷,不要依據常識推測。'''
# 幻覺率 = contradicted 與 not_verifiable 的比例評測集要包含的困難樣本
- 低光源、反光、模糊。
- 傾斜、部分遮擋、裁切不全。
- 手寫內容與印刷混合。
- 格式變體——同一種單據的不同版本。
- 負樣本:圖中根本沒有目標資訊,正確答案是「找不到」。
負樣本是最常缺的
只用「圖中確實有答案」的樣本評測,測不出模型的幻覺傾向。負樣本應該佔評測集的兩到三成,並單獨統計「正確棄答率」。
人工評測的效率化
- 介面要把原圖與模型輸出並排顯示,並支援放大。
- 欄位抽取任務把預測值疊在原圖對應位置上,核對速度快很多。
- 用鍵盤快捷鍵,一筆的核對時間可以壓到幾秒。
把「模型答對但理由錯」也記錄下來。這類案例在評測分數上是對的,但它預示著在稍微不同的輸入上會出錯。
訂閱後繼續閱讀全文
本篇為訂閱者專屬內容。訂閱後可取得下列權限:
- 解鎖全部內容權限
- 閱讀不限篇數
- 全站移除廣告
月卡
NT$240
開通 30 天
一次付清,開通 30 天
季卡
NT$620
開通 90 天
一次付清,開通 90 天,每天約 NT$7
年卡
NT$2,160
開通 365 天
一次付清,開通 365 天,每天約 NT$6
一次性付款,付款成功後立即開通,到期自動結束,不會再次扣款,也不需要取消訂閱。
立即訂閱
金額均為新臺幣(TWD),即實際扣款金額,不另收手續費
支援信用卡 · Apple Pay · Google Pay · WebATM · ATM 轉帳
購買須知與退款政策