Catalog

多模態應用

影像、語音與文件理解的實作,含 OCR、版面解析與跨模態檢索。

符合條件:14 篇
文件處理管線的完整實作:從掃描件到可查詢的知識庫
VIP 多模態應用 實戰
文件處理管線的完整實作:從掃描件到可查詢的知識庫
把版面解析、OCR、表格抽取與索引串成一條可維運的管線。
2026-08-28
13 分鐘
圖片進模型前該做什麼:解析度、格式與 token 成本
免費 多模態應用 入門
圖片進模型前該做什麼:解析度、格式與 token 成本
同一張圖,處理方式不同,成本可以差三倍。這篇講清楚前處理的取捨。
2026-08-27
8 分鐘
視覺模型的評測:怎麼量「看對了沒有」
VIP 多模態應用 實戰
視覺模型的評測:怎麼量「看對了沒有」
視覺任務的評測比純文字難,因為錯誤更隱蔽。這是可操作的方法。
2026-08-26
11 分鐘
跨模態檢索的實作:以圖找文、以文找圖
VIP 多模態應用 實戰
跨模態檢索的實作:以圖找文、以文找圖
把圖片與文字放進同一個向量空間,需要注意的細節比想像中多。
2026-08-24
11 分鐘
文件理解流程:OCR、版面解析與模型各自負責什麼
免費 多模態應用 進階
文件理解流程:OCR、版面解析與模型各自負責什麼
把整份 PDF 丟給視覺模型不是最好的做法。分工的流程更準也更便宜。
2026-08-24
9 分鐘
即時視訊分析:串流場景的架構取捨
VIP 多模態應用 實戰
即時視訊分析:串流場景的架構取捨
把視覺模型接上攝影機串流,成本與延遲都需要重新設計。
2026-08-22
10 分鐘
從圖片抽取結構化資料:發票與表單的實作模式
免費 多模態應用 進階
從圖片抽取結構化資料:發票與表單的實作模式
單據辨識不要用自由問答,用 schema 約束加上欄位驗證。
2026-08-22
8 分鐘
語音轉文字之後:標點、分段與講者辨識
免費 多模態應用 進階
語音轉文字之後:標點、分段與講者辨識
原始逐字稿幾乎不能直接用。後處理決定了它的實用價值。
2026-08-20
8 分鐘
圖文混合檢索:讓 RAG 也能搜到圖表
免費 多模態應用 實戰
圖文混合檢索:讓 RAG 也能搜到圖表
技術文件的關鍵資訊常常在圖表裡。純文字 RAG 會整個漏掉。
2026-08-18
10 分鐘
視覺問答的提示技巧:讓模型看它該看的地方
免費 多模態應用 入門
視覺問答的提示技巧:讓模型看它該看的地方
同一張圖,問法不同結果差很多。這幾個技巧能明顯提升準確率。
2026-08-16
7 分鐘
影片理解的取樣策略:不要每一幀都送
免費 多模態應用 進階
影片理解的取樣策略:不要每一幀都送
影片內容分析的成本主要來自幀數。取樣策略決定了成本與品質。
2026-08-14
8 分鐘
圖片生成接進產品:提示、種子與版權的三個現實問題
免費 多模態應用 進階
圖片生成接進產品:提示、種子與版權的三個現實問題
生成圖不難,難的是穩定、可重現與可商用。
2026-08-12
8 分鐘
多模態應用的成本結構:圖片比文字貴在哪
免費 多模態應用 入門
多模態應用的成本結構:圖片比文字貴在哪
一張圖等於多少 token?搞清楚計費邏輯,成本才控制得住。
2026-08-10
7 分鐘
多模態輸出的驗證:怎麼確認模型真的看懂了
免費 多模態應用 進階
多模態輸出的驗證:怎麼確認模型真的看懂了
視覺任務的錯誤特別隱蔽,因為輸出看起來永遠很合理。
2026-08-08
9 分鐘