视觉问答
視覺問答 (VQA) 讓系統回答有關圖像的自由形式的自然語言問題,例如「有多少人戴著帽子?」它需要共同理解圖片和問題才能得出正確的答案。
深入探討
視覺問答結合了電腦視覺和自然語言處理:給定圖像和問題,模型返回答案,可能是單字、短語或是/否回應。該任務因 VQA 資料集(Antol 等人,2015)及其改進的 VQA v2.0 版本而流行,該版本平衡了答案,以阻止模型僅根據文字進行猜測。系統對圖像和問題進行編碼,融合兩種表示,然後透過對固定答案詞彙進行分類來預測答案。如今,GPT-4V、LLaVA 和 PaLI 等大型視覺語言模型可以處理開放式 VQA,並對物件、屬性、計數、空間關係甚至圖像內寫入的文字進行推理。
技術洞察
典型的 VQA 模型對圖像(CNN 或視覺 Transformer)和問題(Transformer 文字編碼器)進行編碼,然後將它們融合,通常使用交叉注意力,以便問題詞專注於圖像區域。融合向量為常見答案提供分類器,或為開放式回應提供語言解碼器。一個已知的陷阱是語言偏差:模型可以利用答案統計數據並忽略圖像,而 VQA v2.0 等平衡資料集專門對此進行了反駁。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
視覺問答的未來
VQA 正在從簡答分類發展到帶有解釋的開放式、多步驟視覺推理。期望對計數、圖表、圖表和圖像中的文字(文件 VQA)進行更強大的處理,以及隨著時間的推移進行推理的影片 VQA。減少捷徑偏見和幻覺仍然是首要任務,將答案置於特定圖像區域以獲得信任也是如此。有能力的多模式助手將越來越多地透過電話、機器人和可幫助用戶詢問周圍環境的輔助工具以對話方式回答視覺問題。
現實世界的實施
讓盲人用戶拍攝產品並詢問“這是什麼味道?”或“有效期是哪一天?”
回答有關業務工作流程中的圖表、表單和掃描文件(文件 VQA)的問題
為零售和電子商務助理提供支持,以響應“這件夾克有風帽嗎?”來自產品照片
透過回答有關掃描或顯微鏡影像的有針對性的問題來支持醫學或科學影像審查
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Visual Question Answering quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Visual Question Answering?
視覺問答 (VQA) 讓系統回答有關圖像的自由形式的自然語言問題,例如「有多少人戴著帽子?」它需要共同理解圖片和問題才能得出正確的答案。
視覺問答系統採用哪兩個輸入?
VQA 取得影像和有關影像的問題,然後根據影像產生答案。
為什麼使用「平衡」答案來建立 VQA v2.0 資料集?
VQA v2.0 將問題與具有不同答案的圖像配對,迫使模型實際使用視覺輸入而不是利用文字統計資料。
VQA 中的「語言偏見」是什麼?
語言偏差是指模型利用與問題措詞相關的答案統計數據而不是查看圖像。
許多VQA模型如何結合影像和問題資訊?
VQA 模型對每種模態進行編碼並融合它們,經常使用交叉注意力,以便問題詞專注於相關的圖像區域。
經典的 VQA 系統通常透過做什麼來產生答案?
許多早期的 VQA 模型將任務視為最常見答案的分類,儘管現代模型會產生開放式文字。