视觉问答
视觉问答 (VQA) 让系统回答有关图像的自由形式的自然语言问题,例如“有多少人戴着帽子?”它需要共同理解图片和问题才能得出正确的答案。
深入探讨
视觉问答结合了计算机视觉和自然语言处理:给定图像和问题,模型返回答案,可能是单个单词、短语或是/否响应。该任务因 VQA 数据集(Antol 等人,2015)及其改进的 VQA v2.0 版本而流行,该版本平衡了答案,以阻止模型仅根据文本进行猜测。系统对图像和问题进行编码,融合两种表示,然后通过对固定答案词汇进行分类来预测答案。如今,GPT-4V、LLaVA 和 PaLI 等大型视觉语言模型可以处理开放式 VQA,对对象、属性、计数、空间关系甚至图像内写入的文本进行推理。
技术洞察
典型的 VQA 模型对图像(CNN 或视觉 Transformer)和问题(Transformer 文本编码器)进行编码,然后将它们融合,通常使用交叉注意力,以便问题词关注图像区域。融合向量为常见答案提供分类器,或为开放式回复提供语言解码器。一个已知的陷阱是语言偏差:模型可以利用答案统计数据并忽略图像,而 VQA v2.0 等平衡数据集专门对此进行了反驳。
战略影响
速度与规模
视觉人工智能可以大规模自动化检查、检测和标记任务。
构建选择
创意团队可以通过更少的手动修改更快地构建概念原型。
团队与工作流程
操作可以使用以前难以处理的图像和视频信号。
视觉问答的未来
VQA 正在从简答分类发展到带有解释的开放式、多步骤视觉推理。期望对计数、图表、图表和图像中的文本(文档 VQA)进行更强大的处理,以及随着时间的推移进行推理的视频 VQA。减少捷径偏见和幻觉仍然是首要任务,将答案置于特定图像区域以获得信任也是如此。有能力的多模式助手将越来越多地通过电话、机器人和可帮助用户询问周围环境的辅助工具以对话方式回答视觉问题。
现实世界的实施
让盲人用户拍摄产品并询问“这是什么味道?”或“有效期是哪一天?”
回答有关业务工作流程中的图表、表单和扫描文档(文档 VQA)的问题
为零售和电子商务助理提供支持,以响应“这件夹克有风帽吗?”来自产品照片
通过回答有关扫描或显微镜图像的有针对性的问题来支持医学或科学图像审查
风险与防护栏
如果出处不明,肖像权和同意可能会成为法律风险。
模型性能可能因光照、人口统计和环境的不同而有所不同。
除非监控置信阈值,否则误报可能会被忽视。
实施路线图
定义精确度、召回率和错误成本的接受标准。
使用符合实际生产条件的数据进行测试。
为低置信度或高影响力的预测添加人工审核。
跟踪模型漂移并在相机或数据集更改后重新验证。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Visual Question Answering quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是视觉问答?
视觉问答 (VQA) 让系统回答有关图像的自由形式的自然语言问题,例如“有多少人戴着帽子?”它需要共同理解图片和问题才能得出正确的答案。
视觉问答系统采用哪两个输入?
VQA 获取图像和有关图像的问题,然后根据图像生成答案。
为什么使用“平衡”答案创建 VQA v2.0 数据集?
VQA v2.0 将问题与具有不同答案的图像配对,迫使模型实际使用视觉输入而不是利用文本统计数据。
VQA 中的“语言偏见”是什么?
语言偏差是指模型利用与问题措辞相关的答案统计数据而不是查看图像。
许多VQA模型如何结合图像和问题信息?
VQA 模型对每种模态进行编码并融合它们,经常使用交叉注意力,以便问题词关注相关的图像区域。
经典的 VQA 系统通常通过做什么来产生答案?
许多早期的 VQA 模型将任务视为对最常见答案的分类,尽管现代模型会生成开放式文本。