Resposta visual a perguntas
O Visual Question Answering (VQA) permite que um sistema responda a perguntas de linguagem natural de formato livre sobre uma imagem, como 'Quantas pessoas estão usando chapéus?' Requer a compreensão conjunta da imagem e da pergunta para produzir uma resposta correta.
Mergulho profundo
A resposta visual a perguntas combina visão computacional e processamento de linguagem natural: dada uma imagem e uma pergunta, o modelo retorna uma resposta, que pode ser uma única palavra, uma frase curta ou uma resposta sim/não. A tarefa foi popularizada pelo conjunto de dados VQA (Antol et al., 2015) e sua versão refinada VQA v2.0, que equilibrava as respostas para desencorajar os modelos de adivinhar apenas o texto. Os sistemas codificam a imagem e a pergunta, fundem as duas representações e então predizem uma resposta, historicamente classificando um vocabulário de resposta fixo. Hoje, grandes modelos de linguagem de visão como GPT-4V, LLaVA e PaLI lidam com VQA aberto, raciocínio sobre objetos, atributos, contagens, relações espaciais e até mesmo texto escrito dentro de imagens.
Visão Técnica
Um modelo VQA típico codifica a imagem (CNN ou transformador de visão) e a pergunta (codificador de texto do transformador) e, em seguida, as funde, geralmente com atenção cruzada, de modo que palavras interrogativas atendam às regiões da imagem. O vetor fundido alimenta um classificador de respostas comuns ou um decodificador de linguagem para respostas abertas. Uma armadilha conhecida é o preconceito de linguagem: os modelos podem explorar estatísticas de resposta e ignorar a imagem, o que é especificamente contrariado por conjuntos de dados equilibrados como o VQA v2.0.
Impacto Estratégico
Velocidade e escala
A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.
Escolhas de construção
As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.
Equipe e fluxo de trabalho
As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.
O futuro da resposta visual a perguntas
O VQA está evoluindo da classificação de respostas curtas para um raciocínio visual aberto e de várias etapas com explicações. Conte com um manuseio mais robusto de contagem, gráficos, diagramas e texto em imagem (documento VQA), além de VQA de vídeo que raciocina ao longo do tempo. A redução do viés de atalho e das alucinações continua sendo uma prioridade, assim como fundamentar as respostas em regiões de imagem específicas para a confiança. Assistentes multimodais capazes responderão cada vez mais a perguntas visuais em conversação em telefones, em robótica e em ferramentas de acessibilidade que ajudam os usuários a interrogar o que está ao seu redor.
Implementação no mundo real
Permitir que usuários cegos fotografem um produto e perguntem 'Que sabor é esse?' ou 'Qual é a data de validade?'
Respondendo perguntas sobre gráficos, formulários e documentos digitalizados (documento VQA) em fluxos de trabalho empresariais
Capacitar assistentes de varejo e comércio eletrônico que respondam à pergunta 'Esta jaqueta tem capuz?' de uma foto de produto
Apoiar a revisão de imagens médicas ou científicas, respondendo a perguntas específicas sobre varreduras ou imagens microscópicas
Riscos e guarda-corpos
Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.
O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.
Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.
Roteiro de implementação
Defina critérios de aceitação para precisão, recall e custos de erro.
Teste com dados que correspondam às condições reais de produção.
Adicione revisão humana para previsões de baixa confiança ou de alto impacto.
Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Visual Question Answering quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Resposta a perguntas
Perguntas frequentes
What is Visual Question Answering?
O Visual Question Answering (VQA) permite que um sistema responda a perguntas de linguagem natural de formato livre sobre uma imagem, como 'Quantas pessoas estão usando chapéus?' Requer a compreensão conjunta da imagem e da pergunta para produzir uma resposta correta.
Quais são as duas entradas que um sistema de resposta visual a perguntas recebe?
O VQA pega uma imagem e uma pergunta sobre ela e, em seguida, produz uma resposta baseada na imagem.
Por que o conjunto de dados VQA v2.0 foi criado com respostas “equilibradas”?
O VQA v2.0 combina perguntas com imagens que possuem respostas diferentes, forçando os modelos a realmente usar a entrada visual em vez de explorar estatísticas de texto.
O que é 'preconceito linguístico' no VQA?
O viés de linguagem ocorre quando um modelo explora estatísticas de respostas vinculadas à formulação de perguntas em vez de olhar para a imagem.
Quantos modelos VQA combinam informações de imagens e perguntas?
Os modelos VQA codificam cada modalidade e as fundem, frequentemente usando atenção cruzada para que palavras interrogativas atendam a regiões relevantes da imagem.
Os sistemas clássicos de VQA geralmente produziam respostas fazendo o quê?
Muitos modelos iniciais de VQA tratavam a tarefa como uma classificação das respostas mais frequentes, embora os modelos modernos gerem texto aberto.