GUIA visual de IA

Resposta visual a perguntas

O Visual Question Answering (VQA) permite que um sistema responda a perguntas de linguagem natural de formato livre sobre uma imagem, como 'Quantas pessoas estão usando chapéus?' Requer a compreensão conjunta da imagem e da pergunta para produzir uma resposta correta.

2 minutos de leituraÚltima atualização

Mergulho profundo

A resposta visual a perguntas combina visão computacional e processamento de linguagem natural: dada uma imagem e uma pergunta, o modelo retorna uma resposta, que pode ser uma única palavra, uma frase curta ou uma resposta sim/não. A tarefa foi popularizada pelo conjunto de dados VQA (Antol et al., 2015) e sua versão refinada VQA v2.0, que equilibrava as respostas para desencorajar os modelos de adivinhar apenas o texto. Os sistemas codificam a imagem e a pergunta, fundem as duas representações e então predizem uma resposta, historicamente classificando um vocabulário de resposta fixo. Hoje, grandes modelos de linguagem de visão como GPT-4V, LLaVA e PaLI lidam com VQA aberto, raciocínio sobre objetos, atributos, contagens, relações espaciais e até mesmo texto escrito dentro de imagens.

Visão Técnica

Um modelo VQA típico codifica a imagem (CNN ou transformador de visão) e a pergunta (codificador de texto do transformador) e, em seguida, as funde, geralmente com atenção cruzada, de modo que palavras interrogativas atendam às regiões da imagem. O vetor fundido alimenta um classificador de respostas comuns ou um decodificador de linguagem para respostas abertas. Uma armadilha conhecida é o preconceito de linguagem: os modelos podem explorar estatísticas de resposta e ignorar a imagem, o que é especificamente contrariado por conjuntos de dados equilibrados como o VQA v2.0.

Impacto Estratégico

Velocidade e escala

A IA visual pode automatizar tarefas de inspeção, detecção e marcação em grande escala.

Escolhas de construção

As equipes criativas podem criar protótipos de conceitos mais rapidamente e com menos revisões manuais.

Equipe e fluxo de trabalho

As operações podem usar sinais de imagem e vídeo que antes eram difíceis de processar.

O futuro da resposta visual a perguntas

O VQA está evoluindo da classificação de respostas curtas para um raciocínio visual aberto e de várias etapas com explicações. Conte com um manuseio mais robusto de contagem, gráficos, diagramas e texto em imagem (documento VQA), além de VQA de vídeo que raciocina ao longo do tempo. A redução do viés de atalho e das alucinações continua sendo uma prioridade, assim como fundamentar as respostas em regiões de imagem específicas para a confiança. Assistentes multimodais capazes responderão cada vez mais a perguntas visuais em conversação em telefones, em robótica e em ferramentas de acessibilidade que ajudam os usuários a interrogar o que está ao seu redor.

Implementação no mundo real

Permitir que usuários cegos fotografem um produto e perguntem 'Que sabor é esse?' ou 'Qual é a data de validade?'

Respondendo perguntas sobre gráficos, formulários e documentos digitalizados (documento VQA) em fluxos de trabalho empresariais

Capacitar assistentes de varejo e comércio eletrônico que respondam à pergunta 'Esta jaqueta tem capuz?' de uma foto de produto

Apoiar a revisão de imagens médicas ou científicas, respondendo a perguntas específicas sobre varreduras ou imagens microscópicas

Riscos e guarda-corpos

Os direitos de imagem e o consentimento podem tornar-se riscos legais se a proveniência não for clara.

O desempenho do modelo pode variar dependendo da iluminação, dados demográficos e ambientes.

Os falsos positivos podem passar despercebidos, a menos que os limites de confiança sejam monitorados.

Roteiro de implementação

1

Defina critérios de aceitação para precisão, recall e custos de erro.

2

Teste com dados que correspondam às condições reais de produção.

3

Adicione revisão humana para previsões de baixa confiança ou de alto impacto.

4

Rastreie o desvio do modelo e revalide após alterações na câmera ou no conjunto de dados.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual Question Answering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Visual Question Answering?

O Visual Question Answering (VQA) permite que um sistema responda a perguntas de linguagem natural de formato livre sobre uma imagem, como 'Quantas pessoas estão usando chapéus?' Requer a compreensão conjunta da imagem e da pergunta para produzir uma resposta correta.

Quais são as duas entradas que um sistema de resposta visual a perguntas recebe?

O VQA pega uma imagem e uma pergunta sobre ela e, em seguida, produz uma resposta baseada na imagem.

Por que o conjunto de dados VQA v2.0 foi criado com respostas “equilibradas”?

O VQA v2.0 combina perguntas com imagens que possuem respostas diferentes, forçando os modelos a realmente usar a entrada visual em vez de explorar estatísticas de texto.

O que é 'preconceito linguístico' no VQA?

O viés de linguagem ocorre quando um modelo explora estatísticas de respostas vinculadas à formulação de perguntas em vez de olhar para a imagem.

Quantos modelos VQA combinam informações de imagens e perguntas?

Os modelos VQA codificam cada modalidade e as fundem, frequentemente usando atenção cruzada para que palavras interrogativas atendam a regiões relevantes da imagem.

Os sistemas clássicos de VQA geralmente produziam respostas fazendo o quê?

Muitos modelos iniciais de VQA tratavam a tarefa como uma classificação das respostas mais frequentes, embora os modelos modernos gerem texto aberto.