Voltar às notícias
InovaçãoInstruções AI Understanding

ReVA usa regiões de imagem para reduzir alucinações visuais em modelos de resposta a perguntas

Um novo sistema visual de resposta a perguntas com reconhecimento de região relata uma melhoria modesta na detecção de reivindicações de objetos não suportadas, fornecendo a um modelo de linguagem evidências visuais de imagem inteira e de nível de região.

5 min readRead the primary source
Source-provided image accompanying ReVA uses image regions to reduce visual hallucinations in question-answering models
Documento de origem primáriaFonte registrada
Editora
arxiv.org
Link da fonte
arxiv.orghttps://arxiv.org/abs/2608.28707
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Modelo de linguagem grande (LLM)
Um modelo de linguagem treinado em corpora de texto massivo para gerar e analisar texto.
Memória (memória do agente)
Contexto armazenado que um agente de IA usa em etapas ou sessões para melhorar a continuidade.
Visão Computacional
O ramo da IA ​​que extrai significado de imagens e vídeos.
Teste você mesmoQuestionário explicado sobre modelos de IA

O que aconteceu

Um artigo apresenta o ReVA, um modelo visual de resposta a perguntas projetado para melhorar o raciocínio espacial e a compreensão visual refinada. Ele combina representações de imagens inteiras com evidências de regiões de imagens identificadas automaticamente antes de gerar uma resposta.

O artigo, submetido ao arXiv em 27 de agosto de 2026, apresenta o ReVA como um sistema visual de resposta a perguntas com reconhecimento de região. Seu objetivo declarado é solucionar falhas em modelos multimodais de linguagem grande que exigem raciocínio espacial preciso ou interpretação visual refinada. Os autores descrevem essas falhas como alucinações de objetos, atributos e espaciais: respostas que são expressas com confiança, mas não são visualmente apoiadas pela imagem de entrada.

A fonte identifica Anoop Senthil como autor e classifica o trabalho em computação e linguagem e visão computacional. ReVA conecta um transformador de visão CLIP ViT-L/14 congelado com o modelo de linguagem grande Qwen2.5-7B-Instruct por meio do que o artigo chama de ponte dupla. Uma ponte converte os recursos finais do bloco transformador em tokens de imagem que representam a imagem como um todo.

O outro converte recursos recortados de camadas intermediárias do transformador de visão em tokens de região para cada caixa delimitadora. A justificativa do artigo é que as camadas anteriores podem preservar as informações de textura, enquanto as camadas posteriores fornecem dicas mais fortes no nível do objeto. Ambos os tipos de tokens são então colocados antes da entrada do modelo de linguagem como um prefixo de prompt, permitindo que o modelo use contexto em nível de cena e evidências mais localizadas juntos.

O sistema obtém suas regiões através de uma pilha de detectores que fornece caixas delimitadoras automáticas de disparo zero. De acordo com a fonte, a pilha usa RAM++, spaCy e Grounding DINO, com caixas independentes e dependentes de perguntas. O ReVA foi avaliado em VQAv2, MMBench, POPE e SEED-Bench. O resumo fornece uma comparação direta: o ReVA alcançou 82,85% de F1 médio no POPE, em comparação com 81,14% para uma linha de base de token de imagem que não usava tokens de região. O artigo diz que esses resultados demonstram redução da alucinação de objetos e melhor fundamentação factual, mas a fonte não fornece tabelas de referência completas ou detalhes experimentais.

Detalhes da fonte: arxiv.org ↗

Por que isso importa

O trabalho aborda um modo de falha específico na IA multimodal: descrever com segurança objetos, atributos ou relações espaciais que não são suportados por uma imagem. A melhoria relatada é limitada, mas aponta para uma escolha prática de design para reduzir as alucinações com objetos.

O significado central não é uma afirmação geral de que a IA multimodal está resolvida, mas uma resposta direcionada a um problema de confiabilidade conhecido. Um modelo pode reconhecer o conteúdo amplo de uma imagem e ainda assim responder incorretamente sobre um pequeno objeto, um atributo ou um relacionamento entre objetos. O design do ReVA faz com que o modelo processe explicitamente a evidência visual localizada, em vez de depender apenas de uma representação compactada da imagem inteira. Essa é uma abordagem arquitetônica concreta para um problema que afeta a confiabilidade dos assistentes visuais para perguntas detalhadas.

O resultado POPE relatado sugere que a adição de tokens em nível de região pode melhorar a resistência a declarações de objetos não suportadas. A diferença entre 82,85% e 81,14% da média F1 é de 1,71 ponto percentual na comparação descrita pela fonte. Esta é uma melhoria mensurável, mas não é evidência de ampla confiabilidade em todas as tarefas visuais. O resultado é melhor entendido como uma indicação inicial de que uma fundamentação mais explícita pode ajudar em pelo menos uma configuração de avaliação.

A fonte não estabelece se o ganho vem principalmente da ponte de região, da pilha de detectores, do modelo de linguagem subjacente ou das interações entre esses componentes. Se a abordagem for generalizada, o processamento com reconhecimento de região poderá ser útil em aplicações onde as respostas dependem de partes específicas de uma imagem, em vez do reconhecimento geral da cena. O documento não documenta um produto implantado, uma aplicação clínica ou industrial, ou um estudo de usuário, portanto os benefícios práticos permanecem prospectivos.

Seu valor mais amplo é metodológico: dá aos pesquisadores uma maneira de testar se a adição de evidências visuais localizadas altera a factualidade e o comportamento de alucinação. Esse foco também pode tornar o sistema relevante para futuras avaliações de assistentes multimodais, desde que os ganhos relatados sobrevivam aos testes de dados e tipos de tarefas adicionais.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

O que assistir a seguir

O artigo relata resultados em vários benchmarks, mas o resumo fornece uma comparação numérica detalhada apenas para o POPE. Incógnitas importantes incluem o desempenho em imagens do mundo real, a contribuição de cada detector e ponte, custos computacionais e se o método permanece confiável fora das condições de referência.

A primeira questão a observar é a reprodutibilidade independente. A fonte diz que o código está associado ao papel, mas o texto fornecido não fornece endereço de repositório funcional, licença, instruções de implementação ou pesos treinados. Esses detalhes ajudariam a determinar se a comparação reportada pode ser repetida e se a linha de base foi correspondida de forma justa.

A fonte também não indica o número de imagens ou perguntas usadas, a variação entre as execuções ou se a melhoria foi testada estatisticamente. Uma segunda questão é o papel das propostas regionais automáticas. ReVA depende de RAM++, spaCy e Grounding DINO para produzir caixas delimitadoras, incluindo caixas que são independentes ou dependentes de perguntas. O resumo não diz com que frequência essas caixas perdem objetos relevantes, incluem áreas irrelevantes, se sobrepõem incorretamente ou introduzem erros próprios.

Ele também não relata resultados de ablação mostrando como o desempenho muda quando detectores individuais, camadas de recursos, pontes ou contagens de tokens são removidos. Essas medições são necessárias para compreender o custo do método e a origem de seus ganhos. Finalmente, as evidências relatadas não devem ser tratadas como prova de assistência visual confiável em ambientes abertos. A fonte nomeia quatro benchmarks, mas fornece um resultado numérico detalhado apenas para o POPE e não descreve o desempenho em pontos de vista incomuns, cenas desordenadas, pequenos objetos, questões ambíguas ou imagens diferentes dos dados de avaliação.

Também não relata latência, uso de memória, custo de inferência, acessibilidade, testes de segurança ou experiência de implantação. Trabalhos futuros deverão esclarecer se as representações com reconhecimento de região reduzem as alucinações sem criar novos erros, e se a melhoria continua útil quando as questões exigem relações espaciais complexas em vez da presença de objetos.

Guias e questionários relacionados

Modelos de IA explicadosTransformadoresChatGPT e LLMTreinamento de IATeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?