Réponse visuelle aux questions
La réponse visuelle aux questions (VQA) permet à un système de répondre à des questions libres en langage naturel sur une image, telles que « Combien de personnes portent des chapeaux ? » Cela nécessite une compréhension conjointe de l’image et de la question pour produire une réponse correcte.
Plongée profonde
Visual Question Answering combine la vision par ordinateur et le traitement du langage naturel : étant donné une image et une question, le modèle renvoie une réponse, qui peut être un seul mot, une phrase courte ou une réponse oui/non. La tâche a été popularisée par l'ensemble de données VQA (Antol et al., 2015) et sa version raffinée VQA v2.0, qui équilibrait les réponses pour décourager les modèles de deviner à partir du seul texte. Les systèmes codent l'image et la question, fusionnent les deux représentations, puis prédisent une réponse, historiquement en classant sur un vocabulaire de réponse fixe. Aujourd'hui, les grands modèles de langage de vision comme GPT-4V, LLaVA et PaLI gèrent le VQA ouvert, raisonnant sur les objets, les attributs, les décomptes, les relations spatiales et même le texte écrit dans les images.
Aperçu technique
Un modèle VQA typique encode l'image (CNN ou transformateur de vision) et la question (encodeur de texte de transformateur), puis les fusionne, souvent avec une attention croisée, afin que les mots interrogatifs se concentrent sur les régions de l'image. Le vecteur fusionné alimente un classificateur sur les réponses communes ou un décodeur de langage pour les réponses ouvertes. Un piège connu est le biais linguistique : les modèles peuvent exploiter les statistiques de réponse et ignorer l'image, ce que contrent spécifiquement les ensembles de données équilibrés comme VQA v2.0.
Impact stratégique
Vitesse et échelle
L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.
Choix de construction
Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.
Équipe et flux de travail
Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.
L'avenir de la réponse visuelle aux questions
VQA évolue d'une classification à réponses courtes vers un raisonnement visuel ouvert en plusieurs étapes avec des explications. Attendez-vous à une gestion plus efficace du comptage, des graphiques, des diagrammes et du texte dans l'image (document VQA), ainsi qu'à une vidéo VQA qui raisonne au fil du temps. Réduire les biais de raccourci et les hallucinations reste une priorité, tout comme l’ancrage des réponses dans des régions d’image spécifiques pour la confiance. Des assistants multimodaux performants répondront de plus en plus à des questions visuelles de manière conversationnelle sur les téléphones, dans la robotique et dans les outils d'accessibilité qui aident les utilisateurs à interroger leur environnement.
Mise en œuvre dans le monde réel
Permettre aux utilisateurs aveugles de photographier un produit et de demander « De quelle saveur s'agit-il ? ou "Quelle est la date d'expiration ?"
Répondre aux questions sur les graphiques, les formulaires et les documents numérisés (document VQA) dans les flux de travail métier
Alimenter les assistants de vente au détail et de commerce électronique qui répondent à la question « Cette veste a-t-elle une capuche ? » à partir d'une photo de produit
Soutenir l'examen d'images médicales ou scientifiques en répondant à des questions ciblées sur les images scannées ou microscopiques
Risques et garde-fous
Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.
Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.
Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.
Feuille de route de mise en œuvre
Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.
Testez avec des données qui correspondent aux conditions de production réelles.
Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.
Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Visual Question Answering quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Réponse aux questions
Questions fréquemment posées
What is Visual Question Answering?
La réponse visuelle aux questions (VQA) permet à un système de répondre à des questions libres en langage naturel sur une image, telles que « Combien de personnes portent des chapeaux ? » Cela nécessite une compréhension conjointe de l’image et de la question pour produire une réponse correcte.
Quelles sont les deux entrées nécessaires à un système de réponse visuelle aux questions ?
VQA prend à la fois une image et une question à son sujet, puis produit une réponse fondée sur l'image.
Pourquoi l'ensemble de données VQA v2.0 a-t-il été créé avec des réponses « équilibrées » ?
VQA v2.0 associe des questions à des images ayant des réponses différentes, obligeant les modèles à utiliser réellement l'entrée visuelle plutôt que d'exploiter les statistiques textuelles.
Qu'est-ce que le « biais linguistique » dans VQA ?
Le biais linguistique se produit lorsqu'un modèle exploite les statistiques de réponses liées à la formulation des questions au lieu de regarder l'image.
Comment de nombreux modèles VQA combinent-ils les informations sur les images et les questions ?
Les modèles VQA codent chaque modalité et les fusionnent, en utilisant fréquemment une attention croisée afin que les mots interrogatifs se concentrent sur les régions d'image pertinentes.
Les systèmes VQA classiques ont souvent produit des réponses en faisant quoi ?
De nombreux premiers modèles VQA traitaient la tâche comme une classification des réponses les plus fréquentes, bien que les modèles modernes génèrent un texte ouvert.