GUIDE DE L'IA Visuelle

Modèles Vision-Langage-Action pour la robotique

Les modèles Vision-Langage-Action (VLA) sont de grands réseaux neuronaux qui enregistrent des images de caméra ainsi qu'une instruction écrite et émettent directement des commandes de moteur de robot.

2 minutes de lectureDernière mise à jour

Aperçu

They matter because they bring the broad common sense of foundation models to physical machines, letting one model control a robot across many tasks instead of hand-coding each behavior.

Plongée profonde

Un modèle VLA fusionne trois flux : la vision (cadres de caméra), le langage (un objectif comme « mettre la tasse dans l'évier ») et l'action (angles d'articulation, ouverture/fermeture de la pince ou vitesses des effecteurs terminaux). Google Le RT-2 de DeepMind a fait date : il a fallu un modèle de langage de vision formé sur des images et du texte Web, puis l'a co-affiné sur les trajectoires des robots afin que le même réseau puisse répondre "de quel fruit s'agit-il ?" émet également des actions symbolisées sous forme de texte. Des modèles ouverts comme OpenVLA (paramètres 7B) et le pi-0 de Physical Intelligence ont suivi. Surtout, ces modèles montrent un transfert « émergent » : la connaissance du Web (reconnaître un logo de marque, comprendre « le plus petit ») se transforme en manipulation, de sorte que le robot généralise à des objets et à des instructions qu'il n'a jamais vus lors de la formation du robot.

Aperçu technique

De nombreux VLA discrétisent les actions continues en jetons afin qu'un transformateur puisse les prédire de manière autorégressive, tout comme les mots. RT-2 mappe chaque dimension d'action à l'un des 256 groupes et les émet sous forme de chaîne de texte. Des conceptions plus récentes comme le pi-0 attachent une tête « d'expert en action » de diffusion ou de correspondance de flux à une épine dorsale de langage de vision figée, générant des morceaux d'action à haute fréquence fluides (par exemple, 50 Hz) au lieu d'étapes distinctes uniques, améliorant ainsi la dextérité.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir des modèles vision-langage-action pour la robotique

Attendez-vous à des ensembles de données inter-incarnations plus importants (l'effort Open X-Embodiment regroupe déjà les données de plus de 22 types de robots), de sorte qu'un seul modèle pilote des bras, des humanoïdes et des bases mobiles. La recherche s'oriente vers une inférence plus rapide pour un contrôle en temps réel, des entrées 3D et tactiles plus riches et des chaînes de raisonnement dans lesquelles le modèle « réfléchit » avant d'agir. L'objectif est une politique généraliste unique que vous pouvez appliquer dans un anglais simple, avec une correction à la volée, un peu comme si vous discutiez avec un assistant.

Mise en œuvre dans le monde réel

RT-2 contrôlant un robot de cuisine Google pour « déplacer la banane vers le chiffre 3 » à l'aide de chiffres appris à partir d'un texte Web, et non de démonstrations de robots

OpenVLA, un modèle 7B open source, affiné par des laboratoires pour exécuter un prélèvement et un placement sur table sur des bras à faible coût

Pi-0 de l'intelligence physique pour plier le linge et débarrasser une table en enchaînant de nombreuses sous-compétences à partir d'une seule instruction

Un service d'entrepôt a demandé de « choisir l'article le plus fragile » et de déduire de quel objet il s'agit à partir de son apparence visuelle.

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision-Language-Action Models for Robotics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modèles CLIP et Vision-Langage

Questions fréquemment posées

What is Vision-Language-Action Models for Robotics?

Les modèles Vision-Langage-Action (VLA) sont de grands réseaux neuronaux qui enregistrent des images de caméra ainsi qu'une instruction écrite et émettent directement des commandes de moteur de robot. Ils sont importants car ils apportent le sens général des modèles de base aux machines physiques, permettant à un modèle de contrôler un robot sur de nombreuses tâches au lieu de coder manuellement chaque comportement.

Quels sont les trois types d'entrées/sorties qui définissent un modèle Vision-Langage-Action (VLA) ?

Un VLA prend la vision (images) plus un objectif linguistique et produit des actions (commandes motrices), unissant la perception, le suivi des instructions et le contrôle.

Comment le RT-2 de Google DeepMind a-t-il représenté les actions du robot afin qu'un transformateur puisse les générer ?

RT-2 a regroupé chaque dimension d'action en jetons discrets (par exemple, 256 bacs) et les a émis sous forme de chaîne, permettant à la machinerie de modèle de langage de prédire des actions telles que des mots.

Que signifie « transfert émergent » dans le contexte des VLA ?

Étant donné que les VLA partent de modèles de langage de vision formés sur le Web, des connaissances telles que la reconnaissance des logos ou la compréhension du « plus petit » sont transférées à des tâches de manipulation jamais vues dans les données des robots.

Quel est l'avantage clé de la tête d'action de diffusion/correspondance de flux du pi-0 par rapport aux jetons à action discrète unique ?

Au lieu d'une étape discrète à la fois, pi-0 produit des morceaux d'action continue à haute fréquence, permettant un mouvement plus fluide et plus adroit.

Pourquoi l’ensemble de données Open X-Embodiment est-il important pour les VLA ?

Open X-Embodiment combine les trajectoires de nombreux robots différents, aidant ainsi à former des politiques qui se transfèrent entre les armes, les bases mobiles et d'autres incarnations.