GUIDE DES APPLICATIONS

Agents utilisant des ordinateurs

Les agents utilisant un ordinateur utilisent un ordinateur comme le fait une personne : en regardant l'écran, en déplaçant le curseur, en cliquant et en tapant.

2 minutes de lectureDernière mise à jour

Aperçu

This lets AI use any software with a graphical interface, even apps with no API.

Plongée profonde

Un agent utilisant un ordinateur (CUA) contrôle un bureau réel ou virtuel via son écran et ses périphériques d'entrée plutôt que via des API au niveau du code. Le modèle reçoit des captures d'écran de l'écran, explique ce qu'il voit et génère des actions de bas niveau telles que « cliquer sur les coordonnées (412, 230) », « taper ce texte » ou « faire défiler vers le bas ». Cette boucle perception-action se répète : agir, capturer une nouvelle capture d'écran, décider du prochain mouvement. Parce qu'il fonctionne au niveau des pixels et des touches, un CUA peut piloter les navigateurs Web, remplir des formulaires, naviguer dans les menus et utiliser des applications héritées qui n'exposent aucune interface de programmation. Les exemples incluent l'utilisation de l'ordinateur Claude de Anthropic et l'opérateur de OpenAI. Les compromis sont réels : la lecture d'écran peut être lente, les clics peuvent manquer, et donner à un agent le contrôle d'une machine soulève des problèmes de sécurité, de sorte que la plupart fonctionnent dans des environnements sandbox ou supervisés.

Aperçu technique

L'agent reçoit une capture d'écran ainsi que la tâche, et un modèle capable de visualiser base les éléments (boutons, champs) sur les coordonnées des pixels. Il émet une action structurée qu'une couche d'automatisation exécute sur le système d'exploitation ou le navigateur. Après chaque action, une nouvelle capture d'écran boucle la boucle, afin que l'agent perçoive la conséquence avant d'agir à nouveau. La fiabilité dépend fortement d'une mise à la terre visuelle précise et d'une logique de nouvelle tentative ou de vérification lorsqu'un clic atterrit sur le mauvais élément.

Impact stratégique

Choix de construction

La conception au niveau de l’application détermine si l’IA améliore les résultats réels.

Équipe et flux de travail

Une bonne intégration des flux de travail crée des gains de productivité sur lesquels les utilisateurs peuvent compter.

Risques et sécurité

Des cas d’utilisation bien ciblés réduisent la lassitude face au changement et les risques de mise en œuvre.

L'avenir des agents utilisant des ordinateurs

La précision et la vitesse s'amélioreront à mesure que les modèles s'amélioreront dans la mise à la terre des éléments de l'interface utilisateur et à mesure que certaines interactions passeront à des arborescences d'accessibilité plus rapides au lieu de pixels bruts. Attendez-vous à des garde-fous plus solides : des invites de confirmation avant les actions à risque, des bacs à sable restreints et des journaux d'audit. Les références standard pour les tâches de bureau et Web arrivent à maturité, entraînant des progrès mesurables. À plus long terme, les CUA peuvent combiner le contrôle des pixels avec des appels directs à l'API, en utilisant celui qui est le plus fiable par application, tout en conservant une étape d'approbation humaine pour les opérations sensibles telles que les paiements.

Mise en œuvre dans le monde réel

Un agent qui réserve un restaurant en ouvrant un navigateur, en naviguant sur le site de réservation, en choisissant une heure et en saisissant ses coordonnées.

Automatisez les notes de frais en lisant les reçus à l'écran et en saisissant les valeurs dans une application de comptabilité de bureau sans API.

Tests d'assurance qualité où l'agent clique sur le flux d'inscription d'une application Web pour confirmer que chaque bouton et formulaire fonctionne.

Remplissez des formulaires Web répétitifs du gouvernement ou des assurances en lisant chaque étiquette de champ et en tapant les informations correctes.

Risques et garde-fous

L'automatisation d'un processus interrompu peut amplifier les problèmes existants.

Les équipes peuvent sur-automatiser et supprimer le jugement humain nécessaire.

La qualité peut dériver si les résultats ne sont pas évalués en permanence.

Feuille de route de mise en œuvre

1

Cartographiez le flux de travail actuel et identifiez l’étape la plus problématique.

2

Définissez des points de contrôle humains avant une automatisation complète.

3

Formez les utilisateurs aux invites, aux voies d’escalade et aux normes de qualité.

4

Suivez les résultats au niveau des tâches pour confirmer la valeur durable.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Computer-Using Agents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Agents de réflexion et d'autocorrection

Questions fréquemment posées

What is Computer-Using Agents?

Les agents utilisant un ordinateur utilisent un ordinateur comme le fait une personne : en regardant l'écran, en déplaçant le curseur, en cliquant et en tapant. Cela permet à l’IA d’utiliser n’importe quel logiciel doté d’une interface graphique, même les applications sans API.

Comment un agent utilisant un ordinateur interagit-il principalement avec un logiciel ?

Un CUA perçoit les captures d'écran et émet des actions de saisie de type humain, telles que des clics et des frappes au clavier.

Quel est le principal avantage de fonctionner au niveau des pixels et des frappes ?

Parce qu’il agit comme un utilisateur humain, un CUA peut piloter des applications existantes ou sans API.

Que reçoit l’agent pour décider de sa prochaine action ?

Après chaque action, l’agent capture une nouvelle capture d’écran, formant une boucle perception-action.

Lequel de ces produits est un exemple réel de produit agent utilisant un ordinateur ?

L'utilisation de l'ordinateur de Claude et l'opérateur de OpenAI sont des agents utilisant un ordinateur bien connus.

Pourquoi les agents utilisant un ordinateur sont-ils souvent exécutés dans des environnements sandbox ?

Accorder à un agent le contrôle d’un ordinateur réel comporte des risques, donc l’isolement et la supervision réduisent les dommages potentiels.