Que s'est-il passé
Une prépublication publiée sur arXiv le 29 juillet 2026 et révisée le 7 août propose une nouvelle façon de mesurer les progrès vers la recherche automatisée sur l'IA : confier à un agent la question ouverte centrale d'un article non publié de haute qualité et demander aux auteurs originaux de cet article d'évaluer le résultat. Dans deux essais, des agents frontaliers ont réalisé l'ingénierie sans aide humaine, mais ont été rejetés par les évaluateurs humains, et les auteurs identifient cinq modes de défaillance récurrents.
Une prépublication sur arXiv, soumise le 29 juillet 2026 et révisée le 7 août 2026, demande si les agents d'IA peuvent mener des recherches ouvertes sur l'IA. Il compte 24 auteurs répertoriés, dont Peter Kirgis, Sayash Kapoor, Helen Toner, Gillian Hadfield, Seth Lazar, Rishi Bommasani et Arvind Narayanan, et est classé sous intelligence artificielle, ordinateurs et société, et apprentissage automatique. Sa contribution centrale est une méthode de mesure que les auteurs appellent une « évaluation fantôme » : un agent se voit poser la question de recherche centrale et ouverte d'un article de haute qualité mais non publié, et les auteurs originaux de l'article notent ensuite ce que l'agent produit.
Les auteurs la positionnent comme une troisième option entre deux approches existantes qu’ils qualifient d’insuffisantes. Les évaluations actuelles des agents, écrivent-ils, testent les agents sur des tâches étroites et vérifiables – ce qui, par construction, exclut la recherche ouverte – ou soumettent des articles générés par l'IA à un examen aveugle par les pairs, qu'ils qualifient de surchargés, stochastiques et souffrant d'une mauvaise qualité d'évaluation. Les évaluations fantômes utilisent plutôt comme évaluateurs les personnes qui connaissent déjà le problème, sa littérature et ses pièges, car elles disposent d'une réponse non publiée à laquelle comparer.
L’équipe a appliqué la méthode sur deux soumissions non publiées à NeurIPS 2026. Selon le résumé, les agents frontaliers disposaient de six jours et de milliers de dollars de calcul par tentative. Les agents ont réalisé toute l’ingénierie sans aide humaine – le code, les expériences, l’infrastructure – mais n’ont pas pu faire de progrès substantiels pour répondre eux-mêmes aux questions de recherche. Les deux articles qui en ont résulté ont été, selon les termes des auteurs, rejetés sans ambiguïté par les auteurs originaux agissant en tant que réviseurs.
À partir des transcriptions, les auteurs extraient cinq modes d'échec récurrents : un mauvais jugement sur la barre pour la recherche publiable ; des réponses peu créatives aux lacunes de la conception de la recherche ; retour en arrière inefficace hors des impasses ; une mauvaise connaissance des ressources ; et dérive des instructions. Ils rapportent qu'une vérification de robustesse utilisant un deuxième modèle et un deuxième échafaudage a reproduit les mêmes défaillances, ce qui plaide contre le fait que le résultat soit un artefact d'un système ou d'un harnais particulier. L'équipe déclare qu'elle publie les avis d'experts, les réponses à l'enquête, les référentiels d'agents et les journaux.
Plusieurs choses que le résumé n’établit pas méritent d’être clairement énoncées. Il ne précise pas quels agents, modèles ou échafaudages ont été utilisés, ni le deuxième système utilisé dans le contrôle de robustesse. Il n'identifie pas les deux soumissions NeurIPS ou leurs sous-champs, ne donne pas un chiffre de calcul exact au-delà des « milliers de dollars », ne décrit pas la rubrique de notation, ni ne dit si les évaluateurs étaient aveugles au fait qu'ils examinaient les résultats des agents. L'ouvrage est une prépublication ; rien dans la source n'indique qu'elle a terminé l'examen par les pairs. Et l'échantillon est constitué de deux questions de recherche, notées par les personnes qui les ont posées.
Détails de la source: arxiv.org ↗
Pourquoi c'est important
Les arguments selon lesquels les progrès de l’IA vont s’accélérer considérablement reposent sur l’hypothèse que les systèmes d’IA peuvent prendre en charge la recherche elle-même. Il s’agit là d’une preuve directe, quoique minime, que le principe n’est pas encore valable, et qu’elle sépare ce que les agents peuvent déjà faire – la mise en œuvre – de ce qu’ils ne peuvent pas faire : juger ce qui mérite d’être publié, repenser une étude imparfaite et abandonner les impasses.
Le cadrage du document s’appuie directement sur une hypothèse porteuse dans les prévisions actuelles de l’IA. Comme le dit le résumé, les prévisions de progrès explosifs de l’IA dépendent de l’automatisation de la recherche par des agents d’IA – la boucle dans laquelle de meilleurs systèmes construisent de meilleurs systèmes. Cette boucle est fréquemment affirmée et rarement mesurée, car la chose automatisée est exactement le genre de travail qui résiste à un script de notation. Une méthode qui produit un verdict progressif de chercheurs en activité sur une question réelle et sans réponse est une sonde plus directe de cette hypothèse que les scores de référence sur des tâches dont les réponses sont connues.
Le résultat trace une ligne au milieu du travail plutôt qu’autour. Les agents ont exécuté des programmes expérimentaux sur plusieurs jours sans surveillance et ont produit du code et des résultats fonctionnels – c'est une réelle capacité et un changement significatif par rapport à il y a quelques années. Ce qu’ils n’ont pas fait, c’est ce qui détermine si la recherche vaut la peine d’être publiée : reconnaître qu’un résultat est mince, inventer un moyen de contourner un défaut de conception et savoir quand une ligne d’attaque est morte. Pour les équipes qui décident où placer les agents dans un pipeline de recherche ou d’ingénierie, cette distinction est plus exploitable qu’un score de capacité global.
Deux des cinq modes de défaillance se généralisent bien au-delà de la recherche. Une mauvaise connaissance des ressources (consommer un budget de calcul ou de temps fixe sans ajustement) et la dérive des instructions, où un agent cesse progressivement de faire ce qui lui a été demandé, sont des problèmes récurrents dans tout déploiement autonome à long terme, depuis les agents de codage sur plusieurs jours jusqu'à l'automatisation opérationnelle. Les périodes de six jours ici sont inhabituellement longues selon les normes d’évaluation, et c’est précisément sur de longs horizons que ces échecs peuvent s’aggraver avant que quiconque ne s’en aperçoive.
Les limites sont réelles et les auteurs ne les cachent pas. Deux études de cas dans un même lieu, évaluées sur un instantané de modèles, ne peuvent étayer une affirmation sur ce que les agents seront capables de faire l'année prochaine. Il s'agit d'un résultat nul avec un horodatage. Les évaluateurs d’auteurs ont également un intérêt évident dans la question sur laquelle ils ont choisi de travailler, et la méthode s’épuise en partie : une fois qu’un article est publié, sa question de recherche ne peut plus servir de test invisible. La publication des avis, des référentiels et des journaux est ce qui rend les résultats vérifiables plutôt que de prétendre être pris en toute confiance.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
crm_get_transaction(id='4092').What is the most accurate way to describe what AI Agents can do today?
Que regarder ensuite
Si les évaluations parallèles sont répétées à plus grande échelle avec une notation en aveugle et pré-enregistrée ; si les agents et les échafaudages les plus récents comblent l'écart lors de la réexécution sur les référentiels et les journaux publiés ; et si les cinq modes de défaillance résistent à un examen indépendant et à un examen par les pairs.
La première chose à surveiller est de savoir si les évaluations parallèles deviennent un instrument reproductible ou restent une démonstration ponctuelle. Cela signifierait plus d'articles dans plus de lieux et de sous-domaines, des rubriques de notation préenregistrées convenues avant l'exécution de l'agent et une notation aveugle quant à savoir si le résultat provient d'un agent ou d'un humain. Cela impliquerait également de résoudre le problème de l'offre : la méthode nécessite un flux constant de travaux non publiés de haute qualité dont les auteurs sont prêts à consacrer de réels efforts de révision aux tentatives d'un agent.
La deuxième est de savoir si l’écart se comblera et à quelle vitesse. Étant donné que les référentiels d'agents et les journaux sont publiés, d'autres groupes peuvent réexécuter des modèles et des échafaudages plus récents par rapport aux deux mêmes questions de recherche et comparer directement. Surveillez si les améliorations se traduisent par une meilleure ingénierie – ce que les agents ont déjà fait – ou par un mouvement sur les échecs de jugement, qui est la partie manquante selon le journal. Une rediffusion qui produit davantage d’expériences mais le même rejet serait un signal différent de celle qui produit un article que les auteurs originaux prennent au sérieux.
Troisièmement, un examen indépendant des artefacts publiés. Les cinq modes d'échec sont la lecture par les auteurs de leurs propres transcriptions ; d'autres chercheurs lisant les mêmes journaux peuvent catégoriser les pannes différemment ou constater que certaines défaillances sont dues à l'échafaudage et aux invites plutôt qu'aux modèles. Le fait que la prépublication soit soumise à l'examen par les pairs et si sa taxonomie survit au contact avec les évaluations d'autres personnes déterminera le poids qu'elle peut avoir.
Enfin, adoption en dehors de la communauté de recherche. La liste des auteurs comprend des personnes qui travaillent directement sur la gouvernance et la politique de l’IA, et les calendriers de R&D automatisée sur l’IA alimentent les cadres de sécurité aux frontières, les seuils de capacité et les débats politiques nationaux. Regardez si ces preuves sont citées dans ces contextes et si elles sont rapportées avec précision : le document affirme que les agents d'aujourd'hui ont du mal avec des parties critiques du cycle de vie de la recherche, sur la base de deux cas - non pas qu'ils ne pourront jamais faire de recherche, ni que les capacités d'ingénierie exposées sont insignifiantes.