Que s'est-il passé
MarkTechPost rapporte que des chercheurs de Meta FAIR, de l'Université d'Oxford et de l'University College London ont introduit des modèles de préférence de recherche en IA, ou RPM, pour sélectionner les expériences qu'un agent de recherche en IA doit mener. Lors de l'évaluation AIRS-Bench rapportée, les RPM ont amélioré les scores normalisés moyens et ont atteint la ligne de base de sélection aléatoire en environ 15 heures au lieu de 24.
MarkTechPost rapporte que les RPM classent les expériences candidates non exécutées plutôt que de prédire leurs scores absolus. Le système rapporté utilise un échafaudage de recherche arborescente évolutive appelé AIRA-dojo. Un agent génère 15 enfants candidats en parallèle, les compare par paires dans un tournoi à élimination directe et n'exécute que le gagnant. Les comparaisons utilisent des nœuds de contexte précédemment explorés et leurs scores de validation.
L'article décrit deux variantes. Le RPM d'inférence uniquement évalue les plans candidats, le code et l'historique de recherche avec un modèle de langage pré-entraîné gelé. Le RPM agentique exécute en outre de petites expériences pilotes dans un environnement cloné contenant un GPU H200, en utilisant Python, bash et un outil de soumission. MarkTechPost rapporte que le sélecteur d'agent a été utilisé uniquement pour les étapes de brouillon et d'amélioration, tandis que la sélection de débogage est redevenue aléatoire car les pilotes consommaient le budget temps de l'agent.
Sur AIRS-Bench, que MarkTechPost décrit comme contenant 20 tâches de texte public et tabulaires, les scores normalisés moyens rapportés étaient de 0,684 pour la sélection aléatoire, de 0,711 pour le RPM d'inférence uniquement et de 0,729 pour le RPM agentique. La configuration aurait utilisé Qwen3.6-27B à la fois pour les opérateurs d'expérimentation et les RPM, avec 10 graines et 24 heures sur un H200 par tâche.
MarkTechPost rapporte que les deux variantes de RPM ont atteint la ligne de base de sélection aléatoire en 15 heures environ : 14,88 heures pour l'inférence uniquement et 15,50 heures pour la sélection agentique. L'article rapporte également des résultats de 94,1 % sur WinoGrande et de 95,7 % sur SVAMP, les décrivant comme de nouveaux résultats à la pointe de la technologie. Ces chiffres et comparaisons sont des affirmations du rapport fourni et non des résultats confirmés de manière indépendante.
L'article indique que l'échafaudage AIRA-dojo et AIRS-Bench sont open source et que Qwen3.6-27B est disponible sous forme de poids ouverts. Il ne fournit pas de lien d'accès direct, de conditions de licence, de service hébergé, de détails de support commercial ou de tarifs. Le matériel fourni ne permet pas non plus d'établir que le système est prêt pour une utilisation générale en production.
Détails de la source: marktechpost.com ↗
Pourquoi c'est important
Si les résultats rapportés sont valables, la sélection des expériences avant leur exécution pourrait rendre la recherche assistée par l’IA plus efficace en termes de calcul. L’approche s’attaque à un goulot d’étranglement pratique : les agents de recherche peuvent générer de nombreuses expériences candidates, mais tester chacune d’entre elles coûte cher. Les preuves restent limitées au point de référence rapporté et n'ont pas été confirmées de manière indépendante dans les documents fournis.
Les travaux rapportés ciblent un problème d’allocation des ressources dans la recherche sur l’IA plutôt que de simplement améliorer le score de référence d’un modèle. Un agent capable de générer plus d’idées qu’une équipe ne peut se permettre de tester a besoin d’un moyen fiable pour décider quelles expériences méritent d’être calculées. Une couche de sélection pourrait donc affecter le débit de la recherche, en particulier lorsque les sessions de formation ou d’évaluation prennent des heures ou des jours.
La comparaison rapportée suggère que le choix parmi les candidats a apporté certains avantages, car le même réseau fédérateur Qwen3.6-27B a été utilisé pour les opérateurs d'expérimentation et les RPM. MarkTechPost rapporte une augmentation relative de 6,0 %, passant de 0,684 à 0,711 pour la sélection par inférence uniquement et une augmentation de 6,6 % à 0,729 pour la sélection agentique, mais l'article fourni ne fournit pas suffisamment de détails méthodologiques pour évaluer la robustesse statistique au-delà de ses intervalles de confiance indiqués.
Il existe des limites significatives. AIRS-Bench couvre 20 tâches publiques de texte et de tableaux, et les expériences ont utilisé une seule configuration H200, de sorte que les résultats ne peuvent pas être transférés à des programmes de recherche plus vastes, à d'autres matériels ou domaines scientifiques. Le rapport ne fournit aucune réplication indépendante, aucune étude de cas de déploiement ni aucune preuve que l'approche améliore les découvertes du monde réel plutôt que les résultats de référence.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Que regarder ensuite
Surveillez les artefacts de papier, de code et de référence sous-jacents ; réplication sur des tâches supplémentaires ; et des preuves indiquant si les gains persistent avec différents modèles, opérateurs, matériels et domaines de recherche. L'accès aux composants open source signalés est décrit, mais les prix, la disponibilité hébergée et le support de production ne sont pas documentés.
La prochaine vérification la plus utile consiste à savoir si les chercheurs publient l'article sous-jacent, les journaux de mise en œuvre et d'évaluation, et si les équipes extérieures reproduisent les scores rapportés et les gains de temps. Le rapport fourni pointe vers des composants open source mais ne vérifie pas de manière indépendante leur disponibilité ou leur utilisabilité.
Les évaluations futures devraient tester différents modèles de base, méthodes de génération de candidats, familles de tâches et budgets de calcul. La conception agentique rapportée utilise également de courtes expériences pilotes et un budget restant délibérément surestimé, des choix qui peuvent influencer les résultats et méritent d'être testés dans le cadre d'une comptabilité des ressources ordinaires.
Les utilisateurs potentiels doivent traiter les outils signalés comme des éléments de recherche et non comme un produit commercial documenté. La source ne donne aucun prix, conditions de niveau de service, exigences d'installation ou déclaration de disponibilité générale. Il ne montre pas non plus si les RPM peuvent gérer en toute sécurité des expériences dont les échecs sont coûteux ou dont les métriques de validation ne sont pas fiables.
Les résultats rapportés de WinoGrande et SVAMP justifient une vérification par rapport aux références antérieures citées. L’article ne fournit pas de tests indépendants, de ventilations statistiques détaillées ou suffisamment d’informations pour déterminer dans quelle mesure ces gains se généralisent.