Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
Mis à jour quotidiennement1793 histoires vérifiées
Couverture par l'IA vérifiée à la source des lancements de produits, des changements de politique, de la recherche sur la sécurité et des évolutions de l'industrie, expliquée dans un anglais simple par une équipe éducative à but non lucratif.
Chaque article est lié aux preuves disponibles les plus solides : sources originales lorsqu'elles sont disponibles, sinon reportages clairement attribués.
What happened, why it matters, and what to watch — without the jargon.
Lorsque le signal est faible, nous ne publions rien plutôt que de compléter le flux.
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
Dans une prépublication de 24 auteurs, des agents d'IA de pointe ont tenté de répondre aux questions de recherche centrales de deux soumissions non publiées de NeurIPS 2026, puis ont demandé aux propres auteurs des articles d'évaluer les résultats. Les agents ont géré l'ingénierie sans aide pendant six jours, mais ont été sans ambiguïté rejetés lors des recherches.
Warp accepte les demandes d'accès anticipé pour Warp Factories, qui définit les flottes d'agents de codage sous forme de code : dépôts, modèles, autorisations et points de contrôle humains dans un seul fichier YAML, piloté par CLI, API, SDK et MCP. Son automatisation et ses coûts sont des affirmations du fournisseur : pas de prix, pas de date de disponibilité générale ni de tests indépendants.
Un nouvel article arXiv présente un test dans lequel les modèles doivent déduire un mot écrit à partir d'un son de grattage de stylo et d'une vidéo de mouvements de la main, sans encre visible. Les auteurs rapportent que les humains ont une précision des lettres ordonnées supérieure à 80 % et que les modèles principaux sont inférieurs à 10 % – et que le fait de donner aux modèles les deux modalités a souvent aggravé les résultats.
Une nouvelle préimpression arXiv décrit CacheScout, une couche construite sur le serveur vLLM open source qui décide ce qu'il faut conserver dans le cache clé-valeur d'un modèle en fonction de l'agent susceptible de s'exécuter ensuite. Les auteurs rapportent des gains de latence et de débit à deux chiffres ; les charges de travail, les modèles et le matériel ne sont pas indiqués dans le résumé.
Deux chercheurs affirment qu'une preuve de lemme au chapitre 6 du document mathématique de OpenAI comporte une erreur de polarité : un test en termes de réussite moyenne où l'étape suivante nécessite un échec conditionnel important. Ils donnent un contre-exemple et une preuve corrigée, et préviennent qu'il ne s'agit pas d'une vérification du théorème principal du chapitre.
Une prépublication de deux chercheurs reproduit une étude antérieure expliquant pourquoi un nombre égal de FLOP ne signifie pas un temps d'exécution égal. Il confirme l'affirmation sous-jacente, mais indique que la formule de correction des α-FLOP sous-estime généralement le temps d'exécution sur le matériel plus récent, ce qui montre des sauts et des oscillations que la formule ne capture pas.
Une nouvelle prépublication arXiv oppose quatre architectures pour l'interrogation en langage naturel des bases de données d'entreprise sur un benchmark synthétique bilingue. Aucun n’a répondu correctement à plus d’un quart des cas environ, et la conception ayant obtenu le score le plus élevé n’était ni la plus sûre ni la moins chère.
Une nouvelle prépublication d'arXiv affirme que les équipes de sécurité peuvent juger si un agent d'IA équipé de mémoire ou de récupération apprend en mesurant dans quelle mesure il réduit l'écart par rapport à un modèle « enseignant » plus fort, plutôt qu'en se basant sur des références étiquetées qui sont souvent rares ou obsolètes. À en juger par un modèle de puissance similaire, il n’a donné aucun signal utilisable.
Un rapport technique de 17 auteurs publié sur arXiv présente MobileMem, une référence et un cadre pour la mémoire à long terme sur l'appareil, construit à partir d'une collection d'expériences mobiles à l'échelle d'un an. Le résumé décrit la conception mais ne rapporte aucun score, et les détails clés sur les données sous-jacentes restent confidentiels.
Une nouvelle prépublication d'arXiv indique que les grands modèles de langage développent une structure interne fonctionnellement spécialisée qui s'aligne sur des réseaux cérébraux humains distincts, sur la base d'analyses de circuits sur 46 tâches dans quatre domaines cognitifs. La page de résumé ne précise pas les détails méthodologiques clés.
Une prépublication rapporte que la désactivation des experts de faible ampleur dans les cinq dernières couches d'un modèle de mélange d'experts de 35 milliards de paramètres a permis de préserver beaucoup plus de résultats de traduction de code utilisables que de répartir les mêmes coupes sur toutes les couches. Il couvre un modèle et un benchmark, et le résumé ne rapporte aucune référence non masquée.
Un briefing utile chaque semaine
Recevez les actualités vérifiées de la semaine sur l'IA, les données originales, les outils utiles, les choix d'apprentissage et les nouveaux travaux d'IA.
Embaucher un professionnel de l’IA ou lancer un produit d’IA utile ? Présentez-le aux gens qui sont venus ici pour apprendre et agir.
Publier une offre d'emploi IA Soumettre un outil d'IA