Mis à jour quotidiennement2528 histoires vérifiées
Actualités sur l'IA. Sans le bruit.
Couverture par l'IA vérifiée à la source des lancements de produits, des changements de politique, de la recherche sur la sécurité et des évolutions de l'industrie, expliquée dans un anglais simple par une équipe éducative à but non lucratif.
Approvisionnement vérifié
Chaque article est lié aux preuves disponibles les plus solides : sources originales lorsqu'elles sont disponibles, sinon reportages clairement attribués.
Anglais simple
Que s’est-il passé, pourquoi c’est important et que regarder – sans le jargon.
Pas de remplissage
Lorsque le signal est faible, nous ne publions rien plutôt que de compléter le flux.
Plus d'histoires
9 histoiresInnovation
Évaluation des performances des compétences des agents IA avec NVIDIA SkillEvaluator
NVIDIA SkillEvaluator mesure l'impact des compétences vérifiées sur les performances des agents IA grâce à un processus d'évaluation à trois niveaux.
developer.nvidia.comInnovation
L'article présente les « évaluations fantômes » : les agents d'IA ont réalisé l'ingénierie mais ont échoué à deux questions de recherche
Dans une prépublication de 24 auteurs, des agents d'IA de pointe ont tenté de répondre aux questions de recherche centrales de deux soumissions non publiées de NeurIPS 2026, puis ont demandé aux propres auteurs des articles d'évaluer les résultats. Les agents ont géré l'ingénierie sans aide pendant six jours, mais ont été sans ambiguïté rejetés lors des recherches.arxiv.orgProduit
Warp ouvre un accès anticipé à « Factories », un système de configuration en tant que code pour exécuter des flottes d'agents de codage
Warp accepte les demandes d'accès anticipé pour Warp Factories, qui définit les flottes d'agents de codage sous forme de code : dépôts, modèles, autorisations et points de contrôle humains dans un seul fichier YAML, piloté par CLI, API, SDK et MCP. Son automatisation et ses coûts sont des affirmations du fournisseur : pas de prix, pas de date de disponibilité générale ni de tests indépendants.warp.devInnovation
Benchmark indique que les meilleurs modèles multimodaux obtiennent des résultats inférieurs à 10 % à la lecture de mots à partir des sons du stylo et des mouvements de la main
Un nouvel article arXiv présente un test dans lequel les modèles doivent déduire un mot écrit à partir d'un son de grattage de stylo et d'une vidéo de mouvements de la main, sans encre visible. Les auteurs rapportent que les humains ont une précision des lettres ordonnées supérieure à 80 % et que les modèles principaux sont inférieurs à 10 % – et que le fait de donner aux modèles les deux modalités a souvent aggravé les résultats.arxiv.orgInnovation
Paper affirme que la gestion du cache orientée agent réduit le délai d'apparition du premier jeton jusqu'à 45 % dans le service multi-agents
Une nouvelle préimpression arXiv décrit CacheScout, une couche construite sur le serveur vLLM open source qui décide ce qu'il faut conserver dans le cache clé-valeur d'un modèle en fonction de l'agent susceptible de s'exécuter ensuite. Les auteurs rapportent des gains de latence et de débit à deux chiffres ; les charges de travail, les modèles et le matériel ne sont pas indiqués dans le résumé.arxiv.orgInnovation
L'audit d'une preuve OpenAI générée par l'IA détecte une condition inversée et publie une réparation
Deux chercheurs affirment qu'une preuve de lemme au chapitre 6 du document mathématique de OpenAI comporte une erreur de polarité : un test en termes de réussite moyenne où l'étape suivante nécessite un échec conditionnel important. Ils donnent un contre-exemple et une preuve corrigée, et préviennent qu'il ne s'agit pas d'une vérification du théorème principal du chapitre.arxiv.orgInnovation
Une étude de réplication indique que les FLOP prédisent toujours mal le temps d'exécution de l'IA et que le correctif proposé échoue sur le matériel plus récent
Une prépublication de deux chercheurs reproduit une étude antérieure expliquant pourquoi un nombre égal de FLOP ne signifie pas un temps d'exécution égal. Il confirme l'affirmation sous-jacente, mais indique que la formule de correction des α-FLOP sous-estime généralement le temps d'exécution sur le matériel plus récent, ce qui montre des sauts et des oscillations que la formule ne capture pas.arxiv.orgEntreprise
Un document de référence révèle quatre façons d'interroger les données d'entreprise, les LLM ayant tous un score inférieur à 26 %
Une nouvelle prépublication arXiv oppose quatre architectures pour l'interrogation en langage naturel des bases de données d'entreprise sur un benchmark synthétique bilingue. Aucun n’a répondu correctement à plus d’un quart des cas environ, et la conception ayant obtenu le score le plus élevé n’était ni la plus sûre ni la moins chère.arxiv.orgInnovation
Paper propose de classer les agents de sécurité IA sans étiquette en mesurant la convergence vers un modèle plus solide
Une nouvelle prépublication d'arXiv affirme que les équipes de sécurité peuvent juger si un agent d'IA équipé de mémoire ou de récupération apprend en mesurant dans quelle mesure il réduit l'écart par rapport à un modèle « enseignant » plus fort, plutôt qu'en se basant sur des références étiquetées qui sont souvent rares ou obsolètes. À en juger par un modèle de puissance similaire, il n’a donné aucun signal utilisable.arxiv.org
Un briefing utile chaque semaine
Suivez l’IA sans vivre dans le flux.
Recevez les actualités vérifiées de la semaine sur l'IA, les données originales, les outils utiles, les choix d'apprentissage et les nouveaux travaux d'IA.
Touchez les personnes qui apprennent l’IA
Embaucher un professionnel de l’IA ou lancer un produit d’IA utile ? Présentez-le aux gens qui sont venus ici pour apprendre et agir.
Publier une offre d'emploi IASoumettre un outil d'IA