Retour aux Actualités
InnovationBriefing AI Understanding

MIT Technology Review utilise sept énigmes pour révéler où les modèles d'IA échouent encore

MIT Technology Review présente sept énigmes qui testent le raisonnement spatial, la mémoire, l'abstraction, l'intuition et la planification logique, mettant en évidence les lacunes qui subsistent malgré des progrès rapides sur certains points de référence.

6 min readRead the original reporting
Source-provided image accompanying MIT Technology Review uses seven puzzles to expose where AI models still fail
Rapports attribuésSource enregistrée
Éditeur
technologyreview.com
Lien source
technologyreview.comhttps://www.technologyreview.com/2026/08/26/1141952/puzzles-ai-models-flub-these-tests/
Type de source
Reportage d'un média – pas d'un document de première partie.

Ce que nous n'avons pas pu confirmer indépendamment: Cette affirmation est attribuée au point de vente nommé. Nous ne l'avons pas vérifié par rapport à un document de première partie. (technologyreview.com)

ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

AGI (Intelligence Générale Artificielle)
Un système d’IA hypothétique capable d’effectuer la plupart des tâches intellectuelles au niveau humain dans de nombreux domaines.
Mémoire (mémoire de l'agent)
Contexte stocké qu'un agent IA utilise au fil des étapes ou des sessions pour améliorer la continuité.
Généralisation
Dans quelle mesure un modèle fonctionne-t-il sur de nouvelles données invisibles en dehors de l'ensemble d'entraînement.
Testez-vousQuiz sur les modèles d'IA expliqués

Que s'est-il passé

Le MIT Technology Review a publié une fonctionnalité interactive construite autour de sept énigmes qui explorent le raisonnement des modèles d’IA. L'article rapporte que les modèles se sont rapidement améliorés sur certaines tâches, mais ont encore du mal à gérer la manipulation spatiale, les variations subtiles de problèmes familiers, l'abstraction visuelle et le raisonnement en plusieurs étapes de plus en plus complexe.

MIT Technology Review rapporte que sa fonctionnalité présente sept tests couvrant le raisonnement spatial, la mémoire et l'adaptabilité, le raisonnement abstrait et visuel, l'intuition humaine et la complexité croissante. L’article situe la résolution d’énigmes dans l’histoire plus longue de l’évaluation de l’IA, notant que des jeux tels que les dames, les échecs et le Go ont été utilisés comme bancs d’essai depuis les premières années de ce domaine. Il indique que les performances des puzzles se sont considérablement améliorées : une équipe de l’Université de Columbia a découvert fin 2024 que les principaux modèles ne résolvaient que 18 % des énigmes du New York Times Connections, alors qu’au début de 2025, certains modèles pouvaient les résoudre presque parfaitement à chaque fois. La source n'identifie pas les modèles et ne fournit pas de comparaison standardisée entre les exemples de la fonctionnalité.

Le MIT Technology Review affirme que le raisonnement spatial reste une faiblesse majeure. Sa section sur la rotation mentale demande aux lecteurs d'identifier un objet tridimensionnel montré sous un autre angle, et l'article rapporte que les modèles de langage dotés de capacités de saisie visuelle fonctionnent toujours très mal dans de telles tâches. L'article relie cette difficulté aux affirmations selon lesquelles les systèmes d'IA développent des modèles mondiaux, en faisant valoir que les grands modèles de langage actuels ne semblent pas manipuler les objets tridimensionnels de la même manière que les spécialistes spatiaux humains. L'article décrit également un problème de mémoire et d'adaptabilité : les modèles formés sur de grandes quantités d'informations peuvent reconnaître un modèle de puzzle familier et ignorer un petit changement. Il cite une étude Google de 2024 et Urbana-Champaign de l'Université de l'Illinois impliquant des variations de puzzles de chevaliers et de valets comme preuve de cette préoccupation.

La fonctionnalité se tourne ensuite vers l’abstraction bidimensionnelle et le raisonnement visuel. Le MIT Technology Review rapporte que les modèles fonctionnent mieux sur les puzzles ARC-AGI lorsque les grilles sont fournies sous forme de chaînes numériques codant pour les couleurs des cellules plutôt que sous forme d'images. Il indique également que des recherches ont montré que les modèles peuvent parfois parvenir à la bonne réponse grâce à des règles compliquées et non généralisables, tandis que les humains peuvent s'appuyer sur des concepts visuels plus simples. L'article présente des questions SimpleBench, des problèmes de chevaliers et de valets et un puzzle de transformation ARC-AGI comme exemples de tâches pouvant exposer ces différences.

Il décrit séparément les tests d'intuition dans lesquels les personnes donnent souvent des réponses rapides mais incorrectes, tandis que les modèles peuvent répondre de manière plus délibérée. Un exemple demande combien de temps il faudrait à une grotte pour être à moitié remplie lorsque sa population de chauves-souris double quotidiennement ; un autre demande aux lecteurs d'identifier une citation associée à Alice.

Enfin, le MIT Technology Review rapporte que les performances se détériorent souvent à mesure que les problèmes deviennent plus complexes. Il cite une étude Apple révélant que les modèles linguistiques pouvaient résoudre des versions simples de la tour de Hanoï et des problèmes de traversée de rivières, mais commençaient à faiblir lorsque le nombre de disques ou de personnes atteignait six ou plus. Il cite également les travaux de chercheurs de l'Université de Washington, de l'Université de Stanford et de l'Institut Allen qui ont découvert des difficultés similaires avec les énigmes de la grille logique. L'article note que les commentateurs se sont demandé si ces résultats révélaient une limitation de raisonnement propre à une machine ou reflétaient simplement le fait que les gens commettent également davantage d'erreurs à mesure que la complexité augmente. Ses exemples de traversées de rivières et de grilles logiques testent donc non seulement si un modèle peut produire une réponse, mais aussi s'il peut maintenir des contraintes sur plusieurs déductions connectées.

Détails de la source: technologyreview.com ↗

Pourquoi c'est important

Cette fonctionnalité montre pourquoi les affirmations générales sur l’intelligence artificielle peuvent être trompeuses. Un modèle peut bien fonctionner sur des questions triviales ou sur un benchmark familier tout en échouant à un petit changement de formulation, à une transformation visuelle ou à un problème nécessitant plusieurs étapes dépendantes. Ces différences sont importantes lorsque les systèmes sont utilisés pour des décisions plutôt que pour des démonstrations.

La leçon principale est que la performance à une classe de test ne doit pas être considérée comme une mesure générale de l’intelligence. Les exemples du MIT Technology Review couvrent des tâches qui semblent superficiellement simples mais nécessitent des capacités différentes : faire pivoter mentalement un objet, suivre la vérité et le mensonge dans des déclarations, déduire une règle visuelle, résister à une intuition trompeuse ou planifier une séquence sous contraintes. Un système peut être exceptionnellement puissant dans un domaine et peu fiable dans un autre. Cette inégalité est particulièrement pertinente lorsque les utilisateurs interprètent des réponses fluides comme la preuve qu'un modèle a compris le problème sous-jacent.

L'article met également en évidence un problème d'évaluation : le format d'une tâche peut affecter matériellement le résultat. Le MIT Technology Review rapporte que les performances d'ARC-AGI s'améliorent lorsque les grilles visuelles sont converties en représentations numériques. Cela suggère qu’un score peut refléter non seulement la capacité de raisonnement du modèle, mais également la manière dont le problème est codé et présenté. La même préoccupation s’applique aux énigmes familières. Si un modèle a rencontré une variante proche lors de l'entraînement, une réponse correcte peut refléter la reconnaissance ou la récupération de formes plutôt que la capacité à adapter une règle à un nouveau cas. La source n'établit pas la fréquence à laquelle l'un ou l'autre mécanisme se produit sur les systèmes déployés.

Ces limitations ont des implications pratiques pour toute personne utilisant l’IA dans l’éducation, les logiciels, la recherche, l’administration ou dans d’autres contextes impliquant des cas inconnus. Un modèle qui réussit sur des exemples de routine peut toujours échouer lorsque la formulation change, que plusieurs contraintes interagissent ou que les informations pertinentes sont visuelles plutôt que textuelles. La fonctionnalité ne signale pas le lancement d'un nouveau produit, la sortie d'un nouveau modèle ou une évaluation contrôlée d'un système commercial spécifique. Sa valeur est explicative : elle donne aux lecteurs des moyens concrets de comprendre pourquoi les gains de référence et un langage raffiné ne suffisent pas à établir un raisonnement solide. L’article préserve également une réserve importante : les humains ont leurs propres préjugés et peuvent être plus lents ou moins fiables sur certains problèmes.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Vérification de concept interactive+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Que regarder ensuite

Les évaluations futures devront tester plus que les résultats généraux. Des questions importantes sont de savoir si les modèles peuvent se généraliser à des problèmes inconnus, si leurs réponses dépendent de la manière dont les informations sont représentées, de la façon dont les performances évoluent à mesure que la complexité augmente et si le succès reflète une stratégie réutilisable ou des modèles mémorisés.

Le prochain développement utile serait des tests plus larges et reproductibles sur tous les modèles et formats de tâches. La fonctionnalité du MIT Technology Review ne fournit pas de tableau de bord unique couvrant les sept tests, et la source ne précise pas non plus les noms de modèles, les versions, la taille des échantillons, les conditions d'invite ou les taux d'erreur pour la plupart des exemples. Ces détails seraient nécessaires pour déterminer si les faiblesses signalées sont répandues, concentrées dans des familles modèles particulières ou sensibles à la manière dont les tests sont administrés.

Des évaluations indépendantes devraient également séparer les échecs de perception visuelle des échecs de raisonnement en gardant le puzzle sous-jacent constant tout en faisant varier sa représentation. Les chercheurs et les évaluateurs devraient également vérifier si les modèles s’améliorent grâce à une véritable généralisation ou grâce à une plus grande exposition à des éléments de référence. La discussion dans l’article sur les énigmes Connections et les variantes Knights and Knaves montre pourquoi la contamination et la familiarité sont importantes. Un modèle qui fonctionne bien sur des questions publiées ou étroitement liées peut ne pas être aussi performant sur des problèmes nouvellement générés avec la même structure sous-jacente. Les tests doivent donc inclure des énigmes retenues, des formulations modifiées, des présentations visuelles inconnues et des tâches qui nécessitent d'expliquer ou de vérifier des contraintes intermédiaires sans supposer qu'une réponse convaincante est correcte.

La complexité et le transfert dans le monde réel restent des questions ouvertes. Le MIT Technology Review rapporte que les performances peuvent diminuer à mesure que le nombre d'éléments ou d'étapes requises augmente, mais la source n'établit pas comment ces résultats se traduisent en systèmes pratiques dotés d'outils, de récupération, de mémoire externe ou de surveillance humaine. Les futurs rapports devraient déterminer si ces ajouts améliorent la fiabilité, aident simplement les modèles à rechercher plus efficacement ou introduisent de nouveaux modes de défaillance. Les lecteurs doivent également surveiller les évaluations qui mesurent la qualité de la stratégie, et pas seulement la réponse finale, car un résultat correct atteint grâce à une règle fragile ou non généralisable peut ne pas survivre à un petit changement du problème.

Guides et quiz associés

Modèles d'IA expliquésFormation IATransformateursTestez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaireSuivez le suivi des versions du modèle AI
Vous avez trouvé cela utile ?