Torna alle notizie
InnovazioneAI Understanding briefing

La MIT Technology Review utilizza sette enigmi per svelare dove i modelli di intelligenza artificiale continuano a fallire

La MIT Technology Review presenta sette enigmi che mettono alla prova il ragionamento spaziale, la memoria, l'astrazione, l'intuizione e la pianificazione logica, evidenziando le lacune che rimangono nonostante i rapidi progressi su alcuni parametri di riferimento.

6 min readRead the original reporting
Source-provided image accompanying MIT Technology Review uses seven puzzles to expose where AI models still fail
Segnalazione attribuitaFonte registrata
Editore
technologyreview.com
Collegamento alla fonte
technologyreview.comhttps://www.technologyreview.com/2026/08/26/1141952/puzzles-ai-models-flub-these-tests/
Tipo di fonte
Segnalazione da parte di un organo di stampa, non un documento di prima parte.

Ciò che non abbiamo potuto confermare in modo indipendente: Questa affermazione è attribuita al punto vendita indicato. Non lo abbiamo verificato rispetto a un documento di prima parte. (technologyreview.com)

ContestoComprendilo in 60 secondi

Inizia qui

Termini chiave

AGI (Intelligenza Generale Artificiale)
Un ipotetico sistema di intelligenza artificiale in grado di eseguire la maggior parte dei compiti intellettuali a livello umano in molti domini.
Memoria (memoria dell'agente)
Contesto archiviato che un agente AI utilizza attraverso passaggi o sessioni per migliorare la continuità.
Generalizzazione
Quanto bene un modello si comporta su dati nuovi e invisibili al di fuori del set di training.
Mettiti alla provaQuiz sulla spiegazione dei modelli di intelligenza artificiale

Cosa è successo

Il MIT Technology Review ha pubblicato una funzionalità interattiva costruita attorno a sette enigmi che indagano il modo in cui ragionano i modelli di intelligenza artificiale. L’articolo riporta che i modelli sono migliorati rapidamente su alcuni compiti, ma continuano a lottare con la manipolazione spaziale, le sottili variazioni di problemi familiari, l’astrazione visiva e il ragionamento multifase sempre più complesso.

La MIT Technology Review riferisce che la sua funzionalità presenta sette test che coprono il ragionamento spaziale, la memoria e l'adattabilità, il ragionamento astratto e visivo, l'intuizione umana e la crescente complessità. L’articolo colloca la risoluzione di enigmi nella più lunga storia della valutazione dell’intelligenza artificiale, sottolineando che giochi come la dama, gli scacchi e il Go sono stati utilizzati come banchi di prova sin dai primi anni del settore. Si dice che le prestazioni dei puzzle siano migliorate sostanzialmente: un team della Columbia University ha scoperto alla fine del 2024 che i modelli leader risolvevano solo il 18% dei puzzle del New York Times Connections, mentre all’inizio del 2025 alcuni modelli riuscivano a risolverli quasi perfettamente ogni volta. La fonte non identifica i modelli né fornisce un confronto standardizzato tra gli esempi nella funzionalità.

Il MIT Technology Review afferma che il ragionamento spaziale rimane una delle principali debolezze. La sezione sulla rotazione mentale chiede ai lettori di identificare un oggetto tridimensionale mostrato da un'altra angolazione, e l'articolo riporta che i modelli linguistici con capacità di input visivo funzionano ancora molto male in tali compiti. L’articolo collega questa difficoltà alle affermazioni sui sistemi di intelligenza artificiale che sviluppano modelli del mondo, sostenendo che gli attuali modelli linguistici di grandi dimensioni non sembrano manipolare oggetti tridimensionali nello stesso modo in cui potrebbero farlo gli specialisti spaziali umani. L'articolo descrive anche un problema di memoria e adattabilità: modelli addestrati su grandi quantità di informazioni possono riconoscere uno schema di puzzle familiare e trascurare un piccolo cambiamento. Cita uno studio Google del 2024 e l'Università dell'Illinois Urbana-Champaign che coinvolge variazioni dei puzzle di Knights and Knaves come prova di questa preoccupazione.

Il film si rivolge quindi all'astrazione bidimensionale e al ragionamento visivo. Il MIT Technology Review riporta che i modelli funzionano meglio sui puzzle ARC-AGI quando le griglie vengono fornite come stringhe numeriche che codificano i colori delle celle piuttosto che come immagini. Si afferma inoltre che la ricerca ha scoperto che i modelli a volte possono raggiungere la risposta corretta attraverso regole complicate e non generalizzabili, mentre gli esseri umani possono fare affidamento su concetti visivi più semplici. L'articolo presenta domande SimpleBench, problemi Knights and Knaves e un puzzle di trasformazione ARC-AGI come esempi di attività che possono esporre queste differenze.

Descrive separatamente i test di intuizione in cui le persone spesso danno risposte rapide ma errate, mentre i modelli possono rispondere in modo più deliberato. Un esempio si chiede quanto tempo impiegherebbe una grotta a riempirsi per metà quando la sua popolazione di pipistrelli raddoppia ogni giorno; un altro chiede ai lettori di identificare una citazione associata ad Alice.

Infine, il MIT Technology Review riporta che le prestazioni spesso peggiorano man mano che i problemi diventano più complessi. Cita uno studio Apple che ha scoperto che i modelli linguistici potrebbero risolvere versioni semplici della Torre di Hanoi e dei problemi di attraversamento del fiume, ma hanno iniziato a vacillare quando il numero di dischi o persone ha raggiunto sei o più. Cita anche il lavoro di ricercatori dell'Università di Washington, dell'Università di Stanford e dell'Allen Institute che hanno riscontrato difficoltà simili con i puzzle della griglia logica. L'articolo rileva che i commentatori si sono chiesti se questi risultati rivelino una limitazione del ragionamento tipicamente macchina o semplicemente riflettano il fatto che le persone commettono anche più errori all'aumentare della complessità. I suoi esempi di attraversamento del fiume e di griglia logica verificano quindi non solo se un modello può produrre una risposta, ma se può mantenere vincoli attraverso più deduzioni connesse.

Dettagli della fonte: technologyreview.com ↗

Perché è importante

L’articolo mostra perché le affermazioni generiche sull’intelligenza artificiale possono essere fuorvianti. Un modello può funzionare bene su curiosità o benchmark familiari mentre fallisce un piccolo cambiamento nella formulazione, una trasformazione visiva o un problema che richiede diversi passaggi dipendenti. Queste differenze contano quando i sistemi vengono utilizzati per prendere decisioni piuttosto che per dimostrazioni.

La lezione centrale è che la prestazione in una classe di test non dovrebbe essere trattata come una misura generale dell’intelligenza. Gli esempi del MIT Technology Review abbracciano compiti che sembrano superficialmente semplici ma che richiedono capacità diverse: ruotare mentalmente un oggetto, individuare la verità e la falsità nelle affermazioni, dedurre una regola visiva, resistere a un’intuizione fuorviante o pianificare una sequenza sotto vincoli. Un sistema può essere insolitamente forte in un’area e inaffidabile in un’altra. Questa disuguaglianza è particolarmente rilevante quando gli utenti interpretano le risposte fluenti come prova che un modello ha compreso il problema sottostante.

L'articolo evidenzia anche un problema di valutazione: il formato di un compito può influenzare materialmente il risultato. Il MIT Technology Review riporta che le prestazioni di ARC-AGI migliorano quando le griglie visive vengono convertite in rappresentazioni numeriche. Ciò suggerisce che un punteggio può riflettere non solo la capacità di ragionamento del modello ma anche il modo in cui il problema è codificato e presentato. La stessa preoccupazione si applica agli enigmi familiari. Se un modello ha riscontrato una variante simile durante l'addestramento, una risposta corretta può riflettere il riconoscimento o il recupero del modello piuttosto che la capacità di adattare una regola a un nuovo caso. La fonte non stabilisce la frequenza con cui si verifica uno dei due meccanismi nei sistemi distribuiti.

Queste limitazioni hanno implicazioni pratiche per chiunque utilizzi l’intelligenza artificiale nell’istruzione, nel software, nella ricerca, nell’amministrazione o in altri contesti che coinvolgono casi non familiari. Un modello che ha successo con esempi di routine potrebbe comunque fallire quando la formulazione cambia, interagiscono diversi vincoli o le informazioni rilevanti sono visive piuttosto che testuali. La funzionalità non riporta il lancio di un nuovo prodotto, il rilascio di un nuovo modello o una valutazione controllata di uno specifico sistema commerciale. Il suo valore è esplicativo: offre ai lettori modi concreti per capire perché i guadagni dei benchmark e il linguaggio raffinato non bastano da soli a stabilire un ragionamento solido. L’articolo mantiene anche un’importante precisazione: gli esseri umani hanno i propri pregiudizi e possono essere più lenti o meno affidabili su alcuni problemi.

Interactive Mechanism

Meccanismo interattivo: come funziona realmente

Esplora la tecnologia alla base di questo sviluppo in modo interattivo.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verifica concettuale interattiva+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Cosa guardare dopo

Le valutazioni future dovranno testare qualcosa di più dei punteggi principali. Domande importanti includono se i modelli possono generalizzarsi a problemi non familiari, se le loro risposte dipendono da come vengono rappresentate le informazioni, come le prestazioni cambiano con l’aumentare della complessità e se il successo riflette una strategia riutilizzabile o modelli memorizzati.

Il prossimo sviluppo utile sarebbe un test più ampio e riproducibile su modelli e formati di attività. La funzionalità di MIT Technology Review non fornisce un'unica scorecard che copra tutti e sette i test, né la fonte specifica nomi di modelli, versioni, dimensioni dei campioni, condizioni di richiesta o tassi di errore per la maggior parte degli esempi. Tali dettagli sarebbero necessari per determinare se i punti deboli segnalati sono diffusi, concentrati in particolari famiglie di modelli o sensibili al modo in cui vengono somministrati i test.

Valutazioni indipendenti dovrebbero anche separare i fallimenti della percezione visiva dai fallimenti del ragionamento mantenendo costante il puzzle sottostante variandone la rappresentazione. I ricercatori e i valutatori dovrebbero anche verificare se i modelli migliorano attraverso una genuina generalizzazione o attraverso una maggiore esposizione a materiale simile a un benchmark. La discussione dell’articolo sugli enigmi di Connections e sulle variazioni di Knights and Knaves mostra perché la contaminazione e la familiarità sono importanti. Un modello che funziona bene su domande pubblicate o strettamente correlate potrebbe non essere altrettanto efficace su problemi appena generati con la stessa struttura sottostante. I test dovrebbero quindi includere enigmi, parole alterate, layout visivi non familiari e compiti che richiedono la spiegazione o il controllo di vincoli intermedi senza dare per scontato che una risposta persuasiva sia corretta.

La complessità e il trasferimento nel mondo reale rimangono questioni aperte. Il MIT Technology Review riporta che le prestazioni possono diminuire all’aumentare del numero di elementi o passaggi richiesti, ma la fonte non stabilisce come tali risultati si traducano in sistemi pratici con strumenti, recupero, memoria esterna o supervisione umana. I report futuri dovrebbero monitorare se tali aggiunte migliorano l’affidabilità, aiutano semplicemente i modelli a effettuare ricerche in modo più efficace o introducono nuove modalità di errore. I lettori dovrebbero anche prestare attenzione alle valutazioni che misurano la qualità della strategia, non solo la risposta finale, perché un risultato corretto raggiunto attraverso una regola fragile o non generalizzabile potrebbe non sopravvivere a un piccolo cambiamento nel problema.

Guide e quiz correlati

Spiegazione dei modelli di intelligenza artificialeFormazione sull'intelligenza artificialeTrasformatoriMetti alla prova ciò che sai: prova un quiz gratuito sull'intelligenza artificialeCerca un termine AI nel nostro glossarioSegui il tracker del rilascio del modello AI
Lo hai trovato utile?