Cosa è successo
Il MIT Technology Review ha pubblicato una funzionalità interattiva costruita attorno a sette enigmi che indagano il modo in cui ragionano i modelli di intelligenza artificiale. L’articolo riporta che i modelli sono migliorati rapidamente su alcuni compiti, ma continuano a lottare con la manipolazione spaziale, le sottili variazioni di problemi familiari, l’astrazione visiva e il ragionamento multifase sempre più complesso.
La MIT Technology Review riferisce che la sua funzionalità presenta sette test che coprono il ragionamento spaziale, la memoria e l'adattabilità, il ragionamento astratto e visivo, l'intuizione umana e la crescente complessità. L’articolo colloca la risoluzione di enigmi nella più lunga storia della valutazione dell’intelligenza artificiale, sottolineando che giochi come la dama, gli scacchi e il Go sono stati utilizzati come banchi di prova sin dai primi anni del settore. Si dice che le prestazioni dei puzzle siano migliorate sostanzialmente: un team della Columbia University ha scoperto alla fine del 2024 che i modelli leader risolvevano solo il 18% dei puzzle del New York Times Connections, mentre all’inizio del 2025 alcuni modelli riuscivano a risolverli quasi perfettamente ogni volta. La fonte non identifica i modelli né fornisce un confronto standardizzato tra gli esempi nella funzionalità.
Il MIT Technology Review afferma che il ragionamento spaziale rimane una delle principali debolezze. La sezione sulla rotazione mentale chiede ai lettori di identificare un oggetto tridimensionale mostrato da un'altra angolazione, e l'articolo riporta che i modelli linguistici con capacità di input visivo funzionano ancora molto male in tali compiti. L’articolo collega questa difficoltà alle affermazioni sui sistemi di intelligenza artificiale che sviluppano modelli del mondo, sostenendo che gli attuali modelli linguistici di grandi dimensioni non sembrano manipolare oggetti tridimensionali nello stesso modo in cui potrebbero farlo gli specialisti spaziali umani. L'articolo descrive anche un problema di memoria e adattabilità: modelli addestrati su grandi quantità di informazioni possono riconoscere uno schema di puzzle familiare e trascurare un piccolo cambiamento. Cita uno studio Google del 2024 e l'Università dell'Illinois Urbana-Champaign che coinvolge variazioni dei puzzle di Knights and Knaves come prova di questa preoccupazione.
Il film si rivolge quindi all'astrazione bidimensionale e al ragionamento visivo. Il MIT Technology Review riporta che i modelli funzionano meglio sui puzzle ARC-AGI quando le griglie vengono fornite come stringhe numeriche che codificano i colori delle celle piuttosto che come immagini. Si afferma inoltre che la ricerca ha scoperto che i modelli a volte possono raggiungere la risposta corretta attraverso regole complicate e non generalizzabili, mentre gli esseri umani possono fare affidamento su concetti visivi più semplici. L'articolo presenta domande SimpleBench, problemi Knights and Knaves e un puzzle di trasformazione ARC-AGI come esempi di attività che possono esporre queste differenze.
Descrive separatamente i test di intuizione in cui le persone spesso danno risposte rapide ma errate, mentre i modelli possono rispondere in modo più deliberato. Un esempio si chiede quanto tempo impiegherebbe una grotta a riempirsi per metà quando la sua popolazione di pipistrelli raddoppia ogni giorno; un altro chiede ai lettori di identificare una citazione associata ad Alice.
Infine, il MIT Technology Review riporta che le prestazioni spesso peggiorano man mano che i problemi diventano più complessi. Cita uno studio Apple che ha scoperto che i modelli linguistici potrebbero risolvere versioni semplici della Torre di Hanoi e dei problemi di attraversamento del fiume, ma hanno iniziato a vacillare quando il numero di dischi o persone ha raggiunto sei o più. Cita anche il lavoro di ricercatori dell'Università di Washington, dell'Università di Stanford e dell'Allen Institute che hanno riscontrato difficoltà simili con i puzzle della griglia logica. L'articolo rileva che i commentatori si sono chiesti se questi risultati rivelino una limitazione del ragionamento tipicamente macchina o semplicemente riflettano il fatto che le persone commettono anche più errori all'aumentare della complessità. I suoi esempi di attraversamento del fiume e di griglia logica verificano quindi non solo se un modello può produrre una risposta, ma se può mantenere vincoli attraverso più deduzioni connesse.
Dettagli della fonte: technologyreview.com ↗
Perché è importante
L’articolo mostra perché le affermazioni generiche sull’intelligenza artificiale possono essere fuorvianti. Un modello può funzionare bene su curiosità o benchmark familiari mentre fallisce un piccolo cambiamento nella formulazione, una trasformazione visiva o un problema che richiede diversi passaggi dipendenti. Queste differenze contano quando i sistemi vengono utilizzati per prendere decisioni piuttosto che per dimostrazioni.
La lezione centrale è che la prestazione in una classe di test non dovrebbe essere trattata come una misura generale dell’intelligenza. Gli esempi del MIT Technology Review abbracciano compiti che sembrano superficialmente semplici ma che richiedono capacità diverse: ruotare mentalmente un oggetto, individuare la verità e la falsità nelle affermazioni, dedurre una regola visiva, resistere a un’intuizione fuorviante o pianificare una sequenza sotto vincoli. Un sistema può essere insolitamente forte in un’area e inaffidabile in un’altra. Questa disuguaglianza è particolarmente rilevante quando gli utenti interpretano le risposte fluenti come prova che un modello ha compreso il problema sottostante.
L'articolo evidenzia anche un problema di valutazione: il formato di un compito può influenzare materialmente il risultato. Il MIT Technology Review riporta che le prestazioni di ARC-AGI migliorano quando le griglie visive vengono convertite in rappresentazioni numeriche. Ciò suggerisce che un punteggio può riflettere non solo la capacità di ragionamento del modello ma anche il modo in cui il problema è codificato e presentato. La stessa preoccupazione si applica agli enigmi familiari. Se un modello ha riscontrato una variante simile durante l'addestramento, una risposta corretta può riflettere il riconoscimento o il recupero del modello piuttosto che la capacità di adattare una regola a un nuovo caso. La fonte non stabilisce la frequenza con cui si verifica uno dei due meccanismi nei sistemi distribuiti.
Queste limitazioni hanno implicazioni pratiche per chiunque utilizzi l’intelligenza artificiale nell’istruzione, nel software, nella ricerca, nell’amministrazione o in altri contesti che coinvolgono casi non familiari. Un modello che ha successo con esempi di routine potrebbe comunque fallire quando la formulazione cambia, interagiscono diversi vincoli o le informazioni rilevanti sono visive piuttosto che testuali. La funzionalità non riporta il lancio di un nuovo prodotto, il rilascio di un nuovo modello o una valutazione controllata di uno specifico sistema commerciale. Il suo valore è esplicativo: offre ai lettori modi concreti per capire perché i guadagni dei benchmark e il linguaggio raffinato non bastano da soli a stabilire un ragionamento solido. L’articolo mantiene anche un’importante precisazione: gli esseri umani hanno i propri pregiudizi e possono essere più lenti o meno affidabili su alcuni problemi.
Meccanismo interattivo: come funziona realmente
Esplora la tecnologia alla base di questo sviluppo in modo interattivo.
Which component of an AI application is the machine-learning model itself?
Cosa guardare dopo
Le valutazioni future dovranno testare qualcosa di più dei punteggi principali. Domande importanti includono se i modelli possono generalizzarsi a problemi non familiari, se le loro risposte dipendono da come vengono rappresentate le informazioni, come le prestazioni cambiano con l’aumentare della complessità e se il successo riflette una strategia riutilizzabile o modelli memorizzati.
Il prossimo sviluppo utile sarebbe un test più ampio e riproducibile su modelli e formati di attività. La funzionalità di MIT Technology Review non fornisce un'unica scorecard che copra tutti e sette i test, né la fonte specifica nomi di modelli, versioni, dimensioni dei campioni, condizioni di richiesta o tassi di errore per la maggior parte degli esempi. Tali dettagli sarebbero necessari per determinare se i punti deboli segnalati sono diffusi, concentrati in particolari famiglie di modelli o sensibili al modo in cui vengono somministrati i test.
Valutazioni indipendenti dovrebbero anche separare i fallimenti della percezione visiva dai fallimenti del ragionamento mantenendo costante il puzzle sottostante variandone la rappresentazione. I ricercatori e i valutatori dovrebbero anche verificare se i modelli migliorano attraverso una genuina generalizzazione o attraverso una maggiore esposizione a materiale simile a un benchmark. La discussione dell’articolo sugli enigmi di Connections e sulle variazioni di Knights and Knaves mostra perché la contaminazione e la familiarità sono importanti. Un modello che funziona bene su domande pubblicate o strettamente correlate potrebbe non essere altrettanto efficace su problemi appena generati con la stessa struttura sottostante. I test dovrebbero quindi includere enigmi, parole alterate, layout visivi non familiari e compiti che richiedono la spiegazione o il controllo di vincoli intermedi senza dare per scontato che una risposta persuasiva sia corretta.
La complessità e il trasferimento nel mondo reale rimangono questioni aperte. Il MIT Technology Review riporta che le prestazioni possono diminuire all’aumentare del numero di elementi o passaggi richiesti, ma la fonte non stabilisce come tali risultati si traducano in sistemi pratici con strumenti, recupero, memoria esterna o supervisione umana. I report futuri dovrebbero monitorare se tali aggiunte migliorano l’affidabilità, aiutano semplicemente i modelli a effettuare ricerche in modo più efficace o introducono nuove modalità di errore. I lettori dovrebbero anche prestare attenzione alle valutazioni che misurano la qualità della strategia, non solo la risposta finale, perché un risultato corretto raggiunto attraverso una regola fragile o non generalizzabile potrebbe non sopravvivere a un piccolo cambiamento nel problema.