Cosa è successo
Il MIT Technology Review riporta il divario in termini di efficienza dei dati tra i bambini che imparano la lingua e i grandi modelli linguistici formati su enormi raccolte di testi. I ricercatori stanno utilizzando concorsi basati su modelli linguistici basati su piccoli dati, filmati di bambini con la videocamera e registrazioni più ampie dei primi anni di vita dei bambini per indagare su quali macchine potrebbero mancare.
Il MIT Technology Review riporta che i bambini in genere iniziano a produrre frasi grammaticalmente corrette dopo aver ascoltato circa 10 milioni di parole, con stime che raggiungono circa 30 milioni nella fascia alta. Al contrario, i moderni modelli linguistici di grandi dimensioni possono elaborare trilioni di token durante il pre-addestramento. L’articolo descrive questa disparità come il “gap di efficienza dei dati”: i bambini imparano la lingua da un piccolo flusso di esperienze incarnate, mentre i modelli dipendono da raccolte di testi molto più grandi.
Il rapporto fa riferimento a BabyLM, un concorso organizzato da ricercatori tra cui Alex Warstadt, Leshem Choshen e altri. La MIT Technology Review afferma che la competizione principale limita i modelli a un corpus plausibile dal punto di vista dello sviluppo di circa 100 milioni di parole, con una traccia su scala infantile che ne utilizza 10 milioni. I dati possono includere libri di fiabe, dialoghi, sottotitoli di film, Wikipedia e trascrizioni di discorsi rivolti ai bambini. I modelli vengono valutati con compiti grammaticali simili a quelli utilizzati in psicolinguistica.
Secondo il MIT Technology Review, il concorso ha messo in discussione il presupposto secondo cui l’apprendimento del curriculum – presentando materiale semplice prima di materiale complesso – aiuterebbe i modelli a imparare di più come i bambini. L'approccio è stato popolare nella prima fase, ma non ha funzionato come previsto. L’articolo afferma che il sistema leader del 2024, GPT-BERT, ha combinato la previsione del token successivo con la modellazione del linguaggio mascherato e, dopo l’addestramento su circa 100 milioni di parole, ha superato Llama 2 70B di Meta su un BabyLM. Il rapporto sottolinea inoltre che questi modelli rimangono molto più deboli degli attuali sistemi commerciali e non riproducono le capacità generali del bambino.
L'articolo riporta che il testo da solo potrebbe rappresentare un'approssimazione inadeguata dell'esperienza infantile. Il progetto SAYCam di Michael Frank ha registrato due ore a settimana della vita di tre bambini tra i sei mesi e i due anni e mezzo. Il MIT Technology Review afferma che un modello addestrato su 61 ore di questo filmato grezzo ha imparato a identificare gli oggetti e ad associarli alle parole, ma non ha sviluppato le capacità di un bambino di due anni. Un progetto più recente guidato da Uri Hasson ha registrato i primi 1.000 giorni di vita di 17 bambini, utilizzando telecamere e microfoni nelle aree abitate per circa 12 ore al giorno quasi tutti i giorni. Il set di dati risultante è stato descritto in una recente prestampa, ma l’articolo non fornisce informazioni sufficienti per valutare in modo indipendente i metodi o i risultati di tale prestampa.
Il MIT Technology Review riferisce che i ricercatori stanno considerando l’esplorazione attiva e l’apprendimento sociale come ulteriori ingredienti mancanti. Alison Gopnik sostiene che i bambini scelgono esperienze, sperimentano e cercano effetti prevedibili sul mondo, mentre Elizabeth Bonawitz afferma che i bambini ragionano sugli insegnanti e sul perché vengono fornite le informazioni. L'articolo afferma che un percorso BabyLM che consente ai modelli di apprendere attraverso l'interazione con altri modelli non ha superato gli approcci standard. I ricercatori e i collaboratori accademici di Meta hanno anche annunciato un punto di riferimento e una sfida che coinvolge filmati di baby headcam, sebbene il rapporto non dimostri che questo sforzo abbia prodotto un modello di successo su scala infantile.
Dettagli della fonte: technologyreview.com ↗
Perché è importante
La ricerca potrebbe influenzare il modo in cui vengono addestrati i modelli di intelligenza artificiale, in particolare per i video e le lingue minoritarie dove non sono disponibili grandi set di dati. Potrebbe anche fornire nuovi strumenti sperimentali per studiare lo sviluppo del linguaggio, mentre l’articolo sottolinea che i modelli attuali sono lontani dal riprodurre le capacità più ampie di un bambino.
Il MIT Technology Review riporta che l’efficienza dei dati è diventata un vincolo ingegneristico poiché gli sviluppatori di intelligenza artificiale scalano i modelli aumentando i dati di addestramento. L'articolo afferma che i modelli di frontiera potrebbero essere pre-addestrati su circa dieci volte più dati rispetto ai 15 trilioni di token segnalati da Llama 3.1, mentre la fornitura di dati Internet facilmente disponibili potrebbe alla fine diventare limitata, forse già negli anni '30. Tale cronologia è una stima attribuita alla discussione dell’articolo e non è confermata in modo indipendente qui.
Un apprendimento più efficiente potrebbe ampliare l’accesso allo sviluppo dell’IA. Il rapporto cita David Samuel, uno degli architetti di GPT-BERT, secondo cui il ceco e il norvegese hanno molti meno dati di addestramento disponibili rispetto all’inglese, mentre lingue come il sami potrebbero avere solo decine di milioni di token. Se i modelli potessero apprendere in modo più efficace da piccoli set di dati, le università e le comunità che lavorano con linguaggi con risorse limitate potrebbero essere in grado di costruire sistemi più capaci senza le risorse necessarie per la formazione su vasta scala. Il MIT Technology Review lo presenta come un potenziale vantaggio, non come un risultato dimostrato.
La ricerca potrebbe avere importanza anche per l’intelligenza artificiale multimodale. Il MIT Technology Review riferisce che l’aggiunta di dati visivi ai sistemi BabyLM non ha ancora prodotto i vantaggi attesi, mentre i modelli esistenti addestrati sui filmati dei bambini hanno imparato solo semplici associazioni di parole-oggetti. Se i ricercatori identificassero il modo in cui i bambini combinano vista, udito, movimento, attenzione e linguaggio, tali risultati potrebbero informare i sistemi addestrati su video e altri dati sensoriali. L'articolo non riporta un metodo collaudato che abbia già colmato il divario.
Esiste un valore scientifico oltre l’efficienza del modello. Il rapporto descrive i ricercatori che utilizzano modelli linguistici come sostituti sperimentali imperfetti per gli utenti della lingua. Gli scienziati possono imporre condizioni che sarebbe difficile o non etico imporre ai bambini, come limitare l’esposizione a particolari forme grammaticali o simulare diversi gradi di bilinguismo. Il MIT Technology Review afferma che tali esperimenti potrebbero testare idee sulla dipendenza del linguaggio dalla struttura innata, dai vincoli generali di apprendimento o dall’esperienza ambientale. Questi confronti rimangono limitati perché i cervelli sono incarnati, si sviluppano continuamente e contengono meccanismi biologici che i modelli linguistici non condividono.
Le prove principali supportano una conclusione più ristretta rispetto a quella secondo cui l’intelligenza artificiale si sta avvicinando all’apprendimento umano. Il MIT Technology Review riferisce che i modelli possono apprendere la sintassi e funzionare bene su selezionati, ma afferma anche che i sistemi su scala infantile rimangono goffi, molti non possono generare testo e gli attuali modelli addestrati tramite video sono tutt'altro che infantili. L’articolo non stabilisce che alcuna architettura esistente apprenda il linguaggio con efficienza a livello umano, né che le intuizioni provenienti dai modelli risolveranno controversie di lunga data nella linguistica o nella psicologia dello sviluppo.
Meccanismo interattivo: come funziona realmente
Esplora la tecnologia alla base di questo sviluppo in modo interattivo.
Which component of an AI application is the machine-learning model itself?
Cosa guardare dopo
Scopri se i metodi di formazione multimodali, interattivi e socialmente informati migliorano le prestazioni sui dati su scala infantile. Osserva anche se nuovi set di dati, come le registrazioni a lungo termine della vita dei bambini, producono progressi misurabili e se i ricercatori riescono a distinguere utili intuizioni cognitive dai confronti tra sistemi fondamentalmente diversi.
La prima area da osservare è se i modelli addestrati su dati sensoriali più ricchi possano andare oltre le associazioni oggetto-parola. Il MIT Technology Review riporta che i sistemi basati su SAYCam hanno imparato parole semplici come “palla” e “gatto”, ma non sono diventati utenti linguistici ampiamente capaci. Le valutazioni future dovrebbero quindi testare la grammatica, le basi, la generalizzazione, l’interazione e l’apprendimento nel tempo piuttosto che fare affidamento su risultati di riconoscimento isolati.
I ricercatori dovranno anche determinare se l’apprendimento attivo produce guadagni misurabili. L'articolo descrive i bambini come se selezionassero esperienze, sperimentassero e cercassero informazioni che colmino le lacune di conoscenza, ma afferma che i primi esperimenti sui modelli sociali non superavano i modelli standard. Un progresso significativo richiederebbe confronti controllati che mostrino quali forme di esplorazione o interazione migliorano l’apprendimento con gli stessi dati e limiti di calcolo.
I set di dati longitudinali possono modificare la base delle prove. Il MIT Technology Review riporta che il progetto di Hasson ha registrato 17 bambini durante i loro primi 1.000 giorni, creando una visione molto più ampia delle prime esperienze rispetto ai precedenti progetti headcam. Importanti incognite includono quanto siano rappresentative le famiglie partecipanti, come vengono annotate le registrazioni, quali garanzie sulla privacy regolano l’accesso e se i dati possono essere utilizzati per addestrare modelli senza ridurre l’esperienza infantile a un insieme ristretto di segnali misurabili. La fonte non risponde a queste domande.
BabyLM e i relativi parametri di riferimento dovrebbero essere seguiti per quanto riguarda la riproducibilità e l'ambito. L'articolo riporta un ottimo risultato per GPT-BERT su un rispetto a Llama 2 70B, ma chiarisce anche che ciò non rende GPT-BERT generalmente paragonabile a un moderno modello commerciale. I lettori dovrebbero verificare se i risultati valgono per lingue, set di dati, dimensioni del modello e attività di valutazione, e se i vantaggi derivano da metodi di apprendimento veramente migliori o da scelte di progettazione specifiche per benchmark.
Infine, le priorità pratiche del settore potrebbero determinare la diffusione della ricerca ispirata ai bambini. Il MIT Technology Review riferisce che i laboratori di frontiera non stanno correndo per copiare la psicologia dello sviluppo, mentre Meta ha mostrato particolare interesse per la ricerca su video e headcam infantili. Non è noto se le aziende pubblicheranno metodi e risultati sufficienti per consentire un controllo indipendente, se le comunità di piccole lingue ne trarranno benefici diretti e se i risultati cognitivi derivati dai modelli di intelligenza artificiale resisteranno alle prove di bambini reali e studi sullo sviluppo.