Cosa è successo
Secondo Ai2, i ricercatori tailandesi hanno utilizzato il toolkit aperto Dolma per costruire Mangosteen, un corpus da 47 miliardi di token per il pre-addestramento di modelli linguistici tailandesi. Il team ha riprogettato parti di Dolma per tenere conto del testo tailandese, dei problemi di qualità dei dati e di fonti importanti a livello locale che spesso i set di dati esistenti, ricchi di risorse web, spesso non rilevavano.
Ai2 descrive Mangosteen come un corpus di pre-allenamento tailandese creato da un team di ricercatori tailandesi che hanno utilizzato Dolma come punto di partenza. Il corpus contiene 47 miliardi di token. Il team ha iniziato con grandi raccolte di dati web e ha cercato di affrontare i punti deboli riscontrati nei set di dati tailandesi disponibili al pubblico, tra cui un controllo limitato da parte di parlanti tailandesi, materiale inadatto e una copertura insufficiente di libri, documenti di ricerca, siti Web ufficiali e sottotitoli YouTube. Wannaphong Phatthiyaphaibun, identificato da Ai2 come responsabile del progetto e studente di dottorato presso l'Istituto di scienza e tecnologia Vidyasirimedhi, ha affermato che al team mancavano abbastanza sviluppatori per costruire da zero una pipeline completa di data curation.
I ricercatori hanno scoperto che alcuni componenti di Dolma non potevano essere trasferiti direttamente in tailandese. In particolare, hanno riferito che la deduplicazione a livello di frase e di paragrafo ha rimosso quasi tutti i dati perché il tailandese non delimita i confini delle frasi allo stesso modo dell’inglese. Hanno mantenuto la deduplicazione a livello di documento e URL, modificato altre fasi di elaborazione, adattato i filtri di qualità, sostituito strumenti specifici per la lingua e aggiunto regole per i modelli nei dati web tailandesi. Un esempio riguardava le pagine di notizie tailandesi che contenevano frammenti troncati seguiti da istruzioni “Leggi di più”; il team ha aggiunto un filtro inteso a rimuovere quegli articoli incompleti.
Negli esperimenti descritti da Ai2, la pipeline adattata ha rimosso più dell'80% dei dati Common Crawl utilizzati come punto di partenza e quasi la metà di FineWeb2, una raccolta che la fonte descrive come già ripulita e curata per l'addestramento del modello. Il team ha riferito che i modelli addestrati sui set di dati più piccoli e filtrati hanno mantenuto o migliorato le prestazioni rispetto ai modelli addestrati sui set di dati più grandi. Ai2 afferma inoltre che tali miglioramenti sono stati apportati a modelli più grandi e che i modelli addestrati con Mangosteen hanno ottenuto risultati migliori nelle valutazioni della conoscenza culturale tailandese. La fonte non fornisce i nomi delle valutazioni, i punteggi numerici, le configurazioni del modello o i controlli sperimentali necessari per valutare l’entità e la robustezza di tali guadagni.
Dettagli della fonte: allenai.org ↗
Perché è importante
Il lavoro illustra come la qualità del modello linguistico possa dipendere da chi cura i dati di formazione e se gli strumenti possono essere adattati alla struttura specifica di una lingua. Il team riferisce che set di dati più piccoli e curati con maggiore attenzione corrispondono o superano i risultati di raccolte più grandi e migliorano le prestazioni nelle valutazioni della conoscenza culturale tailandese.
Il significato centrale è metodologico: il progetto tratta la formazione-data curation come qualcosa che dovrebbe essere adattato da persone che comprendono la lingua e il suo ambiente informativo. Una pipeline generica può preservare contenuti utili, ma i suoi presupposti sui limiti della frase, sulla duplicazione, sulla qualità o sulla struttura della pagina web possono comportarsi in modo diverso tra le lingue. L’esperienza del team tailandese suggerisce che una pipeline progettata attorno alle convenzioni della lingua inglese può scartare materiale prezioso o trattenere materiale di scarsa qualità se applicato altrove.
I risultati riportati mettono in discussione anche la semplice idea secondo cui un numero maggiore di token di formazione produce automaticamente modelli linguistici migliori. Ai2 afferma che il team ha rimosso la maggior parte di una raccolta web e quasi la metà di un'altra mantenendo o migliorando le prestazioni del modello. Se riprodotto in modo indipendente, ciò indicherebbe che il filtraggio mirato e la selezione della fonte a volte possono fornire più valore rispetto all’aggiunta di testo grezzo. Ridurre il materiale irrilevante o incompleto potrebbe anche rendere più facile l’ispezione dei dati di formazione, sebbene la fonte non riporti cambiamenti nel tempo di formazione, nel consumo di energia o nel costo totale.
Il miglioramento riportato nelle valutazioni della conoscenza culturale tailandese è particolarmente rilevante per la rappresentanza. Un modello può funzionare bene su compiti linguistici generali pur mancando riferimenti locali, istituzioni, storia o contesto culturale. Il team interpreta il risultato come prova che i dati rilevanti a livello locale possono aiutare i modelli a rappresentare le comunità che servono. Tale conclusione rimane un’affermazione derivante dagli esperimenti del progetto, non un risultato stabilito in modo indipendente in questa fonte. L'articolo non fornisce dettagli sui parametri di riferimento, sugli ambiti culturali testati o se i guadagni provenissero dalla diversità delle fonti, dal filtraggio, dal volume dei dati o da altri cambiamenti.
Meccanismo interattivo: come funziona realmente
Esplora la tecnologia alla base di questo sviluppo in modo interattivo.
Which component of an AI application is the machine-learning model itself?
Cosa guardare dopo
La fonte non fornisce nomi di benchmark, punteggi esatti, dimensioni del modello, costi di elaborazione, dettagli sulla licenza del corpus o replica indipendente. Il significato pratico dipenderà dal fatto che Mangosteen e il gasdotto modificato verranno rilasciati, se altri ricercatori tailandesi riusciranno a riprodurre i risultati e se metodi simili miglioreranno i modelli in altre lingue sottorappresentate.
La prima questione pratica è se gli artefatti della ricerca diventeranno disponibili. La fonte sottolinea l'apertura di Dolma e descrive Mangosteen come un adattamento riproducibile, ma non dice se il corpus da 47 miliardi di token, le regole di filtraggio, gli strumenti di sostituzione o il codice di valutazione saranno rilasciati pubblicamente. Considerazioni sulla licenza e sulla privacy possono influenzare ciò che può essere distribuito, soprattutto perché la fonte afferma che il progetto si è basato su pagine web, libri, documenti di ricerca, siti Web ufficiali e sottotitoli YouTube.
La valutazione indipendente sarà importante. La fonte riporta confronti con Common Crawl e FineWeb2, ma non identifica i conteggi dei parametri dei modelli, le procedure di addestramento, le miscele di dati, i punteggi dei benchmark o l’incertezza statistica. Il lavoro di follow-up dovrebbe verificare se i miglioramenti persistono nella generazione del linguaggio, nel ragionamento, nella fattualità, nella sicurezza e nei compiti di seguire le istruzioni, piuttosto che solo nelle valutazioni della conoscenza culturale menzionate da Ai2. Dovrebbe anche esaminare se il filtraggio ha rimosso materiale dialettale, regionale o comunitario legittimo.
Il test più ampio è se questo approccio può essere trasferito ad altri linguaggi e gruppi di ricerca con risorse ingegneristiche limitate. Il valore di Dolma, come presentato qui, è che i ricercatori possono modificare una pipeline esistente invece di ricostruirne una. Ma la fonte non stabilisce che gli stessi cambiamenti funzioneranno per lingue con diversi sistemi di scrittura, ecosistemi web o disponibilità di dati. Gli aggiornamenti futuri dovrebbero chiarire la riproducibilità, la governance del corpus, la copertura delle fonti, il comportamento del modello e i compromessi tra rilevanza locale, qualità dei dati, apertura e uso responsabile.