Torna alle notizie
InnovazioneAI Understanding briefing

I ricercatori adattano il toolkit Dolma di Ai2 per costruire un corpus di formazione tailandese migliore

Un gruppo di ricerca tailandese ha adattato il toolkit di data curation aperto di Ai2 per creare Mangosteen, un corpus da 47 miliardi di token che, secondo il team, ha migliorato le prestazioni del modello in lingua tailandese rimuovendo gran parte dei dati web sottostanti.

5 min readRead the primary source
Primary-source image accompanying Researchers adapt Ai2’s Dolma toolkit to build a better Thai training corpus
Documento di origine primariaFonte registrata
Editore
allenai.org
Collegamento alla fonte
allenai.orghttps://allenai.org/blog/thai-llm-dolma
Tipo di fonte
Documento principale: un annuncio ufficiale, un documento, un documento o una pagina proprietaria che leggiamo direttamente.
ContestoComprendilo in 60 secondi

Inizia qui

Termini chiave

Pre-allenamento
Formazione iniziale del modello su larga scala su dati ampi prima dell'adattamento a valle.
Robustezza
La capacità di un modello di mantenere le prestazioni in condizioni di rumore, cambiamenti o input contrastanti.
Fattualità
Quanto accuratamente le affermazioni di un modello corrispondono a informazioni verificabili nel mondo reale.
Mettiti alla provaQuiz sulla spiegazione dei modelli di intelligenza artificiale

Cosa è successo

Secondo Ai2, i ricercatori tailandesi hanno utilizzato il toolkit aperto Dolma per costruire Mangosteen, un corpus da 47 miliardi di token per il pre-addestramento di modelli linguistici tailandesi. Il team ha riprogettato parti di Dolma per tenere conto del testo tailandese, dei problemi di qualità dei dati e di fonti importanti a livello locale che spesso i set di dati esistenti, ricchi di risorse web, spesso non rilevavano.

Ai2 descrive Mangosteen come un corpus di pre-allenamento tailandese creato da un team di ricercatori tailandesi che hanno utilizzato Dolma come punto di partenza. Il corpus contiene 47 miliardi di token. Il team ha iniziato con grandi raccolte di dati web e ha cercato di affrontare i punti deboli riscontrati nei set di dati tailandesi disponibili al pubblico, tra cui un controllo limitato da parte di parlanti tailandesi, materiale inadatto e una copertura insufficiente di libri, documenti di ricerca, siti Web ufficiali e sottotitoli YouTube. Wannaphong Phatthiyaphaibun, identificato da Ai2 come responsabile del progetto e studente di dottorato presso l'Istituto di scienza e tecnologia Vidyasirimedhi, ha affermato che al team mancavano abbastanza sviluppatori per costruire da zero una pipeline completa di data curation.

I ricercatori hanno scoperto che alcuni componenti di Dolma non potevano essere trasferiti direttamente in tailandese. In particolare, hanno riferito che la deduplicazione a livello di frase e di paragrafo ha rimosso quasi tutti i dati perché il tailandese non delimita i confini delle frasi allo stesso modo dell’inglese. Hanno mantenuto la deduplicazione a livello di documento e URL, modificato altre fasi di elaborazione, adattato i filtri di qualità, sostituito strumenti specifici per la lingua e aggiunto regole per i modelli nei dati web tailandesi. Un esempio riguardava le pagine di notizie tailandesi che contenevano frammenti troncati seguiti da istruzioni “Leggi di più”; il team ha aggiunto un filtro inteso a rimuovere quegli articoli incompleti.

Negli esperimenti descritti da Ai2, la pipeline adattata ha rimosso più dell'80% dei dati Common Crawl utilizzati come punto di partenza e quasi la metà di FineWeb2, una raccolta che la fonte descrive come già ripulita e curata per l'addestramento del modello. Il team ha riferito che i modelli addestrati sui set di dati più piccoli e filtrati hanno mantenuto o migliorato le prestazioni rispetto ai modelli addestrati sui set di dati più grandi. Ai2 afferma inoltre che tali miglioramenti sono stati apportati a modelli più grandi e che i modelli addestrati con Mangosteen hanno ottenuto risultati migliori nelle valutazioni della conoscenza culturale tailandese. La fonte non fornisce i nomi delle valutazioni, i punteggi numerici, le configurazioni del modello o i controlli sperimentali necessari per valutare l’entità e la robustezza di tali guadagni.

Dettagli della fonte: allenai.org ↗

Perché è importante

Il lavoro illustra come la qualità del modello linguistico possa dipendere da chi cura i dati di formazione e se gli strumenti possono essere adattati alla struttura specifica di una lingua. Il team riferisce che set di dati più piccoli e curati con maggiore attenzione corrispondono o superano i risultati di raccolte più grandi e migliorano le prestazioni nelle valutazioni della conoscenza culturale tailandese.

Il significato centrale è metodologico: il progetto tratta la formazione-data curation come qualcosa che dovrebbe essere adattato da persone che comprendono la lingua e il suo ambiente informativo. Una pipeline generica può preservare contenuti utili, ma i suoi presupposti sui limiti della frase, sulla duplicazione, sulla qualità o sulla struttura della pagina web possono comportarsi in modo diverso tra le lingue. L’esperienza del team tailandese suggerisce che una pipeline progettata attorno alle convenzioni della lingua inglese può scartare materiale prezioso o trattenere materiale di scarsa qualità se applicato altrove.

I risultati riportati mettono in discussione anche la semplice idea secondo cui un numero maggiore di token di formazione produce automaticamente modelli linguistici migliori. Ai2 afferma che il team ha rimosso la maggior parte di una raccolta web e quasi la metà di un'altra mantenendo o migliorando le prestazioni del modello. Se riprodotto in modo indipendente, ciò indicherebbe che il filtraggio mirato e la selezione della fonte a volte possono fornire più valore rispetto all’aggiunta di testo grezzo. Ridurre il materiale irrilevante o incompleto potrebbe anche rendere più facile l’ispezione dei dati di formazione, sebbene la fonte non riporti cambiamenti nel tempo di formazione, nel consumo di energia o nel costo totale.

Il miglioramento riportato nelle valutazioni della conoscenza culturale tailandese è particolarmente rilevante per la rappresentanza. Un modello può funzionare bene su compiti linguistici generali pur mancando riferimenti locali, istituzioni, storia o contesto culturale. Il team interpreta il risultato come prova che i dati rilevanti a livello locale possono aiutare i modelli a rappresentare le comunità che servono. Tale conclusione rimane un’affermazione derivante dagli esperimenti del progetto, non un risultato stabilito in modo indipendente in questa fonte. L'articolo non fornisce dettagli sui parametri di riferimento, sugli ambiti culturali testati o se i guadagni provenissero dalla diversità delle fonti, dal filtraggio, dal volume dei dati o da altri cambiamenti.

Interactive Mechanism

Meccanismo interattivo: come funziona realmente

Esplora la tecnologia alla base di questo sviluppo in modo interattivo.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verifica concettuale interattiva+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Cosa guardare dopo

La fonte non fornisce nomi di benchmark, punteggi esatti, dimensioni del modello, costi di elaborazione, dettagli sulla licenza del corpus o replica indipendente. Il significato pratico dipenderà dal fatto che Mangosteen e il gasdotto modificato verranno rilasciati, se altri ricercatori tailandesi riusciranno a riprodurre i risultati e se metodi simili miglioreranno i modelli in altre lingue sottorappresentate.

La prima questione pratica è se gli artefatti della ricerca diventeranno disponibili. La fonte sottolinea l'apertura di Dolma e descrive Mangosteen come un adattamento riproducibile, ma non dice se il corpus da 47 miliardi di token, le regole di filtraggio, gli strumenti di sostituzione o il codice di valutazione saranno rilasciati pubblicamente. Considerazioni sulla licenza e sulla privacy possono influenzare ciò che può essere distribuito, soprattutto perché la fonte afferma che il progetto si è basato su pagine web, libri, documenti di ricerca, siti Web ufficiali e sottotitoli YouTube.

La valutazione indipendente sarà importante. La fonte riporta confronti con Common Crawl e FineWeb2, ma non identifica i conteggi dei parametri dei modelli, le procedure di addestramento, le miscele di dati, i punteggi dei benchmark o l’incertezza statistica. Il lavoro di follow-up dovrebbe verificare se i miglioramenti persistono nella generazione del linguaggio, nel ragionamento, nella fattualità, nella sicurezza e nei compiti di seguire le istruzioni, piuttosto che solo nelle valutazioni della conoscenza culturale menzionate da Ai2. Dovrebbe anche esaminare se il filtraggio ha rimosso materiale dialettale, regionale o comunitario legittimo.

Il test più ampio è se questo approccio può essere trasferito ad altri linguaggi e gruppi di ricerca con risorse ingegneristiche limitate. Il valore di Dolma, come presentato qui, è che i ricercatori possono modificare una pipeline esistente invece di ricostruirne una. Ma la fonte non stabilisce che gli stessi cambiamenti funzioneranno per lingue con diversi sistemi di scrittura, ecosistemi web o disponibilità di dati. Gli aggiornamenti futuri dovrebbero chiarire la riproducibilità, la governance del corpus, la copertura delle fonti, il comportamento del modello e i compromessi tra rilevanza locale, qualità dei dati, apertura e uso responsabile.

Guide e quiz correlati

Spiegazione dei modelli di intelligenza artificialeFormazione sull'intelligenza artificialeEtica dell'IAMetti alla prova ciò che sai: prova un quiz gratuito sull'intelligenza artificialeCerca un termine AI nel nostro glossarioSegui il tracker del rilascio del modello AI
Lo hai trovato utile?