Terug naar Nieuws
InnovatieAI Understanding-briefing

Onderzoekers passen de Dolma-toolkit van Ai2 aan om een beter Thais trainingscorpus op te bouwen

Een Thais onderzoeksteam heeft de open data-curation toolkit van Ai2 aangepast om Mangosteen te creëren, een corpus met 47 miljard tokens waarvan het team zegt dat het de prestaties van het Thaise model heeft verbeterd terwijl veel van de onderliggende webgegevens zijn verwijderd.

5 min readRead the primary source
Primary-source image accompanying Researchers adapt Ai2’s Dolma toolkit to build a better Thai training corpus
Primair brondocumentBron opgenomen
Uitgever
allenai.org
Bronlink
allenai.orghttps://allenai.org/blog/thai-llm-dolma
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Voortraining
Initiële grootschalige modeltraining op brede gegevens vóór downstream-aanpassing.
Robuustheid
Het vermogen van een model om de prestaties te behouden onder ruis, verschuivingen of vijandige input.
Feitelijkheid
Hoe nauwkeurig de beweringen van een model overeenkomen met verifieerbare informatie uit de echte wereld.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

Volgens Ai2 gebruikten Thaise onderzoekers de open Dolma-toolkit om Mangosteen te bouwen, een corpus van 47 miljard token voor het voortrainen van Thaise taalmodellen. Het team heeft delen van Dolma opnieuw ontworpen om rekening te houden met Thaise tekst, problemen met de gegevenskwaliteit en lokaal belangrijke bronnen die bestaande webzware datasets vaak misten.

Ai2 beschrijft Mangosteen als een Thais voortrainingscorpus, gemaakt door een team van Thaise onderzoekers die Dolma als uitgangspunt gebruikten. Het corpus bevat 47 miljard tokens. Het team begon met grote webgegevensverzamelingen en probeerde de zwakke punten aan te pakken die ze in openbaar beschikbare Thaise datasets zagen, waaronder beperkte auditing door Thaise sprekers, ongeschikt materiaal en onvoldoende dekking van boeken, onderzoekspapers, officiële websites en YouTube-ondertitels. Wannaphong Phatthiyaphaibun, door Ai2 geïdentificeerd als projectleider en promovendus aan het Vidyasirimedhi Institute of Science and Technology, zei dat het team niet genoeg ontwikkelaars had om vanaf het begin een complete datacuratiepijplijn op te bouwen.

De onderzoekers ontdekten dat sommige Dolma-componenten niet rechtstreeks naar Thai konden worden overgedragen. Ze meldden met name dat deduplicatie op zins- en alineaniveau bijna al hun gegevens verwijderde, omdat het Thais de zinsgrenzen niet op dezelfde manier markeert als het Engels. Ze behielden deduplicatie op document- en URL-niveau, wijzigden andere verwerkingsfasen, pasten kwaliteitsfilters aan, vervingen taalspecifieke tools en voegden regels toe voor patronen in Thaise webgegevens. Een voorbeeld betrof Thaise nieuwspagina's die afgekapte fragmenten bevatten, gevolgd door 'Lees meer'-prompts; het team heeft filters toegevoegd die bedoeld zijn om die onvolledige artikelen te verwijderen.

In experimenten beschreven door Ai2 verwijderde de aangepaste pijplijn meer dan 80% van de Common Crawl-gegevens die als uitgangspunt werden gebruikt, en bijna de helft van FineWeb2, een verzameling die volgens de bron al is opgeschoond en samengesteld voor modeltraining. Het team rapporteerde dat modellen die waren getraind op de kleinere, gefilterde datasets de prestaties behielden of verbeterden in vergelijking met modellen die waren getraind op de grotere datasets. Ai2 zegt ook dat deze verbeteringen werden doorgevoerd in grotere modellen en dat door Mangosteen getrainde modellen beter presteerden op Thaise culturele kennisevaluaties. De bron geeft niet de evaluatienamen, numerieke scores, modelconfiguraties of experimentele controles die nodig zijn om de omvang en robuustheid van die winsten te beoordelen.

Brongegevens: allenai.org ↗

Waarom het ertoe doet

Het werk illustreert hoe de kwaliteit van taalmodellen kan afhangen van wie de trainingsgegevens beheert en of de tools kunnen worden aangepast aan de specifieke structuur van een taal. Het team rapporteert dat kleinere, zorgvuldiger samengestelde datasets de resultaten van grotere collecties evenaren of zelfs overtroffen, en de prestaties verbeterden op het gebied van evaluaties van Thaise culturele kennis.

De centrale betekenis is methodologisch: het project behandelt training-datacuratie als iets dat moet worden aangepast door mensen die de taal en de informatieomgeving ervan begrijpen. Een pijplijn voor algemeen gebruik kan nuttige inhoud behouden, maar de aannames over zinsgrenzen, duplicatie, kwaliteit of webpaginastructuur kunnen zich in verschillende talen verschillend gedragen. De ervaring van het Thaise team suggereert dat een pijplijn die is ontworpen rond Engelstalige conventies waardevol materiaal kan weggooien of materiaal van slechte kwaliteit kan behouden wanneer het elders wordt toegepast.

De gerapporteerde resultaten dagen ook het simpele idee uit dat meer trainingstokens automatisch betere taalmodellen opleveren. Ai2 zegt dat het team het grootste deel van de ene webcollectie en bijna de helft van de andere heeft verwijderd, terwijl de prestaties van het model behouden of verbeterd zijn. Als dit onafhankelijk wordt gereproduceerd, zou dit erop wijzen dat gerichte filtering en bronselectie soms meer waarde kunnen opleveren dan het toevoegen van onbewerkte tekst. Het verminderen van irrelevant of onvolledig materiaal zou de trainingsgegevens ook gemakkelijker te inspecteren kunnen maken, hoewel de bron geen veranderingen in trainingstijd, energieverbruik of totale kosten rapporteert.

De gerapporteerde verbetering in de evaluaties van de Thaise culturele kennis is met name relevant voor de vertegenwoordiging. Een model kan goed presteren bij algemene taaltaken, terwijl het nog steeds lokale referenties, instellingen, geschiedenis of culturele context mist. Het team interpreteert het resultaat als bewijs dat lokaal relevante gegevens modellen kunnen helpen de gemeenschappen te vertegenwoordigen die zij dienen. Die conclusie blijft een bewering uit de experimenten van het project, en niet een onafhankelijk vastgestelde bevinding in deze bron. Het artikel geeft geen details over de benchmarks, de geteste culturele domeinen, en of de winst voortkwam uit brondiversiteit, filtering, datavolume of andere veranderingen.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

De bron biedt geen benchmarknamen, exacte scores, modelgroottes, computerkosten, corpuslicentiedetails of onafhankelijke replicatie. De praktische betekenis zal afhangen van de vraag of Mangosteen en de gewijzigde pijplijn worden vrijgegeven, of andere Thaise onderzoekers de bevindingen kunnen reproduceren en of soortgelijke methoden modellen in andere ondervertegenwoordigde talen kunnen verbeteren.

De eerste praktische vraag is of de onderzoeksartefacten beschikbaar komen. De bron benadrukt de openheid van Dolma en beschrijft Mangosteen als een reproduceerbare aanpassing, maar zegt niet of het corpus van 47 miljard token, de filterregels, de vervangingstools of de evaluatiecode publiekelijk zijn vrijgegeven. Licentie- en privacyoverwegingen kunnen van invloed zijn op wat er mag worden gedistribueerd, vooral omdat de bron zegt dat het project gebruik maakte van webpagina's, boeken, onderzoekspapers, officiële websites en YouTube-ondertitels.

Onafhankelijke evaluatie zal belangrijk zijn. De bron rapporteert vergelijkingen met Common Crawl en FineWeb2, maar identificeert niet de parametertellingen, trainingsprocedures, datamengsels, benchmarkscores of statistische onzekerheid van de modellen. Vervolgwerk zou moeten testen of de winsten blijven bestaan ​​bij het genereren van talen, redeneren, feitelijkheid, veiligheid en het volgen van instructies, en niet alleen bij de door Ai2 genoemde evaluaties van culturele kennis. Er moet ook worden onderzocht of door het filteren legitiem dialectisch, regionaal of minderheidsgemeenschapsmateriaal is verwijderd.

De bredere test is of deze aanpak ook toepasbaar is op andere talen en onderzoeksteams met beperkte technische middelen. De waarde van Dolma, zoals hier gepresenteerd, is dat onderzoekers een bestaande pijplijn kunnen aanpassen in plaats van er één opnieuw op te bouwen. Maar de bron stelt niet vast dat dezelfde veranderingen zullen werken voor talen met verschillende schrijfsystemen, webecosystemen of beschikbaarheid van gegevens. Toekomstige updates moeten de reproduceerbaarheid, het corpusbeheer, de brondekking, het modelgedrag en de afwegingen tussen lokale relevantie, gegevenskwaliteit, openheid en verantwoord gebruik verduidelijken.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-trainingAI-ethiekTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?