Wat is er gebeurd
MIT Technology Review rapporteert over de data-efficiëntiekloof tussen kinderen die taal leren en grote taalmodellen die zijn getraind op enorme tekstverzamelingen. Onderzoekers gebruiken taalmodelwedstrijden met kleine data, hoofdcamerabeelden van kinderen en grotere opnames van de vroege levens van kinderen om te onderzoeken welke machines mogelijk ontbreken.
MIT Technology Review meldt dat kinderen doorgaans grammaticaal correcte zinnen beginnen te produceren nadat ze ongeveer 10 miljoen woorden hebben gehoord, waarbij schattingen oplopen tot ongeveer 30 miljoen aan de hoge kant. Moderne grote taalmodellen kunnen daarentegen biljoenen tokens verwerken tijdens de voortraining. Het artikel beschrijft deze ongelijkheid als de ‘data efficiency gap’: kinderen leren taal vanuit een kleine, belichaamde stroom van ervaringen, terwijl modellen afhankelijk zijn van veel grotere tekstverzamelingen.
Het rapport verwijst naar BabyLM, een wedstrijd georganiseerd door onderzoekers als Alex Warstadt, Leshem Choshen en anderen. MIT Technology Review zegt dat de belangrijkste concurrentie modellen beperkt tot een voor de ontwikkeling plausibel corpus van ongeveer 100 miljoen woorden, terwijl een track op peuterschaal 10 miljoen woorden gebruikt. De gegevens kunnen bestaan uit verhalenboeken, dialogen, filmondertitels, Wikipedia en transcripties van spraak gericht op kinderen. Modellen worden geëvalueerd met grammaticataken die vergelijkbaar zijn met die welke in de psycholinguïstiek worden gebruikt.
Volgens MIT Technology Review heeft de concurrentie de veronderstelling in twijfel getrokken dat het leren van leerplannen – het presenteren van eenvoudig materiaal vóór complex materiaal – modellen zou helpen meer als kinderen te leren. De aanpak was populair in de eerste ronde, maar presteerde niet zo goed als verwacht. Het artikel zegt dat het toonaangevende systeem uit 2024, GPT-BERT, next-token-voorspelling combineerde met gemaskeerde taalmodellering en, na training op ongeveer 100 miljoen woorden, de Llama 2 70B van Meta overtrof op één BabyLM-. Het rapport benadrukt ook dat deze modellen veel zwakker blijven dan de huidige commerciële systemen en de algemene capaciteiten van een kind niet reproduceren.
Het artikel meldt dat tekst alleen een ontoereikende benadering kan zijn van de ervaringen uit de kindertijd. Het SAYCam-project van Michael Frank registreerde twee uur per week het leven van drie baby's tussen zes maanden en tweeënhalf jaar. MIT Technology Review zegt dat een model dat op 61 uur van deze onbewerkte beelden was getraind, objecten heeft leren identificeren en deze met woorden heeft geassocieerd, maar niet de capaciteiten van een tweejarige heeft voortgebracht. Een nieuwer project onder leiding van Uri Hasson registreerde de eerste 1.000 dagen van het leven van 17 kinderen, waarbij camera's en microfoons in woonruimten op de meeste dagen ongeveer 12 uur per dag werden gebruikt. De resulterende dataset werd beschreven in een recente preprint, maar het artikel biedt hier niet voldoende informatie om de methoden of bevindingen van die preprint onafhankelijk te beoordelen.
MIT Technology Review meldt dat onderzoekers actieve verkenning en sociaal leren beschouwen als aanvullende ontbrekende ingrediënten. Alison Gopnik stelt dat kinderen ervaringen kiezen, experimenteren en voorspelbare effecten op de wereld zoeken, terwijl Elizabeth Bonawitz zegt dat kinderen redeneren over leraren en waarom informatie wordt verstrekt. Het artikel zegt dat een BabyLM-track waarmee modellen kunnen leren door interactie met andere modellen niet beter presteerde dan de standaardbenaderingen. Meta-onderzoekers en academische medewerkers hebben ook een en uitdaging aangekondigd met betrekking tot baby-headcambeelden, hoewel het rapport niet vaststelt dat deze inspanning een succesvol model op kinderschaal heeft opgeleverd.
Brongegevens: technologyreview.com ↗
Waarom het ertoe doet
Het onderzoek zou van invloed kunnen zijn op de manier waarop AI-modellen worden getraind, vooral voor video- en minderheidstalen waarvoor grote datasets niet beschikbaar zijn. Het zou ook nieuwe experimentele instrumenten kunnen opleveren voor het bestuderen van de taalontwikkeling, terwijl het artikel benadrukt dat de huidige modellen nog lang niet de bredere capaciteiten van een kind reproduceren.
MIT Technology Review meldt dat data-efficiëntie een technische beperking is geworden nu AI-ontwikkelaars modellen schalen door trainingsgegevens te vergroten. Het artikel zegt dat grensmodellen kunnen worden voorgetraind op grofweg tien keer meer data dan de door Llama 3.1 gerapporteerde 15 biljoen tokens, terwijl het aanbod van gemakkelijk beschikbare internetdata uiteindelijk beperkt kan worden, mogelijk al in de jaren 2030. Die tijdlijn is een schatting die wordt toegeschreven aan de discussie van het artikel en wordt hier niet onafhankelijk bevestigd.
Efficiënter leren zou de toegang tot AI-ontwikkeling kunnen verbreden. Het rapport citeert David Samuel, een van de architecten van GPT-BERT, die zegt dat Tsjechisch en Noors veel minder trainingsgegevens beschikbaar hebben dan Engels, terwijl talen als Sami mogelijk slechts tientallen miljoenen tokens hebben. Als modellen effectiever zouden kunnen leren van kleine datasets, zouden universiteiten en gemeenschappen die in talen met onvoldoende middelen werken, capabelere systemen kunnen bouwen zonder de middelen die nodig zijn voor grootschalige training. MIT Technology Review presenteert dit als een potentieel voordeel, niet als een aangetoond resultaat.
Het onderzoek kan ook van belang zijn voor multimodale AI. MIT Technology Review meldt dat het toevoegen van visuele gegevens aan BabyLM-systemen nog niet de verwachte winst heeft opgeleverd, terwijl bestaande modellen die zijn getraind op kinderbeelden alleen eenvoudige woord-objectassociaties hebben geleerd. Als onderzoekers identificeren hoe kinderen visie, gehoor, beweging, aandacht en taal combineren, kunnen deze bevindingen systemen vormen die zijn getraind op video en andere sensorische gegevens. Het artikel maakt geen melding van een beproefde methode die de kloof al heeft gedicht.
Er is een wetenschappelijke waarde die verder gaat dan de efficiëntie van modellen. Het rapport beschrijft onderzoekers die taalmodellen gebruiken als onvolmaakte experimentele vervangers voor taalgebruikers. Wetenschappers kunnen voorwaarden opleggen die moeilijk of onethisch zijn om aan kinderen op te leggen, zoals het beperken van de blootstelling aan bepaalde grammaticale vormen of het simuleren van verschillende graden van tweetaligheid. MIT Technology Review zegt dat dergelijke experimenten ideeën kunnen testen over de vraag of taal afhankelijk is van de aangeboren structuur, algemene leerbeperkingen of omgevingservaring. Deze vergelijkingen blijven beperkt omdat hersenen belichaamd zijn, zich voortdurend ontwikkelen en biologische mechanismen bevatten die taalmodellen niet delen.
Het centrale bewijsmateriaal ondersteunt een engere conclusie dan de bewering dat AI het menselijk leren benadert. MIT Technology Review meldt dat modellen syntaxis kunnen leren en goed kunnen presteren op geselecteerde benchmarks, maar zegt ook dat systemen op babyschaal onhandig blijven, dat veel ervan geen tekst kunnen genereren en dat de huidige video-getrainde modellen verre van kinderlijk zijn. Het artikel stelt niet vast dat welke bestaande architectuur dan ook taal leert met efficiëntie op menselijk niveau, noch dat inzichten uit modellen al lang bestaande geschillen in de taalkunde of ontwikkelingspsychologie zullen beslechten.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
Kijk of multimodale, interactieve en sociaal geïnformeerde trainingsmethoden de prestaties op het gebied van gegevens op kinderschaal verbeteren. Kijk ook of nieuwe datasets, zoals langetermijnregistraties van het leven van kinderen, meetbare vooruitgang opleveren, en of onderzoekers nuttige cognitieve inzichten kunnen onderscheiden van vergelijkingen tussen fundamenteel verschillende systemen.
Het eerste gebied dat moet worden bekeken, is of modellen die zijn getraind op rijkere sensorische gegevens verder kunnen gaan dan object-woord-associaties. MIT Technology Review meldt dat op SAYCam gebaseerde systemen eenvoudige woorden als ‘bal’ en ‘kat’ leerden, maar geen algemeen capabele taalgebruikers werden. Toekomstige evaluaties moeten daarom grammatica, onderbouwing, generalisatie, interactie en leren in de loop van de tijd testen, in plaats van te vertrouwen op geïsoleerde herkenningsresultaten.
Onderzoekers zullen ook moeten bepalen of actief leren meetbare voordelen oplevert. Het artikel beschrijft dat kinderen ervaringen uitkiezen, experimenteren en op zoek gaan naar informatie die leemten in de kennis opvult, maar zegt dat vroege experimenten met sociale modellen de standaardmodellen niet konden verslaan. Voor een betekenisvolle vooruitgang zijn gecontroleerde vergelijkingen nodig die laten zien welke vormen van verkenning of interactie het leren verbeteren onder dezelfde gegevens- en rekenlimieten.
Longitudinale datasets kunnen de bewijsbasis veranderen. MIT Technology Review meldt dat het project van Hasson 17 kinderen registreerde gedurende hun eerste 1000 dagen, waardoor een veel breder beeld van de vroege ervaringen ontstond dan eerdere headcam-projecten. Belangrijke onbekenden zijn onder meer hoe representatief de deelnemende gezinnen zijn, hoe de opnames worden geannoteerd, welke privacywaarborgen de toegang regelen en of de gegevens kunnen worden gebruikt om modellen te trainen zonder de ervaringen uit de kindertijd te reduceren tot een beperkt aantal meetbare signalen. De bron geeft geen antwoord op deze vragen.
BabyLM en gerelateerde benchmarks moeten worden gevolgd voor reproduceerbaarheid en reikwijdte. Het artikel rapporteert een sterk resultaat voor de GPT-BERT op één ten opzichte van de Llama 2 70B, maar maakt ook duidelijk dat dit de GPT-BERT over het algemeen niet vergelijkbaar maakte met een modern commercieel model. Lezers moeten kijken of de resultaten gelden voor alle talen, datasets, modelgroottes en evaluatietaken, en of de winst voortkomt uit echt betere leermethoden of uit benchmarkspecifieke ontwerpkeuzes.
Ten slotte kunnen de praktische prioriteiten van het vakgebied bepalen of door kinderen geïnspireerd onderzoek zich verspreidt. MIT Technology Review meldt dat grenslaboratoria niet over het algemeen racen om de ontwikkelingspsychologie te kopiëren, terwijl Meta bijzondere interesse heeft getoond in onderzoek naar video- en kinderheadcams. Het blijft onbekend of bedrijven voldoende methoden en resultaten zullen publiceren om onafhankelijk onderzoek mogelijk te maken, of kleintaalgemeenschappen er direct van zullen profiteren, en of cognitieve bevindingen afgeleid van AI-modellen bestand zullen zijn tegen bewijsmateriaal van echte kinderen en ontwikkelingsstudies.