Vissza a Hírekhez
InnovációAI Understanding eligazítás

Az MIT Technology Review azt vizsgálja, miért tanulnak a gyerekek sokkal hatékonyabban a nyelvet, mint az AI-modellek

Az MIT Technology Review arról számol be, hogy a gyerekek sokkal kevesebb adatból sajátítják el a nyelvet, mint a nagy nyelvi modellek, és a kutatók azt vizsgálják, hogy a gyermekek szenzoros, felfedező és szociális tanulása segíthet-e hatékonyabb mesterséges intelligenciát.

7 min readRead the original reporting
Source-provided image accompanying MIT Technology Review examines why children learn language far more efficiently than AI models
Hozzárendelt jelentésForrás rögzített
Kiadó
technologyreview.com
Forrás link
technologyreview.comhttps://www.technologyreview.com/2026/08/24/1141740/kids-machines-language-learning/
Forrás típusa
Egy hírügynökség jelentése – nem belső dokumentum.

Amit önállóan nem tudtunk megerősíteni: Ez az állítás a megnevezett üzletnek tulajdonítható. Nem ellenőriztük belső dokumentum alapján. (technologyreview.com)

KontextusÉrtsd meg ezt 60 másodperc alatt

Kezdje itt

Kulcsfogalmak

Általánosítás
Milyen jól teljesít egy modell új, nem látott adatokon a képzési halmazon kívül.
Előképzés
Kezdeti nagy léptékű modellképzés széles körű adatokon a későbbi adaptáció előtt.
Benchmark
A modell teljesítményének mérésére és összehasonlítására használt szabványos teszt vagy adatkészlet.
Teszteld magadAI modellek magyarázata kvíz

Mi történt

Az MIT Technology Review beszámol a nyelvet tanuló gyerekek és a hatalmas szöveggyűjteményekre képzett nagy nyelvi modellek közötti adathatékonysági szakadékról. A kutatók kis adattartalmú nyelvi modellversenyeket, gyermekfejkamerás felvételeket és a gyermekek korai életéről készült nagyobb felvételeket használnak annak kiderítésére, hogy milyen gépek hiányozhatnak.

Az MIT Technology Review jelentése szerint a gyerekek általában durván 10 millió szó hallása után kezdenek el nyelvtanilag helyes mondatokat produkálni, a becslések szerint ez a szám a legmagasabb szinten eléri a 30 milliót. Ezzel szemben a modern nagy nyelvi modellek több billió tokent dolgozhatnak fel az előképzés során. A cikk ezt az eltérést „adathatékonysági résként” írja le: a gyerekek egy kis, testet öltött tapasztalati folyamból tanulnak nyelvet, míg a modellek sokkal nagyobb szöveggyűjteményektől függenek.

A jelentés rámutat a BabyLM versenyre, amelyet olyan kutatók szerveztek, mint Alex Warstadt, Leshem Choshen és mások. Az MIT Technology Review szerint a fő verseny a modellek fejlesztése szempontjából elfogadható, körülbelül 100 millió szóból álló korpuszra korlátozza a modelleket, a kisgyermekek méretű pályája pedig 10 millió szót használ. Az adatok tartalmazhatnak mesekönyveket, párbeszédeket, filmfeliratokat, Wikipédiát és a gyerekeknek szóló beszéd átiratait. A modellek értékelése a pszicholingvisztikában használthoz hasonló nyelvtani feladatokkal történik.

Az MIT Technology Review szerint a verseny megkérdőjelezte azt a feltételezést, hogy a tantervi tanulás – amely egyszerű anyagot mutat be az összetett anyag előtt – segít a modelleknek, hogy jobban tanuljanak, mint a gyerekek. A megközelítés első körben népszerű volt, de nem teljesített a vártnak megfelelően. A cikk szerint a 2024-es vezető rendszer, a GPT-BERT a következő token előrejelzését kombinálta a maszkos nyelvű modellezéssel, és körülbelül 100 millió szó betanítása után egy BabyLM benchmarkon felülmúlta a Meta Llama 2 70B értékét. A jelentés azt is hangsúlyozza, hogy ezek a modellek sokkal gyengébbek maradnak, mint a jelenlegi kereskedelmi rendszerek, és nem reprodukálják a gyermekek általános képességeit.

A cikk arról számol be, hogy a szöveg önmagában nem megfelelő közelítése a gyermekkori tapasztalatoknak. Michael Frank SAYCam projektje heti két órát rögzített három baba életéből hat hónap és két és fél év között. Az MIT Technology Review szerint a nyers felvételen 61 órán át kiképzett modell megtanulta azonosítani a tárgyakat és szavakkal társítani őket, de nem produkálta a kétéves képességeit. Az Uri Hasson által vezetett újabb projekt 17 gyermek életének első 1000 napját rögzítette, a legtöbb napon napi 12 órán keresztül kamerákat és mikrofonokat használva a lakóterületeken. Az eredményül kapott adatkészletet egy közelmúltban készült előzetes nyomtatásban írták le, de a cikk itt nem ad elegendő információt ahhoz, hogy önállóan értékelje az előnyomtatás módszereit vagy megállapításait.

Az MIT Technology Review jelentése szerint a kutatók az aktív felfedezést és a társadalmi tanulást további hiányzó összetevőkként tartják számon. Alison Gopnik azzal érvel, hogy a gyerekek a tapasztalatokat választják, kísérleteznek, és kiszámítható hatásokat keresnek a világra, míg Elizabeth Bonawitz szerint a gyerekek okoskodnak a tanárokról és arról, hogy miért kapnak információt. A cikk szerint a BabyLM pálya, amely lehetővé teszi a modellek számára, hogy más modellekkel való interakción keresztül tanuljanak, nem teljesített jobban a szokásos megközelítéseknél. A Meta kutatói és akadémiai munkatársai egy benchmarkot és kihívást is bejelentettek a babafejkamerás felvételekkel kapcsolatban, bár a jelentés nem állapítja meg, hogy ez az erőfeszítés sikeres gyermekléptékű modellt hozott volna létre.

Forrás részletei: technologyreview.com ↗

Miért számít

A kutatás hatással lehet az AI-modellek képzésére, különösen a videó és a kisebbségi nyelvek esetében, ahol nem állnak rendelkezésre nagy adatkészletek. Új kísérleti eszközöket is biztosíthat a nyelvi fejlődés tanulmányozásához, miközben a cikk hangsúlyozza, hogy a jelenlegi modellek messze vannak attól, hogy reprodukálják a gyermek tágabb képességeit.

Az MIT Technology Review jelentése szerint az adathatékonyság mérnöki korláttá vált, mivel az AI-fejlesztők a képzési adatok növelésével méretezik a modelleket. A cikk szerint a határmodellek nagyjából tízszer több adatot tudnak előképezni, mint a Llama 3.1 által közölt 15 billió token, miközben a könnyen elérhető internetes adatok kínálata végül korlátozottá válhat, valószínűleg már a 2030-as években. Ez az idővonal a cikk vitájának tulajdonított becslés, és itt nem erősítik meg önállóan.

A hatékonyabb tanulás kiterjesztheti a mesterséges intelligencia fejlesztéséhez való hozzáférést. A jelentés idézi David Samuelt, a GPT-BERT egyik építészét, aki szerint a cseh és a norvég nyelv sokkal kevesebb képzési adattal rendelkezik, mint az angol, míg az olyan nyelveken, mint a számi, csak több tízmillió token lehet. Ha a modellek hatékonyabban tanulhatnának kis adatkészletekből, akkor az alulfinanszírozott nyelveken dolgozó egyetemek és közösségek képesek lennének hatékonyabb rendszereket építeni a hiperskálás képzéshez szükséges erőforrások nélkül. Az MIT Technology Review ezt potenciális előnyként mutatja be, nem pedig bizonyított eredményként.

A kutatás a multimodális mesterséges intelligencia esetében is számíthat. Az MIT Technology Review jelentése szerint a vizuális adatok hozzáadása a BabyLM rendszerekhez még nem hozta meg a várt eredményeket, míg a gyerekeknek készült felvételeken kiképzett meglévő modellek csak egyszerű szó-objektum asszociációkat tanultak meg. Ha a kutatók megállapítják, hogy a gyerekek hogyan kombinálják a látást, a hallást, a mozgást, a figyelmet és a nyelvet, ezek az eredmények a videóra és más szenzoros adatokra képzett rendszerekre is szolgálhatnak. A cikk nem számol be olyan bevált módszerről, amely már bezárta volna a rést.

A modell hatékonyságán túl van egy tudományos érték is. A jelentés a nyelvi modelleket használó kutatókat a nyelvhasználók tökéletlen kísérleti kiállásaként írja le. A tudósok olyan feltételeket szabhatnak meg, amelyeket nehéz vagy etikátlanok szabni a gyerekekre, például korlátozzák az expozíciót bizonyos nyelvtani formákra vagy szimulálják a kétnyelvűség különböző fokait. Az MIT Technology Review szerint az ilyen kísérletek tesztelhetik az elképzeléseket arról, hogy a nyelv a veleszületett szerkezettől, az általános tanulási korlátoktól vagy a környezeti tapasztalatoktól függ-e. Ezek az összehasonlítások korlátozottak maradnak, mivel az agy megtestesült, folyamatosan fejlődik, és olyan biológiai mechanizmusokat tartalmaz, amelyekben a nyelvi modellek nem osztoznak.

A központi bizonyítékok szűkebb következtetést támasztanak alá, mint azok az állítások, amelyek szerint a mesterséges intelligencia közeledik az emberi tanuláshoz. Az MIT Technology Review arról számol be, hogy a modellek képesek megtanulni a szintaxist, és jól teljesítenek bizonyos benchmarkokon, de azt is kijelenti, hogy a babaméretű rendszerek továbbra is esetlenek, sokan nem tudnak szöveget generálni, és a jelenlegi videós modellek korántsem gyerekszerűek. A cikk nem állítja, hogy bármely létező architektúra emberi szintű hatékonysággal tanulja meg a nyelvet, és azt sem, hogy a modellekből származó belátások megoldanák a nyelvészeti vagy fejlődéslélektani régóta fennálló vitákat.

Interactive Mechanism

Interaktív mechanizmus: Hogyan működik valójában

Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
Interaktív koncepció ellenőrzése+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Mit nézzünk ezután

Figyelje meg, hogy a multimodális, interaktív és szociálisan informált képzési módszerek javítják-e a teljesítményt a gyermekszintű adatokon. Figyelje meg azt is, hogy az új adatkészletek, például a gyermekek életének hosszú távú felvételei mérhető előrelépést eredményeznek-e, és hogy a kutatók meg tudják-e különböztetni a hasznos kognitív betekintést az alapvetően eltérő rendszerek összehasonlításától.

Az első figyelendő terület az, hogy a gazdagabb szenzoros adatokra kiképzett modellek képesek-e túllépni a tárgy-szó asszociációkon. Az MIT Technology Review jelentése szerint a SAYCam alapú rendszerek megtanultak olyan egyszerű szavakat, mint a „labda” és a „macska”, de nem váltak széles körben alkalmas nyelvhasználókká. A jövőbeli értékeléseknek ezért a nyelvtant, az alapozást, az általánosítást, az interakciót és a tanulást idővel kell tesztelniük, ahelyett, hogy elszigetelt felismerési eredményekre hagyatkoznának.

A kutatóknak azt is meg kell határozniuk, hogy az aktív tanulás mérhető haszonnal jár-e. A cikk azt írja le, hogy a gyerekek tapasztalatokat válogatnak, kísérleteznek és olyan információkat keresnek, amelyek pótolják a tudásbeli hiányosságokat, de azt állítja, hogy a korai társadalmi modellkísérletek nem verték felül a standard modelleket. A jelentős előrelépéshez olyan ellenőrzött összehasonlításokra lenne szükség, amelyek megmutatják, hogy a feltárás vagy interakció mely formái javítják a tanulást ugyanazon adat- és számítási korlátok mellett.

A longitudinális adatkészletek megváltoztathatják a bizonyítékokat. Az MIT Technology Review jelentése szerint Hasson projektje 17 gyermeket rögzített az első 1000 nap során, így sokkal nagyobb képet alkotott a korai tapasztalatokról, mint a korábbi headcam projektek. A fontos ismeretlenek közé tartozik, hogy mennyire reprezentatívak a részt vevő családok, hogyan jelölik a felvételeket, milyen adatvédelmi biztosítékok szabályozzák a hozzáférést, és hogy az adatok felhasználhatók-e modellek képzésére anélkül, hogy a gyermekkori tapasztalatokat mérhető jelek szűk körére csökkentenék. A forrás nem válaszol ezekre a kérdésekre.

A BabyLM-et és a kapcsolódó referenciaértékeket követni kell a reprodukálhatóság és a terjedelem érdekében. A cikk a GPT-BERT erős eredményéről számol be egy viszonyítási alapon a Llama 2 70B-vel szemben, de egyértelművé teszi, hogy ez nem tette a GPT-BERT-t általában összehasonlíthatóvá egy modern kereskedelmi modellel. Az olvasóknak figyelniük kell, hogy az eredmények érvényesek-e a nyelvekre, az adatkészletekre, a modellméretekre és az értékelési feladatokra, és hogy az előnyök valóban jobb tanulási módszerekből vagy a -specifikus tervezési döntésekből származnak-e.

Végül, a terület gyakorlati prioritásai meghatározhatják, hogy a gyermekek által inspirált kutatás terjed-e. Az MIT Technology Review jelentése szerint a határlaboratóriumok általában nem versenyeznek a fejlődéslélektan másolásával, míg a Meta különös érdeklődést mutatott a video- és gyermekfejkamerás kutatások iránt. Továbbra sem ismert, hogy a vállalatok elegendő módszert és eredményt tesznek-e közzé a független vizsgálathoz, hogy a kisnyelvű közösségek ebből közvetlenül profitálnak-e, és hogy az AI-modellekből származó kognitív eredmények ellenállnak-e a valódi gyermekek és a fejlődési tanulmányok bizonyítékainak.

Kapcsolódó útmutatók és vetélkedők

Az AI modellek magyarázataAI képzésChatGPT és LLM-ekAz MI jövőjeTesztelje, amit tud – próbáljon ki egy ingyenes AI-kvíztKeressen egy AI kifejezést a szószedetünkbenKövesse az AI modell kiadáskövetőjét
Ezt hasznosnak találta?