Mi történt
Az MIT Technology Review beszámol a nyelvet tanuló gyerekek és a hatalmas szöveggyűjteményekre képzett nagy nyelvi modellek közötti adathatékonysági szakadékról. A kutatók kis adattartalmú nyelvi modellversenyeket, gyermekfejkamerás felvételeket és a gyermekek korai életéről készült nagyobb felvételeket használnak annak kiderítésére, hogy milyen gépek hiányozhatnak.
Az MIT Technology Review jelentése szerint a gyerekek általában durván 10 millió szó hallása után kezdenek el nyelvtanilag helyes mondatokat produkálni, a becslések szerint ez a szám a legmagasabb szinten eléri a 30 milliót. Ezzel szemben a modern nagy nyelvi modellek több billió tokent dolgozhatnak fel az előképzés során. A cikk ezt az eltérést „adathatékonysági résként” írja le: a gyerekek egy kis, testet öltött tapasztalati folyamból tanulnak nyelvet, míg a modellek sokkal nagyobb szöveggyűjteményektől függenek.
A jelentés rámutat a BabyLM versenyre, amelyet olyan kutatók szerveztek, mint Alex Warstadt, Leshem Choshen és mások. Az MIT Technology Review szerint a fő verseny a modellek fejlesztése szempontjából elfogadható, körülbelül 100 millió szóból álló korpuszra korlátozza a modelleket, a kisgyermekek méretű pályája pedig 10 millió szót használ. Az adatok tartalmazhatnak mesekönyveket, párbeszédeket, filmfeliratokat, Wikipédiát és a gyerekeknek szóló beszéd átiratait. A modellek értékelése a pszicholingvisztikában használthoz hasonló nyelvtani feladatokkal történik.
Az MIT Technology Review szerint a verseny megkérdőjelezte azt a feltételezést, hogy a tantervi tanulás – amely egyszerű anyagot mutat be az összetett anyag előtt – segít a modelleknek, hogy jobban tanuljanak, mint a gyerekek. A megközelítés első körben népszerű volt, de nem teljesített a vártnak megfelelően. A cikk szerint a 2024-es vezető rendszer, a GPT-BERT a következő token előrejelzését kombinálta a maszkos nyelvű modellezéssel, és körülbelül 100 millió szó betanítása után egy BabyLM benchmarkon felülmúlta a Meta Llama 2 70B értékét. A jelentés azt is hangsúlyozza, hogy ezek a modellek sokkal gyengébbek maradnak, mint a jelenlegi kereskedelmi rendszerek, és nem reprodukálják a gyermekek általános képességeit.
A cikk arról számol be, hogy a szöveg önmagában nem megfelelő közelítése a gyermekkori tapasztalatoknak. Michael Frank SAYCam projektje heti két órát rögzített három baba életéből hat hónap és két és fél év között. Az MIT Technology Review szerint a nyers felvételen 61 órán át kiképzett modell megtanulta azonosítani a tárgyakat és szavakkal társítani őket, de nem produkálta a kétéves képességeit. Az Uri Hasson által vezetett újabb projekt 17 gyermek életének első 1000 napját rögzítette, a legtöbb napon napi 12 órán keresztül kamerákat és mikrofonokat használva a lakóterületeken. Az eredményül kapott adatkészletet egy közelmúltban készült előzetes nyomtatásban írták le, de a cikk itt nem ad elegendő információt ahhoz, hogy önállóan értékelje az előnyomtatás módszereit vagy megállapításait.
Az MIT Technology Review jelentése szerint a kutatók az aktív felfedezést és a társadalmi tanulást további hiányzó összetevőkként tartják számon. Alison Gopnik azzal érvel, hogy a gyerekek a tapasztalatokat választják, kísérleteznek, és kiszámítható hatásokat keresnek a világra, míg Elizabeth Bonawitz szerint a gyerekek okoskodnak a tanárokról és arról, hogy miért kapnak információt. A cikk szerint a BabyLM pálya, amely lehetővé teszi a modellek számára, hogy más modellekkel való interakción keresztül tanuljanak, nem teljesített jobban a szokásos megközelítéseknél. A Meta kutatói és akadémiai munkatársai egy benchmarkot és kihívást is bejelentettek a babafejkamerás felvételekkel kapcsolatban, bár a jelentés nem állapítja meg, hogy ez az erőfeszítés sikeres gyermekléptékű modellt hozott volna létre.
Forrás részletei: technologyreview.com ↗
Miért számít
A kutatás hatással lehet az AI-modellek képzésére, különösen a videó és a kisebbségi nyelvek esetében, ahol nem állnak rendelkezésre nagy adatkészletek. Új kísérleti eszközöket is biztosíthat a nyelvi fejlődés tanulmányozásához, miközben a cikk hangsúlyozza, hogy a jelenlegi modellek messze vannak attól, hogy reprodukálják a gyermek tágabb képességeit.
Az MIT Technology Review jelentése szerint az adathatékonyság mérnöki korláttá vált, mivel az AI-fejlesztők a képzési adatok növelésével méretezik a modelleket. A cikk szerint a határmodellek nagyjából tízszer több adatot tudnak előképezni, mint a Llama 3.1 által közölt 15 billió token, miközben a könnyen elérhető internetes adatok kínálata végül korlátozottá válhat, valószínűleg már a 2030-as években. Ez az idővonal a cikk vitájának tulajdonított becslés, és itt nem erősítik meg önállóan.
A hatékonyabb tanulás kiterjesztheti a mesterséges intelligencia fejlesztéséhez való hozzáférést. A jelentés idézi David Samuelt, a GPT-BERT egyik építészét, aki szerint a cseh és a norvég nyelv sokkal kevesebb képzési adattal rendelkezik, mint az angol, míg az olyan nyelveken, mint a számi, csak több tízmillió token lehet. Ha a modellek hatékonyabban tanulhatnának kis adatkészletekből, akkor az alulfinanszírozott nyelveken dolgozó egyetemek és közösségek képesek lennének hatékonyabb rendszereket építeni a hiperskálás képzéshez szükséges erőforrások nélkül. Az MIT Technology Review ezt potenciális előnyként mutatja be, nem pedig bizonyított eredményként.
A kutatás a multimodális mesterséges intelligencia esetében is számíthat. Az MIT Technology Review jelentése szerint a vizuális adatok hozzáadása a BabyLM rendszerekhez még nem hozta meg a várt eredményeket, míg a gyerekeknek készült felvételeken kiképzett meglévő modellek csak egyszerű szó-objektum asszociációkat tanultak meg. Ha a kutatók megállapítják, hogy a gyerekek hogyan kombinálják a látást, a hallást, a mozgást, a figyelmet és a nyelvet, ezek az eredmények a videóra és más szenzoros adatokra képzett rendszerekre is szolgálhatnak. A cikk nem számol be olyan bevált módszerről, amely már bezárta volna a rést.
A modell hatékonyságán túl van egy tudományos érték is. A jelentés a nyelvi modelleket használó kutatókat a nyelvhasználók tökéletlen kísérleti kiállásaként írja le. A tudósok olyan feltételeket szabhatnak meg, amelyeket nehéz vagy etikátlanok szabni a gyerekekre, például korlátozzák az expozíciót bizonyos nyelvtani formákra vagy szimulálják a kétnyelvűség különböző fokait. Az MIT Technology Review szerint az ilyen kísérletek tesztelhetik az elképzeléseket arról, hogy a nyelv a veleszületett szerkezettől, az általános tanulási korlátoktól vagy a környezeti tapasztalatoktól függ-e. Ezek az összehasonlítások korlátozottak maradnak, mivel az agy megtestesült, folyamatosan fejlődik, és olyan biológiai mechanizmusokat tartalmaz, amelyekben a nyelvi modellek nem osztoznak.
A központi bizonyítékok szűkebb következtetést támasztanak alá, mint azok az állítások, amelyek szerint a mesterséges intelligencia közeledik az emberi tanuláshoz. Az MIT Technology Review arról számol be, hogy a modellek képesek megtanulni a szintaxist, és jól teljesítenek bizonyos benchmarkokon, de azt is kijelenti, hogy a babaméretű rendszerek továbbra is esetlenek, sokan nem tudnak szöveget generálni, és a jelenlegi videós modellek korántsem gyerekszerűek. A cikk nem állítja, hogy bármely létező architektúra emberi szintű hatékonysággal tanulja meg a nyelvet, és azt sem, hogy a modellekből származó belátások megoldanák a nyelvészeti vagy fejlődéslélektani régóta fennálló vitákat.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
Which component of an AI application is the machine-learning model itself?
Mit nézzünk ezután
Figyelje meg, hogy a multimodális, interaktív és szociálisan informált képzési módszerek javítják-e a teljesítményt a gyermekszintű adatokon. Figyelje meg azt is, hogy az új adatkészletek, például a gyermekek életének hosszú távú felvételei mérhető előrelépést eredményeznek-e, és hogy a kutatók meg tudják-e különböztetni a hasznos kognitív betekintést az alapvetően eltérő rendszerek összehasonlításától.
Az első figyelendő terület az, hogy a gazdagabb szenzoros adatokra kiképzett modellek képesek-e túllépni a tárgy-szó asszociációkon. Az MIT Technology Review jelentése szerint a SAYCam alapú rendszerek megtanultak olyan egyszerű szavakat, mint a „labda” és a „macska”, de nem váltak széles körben alkalmas nyelvhasználókká. A jövőbeli értékeléseknek ezért a nyelvtant, az alapozást, az általánosítást, az interakciót és a tanulást idővel kell tesztelniük, ahelyett, hogy elszigetelt felismerési eredményekre hagyatkoznának.
A kutatóknak azt is meg kell határozniuk, hogy az aktív tanulás mérhető haszonnal jár-e. A cikk azt írja le, hogy a gyerekek tapasztalatokat válogatnak, kísérleteznek és olyan információkat keresnek, amelyek pótolják a tudásbeli hiányosságokat, de azt állítja, hogy a korai társadalmi modellkísérletek nem verték felül a standard modelleket. A jelentős előrelépéshez olyan ellenőrzött összehasonlításokra lenne szükség, amelyek megmutatják, hogy a feltárás vagy interakció mely formái javítják a tanulást ugyanazon adat- és számítási korlátok mellett.
A longitudinális adatkészletek megváltoztathatják a bizonyítékokat. Az MIT Technology Review jelentése szerint Hasson projektje 17 gyermeket rögzített az első 1000 nap során, így sokkal nagyobb képet alkotott a korai tapasztalatokról, mint a korábbi headcam projektek. A fontos ismeretlenek közé tartozik, hogy mennyire reprezentatívak a részt vevő családok, hogyan jelölik a felvételeket, milyen adatvédelmi biztosítékok szabályozzák a hozzáférést, és hogy az adatok felhasználhatók-e modellek képzésére anélkül, hogy a gyermekkori tapasztalatokat mérhető jelek szűk körére csökkentenék. A forrás nem válaszol ezekre a kérdésekre.
A BabyLM-et és a kapcsolódó referenciaértékeket követni kell a reprodukálhatóság és a terjedelem érdekében. A cikk a GPT-BERT erős eredményéről számol be egy viszonyítási alapon a Llama 2 70B-vel szemben, de egyértelművé teszi, hogy ez nem tette a GPT-BERT-t általában összehasonlíthatóvá egy modern kereskedelmi modellel. Az olvasóknak figyelniük kell, hogy az eredmények érvényesek-e a nyelvekre, az adatkészletekre, a modellméretekre és az értékelési feladatokra, és hogy az előnyök valóban jobb tanulási módszerekből vagy a -specifikus tervezési döntésekből származnak-e.
Végül, a terület gyakorlati prioritásai meghatározhatják, hogy a gyermekek által inspirált kutatás terjed-e. Az MIT Technology Review jelentése szerint a határlaboratóriumok általában nem versenyeznek a fejlődéslélektan másolásával, míg a Meta különös érdeklődést mutatott a video- és gyermekfejkamerás kutatások iránt. Továbbra sem ismert, hogy a vállalatok elegendő módszert és eredményt tesznek-e közzé a független vizsgálathoz, hogy a kisnyelvű közösségek ebből közvetlenül profitálnak-e, és hogy az AI-modellekből származó kognitív eredmények ellenállnak-e a valódi gyermekek és a fejlődési tanulmányok bizonyítékainak.