Какво стана
MIT Technology Review докладва за разликата в ефективността на данните между децата, които учат език, и големите езикови модели, обучени върху огромни текстови колекции. Изследователите използват състезания за езикови модели с малки данни, кадри от детски камери и по-големи записи от ранния живот на децата, за да проучат какви машини може да липсват.
MIT Technology Review съобщава, че децата обикновено започват да произнасят граматически правилни изречения, след като чуят приблизително 10 милиона думи, като оценките достигат около 30 милиона в горния край. За разлика от това, съвременните големи езикови модели могат да обработват трилиони токени по време на предварителното обучение. Статията описва това несъответствие като „пропаст в ефективността на данните“: децата учат език от малък, въплътен поток от опит, докато моделите зависят от много по-големи колекции от текст.
Докладът сочи към BabyLM, състезание, организирано от изследователи, включително Алекс Варщат, Лешем Чошен и други. MIT Technology Review казва, че основната конкуренция ограничава моделите до правдоподобен за развитието корпус от около 100 милиона думи, като песента в мащаб за малки деца използва 10 милиона. Данните могат да включват книги с приказки, диалози, филмови субтитри, Wikipedia и преписи на реч, насочена към деца. Моделите се оценяват с граматични задачи, подобни на тези, използвани в психолингвистиката.
Според MIT Technology Review състезанието оспори предположението, че обучението по учебна програма - представяне на прост материал преди сложен материал - би помогнало на моделите да учат повече като деца. Подходът беше популярен в първия кръг, но не се представи толкова добре, колкото се очакваше. В статията се казва, че водещата система за 2024 г., GPT-BERT, комбинира прогнозиране на следващия токен с моделиране на маскиран език и, след обучение на около 100 милиона думи, надмина Llama 2 70B на Meta на един бенчмарк на BabyLM. Докладът също така подчертава, че тези модели остават много по-слаби от настоящите търговски системи и не възпроизвеждат общите способности на детето.
Статията съобщава, че текстът сам по себе си може да бъде неадекватно приближение на детския опит. Проектът SAYCam на Майкъл Франк записва два часа седмично от живота на три бебета между шест месеца и две години и половина. MIT Technology Review казва, че модел, обучен на 61 часа от този необработен материал, се е научил да идентифицира обекти и да ги свързва с думи, но не е развил способностите на двегодишно дете. По-нов проект, ръководен от Uri Hasson, записа първите 1000 дни от живота на 17 деца, използвайки камери и микрофони в жилищните помещения за около 12 часа на ден през повечето дни. Полученият набор от данни беше описан в скорошен предпечат, но статията не предоставя достатъчно информация тук, за да оцени независимо методите или констатациите на този предпечат.
MIT Technology Review съобщава, че изследователите обмислят активното изследване и социалното обучение като допълнителни липсващи съставки. Алисън Гопник твърди, че децата избират преживявания, експериментират и търсят предвидими ефекти върху света, докато Елизабет Бонавиц казва, че децата разсъждават за учителите и защо се предоставя информация. В статията се казва, че песента BabyLM, позволяваща на моделите да се учат чрез взаимодействие с други модели, не надминава стандартните подходи. Изследователите и академичните сътрудници на Meta също обявиха бенчмарк и предизвикателство, включващо кадри от камера с глава на бебе, въпреки че докладът не установява, че това усилие е създало успешен модел в детски мащаб.
Детайли за източника: technologyreview.com ↗
Защо има значение
Изследването може да повлияе на начина, по който се обучават AI моделите, особено за видео и малцинствени езици, където не са налични големи набори от данни. Може също така да предостави нови експериментални инструменти за изучаване на езиковото развитие, докато статията подчертава, че настоящите модели остават далеч от възпроизвеждането на по-широките способности на детето.
MIT Technology Review съобщава, че ефективността на данните се е превърнала в инженерно ограничение, тъй като разработчиците на AI мащабират модели чрез увеличаване на данните за обучение. В статията се казва, че граничните модели може да се обучават предварително на приблизително десет пъти повече данни от докладваните 15 трилиона токена на Llama 3.1, докато предлагането на лесно достъпни интернет данни може в крайна сметка да стане ограничено, вероятно още през 2030 г. Тази времева линия е оценка, приписана на дискусията в статията и не е независимо потвърдена тук.
По-ефективното учене може да разшири достъпа до разработване на AI. Докладът цитира Дейвид Самуел, един от архитектите на GPT-BERT, който казва, че чешкият и норвежкият разполагат с много по-малко данни за обучение от английския, докато езици като саами може да имат само десетки милиони токени. Ако моделите могат да се учат по-ефективно от малки набори от данни, университетите и общностите, работещи на езици с недостатъчен ресурс, може да са в състояние да изградят по-способни системи без ресурсите, необходими за хипермащабно обучение. MIT Technology Review представя това като потенциална полза, а не като демонстриран резултат.
Изследването може да има значение и за мултимодалния ИИ. MIT Technology Review съобщава, че добавянето на визуални данни към системите BabyLM все още не е довело до очакваните печалби, докато съществуващите модели, обучени върху детски кадри, са научили само прости асоциации дума-обект. Ако изследователите идентифицират как децата комбинират зрение, слух, движение, внимание и език, тези констатации биха могли да информират системите, обучени на видео и други сензорни данни. Статията не съобщава за доказан метод, който вече е запълнил празнината.
Има научна стойност отвъд ефективността на модела. Докладът описва изследователи, използващи езикови модели като несъвършени експериментални заместители за потребители на език. Учените могат да налагат условия, които биха били трудни или неетични за налагане на деца, като ограничаване на излагането на определени граматически форми или симулиране на различни степени на билингвизъм. MIT Technology Review казва, че подобни експерименти могат да тестват идеи за това дали езикът зависи от вродена структура, общи ограничения на обучението или опит в околната среда. Тези сравнения остават ограничени, тъй като мозъците са въплътени, развиват се непрекъснато и съдържат биологични механизми, които езиковите модели не споделят.
Основните доказателства подкрепят по-тясно заключение от твърденията, че ИИ се доближава до човешкото обучение. MIT Technology Review съобщава, че моделите могат да научат синтаксис и да се представят добре на избрани бенчмаркове, но също така казва, че системите с бебешки мащаб остават тромави, много от тях не могат да генерират текст и настоящите модели, обучени с видео, далеч не са детски. Статията не установява, че която и да е съществуваща архитектура учи език с ефективност на човешко ниво, нито че прозренията от моделите ще разрешат дългогодишни спорове в лингвистиката или психологията на развитието.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
Which component of an AI application is the machine-learning model itself?
Какво да гледате след това
Гледайте дали мултимодалните, интерактивните и социално информираните методи на обучение подобряват представянето на данни от детски мащаб. Също така наблюдавайте дали новите масиви от данни, като дългосрочни записи на живота на децата, водят до измерим напредък и дали изследователите могат да разграничат полезни когнитивни прозрения от сравнения между фундаментално различни системи.
Първата област, която трябва да се наблюдава, е дали моделите, обучени на по-богати сензорни данни, могат да преминат отвъд асоциациите обект-дума. MIT Technology Review докладва, че системите, базирани на SAYCam, са научили прости думи като „топка“ и „котка“, но не са станали потребители на широк език. Следователно бъдещите оценки трябва да тестват граматиката, основата, обобщението, взаимодействието и ученето с течение на времето, вместо да разчитат на изолирани резултати от разпознаването.
Изследователите също ще трябва да определят дали активното учене води до измерими печалби. Статията описва децата като избиращи преживявания, експериментиране и търсене на информация, която запълва пропуските в знанията, но казва, че ранните експерименти със социални модели не са победили стандартните модели. Значителен напредък би изисквал контролирани сравнения, показващи кои форми на изследване или взаимодействие подобряват обучението при едни и същи данни и изчислителни ограничения.
Надлъжните масиви от данни могат да променят базата от доказателства. MIT Technology Review съобщава, че проектът на Hasson е записал 17 деца през първите им 1000 дни, създавайки много по-широк поглед върху ранния опит в сравнение с по-ранните проекти с хедкамери. Важни неизвестни са доколко представителни са участващите семейства, как се анотират записите, какви гаранции за поверителност управляват достъпа и дали данните могат да се използват за обучение на модели, без да се намалява детският опит до тесен набор от измерими сигнали. Източникът не отговаря на тези въпроси.
BabyLM и свързаните с него показатели трябва да се следват за възпроизводимост и обхват. Статията съобщава за силен резултат за GPT-BERT при един бенчмарк срещу Llama 2 70B, но също така изяснява, че това не прави GPT-BERT като цяло сравним с модерен търговски модел. Читателите трябва да следят дали резултатите се запазват за различни езици, набори от данни, размери на модели и задачи за оценка и дали печалбите идват от наистина по-добри методи за обучение или от избор на дизайн, специфичен за бенчмарк.
И накрая, практическите приоритети в областта могат да определят дали вдъхновените от децата изследвания се разпространяват. MIT Technology Review съобщава, че граничните лаборатории не се надпреварват масово да копират психологията на развитието, докато Meta е показал особен интерес към изследванията на видео и детски камери. Остава неизвестно дали компаниите ще публикуват достатъчно методи и резултати, за да позволят независим контрол, дали общностите с малки езици ще се възползват пряко и дали когнитивните открития, получени от AI модели, ще издържат на доказателства от реални деца и проучвания за развитието.