РЪКОВОДСТВО по основи

Grokking и забавена генерализация

Grokking е изумителен феномен, при който невронната мрежа първо запаметява данните си за обучение, остава при почти нулева точност на валидиране за дълго време и след това внезапно генерализира дълго след като точността на обучение достигне 100%.

2 min readПоследна актуализация

Преглед

It overturns the intuition that learning and generalization happen together.

Дълбоко гмуркане

Открито от изследователи на OpenAI през 2021 г. при малки алгоритмични задачи като модулна аритметика, гроккингът показва остра двуфазова крива. В началото моделът се вписва идеално в комплекта за обучение, докато ефективността на валидиране остава случайна, изглеждайки безнадеждно прекалена. След това, след хиляди или дори милиони допълнителни стъпки без видим напредък, точността на валидиране рязко скача до почти перфектна. Водещото обяснение е, че разпадането на теглото (регуляризиране) бавно притиска мрежата да изостави крехко запаметено решение и да открие компактно, структурирано такова, което всъщност улавя основното правило, например представящо модулно добавяне като ротации в кръг. Grokking е най-видим на малки синтетични масиви от данни, но разбирането му хвърля светлина върху по-дълбоката механика на това кога и защо се появява генерализация.

Техническа информация

Механистичните проучвания са направили обратно инженерство на grokked мрежи и са открили, че те прилагат чисти алгоритми, като например използване на подобни на Фурие кръгови вграждания за извършване на модулна аритметика чрез тригонометрични идентичности. Преходът корелира с теглата на мрежата, които стават по-редки и с по-ниска норма при регулиране: запаметяването се нуждае от големи, нередовни тегла, докато обобщаващата верига е по-проста. По този начин Grokking илюстрира конкуренция между решение за бързо намиране на запаметяване и по-бавно формиращо се, по-ефективно обобщаващо решение.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на Grokking и забавеното обобщение

Grokking е прозорец към науката за обобщението, която изследователите се надяват да разширят. Отворените въпроси включват дали забавеното генерализиране се случва безшумно в големи модели, как да се открие или ускори преходът и какво означава да се знае кога моделът наистина е научил концепция спрямо запомнени примери. Прозренията могат да осигурят по-добро регулиране, графици за обучение и инструменти за интерпретация и могат да помогнат за прогнозиране на възникващи възможности в големи езикови модели.

Внедряване в реалния свят

Изучаване на модулни аритметични задачи за обратно проектиране на точните схеми, които мрежата научава

Демонстриране как намаляването на теглото води до преминаването от запомняне към истинско обобщение

Информиране на изследванията за интерпретируемост чрез предоставяне на чисти, напълно разбрани модели на поведение за анализ

Предупреждаваме практикуващите, че платата за ранно валидиране не винаги означават, че моделът не е успял да се научи

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде Grokking и Delayed Generalization помагат и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grokking and Delayed Generalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Регулиране

Frequently asked questions

What is Grokking and Delayed Generalization?

Grokking е изумителен феномен, при който невронната мрежа първо запаметява данните си за обучение, остава при почти нулева точност на валидиране за дълго време и след това внезапно генерализира дълго след като точността на обучение достигне 100%. Това преобръща интуицията, че ученето и обобщаването се случват заедно.

Какво определя grokking в обучението на невронни мрежи?

Grokking е внезапният скок към добро представяне при валидиране, което се случва много след като точността на обучението е вече 100%.

При какъв вид задачи за пръв път се забелязва грокинг?

Изследователите на OpenAI докладваха за измама през 2021 г. върху малки синтетични алгоритмични проблеми като модулно добавяне.

На кой фактор най-често се приписва задвижването на прехода към обобщаване в гроккинга?

Разпадането на теглото постепенно тласка мрежата от крехко запаметено решение към компактна, обобщаваща верига.

Какво откриха, когато изследователите направиха обратно инженерство на мрежа с модулна аритметика?

Механистичната интерпретируемост разкри, че мрежата е научила тригонометрични, кръгови представяния за изчисляване на модулна аритметика.

Защо гроккингът се описва като конкуренция между две решения?

Мрежите бързо намират решение за запаметяване, но при регулиране в крайна сметка се сближават с по-проста обобщаваща схема.