ПОСІБНИК З ОСНОВ

Гіпотеза лотерейного квитка

Гіпотеза лотерейного квитка говорить, що всередині великої, випадково ініціалізованої нейронної мережі ховається невелика підмережа — «виграшний квиток», — яка, навчена окремо з тих самих початкових ваг, може відповідати точності повної мережі.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it suggests we are training far more parameters than we actually need.

Глибоке занурення

Запропонована Джонатаном Франклом і Майклом Карбіном з Массачусетського технологічного інституту в 2018 році ця гіпотеза виникла в результаті досліджень обрізки. Зазвичай ви можете скоротити навчену мережу до 10-20% її ваги без втрати точності, але навчання цієї невеликої мережі з нуля не вдається. Франкл і Карбін знайшли хитрість: зберегти початкову вагу вцілілих з’єднань. Ця розріджена підмережа — виграшний квиток — потім тренується до повної точності в ізоляції, іноді швидше, ніж щільний оригінал. Вони ідентифікували квитки за допомогою «ітеративного обрізання величини»: тренування, обрізання ваг найменшої величини, перемотування решти до початкових значень і повторення. Результат означає, що щільна надпараметризація в основному допомагає оптимізації знайти хорошу розріджену структуру, а не те, що всі ці ваги необхідні окремо.

Технічне розуміння

Основною процедурою є ітераційне скорочення величини з перемотуванням ваг: після навчання видаліть вагові коефіцієнти з найнижчою величиною, скиньте вагові коефіцієнти, що залишилися, до початкової ініціалізації (або контрольної точки раннього навчання, уточнення під назвою «перемотування»), а потім перенавчайте. Поєднання конкретної розрідженої маски ТА її відповідної ініціалізації робить квиток «виграшним» — випадкова повторна ініціалізація тієї самої маски руйнує ефект.

Стратегічний вплив

Чіткіші рішення

Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.

Вартість і бюджет

Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.

Команда та робочий процес

Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.

Гіпотеза про майбутнє лотерейних квитків

Лотерейні квитки спонукають досліджувати розріджені мережі з самого початку для економії обчислювальної техніки та енергії, а також перевіряти, чи передаються квитки між наборами даних і завданнями. Масштабування ітераційного скорочення до моделей з мільярдами параметрів залишається дорогим, тому робота продовжується над пошуком дешевих квитків або підтвердженням їх існування (гіпотеза про «сильні» лотерейні квитки говорить, що квитки існують на момент ініціалізації без навчання взагалі). Очікуйте зв’язків із ефективними моделями на пристрої та екологічним ШІ.

Реалізація в реальному світі

Стиснення великого класифікатора зображень до рівня менше 20% від його ваги для розгортання на телефоні зі збереженням точності

Прискорення навчання шляхом виявлення та навчання лише розрідженої виграшної підмережі

Вивчення можливості перенесення ваги шляхом повторного використання квитка, знайденого в одному наборі даних, для початку навчання на пов’язаному

Зменшення енергії висновку та пам’яті в периферійних пристроях за рахунок доставки скороченого виграшного квитка замість щільної моделі

Ризики та огорожі

Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.

Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.

Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.

Дорожня карта впровадження

1

Почніть із простого визначення необхідного результату.

2

Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.

3

Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.

4

Задокументуйте, де гіпотеза лотерейного квитка допомагає, а де простіші методи кращі.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Lottery Ticket Hypothesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Chinchilla Compute-Optimal Training

Часті запитання

What is Lottery Ticket Hypothesis?

Гіпотеза лотерейного квитка говорить, що всередині великої, випадково ініціалізованої нейронної мережі ховається невелика підмережа — «виграшний квиток», — яка, навчена окремо з тих самих початкових ваг, може відповідати точності повної мережі. Це має значення, оскільки означає, що ми тренуємо набагато більше параметрів, ніж нам насправді потрібно.

Що таке «виграшний квиток» у цій гіпотезі?

Виграшний білет — це невелика підмережа, яка при навчанні окремо від тих самих початкових ваг досягає точності, порівнянної з щільною мережею.

Чому навчання скороченої підмережі зазвичай не вдається, якщо ви не зробите щось особливе?

Ключове розуміння полягає в тому, що розріджена маска працює лише в парі з відповідною оригінальною ініціалізацією; випадкова повторна ініціалізація порушує його.

Хто запропонував гіпотезу лотерейного квитка?

Джонатан Франкл і Майкл Карбін представили гіпотезу в своїй статті 2018 року в MIT.

Яка техніка використовується для пошуку виграшних квитків?

Ітеративне скорочення величини неодноразово тренується, видаляє вагові коефіцієнти найменшої величини та перемотує решту до початкових значень.

Що говорить гіпотеза про великі надпараметризовані мережі?

Це відкриття означає, що надмірна параметризація допомагає шукати розріджену підмережу, яку можна навчити, а не будь-яку необхідну вагу.