Chinchilla Compute-Optimal Training
Chinchilla — це дослідження DeepMind 2022 року, яке виявило, що більшість великих мовних моделей були погано навчені: для фіксованого бюджету обчислень вам слід масштабувати параметри та дані приблизно однаково, а не просто створювати більшу модель.
Огляд
It reshaped how the industry balances model size against training data.
Глибоке занурення
У документі DeepMind Chinchilla переглянуто масштабування та навчено понад 400 моделей, щоб знайти оптимальний баланс для обчислень. Головне емпіричне правило: розмір моделі та навчальні маркери мають зростати паралельно, приблизно 20 навчальних маркерів на параметр. Щоб довести це, вони навчили Chinchilla, модель із 70 мільярдами параметрів на 1,4 трильйона токенів, використовуючи ті самі обчислення, що й Gopher із 280 мільярдами параметрів, який навчався на набагато меншій кількості токенів. Шиншила, незважаючи на те, що вона в чотири рази менша, перевершила Gopher, GPT-3 та інших гігантів майже за всіма показниками. Урок скасував попередній висновок OpenAI про те, що перевага віддавалася розміру над даними, показавши, що багато флагманських моделей залишають продуктивність на столі через те, що вони занадто великі та не потребують даних.
Технічне розуміння
Втрата відповідності шиншили як L(N,D) = E + A·N^(-α) + B·D^(-β), причому α і β обидва близькі до 0,34, що означає, що параметри та дані впливають майже симетрично. Оптимізація цього за фіксованого обмеження обчислення (обчислення ≈ 6·N·D для трансформаторів) дає результат рівного масштабування. Меншу модель із багатим даними також дешевше запускати під час висновку, тому її перевага поєднується під час розгортання, а не лише навчання.
Стратегічний вплив
Чіткіші рішення
Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.
Вартість і бюджет
Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.
Команда та робочий процес
Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.
Майбутнє навчання Chinchilla Compute-Optimal
Сучасні моделі, такі як Llama 3, навмисно виходять за межі співвідношення 20 токенів на параметр у Chinchilla, навчаючи малі моделі на трильйонах токенів, щоб зробити висновок дешевим, приймаючи неоптимальні навчальні обчислення. Оскільки якісних даних стає дефіцитніше, зростає інтерес до повторюваних епох, синтетичних даних і фільтрації якості. Шиншила залишається точкою відліку, але оптимум усе більше залежить від вартості висновків протягом життя, а не лише від одноразового бюджету на навчання.
Реалізація в реальному світі
Вибір навчання моделі з 7 мільярдами параметрів на 2 трильйонах токенів замість моделі з 30 мільярдами на занадто малому обсязі даних за той самий бюджет.
За оцінками моделі з 10 мільярдами параметрів потрібно приблизно 200 мільярдів токенів, щоб потрапити в оптимальну для обчислень точку.
Виправдання меншої розгорнутої моделі для скорочення витрат на висновок за запитом, відповідаючи якості більшого конкурента.
Аудит існуючої моделі та висновок про те, що вона була недостатньо навчена, а потім планування більш тривалого тренування замість збільшення параметрів.
Ризики та огорожі
Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.
Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.
Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.
Дорожня карта впровадження
Почніть із простого визначення необхідного результату.
Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.
Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.
Задокументуйте, де Chinchilla Compute-Optimal Training допомагає, а де простіші методи кращі.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Навчання під час тестування
Часті запитання
What is Chinchilla Compute-Optimal Training?
Chinchilla — це дослідження DeepMind 2022 року, яке виявило, що більшість великих мовних моделей були погано навчені: для фіксованого бюджету обчислень вам слід масштабувати параметри та дані приблизно однаково, а не просто створювати більшу модель. Це змінило те, як галузь збалансовує розмір моделі з навчальними даними.
Яке відоме емпіричне правило Chinchilla щодо навчання, оптимального для обчислень?
Параметри та маркери, знайдені DeepMind, мають масштабуватися разом приблизно на рівні 20 маркерів на параметр для певного обчислювального бюджету.
Як шиншила з параметром 70B порівнюється з Gopher з параметром 280B?
Навчаючись на набагато більшій кількості токенів з однаковими обчисленнями, Chinchilla перемогла набагато більшого Gopher у більшості тестів.
Яку ключову проблему виявив документ Chinchilla щодо попередніх великих моделей?
Такі моделі, як GPT-3 і Gopher, були занадто великими порівняно з їхніми навчальними даними, тому продуктивність була нереалізованою.
Приблизно скільки токенів пропонує правило Шиншилла для моделі з 10 мільярдами параметрів?
При 20 маркерах на параметр 10 мільярдів параметрів означають приблизно 200 мільярдів навчальних маркерів.
Окрім ефективності навчання, чому менша, багата даними модель приваблива для розгортання?
Менша кількість параметрів означає меншу кількість обчислень для кожного запиту, тому економія зростає щоразу, коли використовується модель.