Мова AI GUIDE

Закони лущення шиншил

Закони масштабування Chinchilla, розроблені DeepMind у 2022 році, показали, що більшість великих мовних моделей були погано навчені: для фіксованого бюджету обчислень вам слід масштабувати розмір моделі та навчальні дані приблизно в рівній пропорції.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Глибоке занурення

До Chinchilla трендом було створювати все більші моделі (наприклад, GPT-3 із параметрами 175B), навчаючись на відносно скромних обсягах даних. DeepMind навчив понад 400 моделей різних розмірів і бюджетів даних, а потім підібрав криві, що передбачають втрати як функцію параметрів і маркерів за фіксованого бюджету обчислень (FLOP). Їх висновок: параметри та навчальні маркери повинні масштабуватися разом, приблизно у співвідношенні 1 до 1, тобто приблизно 20 маркерів навчальних даних на параметр. Щоб довести це, вони навчили Chinchilla, модель із параметрами 70B на 1,4 трильйонах токенів, яка перевершила набагато більшу модель Gopher із параметрами 280B, незважаючи на те саме обчислення, оскільки вона була навчена на набагато більшій кількості даних.

Технічне розуміння

Закони випливають із підгонки параметричної функції втрат L(N, D), де N — це параметри, а D — це токени, включаючи терміни незнижуваних втрат, розміру моделі та розміру даних. Мінімізація втрат за умови обмеження обчислення (обчислення приблизно пропорційно N, помноженому на D) призводить до того, що оптимальні N і D зростають як потужність обчислення з однаковими показниками, тому співвідношення оптимального обчислення залишається близько 20 маркерів на параметр.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє законів про чищення шиншил

Chinchilla перейшла з пошуку параметрів на передачу в моделі набагато більш високоякісних даних, а сучасні моделі часто тренуються далеко за межі «оптимального обчислення», щоб зробити висновок дешевшим. Оскільки високоякісний веб-текст стає дефіцитним, увага звертається на контроль даних, синтетичні дані, кілька епох і мультимодальні дані для продовження масштабування. Основний урок зберігається: дані та параметри мають бути збалансовані, і лише необроблений розмір більше не є метою.

Реалізація в реальному світі

Chinchilla з параметрами 70B від DeepMind перемагає Gopher 280B за тестами, використовуючи однакові обчислення, навчаючись на значно більшій кількості даних

Керівництво командами щодо бюджету приблизно 20 жетонів навчання на параметр під час планування моделі з нуля

Виправдання менших, багатих на дані моделей, таких як LLaMA, які дешевше запускати під час висновку

Оцінка того, чи є запланована модель «недостатньо навченою» і чи принесе їй більше переваг від додаткових даних, ніж від додаткових параметрів

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Закони масштабування для нейронних мереж

Часті запитання

What is Chinchilla Scaling Laws?

Закони масштабування Chinchilla, розроблені DeepMind у 2022 році, показали, що більшість великих мовних моделей були погано навчені: для фіксованого бюджету обчислень вам слід масштабувати розмір моделі та навчальні дані приблизно в рівній пропорції. Це важливо, оскільки він переосмислив, що означає «оптимальний» розмір моделі, і змінив те, як лабораторії витрачають обчислення.

Що було головним відкриттям законів лущення шиншил?

Chinchilla показала, що для фіксованого бюджету обчислень параметри та навчальні токени повинні зростати разом, приблизно 1 до 1.

Приблизно скільки тренувальних жетонів на параметр Chinchilla вважає оптимальним для обчислень?

Оптимальне для обчислення співвідношення становить приблизно 20 навчальних маркерів для кожного параметра моделі.

Яка модель Chinchilla була кращою, незважаючи на те, що була набагато меншою?

Chinchilla з параметром 70B переміг власний Gopher від DeepMind з параметром 280B, використовуючи ті самі обчислення, оскільки він тренувався на набагато більшій кількості даних.

Що натякала Chinchilla про такі моделі, як GPT-3 у той час?

Багато великих моделей тієї епохи були недостатньо підготовленими, а це означає, що вони працювали б краще з набагато більшою кількістю даних для підрахунку параметрів.

Приблизно як було наближено обчислення в аналізі Chinchilla?

Навчальні обчислення (FLOP) приблизно пропорційні кількості параметрів, помноженій на кількість навчальних жетонів.