РУКОВОДСТВО ПО ОСНОВАМ

Оптимальное для вычислений обучение шиншиллы

Chinchilla — это вывод DeepMind 2022 года о том, что большинство крупных языковых моделей сильно недостаточно обучены: при фиксированном бюджете вычислений вам следует примерно одинаково масштабировать параметры и данные, а не просто строить более крупную модель.

2 минуты чтенияПоследнее обновление

Обзор

It reshaped how the industry balances model size against training data.

Глубокое погружение

В статье DeepMind Chinchilla вновь рассматривался вопрос масштабирования и обучалось более 400 моделей, чтобы найти оптимальный баланс вычислений. Эмпирическое правило заголовка: размер модели и обучающие токены должны расти синхронно, примерно по 20 обучающих жетонов на параметр. Чтобы доказать это, они обучили Chinchilla, модель с 70 миллиардами параметров, на 1,4 триллионах токенов, используя те же вычисления, что и Gopher с 280 миллиардами параметров, обученный на гораздо меньшем количестве токенов. Шиншилла, несмотря на то, что она была в четыре раза меньше, превзошла Gopher, GPT-3 и других гигантов почти по всем критериям. Этот урок опроверг сделанный ранее вывод OpenAI о том, что размер отдается предпочтение перед данными, и показал, что многие флагманские модели теряют производительность из-за того, что они слишком велики и испытывают недостаток данных.

Техническая информация

Шиншилла соответствует потере как L(N,D) = E + A·N^(-α) + B·D^(-β), где α и β оба близки к 0,34, что означает, что параметры и данные вносят почти симметричный вклад. Оптимизация этого при фиксированном ограничении вычислений (вычисление ≈ 6·N·D для трансформаторов) дает результат равного масштабирования. Меньшую модель с большим объемом данных также дешевле использовать для вывода, поэтому ее преимущество увеличивается при развертывании, а не только при обучении.

Стратегическое воздействие

Более четкие решения

Это поможет вам отделить четкие технические заявления от маркетингового языка.

Стоимость и бюджет

Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.

Команда и рабочий процесс

Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.

Будущее оптимального для вычислений обучения шиншилл

Современные модели, такие как Llama 3, намеренно выходят далеко за рамки соотношения 20 токенов на параметр Chinchilla, обучая небольшие модели на триллионах токенов, чтобы сделать вывод дешевым, допуская неоптимальные обучающие вычисления. Поскольку хороших данных становится все меньше, растет интерес к повторяющимся эпохам, синтетическим данным и качественной фильтрации. Шиншилла остается ориентиром, но оптимум все больше зависит от стоимости жизни, а не только от единовременного бюджета на обучение.

Реальная реализация

Выбор обучения модели с 7 миллиардами параметров на 2 триллионах токенов, а не модели с 30 миллиардами на слишком небольшом количестве данных для того же бюджета.

По оценкам, для модели с 10 миллиардами параметров требуется примерно 200 миллиардов токенов, чтобы достичь оптимальной для вычислений точки.

Обоснование использования меньшей развернутой модели для сокращения затрат на вывод на каждый запрос при сохранении качества более крупного конкурента.

Аудит существующей модели и вывод о том, что она недостаточно обучена, а затем планирование более длительного обучения вместо увеличения параметров.

Риски и ограничения

Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.

Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.

Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.

Дорожная карта реализации

1

Начните с простого определения желаемого результата.

2

Перед тестированием выберите один показатель успеха и одно условие отказа.

3

Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.

4

Документ, в котором помогает оптимальное вычислительное обучение шиншиллы и где более простые методы лучше.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Обучение во время тестирования

Часто задаваемые вопросы

What is Chinchilla Compute-Optimal Training?

Chinchilla — это вывод DeepMind 2022 года о том, что большинство крупных языковых моделей сильно недостаточно обучены: при фиксированном бюджете вычислений вам следует примерно одинаково масштабировать параметры и данные, а не просто строить более крупную модель. Это изменило то, как отрасль балансирует размер модели с обучающими данными.

Каково знаменитое эмпирическое правило Шиншиллы для оптимального обучения?

DeepMind обнаружил, что параметры и токены должны масштабироваться примерно по 20 токенов на параметр для заданного вычислительного бюджета.

Чем шиншилла с параметром 70В отличается от суслика с параметром 280В?

Обученная на гораздо большем количестве токенов с теми же вычислениями, Chinchilla превзошла гораздо более крупного Gopher по большинству тестов.

Какую ключевую проблему выявила статья «Шиншилла» в отношении предыдущих крупных моделей?

Такие модели, как GPT-3 и Gopher, были слишком большими по сравнению с их обучающими данными, в результате чего производительность оставалась нереализованной.

Сколько примерно токенов предполагает правило Шиншиллы для модели с 10 миллиардами параметров?

При 20 токенах на параметр 10 миллиардов параметров подразумевают около 200 миллиардов обучающих токенов.

Помимо эффективности обучения, почему меньшая модель с большим объемом данных привлекательна для развертывания?

Меньшее количество параметров означает меньшие вычисления для каждого запроса, поэтому экономия увеличивается каждый раз, когда используется модель.