Законы масштабирования шиншиллы
Законы масштабирования Chinchilla, разработанные DeepMind в 2022 году, показали, что большинство крупных языковых моделей сильно недообучены: при фиксированном бюджете вычислений следует масштабировать размер модели и обучающие данные примерно в равной пропорции.
Обзор
Это важно, потому что оно переопределило, что значит «оптимальный» размер модели, и изменило то, как лаборатории тратят вычислительные ресурсы.
Глубокое погружение
До появления Chinchilla существовала тенденция строить все более крупные модели (например, GPT-3 с параметром 175B) при обучении на относительно скромных объемах данных. DeepMind обучил более 400 моделей разных размеров и бюджетов данных, а затем подобрал кривые, прогнозирующие потери в зависимости от параметров и токенов в рамках фиксированного бюджета вычислений (FLOP). Их вывод: параметры и обучающие токены должны масштабироваться вместе, примерно в соотношении 1 к 1, что означает около 20 токенов обучающих данных на каждый параметр. Чтобы доказать это, они обучили Chinchilla, модель с 70B параметрами, на 1,4 триллионах токенов, которая превзошла гораздо более крупную Gopher с 280B параметрами, несмотря на использование тех же вычислений, поскольку она была обучена на гораздо большем количестве данных.
Техническая информация
Законы возникают в результате подбора параметрической функции потерь L(N, D), где N — параметры, а D — токены, включая условия неуменьшаемых потерь, размера модели и размера данных. Минимизация потерь при условии ограничения вычислений (вычисления примерно пропорциональны N, умноженному на D) дает результат, что оптимальные N и D растут как степень вычислений с одинаковыми показателями, поэтому оптимальное соотношение вычислений остается около 20 токенов на параметр.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее законов масштабирования шиншилл
Chinchilla перешла от погони за подсчетом параметров к предоставлению моделям гораздо более качественных данных, а современные модели часто обучаются далеко за пределами «вычислительно-оптимальной» точки, чтобы сделать логические выводы более дешевыми. Поскольку высококачественного веб-текста становится мало, внимание переключается на курирование данных, синтетические данные, несколько эпох и мультимодальные данные для дальнейшего масштабирования. Основной урок остается неизменным: данные и параметры должны быть сбалансированы, а сам по себе размер больше не является целью.
Реальная реализация
70B-параметрическая система Chinchilla от DeepMind превосходит 280B Gopher в тестах с равными вычислительными возможностями, обучаясь на гораздо большем количестве данных
Помощь командам в бюджете примерно 20 токенов обучения на каждый параметр при планировании модели с нуля.
Обоснование небольших моделей с большим объемом данных, таких как LLaMA, которые дешевле запускать во время вывода
Оценка того, является ли запланированная модель «недостаточно обученной» и получит ли она больше пользы от дополнительных данных, чем от дополнительных параметров.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Законы масштабирования для нейронных сетей
Часто задаваемые вопросы
Что такое законы масштабирования шиншилл?
Законы масштабирования Chinchilla, разработанные DeepMind в 2022 году, показали, что большинство крупных языковых моделей сильно недообучены: при фиксированном бюджете вычислений следует масштабировать размер модели и обучающие данные примерно в равной пропорции. Это важно, потому что оно по-новому определило, что означает «оптимальный» размер модели, и изменило то, как лаборатории тратят вычислительные ресурсы.
В чем заключался главный вывод законов масштабирования шиншилл?
Чиншилла показала, что при фиксированном бюджете вычислений параметры и обучающие токены должны расти вместе примерно 1 к 1.
Сколько примерно обучающих жетонов на параметр, по мнению Шиншиллы, является оптимальным для вычислений?
Оптимальное для вычислений соотношение составляет примерно 20 обучающих токенов для каждого параметра модели.
Какую модель Шиншилла превзошла, несмотря на то, что она была намного меньше?
Модель Chinchilla с 70B параметрами превзошла собственную версию Gopher с 280B от DeepMind, использовавшую те же вычисления, поскольку она обучалась на гораздо большем количестве данных.
Что в то время имела в виду Шиншилла о таких моделях, как GPT-3?
Многие крупные модели той эпохи были недостаточно обучены, а это означало, что они работали бы лучше, если бы для их параметров было гораздо больше данных.
Как примерно были аппроксимированы вычисления при анализе шиншиллы?
Обучающие вычисления (FLOP) примерно пропорциональны количеству параметров, умноженному на количество обучающих токенов.