Квантование
Квантование сжимает модель ИИ, сохраняя ее числа с более низкой точностью, поэтому модель, для которой требуется графический процессор центра обработки данных, иногда может работать на ноутбуке или телефоне.
Обзор
It is the main trick that makes large language models cheap and fast enough to deploy widely.
Глубокое погружение
Нейронная сеть — это в основном гигантская куча чисел, называемых весами, обычно хранящихся в виде 16- или 32-битных значений с плавающей запятой. Квантование восстанавливает эти веса, используя меньшее количество битов, обычно 8-битные (INT8) или даже 4-битные целые числа. Переход с 16-битной на 4-битную версию сокращает объем памяти примерно в четыре раза, поэтому модель с 70 миллиардами параметров, которой требуется около 140 ГБ при 16-битной версии, может уместиться примерно в 35 ГБ при 4-битной версии. Меньшие числа также быстрее перемещаются по памяти, что обычно ускоряет генерацию. Загвоздка в точности: сжатие широкого диапазона значений в несколько уровней приводит к ошибке округления. Хорошие методы минимизируют эти потери за счет тщательного выбора коэффициентов масштабирования и защиты наиболее чувствительных весов, поэтому модель ведет себя почти идентично при использовании части ресурсов.
Техническая информация
Каждая группа весов получает масштабный коэффициент, который отображает реальные значения в небольшой набор целых чисел; обратное умножение на шкалу приблизительно восстанавливает исходное число. Методы квантования после обучения, такие как GPTQ и AWQ, анализируют небольшой набор калибровочных данных, чтобы решить, какие веса имеют наибольшее значение, и устанавливают шкалы, чтобы минимизировать ошибку вывода, а не округлять все вслепую. Активации часто выполняются с более высокой точностью, поскольку они больше изменяются во время выполнения. Результатом является модель, которая хранит 4-битные целые числа, но вычисляет результаты, очень близкие к версии полной точности.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее квантования
Ожидайте, что квантование станет значением по умолчанию, а не оптимизацией. Поставщики оборудования с самого начала добавляют в модель встроенную поддержку 4-битных и даже младших разрядов, а также такие методы, как обучение с учетом квантования для низкой точности, что еще больше снижает потерю точности. Исследования 2-битных и 1-битных (двоичных) представлений активны с целью запуска работоспособных моделей на телефонах и встроенных чипах. По мере развития искусственного интеллекта на устройствах и частного использования эффективные квантовые модели будут играть центральную роль в локальном запуске помощников без отправки данных в облако.
Реальная реализация
Запуск модели чата, такой как Llama, локально на потребительском графическом процессоре с использованием 4-битных файлов GGUF или GPTQ вместо использования нескольких карт центра обработки данных.
Помощники на устройствах на телефонах, где 8-битные или 4-битные модели позволяют использовать голосовые и текстовые функции без подключения к сети.
Сокращение затрат на облачный вывод для бота поддержки клиентов за счет обслуживания модели INT8 и размещения большего количества запросов на каждом графическом процессоре.
Периферийные устройства, такие как интеллектуальные камеры или датчики Интернета вещей, используют компактные квантовые модели на языке видения в ограниченном объеме памяти.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Остаточное векторное квантование
Часто задаваемые вопросы
What is Quantization?
Квантование сжимает модель ИИ, сохраняя ее числа с более низкой точностью, поэтому модель, для которой требуется графический процессор центра обработки данных, иногда может работать на ноутбуке или телефоне. Это главный трюк, который делает большие языковые модели дешевыми и достаточно быстрыми для широкого развертывания.
Что в первую очередь меняет квантование в нейронной сети?
Квантование восстанавливает веса модели с более низкой числовой точностью, например, 8-битные или 4-битные целые числа вместо 16- или 32-битных чисел с плавающей запятой.
Сколько примерно памяти экономится при перемещении весов с 16-битного на 4-битный?
4 бита — это одна четверть от 16 бит, поэтому вес хранилища падает примерно до четверти, то есть примерно в 4 раза.
Каков основной недостаток агрессивного квантования?
Представление значений с меньшим количеством уровней приводит к ошибке округления, которая может ухудшить качество вывода, если не соблюдать осторожность.
Для чего такие методы, как GPTQ и AWQ, используют небольшой набор калибровочных данных?
Эти методы после обучения анализируют несколько выборочных входных данных, чтобы установить коэффициенты масштабирования и защитить чувствительные веса, сохраняя выходные данные близкими к оригиналу.
Почему квантование часто делает модель быстрее, а не просто меньше?
Значения с более низкой точностью требуют меньше пропускной способности памяти для загрузки и перемещения, что часто является узким местом во время генерации, поэтому вывод ускоряется.