Мова AI GUIDE

Квантування

Квантування зменшує модель штучного інтелекту, зберігаючи її числа з нижчою точністю, тому модель, якій потрібен графічний процесор центру обробки даних, іноді може працювати на ноутбуці чи телефоні.

2 хвилини читанняОстаннє оновлення

Огляд

It is the main trick that makes large language models cheap and fast enough to deploy widely.

Глибоке занурення

Нейронна мережа — це здебільшого величезна купа чисел, які називаються вагами, зазвичай зберігаються як 16- або 32-розрядні значення з плаваючою комою. Квантування повторно зберігає ці ваги, використовуючи меншу кількість бітів, зазвичай 8-бітних (INT8) або навіть 4-бітних цілих чисел. Перехід від 16-бітної до 4-бітної скорочує обсяг пам’яті приблизно в чотири рази, тому модель із 70 мільярдами параметрів, якій потрібно близько 140 ГБ у 16-бітній версії, може вмістити приблизно 35 ГБ у 4-бітній версії. Менші числа також швидше переміщуються в пам’яті, що зазвичай прискорює генерацію. Заковика полягає в точності: стискання широкого діапазону значень на кілька рівнів призводить до помилки округлення. Хороші методи мінімізують цю втрату шляхом ретельного вибору коефіцієнтів масштабування та захисту найбільш чутливих ваг, тому модель поводиться майже ідентично, використовуючи частину ресурсів.

Технічне розуміння

Кожна група вагових коефіцієнтів отримує масштабний коефіцієнт, який відображає реальні значення на невеликий набір цілих чисел; множення назад на масштаб приблизно відновлює початкове число. Методи квантування після навчання, такі як GPTQ і AWQ, аналізують невеликий набір даних калібрування, щоб визначити, які ваги мають найбільше значення, і встановлюють масштаби, щоб мінімізувати помилку виводу, а не округляти все наосліп. Активації часто мають вищу точність, оскільки вони більше змінюються під час виконання. Результатом є модель, яка зберігає 4-розрядні цілі числа, але обчислює результати, дуже близькі до версії з повною точністю.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє квантування

Очікуйте, що квантування стане стандартним, а не оптимізованим. Постачальники апаратного забезпечення з самого початку додають у модель власну підтримку 4-розрядних і навіть нижчих розрядів, а також такі методи, як навчання толерантності до запікання з урахуванням квантування для низької точності, що ще більше зменшує втрату точності. Дослідження 2-бітних і 1-бітних (двійкових) представлень активно, спрямовані на запуск придатних моделей на телефонах і вбудованих мікросхемах. У міру зростання внутрішнього і приватного штучного інтелекту ефективні квантовані моделі будуть центральними для локальної роботи помічників без надсилання даних у хмару.

Реалізація в реальному світі

Запуск моделі чату, як-от Llama, локально на споживчому графічному процесорі з використанням 4-розрядних файлів GGUF або GPTQ замість потреби в кількох картах центру обробки даних.

Вбудовані помічники на телефонах, де 8- або 4-розрядні моделі дозволяють функціям мовлення та тексту працювати без підключення до мережі.

Зниження витрат на хмарні висновки для бота клієнтської підтримки завдяки обслуговуванню моделі INT8, установці більше запитів на кожному GPU.

Граничні пристрої, такі як розумні камери або датчики Інтернету речей, які працюють з компактними квантованими моделями мови зору в жорстких обмеженнях пам’яті.

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Залишкове векторне квантування

Часті запитання

What is Quantization?

Квантування зменшує модель штучного інтелекту, зберігаючи її числа з нижчою точністю, тому модель, якій потрібен графічний процесор центру обробки даних, іноді може працювати на ноутбуці чи телефоні. Це головний трюк, який робить великі мовні моделі дешевими та досить швидкими для широкого розгортання.

Що в основному змінює квантування в нейронній мережі?

Квантування повторно зберігає вагові коефіцієнти моделі з нижчою чисельною точністю, наприклад, 8- або 4-бітні цілі замість 16- або 32-бітних чисел з плаваючою точкою.

Приблизно скільки пам’яті зберігається шляхом переміщення вагових коефіцієнтів із 16-бітних на 4-бітні?

4 біти становлять одну чверть від 16 бітів, тому вага пам’яті зменшується приблизно до чверті, приблизно в 4 рази.

Який головний недолік агресивного квантування?

Представлення значень меншою кількістю рівнів призводить до помилки округлення, яка може погіршити якість виведення, якщо нею керувати не ретельно.

Для чого такі методи, як GPTQ і AWQ, використовують невеликий набір даних калібрування?

Ці методи після навчання аналізують кілька зразків вхідних даних, щоб встановити коефіцієнти масштабування та захистити чутливі ваги, зберігаючи вихідні дані близькими до оригіналу.

Чому квантування часто робить модель швидшою, а не просто меншою?

Значення з нижчою точністю потребують меншої пропускної здатності пам’яті для завантаження та переміщення, що часто є вузьким місцем під час генерації, тому логічний висновок пришвидшується.