Що сталося
Дослідники оцінили два способи зменшення навантаження на пам’ять при обслуговуванні великих мовних моделей: розподіл ваг і кешу KV між декількома графічними процесорами або стиснення та вибіркове видалення кешу KV. Використовуючи профільований симулятор, відкалібрований на апаратному забезпеченні A100, A40 і H100, вони порівняли вартість мільйона токенів із затримкою в моделях Llama-2 при параметрах 7B і 70B.
У статті розглядається конкретне вузьке місце в обслуговуванні великої мовної моделі: недостатньо місця для кешу ключ-значення або KV. За словами авторів, тензорний паралелізм вирішує проблему шляхом розподілу вагових коефіцієнтів моделі та кешу KV на два, чотири або вісім пристроїв. Такий підхід створює додатковий запас пам’яті, але вимагає операції повного зменшення на кожному рівні та збільшує рахунок за апаратне забезпечення зі збільшенням кількості пристроїв.
Досліджена альтернатива полягає в тому, щоб зменшити сам кеш. Автори оцінюють квантування KV на 16-, 8- та 4-бітних рівнях, а також коефіцієнт збереження до 0,25, що означає, що тестовані конфігурації зберігають різні частки кешу. У документі обидві стратегії розміщуються на осі спільних витрат: вартість мільйона токенів у порівнянні з затримкою, а не окремо порівнюються коефіцієнти пам’яті та криві пропускної здатності.
Для аналізу використовується профільований симулятор, відкалібрований на обладнанні A100, A40 і H100. Він охоплює моделі Llama-2 із 7 мільярдами та 70 мільярдами параметрів, тензорно-паралельними ступенями від одного до восьми та перевіреними параметрами стиснення. Автори повідомляють, що в цих експериментах вони не виявили перехресного еквівалентності вартості: стиснення було в 1,20-2,00 рази дешевшим у конфігураціях, які вони створили.
Повідомлена межа залежить від співвідношення між розміром моделі та пам’яттю пристрою. Для пристрою на 80 ГБ автори кажуть, що модель 7B не може вичерпати свій бюджет KV у власному вікні контексту, тоді як межа рішення з’являється приблизно на параметрах 36B. Нижче цієї точки, як повідомляється, стиснення економічно домінує. Над ним тензорний паралелізм усуває більші обмеження, коли вагові коефіцієнти моделі не можуть поміститися на одному пристрої; автори наводять Llama-2 70B на одному A100 як приклад, який залишається нездійсненним незалежно від налаштування KV.
Чому це важливо
Документ містить практичний вибір інфраструктури для операторів ШІ. Його результати свідчать про те, що стиснення може забезпечити значно більшу ємність обслуговування на долар для моделей, які відповідають своїй вазі на одному пристрої, тоді як тензорний паралелізм стає необхідним, коли сама вага моделі перевищує доступну пам’ять. Компромісом є більша затримка під час стиснення в тестованих налаштуваннях.
Практична цінність статті полягає в тому, що вона порівнює два інфраструктурні рішення, які часто обговорюються з використанням різних заходів. Команда, яка вирішує, як обслуговувати LLM, повинна збалансувати обсяг пам’яті, затримку та вартість. Виражаючи альтернативи як вартість мільйона токенів проти затримки, дослідження пропонує загальну основу для обдумування цього рішення, хоча результати залишаються результатами змодельованих і профільованих конфігурацій у статті.
Повідомлена економічна перевага є найбільшою для моделей, вага яких уже підходить для одного пристрою. У такій ситуації зменшення кешу KV може збільшити обсяг роботи, що виконується доступним обладнанням, не вимагаючи більшого кластера GPU. Автори повідомляють про 16,5-кратний множник ємності на долар для стиснення в порівнянні з 1,21-кратним для восьмикратного збільшення витрат GPU. Це звітні результати, а не загальна гарантія для всіх розгортань.
Затримка є основною ціною стратегії стиснення в дослідженні. Автори повідомляють, що стиснення збільшило затримку кожного токена на 8% до 93%, що вони пов’язують з суперечками щодо пакетування. Паралелізм тензорів був єдиним перевіреним важелем, який покращив затримку. Це створює чіткий операційний компроміс: стиснення може бути кращим там, де пропускна здатність або ємність на долар мають найбільше значення, тоді як додаткові графічні процесори можуть бути виправданими, коли основним вимогою є час відгуку.
У документі також пояснюється, чому єдине правило для всіх розгортань LLM вводить в оману. Стиснення KV не зменшує обсяг пам’яті, зайнятий вагами моделей, тому не дозволяє розмістити велику модель на одному пристрої. І навпаки, додавання графічних процесорів може зменшити ємність ваги, але може бути надмірним для меншої моделі, основною проблемою якої є використання кешу. Таким чином, внесок дослідження є умовною рекомендацією, прив’язаною до зв’язувального ресурсу пам’яті, а не твердженням, що один метод завжди замінює інший.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
Which component of an AI application is the machine-learning model itself?
Що дивитися далі
Отримані дані потрібно перевірити на виробничі робочі навантаження, сімейства моделей, вимоги до якості та фактичні ціни на хмару чи апаратне забезпечення. У анотації не повідомляється про детальні ефекти точності від квантування чи витіснення, результати перевірки симулятора, а також про те, чи зареєстрована межа кросовера виходить за межі перевірених моделей Llama-2 і типів GPU.
Анотація не містить основних цін на хмару, припущень про використання апаратного забезпечення, суміші робочого навантаження, розмірів пакетів або цільових показників затримки, які використовуються для розрахунку вартості за мільйон токенів. Ці деталі визначатимуть, наскільки швидко оператори зможуть перевести звітні коефіцієнти у власні бюджети обслуговування. Результат, заснований на одному профілі ціноутворення або використання, може змінитися, коли ці вхідні дані зміняться.
Вартість якості стиснення також не повністю вказана в джерелі. Стаття описує квантування та виселення як витрати «невеликої якості», але анотація не дає виміряних показників якості, завдань, діапазонів погіршення або порогових значень, які використовуються для прийняття рішення про прийнятність конфігурації. Виробничим групам потрібна ця інформація, перш ніж розглядати результати витрат як наскрізну рекомендацію.
Дослідження обмежене в джерелі двома розмірами Llama-2 і трьома типами GPU, хоча воно представляє загальну межу прийняття рішення приблизно за 36B параметрів для карти на 80 ГБ. Анотація не встановлює, чи зберігається ця межа для інших архітектур, довжин контексту, дизайнів уваги, сімейств моделей або новішого обладнання. Тут також не сказано, як змінюються висновки, коли ваги моделі квантуються або коли обслуговуючі системи використовують інші методи керування пам’яттю.
Подальша перевірка повинна бути зосереджена на реальних розгортаннях і на калібруванні симулятора. Джерело ідентифікує симулятор як профільований на апаратному забезпеченні A100, A40 і H100, але анотація не повідомляє про незалежну валідацію щодо вимірювань живого обслуговування. Це також залишає відкритим питання про ефективність стиснення та паралелізму тензорів у поєднанні, чи змінюється штраф за затримку залежно від шаблонів трафіку та яку якість моделі користувачі обміняли б за повідомлені прирости ємності.