Дослідження порівнює додавання графічних процесорів зі стисненням пам’яті LLM для здешевлення обслуговування
Нова стаття arXiv порівнює тензорний паралелізм із стисненням KV-кешу для обслуговування великої мовної моделі, пов’язаної з пам’яттю, повідомляючи, що стиснення було в 1,20–2,00 рази дешевшим у протестованих конфігураціях, тоді як додаткові графічні процесори були єдиним перевіреним підходом, який зменшив затримку.