Исследование сравнивает добавление графических процессоров со сжатием памяти LLM для более дешевого обслуживания
В новой статье arXiv сравнивается тензорный параллелизм со сжатием KV-кэша для обслуживания моделей большого языка с привязкой к памяти, сообщается, что сжатие было в 1,20–2,00 раза дешевле в протестированных конфигурациях, в то время как дополнительные графические процессоры были единственным протестированным подходом, который уменьшал задержку.