Badanie porównuje dodanie procesorów graficznych z kompresją pamięci LLM w celu tańszego serwowania
W nowym artykule arXiv porównano równoległość tensorów z kompresją pamięci podręcznej KV w przypadku obsługi dużych modeli językowych związanych z pamięcią i stwierdzono, że kompresja była od 1,20 do 2,00 razy tańsza w testowanych konfiguracjach, podczas gdy dodatkowe procesory graficzne były jedynym testowanym podejściem, które zmniejszyło opóźnienia.