Η μελέτη συγκρίνει την προσθήκη GPU με τη συμπίεση της μνήμης LLM για φθηνότερη εξυπηρέτηση
Ένα νέο χαρτί arXiv συγκρίνει τον παραλληλισμό τανυστών με τη συμπίεση κρυφής μνήμης KV για την υπηρεσία μοντέλων μεγάλων γλωσσών με περιορισμένη μνήμη, αναφέροντας ότι η συμπίεση ήταν 1,20 έως 2,00 φορές φθηνότερη στις δοκιμασμένες διαμορφώσεις του, ενώ οι πρόσθετες GPU ήταν η μόνη δοκιμασμένη προσέγγιση που μείωσε την καθυστέρηση.