Kajian membandingkan penambahan GPU dengan pemampatan memori LLM untuk penyajian yang lebih murah
Kertas arXiv baharu membandingkan keselarian tensor dengan pemampatan cache KV untuk penyajian model bahasa besar terikat memori, melaporkan bahawa pemampatan adalah 1.20 hingga 2.00 kali lebih murah merentas konfigurasi yang diuji, manakala GPU tambahan merupakan satu-satunya pendekatan yang diuji yang mengurangkan kependaman.