Studie srovnává přidávání GPU s kompresí paměti LLM pro levnější obsluhu
Nový dokument arXiv srovnává paralelismus tenzoru s kompresí KV-cache pro obsluhu velkých jazykových modelů vázaných na paměť a uvádí, že komprese byla 1,20 až 2,00krát levnější v testovaných konfiguracích, zatímco další GPU byly jediným testovaným přístupem, který snížil latenci.