Lo studio mette a confronto l'aggiunta di GPU con la compressione della memoria LLM per un servizio più economico
Un nuovo documento arXiv confronta il parallelismo del tensore con la compressione della cache KV per il servizio di modelli linguistici di grandi dimensioni legati alla memoria, segnalando che la compressione era da 1,20 a 2,00 volte più economica nelle configurazioni testate, mentre GPU aggiuntive erano l'unico approccio testato che riduceva la latenza.