Une étude compare l'ajout de GPU à la compression de la mémoire LLM pour un service moins cher
Un nouvel article arXiv compare le parallélisme tensoriel avec la compression du cache KV pour la diffusion de modèles de langage volumineux liés à la mémoire, rapportant que la compression était 1,20 à 2,00 fois moins chère dans ses configurations testées, tandis que les GPU supplémentaires étaient la seule approche testée qui réduisait la latence.