Nazarin ya kwatanta ƙara GPUs tare da matsawa ƙwaƙwalwar LLM don hidima mai rahusa
Sabuwar takarda ta arXiv tana kwatankwacin daidaiton tensor tare da matsawar KV-cache don babban ƙirar harshe mai ɗaure da ƙwaƙwalwar ajiya, yana ba da rahoton cewa matsawa ya kasance mai rahusa sau 1.20 zuwa sau 2.00 a duk faɗin tsarin da aka gwada, yayin da ƙarin GPUs shine kawai hanyar da aka gwada wanda ya rage latency.