Nghiên cứu so sánh việc thêm GPU với việc nén bộ nhớ LLM để phục vụ rẻ hơn
Một bài báo arXiv mới so sánh tính song song tensor với nén KV-cache để phục vụ mô hình ngôn ngữ lớn giới hạn bộ nhớ, báo cáo rằng tính năng nén rẻ hơn 1,20 đến 2,00 lần trên các cấu hình đã được thử nghiệm, trong khi GPU bổ sung là phương pháp được thử nghiệm duy nhất giúp giảm độ trễ.