การศึกษาเปรียบเทียบการเพิ่ม GPU กับการบีบอัดหน่วยความจำ LLM เพื่อการแสดงผลที่ถูกกว่า
เอกสาร arXiv ใหม่เปรียบเทียบความเท่าเทียมของเทนเซอร์กับการบีบอัด KV-cache สำหรับการให้บริการโมเดลภาษาขนาดใหญ่ที่ผูกกับหน่วยความจำ โดยรายงานว่าการบีบอัดมีราคาถูกกว่า 1.20 ถึง 2.00 เท่าในการกำหนดค่าที่ทดสอบ ในขณะที่ GPU เพิ่มเติมเป็นวิธีเดียวที่ได้รับการทดสอบที่ลดเวลาแฝง