Ucwaningo luqhathanisa ukwengeza ama-GPU ngokucindezela inkumbulo ye-LLM ukuze kusetshenziswe okushibhile
Iphepha elisha le-arXiv liqhathanisa i-tensor parallelism ne-KV-cache yokucindezelwa kwemodeli yolimi olukhulu oluboshwe ngenkumbulo, kubika ukuthi ukucindezela bekushibhe izikhathi ezingu-1.20 kuya kwezingu-2.00 kukho konke ukulungiselelwa kwalo okuhloliwe, kuyilapho ama-GPU engeziwe bekuwukuphela kwendlela ehloliwe eyanciphisa ukubambezeleka.