PagedAttention ve vLLM
PagedAttention, bir dil modelinin dikkat önbelleğini büyük, bitişik bir yığın yerine yeniden kullanılabilir küçük bloklarda saklayan bir bellek yönetimi tekniğidir.
Genel Bakış
It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.
Derin Dalış
Bir dil modeli metin ürettiğinde, gördüğü her belirteç için bir 'KV önbelleği' (anahtar ve değer vektörleri) tutar, böylece bir sonraki belirteç tam bağlama katılabilir. Geleneksel olarak her istek, mümkün olan maksimum uzunluğa göre boyutlandırılmış büyük bir bitişik GPU bellek parçasını ayırıyordu; diziler daha kısa olduğunda veya uzunlukları değiştiğinde büyük miktarlar israf ediliyordu. UC Berkeley'in 2023 vLLM makalesinde tanıtılan PagedAttention, sanal bellek sayfalama fikrini işletim sistemlerinden ödünç alıyor: KV önbelleğini, belleğin herhangi bir yerinde yaşayabilen ve talep üzerine tahsis edilebilen sabit boyutlu bloklara böler. Bir arama tablosu mantıksal belirteç konumlarını fiziksel bloklarla eşler. Bu, bellek parçalanmasını neredeyse ortadan kaldırır ve blokların, örneğin aynı istemden birden fazla çıktı arasında paylaşılmasına olanak tanır.
Teknik Bilgi
KV önbelleği, her biri belirli sayıda jetonun anahtarlarını ve değerlerini tutan sabit boyutlu sayfalara bölünmüştür. Her diziye özel bir blok tablosu, mantıksal konumları fiziksel sayfa konumlarıyla eşleştirir; dolayısıyla bir dizinin önbelleğinin bitişik olması gerekmez. Aynı önekler (paylaşılan bir sistem istemi veya ışın arama dalları) yazma sırasında kopyalama yoluyla aynı fiziksel sayfaları işaret edebildiğinden, bellek kopyalanmak yerine yeniden kullanılır ve israf %60'ın üzerinde bir orandan yüzde birkaçına düşürülür.
Stratejik Etki
Maliyet ve bütçe
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Daha net kararlar
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Quality control
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
PagedAttention ve vLLM'nin Geleceği
vLLM, varsayılan bir açık kaynak çıkarım omurgası haline geldi ve PagedAttention'ın fikirleri artık çoğu hizmet yığınında görülüyor. Daha derin ön ek önbelleğe alma (kullanıcılar arasında önbelleğe alınmış sistem istemlerinin yeniden kullanılması), ayrı makinelerde ayrıştırılmış ön doldurma ve kod çözme, daha akıllı tahliye politikaları ve niceleme ve spekülatif kod çözme ile sıkı entegrasyon bekleyebilirsiniz. Bağlam pencereleri milyonlarca jetona dönüştükçe, verimli sayfalanmış KV yönetimi, hizmeti uygun maliyetli tutmak açısından daha da merkezi hale geliyor.
Gerçek Dünya Uygulaması
vLLM'nin tek bir GPU'dan birçok eşzamanlı sohbet kullanıcısına yüksek verimle hizmet verdiği açık kaynaklı bir LLM API'sini barındırma
Önek önbelleğe alma yoluyla uzun bir sistem isteminin binlerce istekle paylaşılması, böylece tekrar tekrar değil bir kez işlenmesi
Yazma üzerine kopyalama yoluyla ortak istem için KV bloklarını paylaşan ışın aramayı veya birden fazla örneklenmiş tamamlamayı çalıştırma
Bir sağlayıcının aynı donanıma daha fazla eş zamanlı oturumu paketleyebilmesi için GPU bellek atıklarının parçalanması önleniyor
Riskler ve Korkuluklar
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulama Yol Haritası
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PagedAttention and vLLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Diferansiyel Gizlilik
Sık sorulan sorular
What is PagedAttention and vLLM?
PagedAttention, bir dil modelinin dikkat önbelleğini büyük, bitişik bir yığın yerine yeniden kullanılabilir küçük bloklarda saklayan bir bellek yönetimi tekniğidir. Tek bir GPU'nun işleyebileceği istek sayısını önemli ölçüde artıran açık kaynaklı bir hizmet motoru olan vLLM'ye güç verir.
Metin oluşturma sırasında 'KV önbelleği' neyi saklıyor?
KV önbelleği, önceki her simge için anahtar ve değer vektörlerini tutar ve modelin, her adımda yeniden hesaplamadan tüm içeriğe katılmasına olanak tanır.
PagedAttention'a hangi işletim sistemi konsepti ilham verdi?
PagedAttention, sanal bellek sayfalamayı ödünç alır: KV önbelleği, herhangi bir yerde yaşayabilen, bir blok tabloyla eşlenen sabit boyutlu sayfalara bölünmüştür.
PagedAttention geleneksel KV önbellek tahsisiyle ilgili hangi sorunu çözüyor?
İstek başına maksimum uzunluğa göre boyutlandırılmış büyük bir bitişik levhanın ayrılması, büyük miktarda GPU belleğinin boşa harcanmasına neden oluyordu. Sayfalama, talep üzerine küçük bloklar tahsis ederek israfı azaltır.
PagedAttention, birden fazla çıkışın ortak bir istem için belleği paylaşmasına nasıl izin verir?
Aynı önekler (paylaşılan istemler veya ışın arama dalları) aynı fiziksel KV sayfalarına referans verir ve yalnızca bir dal farklılaştığında kopyalanır.
vLLM ve PagedAttention ilk olarak nerede geliştirildi?
vLLM ve PagedAttention algoritması, UC Berkeley'den 2023 tarihli bir makalede ortaya çıktı ve kısa sürede yaygın olarak kullanılan bir açık kaynaklı hizmet motoru haline geldi.