Teknik KILAVUZ

PagedAttention ve vLLM

PagedAttention, bir dil modelinin dikkat önbelleğini büyük, bitişik bir yığın yerine yeniden kullanılabilir küçük bloklarda saklayan bir bellek yönetimi tekniğidir.

2 min readSon güncelleme

Genel Bakış

It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.

Derin Dalış

Bir dil modeli metin ürettiğinde, gördüğü her belirteç için bir 'KV önbelleği' (anahtar ve değer vektörleri) tutar, böylece bir sonraki belirteç tam bağlama katılabilir. Geleneksel olarak her istek, mümkün olan maksimum uzunluğa göre boyutlandırılmış büyük bir bitişik GPU bellek parçasını ayırıyordu; diziler daha kısa olduğunda veya uzunlukları değiştiğinde büyük miktarlar israf ediliyordu. UC Berkeley'in 2023 vLLM makalesinde tanıtılan PagedAttention, sanal bellek sayfalama fikrini işletim sistemlerinden ödünç alıyor: KV önbelleğini, belleğin herhangi bir yerinde yaşayabilen ve talep üzerine tahsis edilebilen sabit boyutlu bloklara böler. Bir arama tablosu mantıksal belirteç konumlarını fiziksel bloklarla eşler. Bu, bellek parçalanmasını neredeyse ortadan kaldırır ve blokların, örneğin aynı istemden birden fazla çıktı arasında paylaşılmasına olanak tanır.

Teknik Bilgi

KV önbelleği, her biri belirli sayıda jetonun anahtarlarını ve değerlerini tutan sabit boyutlu sayfalara bölünmüştür. Her diziye özel bir blok tablosu, mantıksal konumları fiziksel sayfa konumlarıyla eşleştirir; dolayısıyla bir dizinin önbelleğinin bitişik olması gerekmez. Aynı önekler (paylaşılan bir sistem istemi veya ışın arama dalları) yazma sırasında kopyalama yoluyla aynı fiziksel sayfaları işaret edebildiğinden, bellek kopyalanmak yerine yeniden kullanılır ve israf %60'ın üzerinde bir orandan yüzde birkaçına düşürülür.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

PagedAttention ve vLLM'nin Geleceği

vLLM, varsayılan bir açık kaynak çıkarım omurgası haline geldi ve PagedAttention'ın fikirleri artık çoğu hizmet yığınında görülüyor. Daha derin ön ek önbelleğe alma (kullanıcılar arasında önbelleğe alınmış sistem istemlerinin yeniden kullanılması), ayrı makinelerde ayrıştırılmış ön doldurma ve kod çözme, daha akıllı tahliye politikaları ve niceleme ve spekülatif kod çözme ile sıkı entegrasyon bekleyebilirsiniz. Bağlam pencereleri milyonlarca jetona dönüştükçe, verimli sayfalanmış KV yönetimi, hizmeti uygun maliyetli tutmak açısından daha da merkezi hale geliyor.

Gerçek Dünya Uygulaması

vLLM'nin tek bir GPU'dan birçok eşzamanlı sohbet kullanıcısına yüksek verimle hizmet verdiği açık kaynaklı bir LLM API'sini barındırma

Önek önbelleğe alma yoluyla uzun bir sistem isteminin binlerce istekle paylaşılması, böylece tekrar tekrar değil bir kez işlenmesi

Yazma üzerine kopyalama yoluyla ortak istem için KV bloklarını paylaşan ışın aramayı veya birden fazla örneklenmiş tamamlamayı çalıştırma

Bir sağlayıcının aynı donanıma daha fazla eş zamanlı oturumu paketleyebilmesi için GPU bellek atıklarının parçalanması önleniyor

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PagedAttention and vLLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Diferansiyel Gizlilik

Sık sorulan sorular

What is PagedAttention and vLLM?

PagedAttention, bir dil modelinin dikkat önbelleğini büyük, bitişik bir yığın yerine yeniden kullanılabilir küçük bloklarda saklayan bir bellek yönetimi tekniğidir. Tek bir GPU'nun işleyebileceği istek sayısını önemli ölçüde artıran açık kaynaklı bir hizmet motoru olan vLLM'ye güç verir.

Metin oluşturma sırasında 'KV önbelleği' neyi saklıyor?

KV önbelleği, önceki her simge için anahtar ve değer vektörlerini tutar ve modelin, her adımda yeniden hesaplamadan tüm içeriğe katılmasına olanak tanır.

PagedAttention'a hangi işletim sistemi konsepti ilham verdi?

PagedAttention, sanal bellek sayfalamayı ödünç alır: KV önbelleği, herhangi bir yerde yaşayabilen, bir blok tabloyla eşlenen sabit boyutlu sayfalara bölünmüştür.

PagedAttention geleneksel KV önbellek tahsisiyle ilgili hangi sorunu çözüyor?

İstek başına maksimum uzunluğa göre boyutlandırılmış büyük bir bitişik levhanın ayrılması, büyük miktarda GPU belleğinin boşa harcanmasına neden oluyordu. Sayfalama, talep üzerine küçük bloklar tahsis ederek israfı azaltır.

PagedAttention, birden fazla çıkışın ortak bir istem için belleği paylaşmasına nasıl izin verir?

Aynı önekler (paylaşılan istemler veya ışın arama dalları) aynı fiziksel KV sayfalarına referans verir ve yalnızca bir dal farklılaştığında kopyalanır.

vLLM ve PagedAttention ilk olarak nerede geliştirildi?

vLLM ve PagedAttention algoritması, UC Berkeley'den 2023 tarihli bir makalede ortaya çıktı ve kısa sürede yaygın olarak kullanılan bir açık kaynaklı hizmet motoru haline geldi.