SmoothQuant ve Aktivasyon Nicelemesi
SmoothQuant, büyük dil modellerini yeniden eğitim gerektirmeden hem ağırlıklar hem de aktivasyonlar için 8 bitlik tam sayılara kadar sıkıştırmayı mümkün kılan bir tekniktir.
Genel Bakış
It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.
Derin Dalış
Bir modeli 16 bitlik değişkenlerden 8 bitlik tam sayılara küçülttüğünüzde, ağırlıklar kolayca sıkıştırılır ancak aktivasyonlar sorunludur: bazı kanallar diğerlerinden 10 ila 100 kat daha büyük değerler taşır ve bunları kaba bir tamsayı ızgarasına zorlamak doğruluğu yok eder. SmoothQuant, Xiao ve diğerleri tarafından tanıtıldı. 2022'de ağırlıkların düzgün olduğunu ve nicelleştirilmesinin kolay olduğunu, aktivasyonların ise dikenli olduğunu gözlemledi. Böylece zorluğu matematiksel olarak aktarır: Aktivasyon kanallarını kanal başına bir ölçeğe böler ve karşılık gelen ağırlıkları aynı ölçekle çarpar. İki işlem iptal edilerek model çıktısı değişmeden kalır, ancak artık her iki tensör de dost aralıklarda bulunur. Sonuç, sıfıra yakın doğruluk kaybı ve kabaca 2 kat hızlanma ve bellek tasarrufu ile W8A8 (8 bit ağırlıklar ve aktivasyonlar) çıkarımıdır.
Teknik Bilgi
Temel püf noktası, s = max(|X|)^alpha / max(|W|)^(1-alpha) olarak hesaplanan kanal başına yumuşatma faktörüdür. Aktivasyonlar 1/s ile, ağırlıklar ise s ile ölçeklendirilir, böylece XW matris ürünü korunur. Ölçeklendirme çevrimdışı olarak önceki katmanın ağırlıklarına veya birleştirilmiş bir işleme emildiği için sıfır çalışma süresi maliyeti ekler. Alfa hiperparametresi (genellikle 0,5), aktivasyonlardan ağırlıklara ne kadar aykırı değer yükünün kaydığını kontrol eder.
Stratejik Etki
Maliyet ve bütçe
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Daha net kararlar
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Quality control
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
SmoothQuant'ın Geleceği ve Aktivasyon Nicelemesi
SmoothQuant, etkinleştirme aykırı değerlerinin kaçınılmaz değil, taşınabilir olduğunu belirledi ve bu fikir artık üretim INT8 ve FP8 hizmetinin temelini oluşturuyor. Yumuşatmanın, grup başına niceleme, öğrenilmiş ölçeklendirme ve 4 bitlik aktivasyon araştırması (örneğin aykırı değere duyarlı yöntemler) gibi daha ince taneli şemalarla birleştirilmesini bekleyin. FP8 donanımı (Hopper, Blackwell) olgunlaştıkça, yumuşatma tarzı dengeleme, derleyici ve çıkarım motoru ardışık düzenlerinde yer almaya devam edecek ve böylece niceleme neredeyse ücretsiz kalacaktır.
Gerçek Dünya Uygulaması
Hem bellek hem de matris çoğaltma maliyetini yarıya indirerek daha az GPU'da W8A8'de 70B parametreli bir LLM'ye hizmet etme
8 bit tam sayı matematiğini yerel olarak hızlandıran NVIDIA Hopper/Blackwell tensör çekirdeklerinde INT8 çıkarımını etkinleştirme
Verimin iki katına çıkarılmasının jeton başına faturayı doğrudan azalttığı, maliyeti kısıtlı bulut uç noktalarında sohbet modellerinin devreye alınması
8 bit çekirdeklerin daha hızlı ve daha serin çalıştığı cihaz içi konuşma veya çeviri için transformatör kodlayıcıların sıkıştırılması
Riskler ve Korkuluklar
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulama Yol Haritası
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Aktivasyon Yönlendirme ve Temsil Mühendisliği
Sık sorulan sorular
What is SmoothQuant and Activation Quantization?
SmoothQuant, büyük dil modellerini yeniden eğitim gerektirmeden hem ağırlıklar hem de aktivasyonlar için 8 bitlik tam sayılara kadar sıkıştırmayı mümkün kılan bir tekniktir. Bu önemlidir çünkü büyük modellerdeki aktivasyonlar, normalde düşük hassasiyetli matematiği bozan aşırı aykırı değerler içerir ve SmoothQuant bunları ehlileştirir.
SmoothQuant düşük hassasiyetli çıkarımlarda özellikle hangi sorunu ele alıyor?
SmoothQuant, belirli aktivasyon kanallarında görünen büyük aykırı değerleri hedefler; aksi takdirde aktivasyonlar 8 bit olarak nicelendiğinde doğruluğu yok eder.
SmoothQuant aktivasyonların nicelendirilmesini nasıl kolaylaştırır?
Aktivasyon kanallarını kanal başına bir ölçeğe böler ve eşleşen ağırlıkları bu ölçekle çarpar, böylece ürün değişmez ancak her iki tensörün nicelenmesi daha kolay hale gelir.
W8A8 gösterimi ne anlama geliyor?
W8A8, SmoothQuant'ın minimum doğruluk kaybıyla mümkün kıldığı rejim olan hem ağırlıklar (W) hem de aktivasyonlar (A) için 8 bitlik nicelemeyi belirtir.
SmoothQuant'ın ölçeklendirmesi neden aslında hiçbir çalışma zamanı yükü eklemiyor?
Düzleştirme ölçekleri önceki katmanın ağırlıklarına veya birleştirilmiş bir operasyona önceden katlanır, böylece çıkarım sırasında fazladan hesaplama yapılmaz.
Alfa hiperparametresi SmoothQuant'ta nasıl bir rol oynuyor?
Alfa (genellikle 0,5), niceleme zorluğunun ne kadarının aktivasyonlardan ağırlıklara kaydırılacağına karar vererek yumuşatma faktörünü dengeler.