Teknik KILAVUZ

SmoothQuant ve Aktivasyon Nicelemesi

SmoothQuant, büyük dil modellerini yeniden eğitim gerektirmeden hem ağırlıklar hem de aktivasyonlar için 8 bitlik tam sayılara kadar sıkıştırmayı mümkün kılan bir tekniktir.

2 min readSon güncelleme

Genel Bakış

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

Derin Dalış

Bir modeli 16 bitlik değişkenlerden 8 bitlik tam sayılara küçülttüğünüzde, ağırlıklar kolayca sıkıştırılır ancak aktivasyonlar sorunludur: bazı kanallar diğerlerinden 10 ila 100 kat daha büyük değerler taşır ve bunları kaba bir tamsayı ızgarasına zorlamak doğruluğu yok eder. SmoothQuant, Xiao ve diğerleri tarafından tanıtıldı. 2022'de ağırlıkların düzgün olduğunu ve nicelleştirilmesinin kolay olduğunu, aktivasyonların ise dikenli olduğunu gözlemledi. Böylece zorluğu matematiksel olarak aktarır: Aktivasyon kanallarını kanal başına bir ölçeğe böler ve karşılık gelen ağırlıkları aynı ölçekle çarpar. İki işlem iptal edilerek model çıktısı değişmeden kalır, ancak artık her iki tensör de dost aralıklarda bulunur. Sonuç, sıfıra yakın doğruluk kaybı ve kabaca 2 kat hızlanma ve bellek tasarrufu ile W8A8 (8 bit ağırlıklar ve aktivasyonlar) çıkarımıdır.

Teknik Bilgi

Temel püf noktası, s = max(|X|)^alpha / max(|W|)^(1-alpha) olarak hesaplanan kanal başına yumuşatma faktörüdür. Aktivasyonlar 1/s ile, ağırlıklar ise s ile ölçeklendirilir, böylece XW matris ürünü korunur. Ölçeklendirme çevrimdışı olarak önceki katmanın ağırlıklarına veya birleştirilmiş bir işleme emildiği için sıfır çalışma süresi maliyeti ekler. Alfa hiperparametresi (genellikle 0,5), aktivasyonlardan ağırlıklara ne kadar aykırı değer yükünün kaydığını kontrol eder.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

SmoothQuant'ın Geleceği ve Aktivasyon Nicelemesi

SmoothQuant, etkinleştirme aykırı değerlerinin kaçınılmaz değil, taşınabilir olduğunu belirledi ve bu fikir artık üretim INT8 ve FP8 hizmetinin temelini oluşturuyor. Yumuşatmanın, grup başına niceleme, öğrenilmiş ölçeklendirme ve 4 bitlik aktivasyon araştırması (örneğin aykırı değere duyarlı yöntemler) gibi daha ince taneli şemalarla birleştirilmesini bekleyin. FP8 donanımı (Hopper, Blackwell) olgunlaştıkça, yumuşatma tarzı dengeleme, derleyici ve çıkarım motoru ardışık düzenlerinde yer almaya devam edecek ve böylece niceleme neredeyse ücretsiz kalacaktır.

Gerçek Dünya Uygulaması

Hem bellek hem de matris çoğaltma maliyetini yarıya indirerek daha az GPU'da W8A8'de 70B parametreli bir LLM'ye hizmet etme

8 bit tam sayı matematiğini yerel olarak hızlandıran NVIDIA Hopper/Blackwell tensör çekirdeklerinde INT8 çıkarımını etkinleştirme

Verimin iki katına çıkarılmasının jeton başına faturayı doğrudan azalttığı, maliyeti kısıtlı bulut uç noktalarında sohbet modellerinin devreye alınması

8 bit çekirdeklerin daha hızlı ve daha serin çalıştığı cihaz içi konuşma veya çeviri için transformatör kodlayıcıların sıkıştırılması

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Aktivasyon Yönlendirme ve Temsil Mühendisliği

Sık sorulan sorular

What is SmoothQuant and Activation Quantization?

SmoothQuant, büyük dil modellerini yeniden eğitim gerektirmeden hem ağırlıklar hem de aktivasyonlar için 8 bitlik tam sayılara kadar sıkıştırmayı mümkün kılan bir tekniktir. Bu önemlidir çünkü büyük modellerdeki aktivasyonlar, normalde düşük hassasiyetli matematiği bozan aşırı aykırı değerler içerir ve SmoothQuant bunları ehlileştirir.

SmoothQuant düşük hassasiyetli çıkarımlarda özellikle hangi sorunu ele alıyor?

SmoothQuant, belirli aktivasyon kanallarında görünen büyük aykırı değerleri hedefler; aksi takdirde aktivasyonlar 8 bit olarak nicelendiğinde doğruluğu yok eder.

SmoothQuant aktivasyonların nicelendirilmesini nasıl kolaylaştırır?

Aktivasyon kanallarını kanal başına bir ölçeğe böler ve eşleşen ağırlıkları bu ölçekle çarpar, böylece ürün değişmez ancak her iki tensörün nicelenmesi daha kolay hale gelir.

W8A8 gösterimi ne anlama geliyor?

W8A8, SmoothQuant'ın minimum doğruluk kaybıyla mümkün kıldığı rejim olan hem ağırlıklar (W) hem de aktivasyonlar (A) için 8 bitlik nicelemeyi belirtir.

SmoothQuant'ın ölçeklendirmesi neden aslında hiçbir çalışma zamanı yükü eklemiyor?

Düzleştirme ölçekleri önceki katmanın ağırlıklarına veya birleştirilmiş bir operasyona önceden katlanır, böylece çıkarım sırasında fazladan hesaplama yapılmaz.

Alfa hiperparametresi SmoothQuant'ta nasıl bir rol oynuyor?

Alfa (genellikle 0,5), niceleme zorluğunun ne kadarının aktivasyonlardan ağırlıklara kaydırılacağına karar vererek yumuşatma faktörünü dengeler.