Teknik KILAVUZ

GPTQ ve AWQ Eğitim Sonrası Niceleme

GPTQ ve AWQ, önceden eğitilmiş dil modellerini 4 bit hassasiyete küçülterek daha ucuz ve daha küçük donanımlarda çalışmasını sağlayan önde gelen iki yöntemdir.

2 min readSon güncelleme

Genel Bakış

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

Derin Dalış

Eğitim sonrası niceleme (PTQ), bitmiş bir modeli yeniden eğitmeden sıkıştırır ve belleği kabaca dörtte bir oranında yüksek hassasiyetli ağırlıkları 4 bit'e kadar eşler. Buradaki zorluk, doğruluğu bozmadan bunu yapmaktır. GPTQ (OBQ'nun geliştirilmiş hali), kalan ağırlıkları ayarlamak ve her yuvarlama hatasını telafi etmek için küçük bir kalibrasyon veri kümesinden gelen ikinci derece bilgileri kullanarak ağırlıkları katman katman nicemler. AWQ (Aktivasyona Duyarlı Ağırlık Niceleme) farklı bir açı alır: ağırlık kanallarının küçük bir kısmının orantısız derecede önemli olduğunu gözlemler, aktivasyon büyüklüklerine bakarak tanımlanır ve bu göze çarpan kanalları agresif bir şekilde nicelemek yerine ölçeklendirerek korur. Her ikisi de Llama gibi modellerin 4 bit olarak çalışmasına izin veriyor ve vLLM, llama.cpp ve AutoGPTQ gibi araçlar, onları yerel ve uygun maliyetli çıkarımlar için ana akım haline getiriyor.

Teknik Bilgi

GPTQ, bir ağırlığı yuvarlamanın diğerlerini nasıl itmesi gerektiğine karar vermek ve ortaya çıkan hatayı en aza indirmek için Hessian'ın (kayıp eğriliği) bir yaklaşımını kullanır. AWQ, Hessian'ları tamamen atlıyor: kanal başına bir ölçeklendirme faktörü hesaplıyor, böylece önemli ağırlık kanalları etkili hassasiyetlerini koruyor ve ardından eşit şekilde nicemliyor. Her ikisi de aktivasyonları daha yüksek hassasiyette tutar ve sadece ağırlıkları sıkıştırır, çünkü ağırlıklar hafızaya hakim olurken aktivasyon kuantizasyonu doğruluğu daha fazla zedeleme eğilimindedir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

GPTQ ve AWQ Eğitim Sonrası Nicelemenin Geleceği

Niceleme, genellikle seyreklikle birleştirilen 3 bit, 2 bit ve karma duyarlıklı şemalara doğru 4 bitin altına itiyor. Niceleme, KV önbellek sıkıştırma ve spekülatif kod çözmenin birlikte çalışması için hizmet veren motorlarla daha yakın bağlantı bekleyebilirsiniz. NVFP4 ve MXFP4 gibi düşük bit formatları için donanım desteği olgunlaşıyor ve otomatik araçlar giderek katman başına bit genişliklerini seçecek. Genel hedef, varsayılan olarak neredeyse kayıpsız 4 bit (ve daha düşük) olup, güçlü modellerin her yerde hizmet vermesini ucuz hale getirir.

Gerçek Dünya Uygulaması

70 milyar parametreli bir Llama modelini, 4 bit GPTQ ağırlıklarını kullanarak tek bir 24 GB tüketici GPU'da çalıştırma.

AWQ ile nicelenmiş modeller, uygun maliyetli üretim API'leri için vLLM'de yüksek aktarım hızında hizmet verdi.

Llama.cpp, dil modellerini bir dizüstü bilgisayar CPU'sunda yerel olarak çalıştırmak için nicelenmiş GGUF ağırlıklarını kullanıyor.

Hugging Face'in AutoGPTQ ve AutoAWQ kitaplıkları, geliştiricilerin indirilen bir modeli birkaç satır kodla nicelleştirmesine olanak tanır.

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Eğitim Verileri İlişkilendirmesine Yönelik Etkileme İşlevleri

Sık sorulan sorular

What is GPTQ and AWQ Post-Training Quantization?

GPTQ ve AWQ, önceden eğitilmiş dil modellerini 4 bit hassasiyete küçülterek daha ucuz ve daha küçük donanımlarda çalışmasını sağlayan önde gelen iki yöntemdir. Yetenekli bir modeli veri merkezi rafı yerine tek bir tüketici GPU'sunda çalıştırabilmenizin nedeni budur.

'Eğitim sonrası kuantizasyon' ne anlama geliyor?

Eğitim sonrası niceleme, bitmiş bir modelin ağırlıklarının hassasiyetini, onu sıfırdan yeniden eğitmeden azaltır (örneğin, 4 bit'e).

GPTQ, niceleme sırasında yuvarlama hatalarını telafi etmek için hangi bilgileri kullanır?

GPTQ, bir ağırlığı nicelemenin kaybı nasıl etkilediğini anlamak için yaklaşık bir Hessian kullanır, ardından kalan ağırlıkları telafi edecek şekilde ayarlar.

Hangi temel bilgiler AWQ'yu (Etkinleştirme Farkında Ağırlık Niceleme) yönlendiriyor?

AWQ, aktivasyon büyüklüklerini kullanarak belirgin ağırlık kanallarını tanımlar ve birkaç kanalın orantısız bir şekilde önemli olması nedeniyle bunları ölçeklendirme yoluyla korur.

4 bit niceleme, 16 bit ağırlıklara kıyasla kabaca ne kadar bellek tasarrufu sağlar?

Ağırlık başına 16 bitten 4 bit'e çıkmak, ağırlık hafızasını yaklaşık dörtte bire indirir; bu da kabaca 4 kat azalma anlamına gelir.

Neden hem GPTQ hem de AWQ genellikle ağırlıkları nicelleştiriyor ancak aktivasyonları daha yüksek hassasiyette tutuyor?

Ağırlıklar ana hafıza maliyetidir, aktivasyonlar ise hassasiyet kaybına karşı daha hassastır, dolayısıyla yalnızca ağırlık nicelemesi ortak tatlı noktadır.