Dil AI KILAVUZU

Niceleme

Niceleme, bir yapay zeka modelini, sayılarını daha düşük hassasiyette depolayarak küçültür; böylece veri merkezi GPU'ya ihtiyaç duyan bir model bazen bir dizüstü bilgisayarda veya telefonda çalışabilir.

2 min readSon güncelleme

Genel Bakış

It is the main trick that makes large language models cheap and fast enough to deploy widely.

Derin Dalış

Bir sinir ağı çoğunlukla, normalde 16 veya 32 bitlik kayan nokta değerleri olarak depolanan, ağırlık adı verilen dev bir sayı yığınından oluşur. Niceleme, bu ağırlıkları daha az bit, genellikle 8 bit (INT8) ve hatta 4 bit tamsayılar kullanarak yeniden depolar. 16 bitten 4 bit'e geçiş, belleği kabaca dört kat azaltır; dolayısıyla, 16 bitte yaklaşık 140 GB'a ihtiyaç duyan 70 milyar parametreli bir model, 4 bitte yaklaşık 35 GB'a sığabilir. Daha küçük sayılar da bellekte daha hızlı hareket eder, bu da genellikle üretimi hızlandırır. İşin püf noktası doğruluktur: geniş bir aralıktaki değerleri birkaç seviyeye sıkıştırmak yuvarlama hatasına neden olur. İyi yöntemler, ölçeklendirme faktörlerini dikkatli bir şekilde seçerek ve en hassas ağırlıkları koruyarak bu kaybı en aza indirir; böylece model, kaynakların bir kısmını kullanırken neredeyse aynı şekilde davranır.

Teknik Bilgi

Her ağırlık grubu, gerçek değerleri küçük bir tamsayı kümesine eşleyen bir ölçek faktörü alır; ölçekle geriye doğru çarpmak orijinal sayıyı yaklaşık olarak yeniden oluşturur. GPTQ ve AWQ gibi eğitim sonrası niceleme yöntemleri, her şeyi körü körüne yuvarlamak yerine, hangi ağırlıkların en önemli olduğuna karar vermek ve ölçekleri çıktı hatasını en aza indirecek şekilde ayarlamak için küçük bir kalibrasyon veri kümesini analiz eder. Etkinleştirmeler genellikle çalışma zamanında daha fazla değişiklik gösterdiği için daha yüksek hassasiyette tutulur. Sonuç, 4 bitlik tamsayıları saklayan ancak tam duyarlıklı sürüme son derece yakın sonuçları hesaplayan bir modeldir.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Nicelemenin Geleceği

Nicelemenin bir optimizasyon yerine varsayılan olmasını bekleyin. Donanım satıcıları, yerel 4 bit ve hatta daha düşük bit desteği ve nicemleme bilinçli eğitim gibi teknikler ekleyerek düşük hassasiyet için toleransı başlangıçtan itibaren modele ekleyerek doğruluk kaybını daha da azaltıyor. Telefonlarda ve gömülü çiplerde yetenekli modellerin çalıştırılması amacıyla 2 bit ve 1 bit (ikili) temsillere yönelik araştırmalar aktiftir. Cihaz içi ve özel yapay zeka büyüdükçe, verimli nicelenmiş modeller, asistanların buluta veri göndermeden yerel olarak çalıştırılmasında merkezi bir rol oynayacak.

Gerçek Dünya Uygulaması

Birden fazla veri merkezi kartına ihtiyaç duymak yerine 4 bitlik GGUF veya GPTQ dosyalarını kullanarak tüketici GPU'sunda Llama gibi bir sohbet modelini yerel olarak çalıştırma.

8 bit veya 4 bit modellerin, konuşma ve metin özelliklerinin ağ bağlantısı olmadan çalışmasına olanak tanıyan, telefonlardaki cihaz içi asistanlar.

Bir INT8 modeli sunarak müşteri destek botunun bulut çıkarım maliyetlerini azaltarak her GPU'ya daha fazla istek sığdırın.

Akıllı kameralar veya IoT sensörleri gibi uç cihazlar, kompakt nicelenmiş görüş dili modellerini sıkı bellek sınırları dahilinde çalıştırır.

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Artık Vektör Nicelemesi

Sık sorulan sorular

What is Quantization?

Niceleme, bir yapay zeka modelini, sayılarını daha düşük hassasiyette depolayarak küçültür; böylece veri merkezi GPU'ya ihtiyaç duyan bir model bazen bir dizüstü bilgisayarda veya telefonda çalışabilir. Büyük dil modellerini ucuz ve geniş çapta dağıtılacak kadar hızlı hale getiren temel püf noktası budur.

Niceleme bir sinir ağında öncelikle neyi değiştirir?

Niceleme, modelin ağırlıklarını, 16 veya 32 bit kayan değerler yerine 8 bit veya 4 bit tamsayılar gibi daha düşük sayısal hassasiyette yeniden depolar.

Ağırlıkların 16 bitten 4 bit'e taşınmasıyla kabaca ne kadar bellek tasarrufu sağlanır?

4 bit, 16 bitin dörtte biridir, dolayısıyla depolama ağırlığı yaklaşık dörtte bire düşer, bu da yaklaşık 4 kat bir azalmadır.

Agresif nicelemenin ana dezavantajı nedir?

Değerlerin daha az düzeyle temsil edilmesi, yuvarlama hatasına neden olur ve bu, dikkatli yönetilmediği takdirde çıktı kalitesini düşürebilir.

GPTQ ve AWQ gibi yöntemler küçük bir kalibrasyon veri kümesini ne için kullanır?

Bu eğitim sonrası yöntemler, ölçeklendirme faktörlerini ayarlamak ve hassas ağırlıkları korumak için birkaç örnek girdiyi analiz ederek çıktıları orijinaline yakın tutar.

Neden niceleme bir modeli yalnızca küçültmekle kalmayıp daha da hızlandırıyor?

Daha düşük hassasiyetli değerlerin yüklenmesi ve taşınması daha az bellek bant genişliği gerektirir; bu genellikle oluşturma sırasındaki darboğazdır, dolayısıyla çıkarım hızlanır.