Kuantisasi
Kuantisasi mengecilkan model AI dengan menyimpan angka-angkanya pada presisi yang lebih rendah, sehingga model yang memerlukan GPU pusat data terkadang dapat dijalankan di laptop atau ponsel.
Ikhtisar
It is the main trick that makes large language models cheap and fast enough to deploy widely.
Menyelam Lebih Dalam
Jaringan saraf sebagian besar berupa tumpukan angka raksasa yang disebut bobot, biasanya disimpan sebagai nilai floating-point 16 atau 32-bit. Kuantisasi menyimpan kembali bobot tersebut menggunakan bit yang lebih sedikit, biasanya 8-bit (INT8) atau bahkan bilangan bulat 4-bit. Beralih dari 16-bit ke 4-bit memangkas memori sekitar empat kali lipat, sehingga model dengan 70 miliar parameter yang memerlukan sekitar 140 GB pada 16-bit dapat memuat sekitar 35 GB pada 4-bit. Angka yang lebih kecil juga berpindah ke memori lebih cepat, yang biasanya mempercepat pembuatannya. Tangkapannya adalah akurasi: memeras berbagai nilai ke dalam beberapa level menyebabkan kesalahan pembulatan. Metode yang baik meminimalkan kerugian tersebut dengan memilih faktor penskalaan secara cermat dan melindungi bobot yang paling sensitif, sehingga model berperilaku hampir sama saat menggunakan sebagian kecil sumber daya.
Wawasan Teknis
Setiap kelompok bobot mendapatkan faktor skala yang memetakan nilai riil ke dalam sekumpulan kecil bilangan bulat; mengalikan kembali dengan skala kira-kira akan mengembalikan bilangan aslinya. Metode kuantisasi pasca-pelatihan seperti GPTQ dan AWQ menganalisis kumpulan data kalibrasi kecil untuk menentukan bobot mana yang paling penting dan menetapkan skala untuk meminimalkan kesalahan keluaran, daripada membulatkan semuanya secara membabi buta. Aktivasi sering kali dijaga dengan presisi lebih tinggi karena lebih bervariasi pada waktu proses. Hasilnya adalah model yang menyimpan bilangan bulat 4-bit tetapi hasil komputasinya sangat mendekati versi presisi penuh.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Kuantisasi
Harapkan kuantisasi menjadi default daripada optimasi. Vendor perangkat keras menambahkan dukungan asli 4-bit dan bahkan bit yang lebih rendah, dan teknik seperti pelatihan yang sadar kuantisasi memasukkan toleransi untuk presisi rendah ke dalam model sejak awal, sehingga semakin mengurangi kehilangan akurasi. Penelitian terhadap representasi 2-bit dan 1-bit (biner) sedang aktif, bertujuan untuk menjalankan model yang mumpuni pada ponsel dan chip yang tertanam. Seiring dengan berkembangnya AI pada perangkat dan AI pribadi, model terkuantisasi yang efisien akan menjadi hal penting dalam menjalankan asisten secara lokal tanpa mengirimkan data ke cloud.
Implementasi Dunia Nyata
Menjalankan model obrolan seperti Llama secara lokal pada GPU konsumen menggunakan file GGUF atau GPTQ 4-bit alih-alih memerlukan beberapa kartu pusat data.
Asisten pada perangkat di ponsel, dengan model 8-bit atau 4-bit yang memungkinkan fitur ucapan dan teks berjalan tanpa koneksi jaringan.
Memotong biaya inferensi cloud untuk bot dukungan pelanggan dengan menyajikan model INT8, menyesuaikan lebih banyak permintaan pada setiap GPU.
Perangkat edge seperti kamera pintar atau sensor IoT menjalankan model bahasa visi terkuantisasi yang ringkas dalam batas memori yang ketat.
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Kuantisasi Vektor Sisa
Pertanyaan yang sering diajukan
What is Quantization?
Kuantisasi mengecilkan model AI dengan menyimpan angka-angkanya pada presisi yang lebih rendah, sehingga model yang memerlukan GPU pusat data terkadang dapat dijalankan di laptop atau ponsel. Ini adalah trik utama yang membuat model bahasa besar menjadi murah dan cukup cepat untuk diterapkan secara luas.
Apa perubahan utama kuantisasi pada jaringan saraf?
Kuantisasi menyimpan kembali bobot model pada presisi numerik yang lebih rendah, seperti bilangan bulat 8-bit atau 4-bit, bukan float 16 atau 32-bit.
Kira-kira berapa banyak memori yang dihemat dengan memindahkan bobot dari 16-bit ke 4-bit?
4 bit sama dengan seperempat dari 16 bit, jadi berat penyimpanan turun menjadi sekitar seperempat, sekitar pengurangan 4x.
Apa kelemahan utama dari kuantisasi agresif?
Mewakili nilai dengan tingkat yang lebih sedikit menimbulkan kesalahan pembulatan, yang dapat menurunkan kualitas keluaran jika tidak dikelola dengan hati-hati.
Untuk apa metode seperti GPTQ dan AWQ menggunakan kumpulan data kalibrasi kecil?
Metode pasca-pelatihan ini menganalisis beberapa sampel masukan untuk menetapkan faktor penskalaan dan melindungi bobot sensitif, sehingga keluaran tetap mendekati aslinya.
Mengapa kuantisasi sering kali membuat model lebih cepat, bukan hanya lebih kecil?
Nilai dengan presisi lebih rendah membutuhkan lebih sedikit bandwidth memori untuk dimuat dan dipindahkan, yang sering kali menjadi hambatan selama pembuatan, sehingga inferensi menjadi lebih cepat.