PANDUAN AI Bahasa

Kuantisasi

Kuantisasi mengecilkan model AI dengan menyimpan angka-angkanya pada presisi yang lebih rendah, sehingga model yang memerlukan GPU pusat data terkadang dapat dijalankan di laptop atau ponsel.

2 min readTerakhir diperbarui

Ikhtisar

It is the main trick that makes large language models cheap and fast enough to deploy widely.

Menyelam Lebih Dalam

Jaringan saraf sebagian besar berupa tumpukan angka raksasa yang disebut bobot, biasanya disimpan sebagai nilai floating-point 16 atau 32-bit. Kuantisasi menyimpan kembali bobot tersebut menggunakan bit yang lebih sedikit, biasanya 8-bit (INT8) atau bahkan bilangan bulat 4-bit. Beralih dari 16-bit ke 4-bit memangkas memori sekitar empat kali lipat, sehingga model dengan 70 miliar parameter yang memerlukan sekitar 140 GB pada 16-bit dapat memuat sekitar 35 GB pada 4-bit. Angka yang lebih kecil juga berpindah ke memori lebih cepat, yang biasanya mempercepat pembuatannya. Tangkapannya adalah akurasi: memeras berbagai nilai ke dalam beberapa level menyebabkan kesalahan pembulatan. Metode yang baik meminimalkan kerugian tersebut dengan memilih faktor penskalaan secara cermat dan melindungi bobot yang paling sensitif, sehingga model berperilaku hampir sama saat menggunakan sebagian kecil sumber daya.

Wawasan Teknis

Setiap kelompok bobot mendapatkan faktor skala yang memetakan nilai riil ke dalam sekumpulan kecil bilangan bulat; mengalikan kembali dengan skala kira-kira akan mengembalikan bilangan aslinya. Metode kuantisasi pasca-pelatihan seperti GPTQ dan AWQ menganalisis kumpulan data kalibrasi kecil untuk menentukan bobot mana yang paling penting dan menetapkan skala untuk meminimalkan kesalahan keluaran, daripada membulatkan semuanya secara membabi buta. Aktivasi sering kali dijaga dengan presisi lebih tinggi karena lebih bervariasi pada waktu proses. Hasilnya adalah model yang menyimpan bilangan bulat 4-bit tetapi hasil komputasinya sangat mendekati versi presisi penuh.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Kuantisasi

Harapkan kuantisasi menjadi default daripada optimasi. Vendor perangkat keras menambahkan dukungan asli 4-bit dan bahkan bit yang lebih rendah, dan teknik seperti pelatihan yang sadar kuantisasi memasukkan toleransi untuk presisi rendah ke dalam model sejak awal, sehingga semakin mengurangi kehilangan akurasi. Penelitian terhadap representasi 2-bit dan 1-bit (biner) sedang aktif, bertujuan untuk menjalankan model yang mumpuni pada ponsel dan chip yang tertanam. Seiring dengan berkembangnya AI pada perangkat dan AI pribadi, model terkuantisasi yang efisien akan menjadi hal penting dalam menjalankan asisten secara lokal tanpa mengirimkan data ke cloud.

Implementasi Dunia Nyata

Menjalankan model obrolan seperti Llama secara lokal pada GPU konsumen menggunakan file GGUF atau GPTQ 4-bit alih-alih memerlukan beberapa kartu pusat data.

Asisten pada perangkat di ponsel, dengan model 8-bit atau 4-bit yang memungkinkan fitur ucapan dan teks berjalan tanpa koneksi jaringan.

Memotong biaya inferensi cloud untuk bot dukungan pelanggan dengan menyajikan model INT8, menyesuaikan lebih banyak permintaan pada setiap GPU.

Perangkat edge seperti kamera pintar atau sensor IoT menjalankan model bahasa visi terkuantisasi yang ringkas dalam batas memori yang ketat.

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Kuantisasi Vektor Sisa

Pertanyaan yang sering diajukan

What is Quantization?

Kuantisasi mengecilkan model AI dengan menyimpan angka-angkanya pada presisi yang lebih rendah, sehingga model yang memerlukan GPU pusat data terkadang dapat dijalankan di laptop atau ponsel. Ini adalah trik utama yang membuat model bahasa besar menjadi murah dan cukup cepat untuk diterapkan secara luas.

Apa perubahan utama kuantisasi pada jaringan saraf?

Kuantisasi menyimpan kembali bobot model pada presisi numerik yang lebih rendah, seperti bilangan bulat 8-bit atau 4-bit, bukan float 16 atau 32-bit.

Kira-kira berapa banyak memori yang dihemat dengan memindahkan bobot dari 16-bit ke 4-bit?

4 bit sama dengan seperempat dari 16 bit, jadi berat penyimpanan turun menjadi sekitar seperempat, sekitar pengurangan 4x.

Apa kelemahan utama dari kuantisasi agresif?

Mewakili nilai dengan tingkat yang lebih sedikit menimbulkan kesalahan pembulatan, yang dapat menurunkan kualitas keluaran jika tidak dikelola dengan hati-hati.

Untuk apa metode seperti GPTQ dan AWQ menggunakan kumpulan data kalibrasi kecil?

Metode pasca-pelatihan ini menganalisis beberapa sampel masukan untuk menetapkan faktor penskalaan dan melindungi bobot sensitif, sehingga keluaran tetap mendekati aslinya.

Mengapa kuantisasi sering kali membuat model lebih cepat, bukan hanya lebih kecil?

Nilai dengan presisi lebih rendah membutuhkan lebih sedikit bandwidth memori untuk dimuat dan dipindahkan, yang sering kali menjadi hambatan selama pembuatan, sehingga inferensi menjadi lebih cepat.