Kuantisasi
Pengkuantitian mengecilkan model AI dengan menyimpan nombornya pada ketepatan yang lebih rendah, jadi model yang memerlukan GPU pusat data kadangkala boleh dijalankan pada komputer riba atau telefon.
Gambaran keseluruhan
It is the main trick that makes large language models cheap and fast enough to deploy widely.
Menyelam dalam
Rangkaian saraf kebanyakannya adalah timbunan nombor gergasi yang dipanggil pemberat, biasanya disimpan sebagai nilai titik terapung 16- atau 32-bit. Kuantiti menyimpan semula pemberat tersebut menggunakan lebih sedikit bit, biasanya 8-bit (INT8) atau bahkan integer 4-bit. Daripada 16-bit kepada 4-bit mengurangkan memori kira-kira empat kali ganda, jadi model 70-bilion parameter yang memerlukan kira-kira 140GB pada 16-bit boleh dimuatkan dalam kira-kira 35GB pada 4-bit. Nombor yang lebih kecil juga bergerak melalui memori dengan lebih pantas, yang biasanya mempercepatkan penjanaan. Tangkapan adalah ketepatan: memerah pelbagai nilai ke dalam beberapa peringkat memperkenalkan ralat pembundaran. Kaedah yang baik meminimumkan kerugian itu dengan memilih faktor penskalaan dengan teliti dan melindungi pemberat yang paling sensitif, jadi model berkelakuan hampir sama semasa menggunakan sebahagian kecil daripada sumber.
Wawasan Teknikal
Setiap kumpulan pemberat mendapat faktor skala yang memetakan nilai sebenar pada set kecil integer; mendarab kembali dengan skala lebih kurang membina semula nombor asal. Kaedah pengkuantitian selepas latihan seperti GPTQ dan AWQ menganalisis set data penentukuran kecil untuk memutuskan pemberat mana yang paling penting dan tetapkan skala untuk meminimumkan ralat output, dan bukannya membundarkan semuanya secara membuta tuli. Pengaktifan selalunya disimpan pada ketepatan yang lebih tinggi kerana ia lebih berbeza pada masa jalan. Hasilnya ialah model yang menyimpan integer 4-bit tetapi mengira keputusan sangat hampir dengan versi ketepatan penuh.
Kesan Strategik
Kelajuan dan skala
Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.
Akses dan capai
Ia meluaskan akses merentas bahasa dan gaya komunikasi.
Keputusan yang lebih jelas
Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.
Masa Depan Pengkuantitian
Jangkakan pengkuantitian untuk menjadi lalai dan bukannya pengoptimuman. Penjual perkakasan menambah sokongan 4-bit asli dan malah lebih rendah, dan teknik seperti toleransi membakar latihan sedar pengkuantitian untuk ketepatan rendah ke dalam model dari awal, mengurangkan lagi kehilangan ketepatan. Penyelidikan ke dalam perwakilan 2-bit dan 1-bit (perduaan) sedang aktif, bertujuan untuk menjalankan model berkebolehan pada telefon dan cip terbenam. Apabila AI pada peranti dan peribadi berkembang, model terkuantiti yang cekap akan menjadi pusat untuk menjalankan pembantu secara tempatan tanpa menghantar data ke awan.
Pelaksanaan Dunia Sebenar
Menjalankan model sembang seperti Llama secara tempatan pada GPU pengguna menggunakan fail GGUF atau GPTQ 4-bit dan bukannya memerlukan berbilang kad pusat data.
Pembantu pada peranti pada telefon, di mana model 8-bit atau 4-bit membenarkan ciri pertuturan dan teks berjalan tanpa sambungan rangkaian.
Mengurangkan kos inferens awan untuk bot sokongan pelanggan dengan menyediakan model INT8, menyesuaikan lebih banyak permintaan pada setiap GPU.
Peranti tepi seperti kamera pintar atau penderia IoT menjalankan model bahasa penglihatan terkuantiti padat dalam had memori yang ketat.
Risiko & Pengawal
Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.
Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.
Data teks sensitif mungkin terdedah jika kawalan akses lemah.
Hala Tuju Pelaksanaan
Tentukan format output, nada dan standard kualiti sebelum pelancaran.
Respons asas dengan sumber yang dipercayai apabila ketepatan penting.
Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.
Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Kuantiti Vektor Baki
Soalan lazim
What is Quantization?
Pengkuantitian mengecilkan model AI dengan menyimpan nombornya pada ketepatan yang lebih rendah, jadi model yang memerlukan GPU pusat data kadangkala boleh dijalankan pada komputer riba atau telefon. Ini adalah helah utama yang menjadikan model bahasa besar murah dan cukup pantas untuk digunakan secara meluas.
Apakah perubahan kuantisasi terutamanya mengenai rangkaian saraf?
Kuantiti menyimpan semula berat model pada ketepatan berangka yang lebih rendah, seperti integer 8-bit atau 4-bit dan bukannya apungan 16- atau 32-bit.
Secara kasar berapa banyak memori yang disimpan dengan mengalihkan pemberat daripada 16-bit ke 4-bit?
4 bit ialah satu perempat daripada 16 bit, jadi simpanan berat turun kepada kira-kira satu perempat, kira-kira pengurangan 4x.
Apakah kelemahan utama pengkuantitian agresif?
Mewakili nilai dengan tahap yang lebih sedikit memperkenalkan ralat pembundaran, yang boleh merendahkan kualiti output jika tidak diurus dengan teliti.
Untuk apakah kaedah seperti GPTQ dan AWQ menggunakan set data penentukuran kecil?
Kaedah pasca latihan ini menganalisis beberapa input sampel untuk menetapkan faktor penskalaan dan melindungi pemberat sensitif, memastikan output dekat dengan yang asal.
Mengapakah kuantisasi sering menjadikan model lebih pantas, bukan hanya lebih kecil?
Nilai ketepatan yang lebih rendah mengambil kurang lebar jalur memori untuk dimuatkan dan dialihkan, yang selalunya menjadi hambatan semasa penjanaan, jadi inferens mempercepatkan.