Kuantiti SmoothQuant dan Pengaktifan
SmoothQuant ialah teknik yang memungkinkan untuk memampatkan model bahasa besar kepada integer 8-bit untuk kedua-dua pemberat dan pengaktifan tanpa latihan semula.
Gambaran keseluruhan
It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.
Menyelam dalam
Apabila anda mengecilkan model daripada terapung 16-bit kepada integer 8-bit, pemberat dimampatkan dengan mudah tetapi pengaktifan menyusahkan: saluran tertentu membawa nilai 10 hingga 100 kali lebih besar daripada yang lain dan memaksanya menjadi grid integer kasar memusnahkan ketepatan. SmoothQuant, diperkenalkan oleh Xiao et al. pada tahun 2022, memerhatikan bahawa pemberat adalah licin dan mudah untuk diukur manakala pengaktifan adalah berduri. Jadi ia secara matematik memindahkan kesukaran: ia membahagikan saluran pengaktifan dengan skala setiap saluran dan mendarabkan pemberat yang sepadan dengan skala yang sama. Kedua-dua operasi itu dibatalkan, menjadikan output model tidak berubah, tetapi kini kedua-dua tensor berada dalam julat mesra. Hasilnya ialah W8A8 (8-bit berat dan pengaktifan) inferens dengan kehilangan ketepatan hampir sifar dan kira-kira 2x kelajuan dan penjimatan memori.
Wawasan Teknikal
Helah teras ialah faktor pelicinan setiap saluran yang dikira sebagai s = max(|X|)^alfa / max(|W|)^(1-alpha). Pengaktifan diskalakan dengan 1/s dan berat dengan s, jadi hasil matriks XW dikekalkan. Oleh kerana penskalaan diserap di luar talian ke dalam pemberat lapisan sebelumnya atau operasi bercantum, ia menambahkan kos masa jalan sifar. Hiperparameter alfa (selalunya 0.5) mengawal berapa banyak beban terpencil beralih daripada pengaktifan ke pemberat.
Kesan Strategik
Kos dan bajet
Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.
Keputusan yang lebih jelas
Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.
Kawalan kualiti
Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.
Masa Depan Kuantiti SmoothQuant dan Pengaktifan
SmoothQuant menetapkan bahawa outlier pengaktifan boleh dipindahkan dan bukannya tidak dapat dielakkan, dan idea itu kini menyokong pengeluaran INT8 dan siaran FP8. Jangkakan pelicinan digabungkan dengan skema yang lebih halus seperti pengkuantitian setiap kumpulan, penskalaan yang dipelajari dan penyelidikan pengaktifan 4-bit (mis. kaedah yang lebih sedar). Apabila perkakasan FP8 (Hopper, Blackwell) matang, pengimbangan gaya pelicinan akan terus dimasukkan ke dalam saluran paip pengkompil dan inferens supaya pengkuantitian kekal hampir percuma.
Pelaksanaan Dunia Sebenar
Menyediakan LLM parameter 70B di W8A8 pada GPU yang lebih sedikit dengan mengurangkan separuh kos penggandaan memori dan matriks
Mendayakan inferens INT8 pada teras tensor NVIDIA Hopper/Blackwell yang mempercepatkan matematik integer 8-bit secara asli
Menggunakan model sembang pada titik akhir awan yang dikekang kos di mana pemprosesan dua kali ganda secara langsung mengurangkan bil setiap token
Memampatkan pengekod pengubah untuk pertuturan atau terjemahan pada peranti di mana kernel 8-bit berjalan lebih pantas dan lebih sejuk
Risiko & Pengawal
Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.
Kos infrastruktur dan penyelenggaraan sering dipandang remeh.
Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.
Hala Tuju Pelaksanaan
Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.
Penanda aras di bawah beban realistik dan keadaan data.
Pemantauan instrumen untuk ralat, drift dan kesan pengguna.
Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Kejuruteraan Pemandu Pengaktifan dan Perwakilan
Soalan lazim
What is SmoothQuant and Activation Quantization?
SmoothQuant ialah teknik yang memungkinkan untuk memampatkan model bahasa besar kepada integer 8-bit untuk kedua-dua pemberat dan pengaktifan tanpa latihan semula. Ini penting kerana pengaktifan dalam model besar mengandungi outlier melampau yang biasanya merosakkan matematik ketepatan rendah, dan SmoothQuant menjinakkannya.
Apakah masalah yang khusus ditangani oleh SmoothQuant dalam inferens ketepatan rendah?
SmoothQuant menyasarkan nilai outlier besar yang muncul dalam saluran pengaktifan tertentu, yang sebaliknya memusnahkan ketepatan apabila pengaktifan dikuantisasi kepada 8 bit.
Bagaimanakah SmoothQuant menjadikan pengaktifan lebih mudah untuk diukur?
Ia membahagikan saluran pengaktifan dengan skala setiap saluran dan mendarabkan pemberat yang sepadan dengan skala itu, jadi produk tidak berubah tetapi kedua-dua tensor menjadi lebih mudah untuk diukur.
Apakah maksud notasi W8A8?
W8A8 menandakan pengkuantitian 8-bit untuk kedua-dua pemberat (W) dan pengaktifan (A), rejim SmoothQuant membolehkan dengan kehilangan ketepatan yang minimum.
Mengapakah penskalaan SmoothQuant menambah pada dasarnya tiada overhed masa jalan?
Skala pelicinan dilipat ke dalam pemberat lapisan sebelumnya atau op bercantum lebih awal daripada masa, jadi tiada pengiraan tambahan berlaku pada inferens.
Apakah peranan yang dimainkan oleh hiperparameter alfa dalam SmoothQuant?
Alfa (biasanya 0.5) mengimbangi faktor pelicinan, menentukan berapa banyak kesukaran pengkuantitian dialihkan daripada pengaktifan dan ke pemberat.