PANDUAN Teknikal

Kuantiti SmoothQuant dan Pengaktifan

SmoothQuant ialah teknik yang memungkinkan untuk memampatkan model bahasa besar kepada integer 8-bit untuk kedua-dua pemberat dan pengaktifan tanpa latihan semula.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

Menyelam dalam

Apabila anda mengecilkan model daripada terapung 16-bit kepada integer 8-bit, pemberat dimampatkan dengan mudah tetapi pengaktifan menyusahkan: saluran tertentu membawa nilai 10 hingga 100 kali lebih besar daripada yang lain dan memaksanya menjadi grid integer kasar memusnahkan ketepatan. SmoothQuant, diperkenalkan oleh Xiao et al. pada tahun 2022, memerhatikan bahawa pemberat adalah licin dan mudah untuk diukur manakala pengaktifan adalah berduri. Jadi ia secara matematik memindahkan kesukaran: ia membahagikan saluran pengaktifan dengan skala setiap saluran dan mendarabkan pemberat yang sepadan dengan skala yang sama. Kedua-dua operasi itu dibatalkan, menjadikan output model tidak berubah, tetapi kini kedua-dua tensor berada dalam julat mesra. Hasilnya ialah W8A8 (8-bit berat dan pengaktifan) inferens dengan kehilangan ketepatan hampir sifar dan kira-kira 2x kelajuan dan penjimatan memori.

Wawasan Teknikal

Helah teras ialah faktor pelicinan setiap saluran yang dikira sebagai s = max(|X|)^alfa / max(|W|)^(1-alpha). Pengaktifan diskalakan dengan 1/s dan berat dengan s, jadi hasil matriks XW dikekalkan. Oleh kerana penskalaan diserap di luar talian ke dalam pemberat lapisan sebelumnya atau operasi bercantum, ia menambahkan kos masa jalan sifar. Hiperparameter alfa (selalunya 0.5) mengawal berapa banyak beban terpencil beralih daripada pengaktifan ke pemberat.

Kesan Strategik

Kos dan bajet

Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.

Kawalan kualiti

Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.

Masa Depan Kuantiti SmoothQuant dan Pengaktifan

SmoothQuant menetapkan bahawa outlier pengaktifan boleh dipindahkan dan bukannya tidak dapat dielakkan, dan idea itu kini menyokong pengeluaran INT8 dan siaran FP8. Jangkakan pelicinan digabungkan dengan skema yang lebih halus seperti pengkuantitian setiap kumpulan, penskalaan yang dipelajari dan penyelidikan pengaktifan 4-bit (mis. kaedah yang lebih sedar). Apabila perkakasan FP8 (Hopper, Blackwell) matang, pengimbangan gaya pelicinan akan terus dimasukkan ke dalam saluran paip pengkompil dan inferens supaya pengkuantitian kekal hampir percuma.

Pelaksanaan Dunia Sebenar

Menyediakan LLM parameter 70B di W8A8 pada GPU yang lebih sedikit dengan mengurangkan separuh kos penggandaan memori dan matriks

Mendayakan inferens INT8 pada teras tensor NVIDIA Hopper/Blackwell yang mempercepatkan matematik integer 8-bit secara asli

Menggunakan model sembang pada titik akhir awan yang dikekang kos di mana pemprosesan dua kali ganda secara langsung mengurangkan bil setiap token

Memampatkan pengekod pengubah untuk pertuturan atau terjemahan pada peranti di mana kernel 8-bit berjalan lebih pantas dan lebih sejuk

Risiko & Pengawal

Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.

Kos infrastruktur dan penyelenggaraan sering dipandang remeh.

Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.

Hala Tuju Pelaksanaan

1

Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.

2

Penanda aras di bawah beban realistik dan keadaan data.

3

Pemantauan instrumen untuk ralat, drift dan kesan pengguna.

4

Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Kejuruteraan Pemandu Pengaktifan dan Perwakilan

Soalan lazim

What is SmoothQuant and Activation Quantization?

SmoothQuant ialah teknik yang memungkinkan untuk memampatkan model bahasa besar kepada integer 8-bit untuk kedua-dua pemberat dan pengaktifan tanpa latihan semula. Ini penting kerana pengaktifan dalam model besar mengandungi outlier melampau yang biasanya merosakkan matematik ketepatan rendah, dan SmoothQuant menjinakkannya.

Apakah masalah yang khusus ditangani oleh SmoothQuant dalam inferens ketepatan rendah?

SmoothQuant menyasarkan nilai outlier besar yang muncul dalam saluran pengaktifan tertentu, yang sebaliknya memusnahkan ketepatan apabila pengaktifan dikuantisasi kepada 8 bit.

Bagaimanakah SmoothQuant menjadikan pengaktifan lebih mudah untuk diukur?

Ia membahagikan saluran pengaktifan dengan skala setiap saluran dan mendarabkan pemberat yang sepadan dengan skala itu, jadi produk tidak berubah tetapi kedua-dua tensor menjadi lebih mudah untuk diukur.

Apakah maksud notasi W8A8?

W8A8 menandakan pengkuantitian 8-bit untuk kedua-dua pemberat (W) dan pengaktifan (A), rejim SmoothQuant membolehkan dengan kehilangan ketepatan yang minimum.

Mengapakah penskalaan SmoothQuant menambah pada dasarnya tiada overhed masa jalan?

Skala pelicinan dilipat ke dalam pemberat lapisan sebelumnya atau op bercantum lebih awal daripada masa, jadi tiada pengiraan tambahan berlaku pada inferens.

Apakah peranan yang dimainkan oleh hiperparameter alfa dalam SmoothQuant?

Alfa (biasanya 0.5) mengimbangi faktor pelicinan, menentukan berapa banyak kesukaran pengkuantitian dialihkan daripada pengaktifan dan ke pemberat.