PANDUAN Teknis

SmoothQuant dan Kuantisasi Aktivasi

SmoothQuant adalah teknik yang memungkinkan untuk mengompresi model bahasa besar menjadi bilangan bulat 8-bit untuk bobot dan aktivasi tanpa pelatihan ulang.

2 min readTerakhir diperbarui

Ikhtisar

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

Menyelam Lebih Dalam

Saat Anda mengecilkan model dari float 16-bit menjadi bilangan bulat 8-bit, bobot dapat dikompres dengan mudah tetapi aktivasi menjadi masalah: saluran tertentu membawa nilai 10 hingga 100 kali lebih besar daripada saluran lainnya, dan memaksanya ke dalam kisi bilangan bulat kasar akan merusak akurasi. SmoothQuant, diperkenalkan oleh Xiao dkk. pada tahun 2022, mengamati bahwa bobot halus dan mudah diukur sementara aktivasinya tajam. Jadi secara matematis ia memigrasikan kesulitannya: ia membagi saluran aktivasi dengan skala per saluran dan mengalikan bobot yang sesuai dengan skala yang sama. Kedua operasi tersebut dibatalkan, sehingga keluaran model tidak berubah, tetapi kini kedua tensor berada dalam rentang yang bersahabat. Hasilnya adalah inferensi W8A8 (bobot dan aktivasi 8-bit) dengan kehilangan akurasi mendekati nol dan peningkatan kecepatan serta penghematan memori sekitar 2x.

Wawasan Teknis

Trik intinya adalah faktor pemulusan per saluran yang dihitung sebagai s = max(|X|)^alpha / max(|W|)^(1-alpha). Aktivasi diskalakan sebesar 1/s dan bobot sebesar s, sehingga produk matriks XW dipertahankan. Karena penskalaan diserap secara offline ke dalam bobot lapisan sebelumnya atau operasi gabungan, hal ini tidak menambah biaya waktu proses. Hyperparameter alfa (seringkali 0,5) mengontrol seberapa besar perpindahan beban outlier dari aktivasi ke bobot.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan SmoothQuant dan Kuantisasi Aktivasi

SmoothQuant menetapkan bahwa outlier aktivasi dapat dimigrasikan dan bukannya tidak dapat dihindari, dan gagasan tersebut sekarang mendasari penyajian produksi INT8 dan FP8. Harapkan pemulusan untuk dikombinasikan dengan skema yang lebih terperinci seperti kuantisasi per grup, penskalaan yang dipelajari, dan penelitian aktivasi 4-bit (misalnya metode yang peka terhadap outlier). Seiring dengan semakin matangnya perangkat keras FP8 (Hopper, Blackwell), penyeimbangan gaya penghalusan akan terus dimasukkan ke dalam saluran kompiler dan mesin inferensi sehingga kuantisasi hampir tetap bebas.

Implementasi Dunia Nyata

Melayani LLM parameter 70B di W8A8 pada GPU yang lebih sedikit dengan mengurangi separuh biaya memori dan penggandaan matriks

Mengaktifkan inferensi INT8 pada inti tensor NVIDIA Hopper/Blackwell yang secara asli mempercepat matematika bilangan bulat 8-bit

Menerapkan model obrolan pada titik akhir cloud dengan biaya terbatas di mana penggandaan throughput secara langsung memotong tagihan per token

Mengompresi encoder transformator untuk ucapan atau terjemahan pada perangkat di mana kernel 8-bit berjalan lebih cepat dan lebih dingin

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Teknik Kemudi dan Representasi Aktivasi

Pertanyaan yang sering diajukan

What is SmoothQuant and Activation Quantization?

SmoothQuant adalah teknik yang memungkinkan untuk mengompresi model bahasa besar menjadi bilangan bulat 8-bit untuk bobot dan aktivasi tanpa pelatihan ulang. Hal ini penting karena aktivasi dalam model besar mengandung outlier ekstrem yang biasanya merusak matematika presisi rendah, dan SmoothQuant menjinakkannya.

Masalah apa yang secara khusus ditangani oleh SmoothQuant dalam inferensi presisi rendah?

SmoothQuant menargetkan nilai outlier besar yang muncul di saluran aktivasi tertentu, yang jika tidak maka akan merusak akurasi saat aktivasi dikuantisasi hingga 8 bit.

Bagaimana SmoothQuant membuat aktivasi lebih mudah diukur?

Ini membagi saluran aktivasi dengan skala per saluran dan mengalikan bobot yang cocok dengan skala tersebut, sehingga produknya tidak berubah tetapi kedua tensor menjadi lebih mudah untuk diukur.

Apa arti notasi W8A8?

W8A8 menunjukkan kuantisasi 8-bit untuk bobot (W) dan aktivasi (A), rezim yang dimungkinkan oleh SmoothQuant dengan kehilangan akurasi minimal.

Mengapa penskalaan SmoothQuant pada dasarnya tidak menambah overhead waktu proses?

Skala penghalusan dilipat ke dalam bobot lapisan sebelumnya atau operasi gabungan sebelumnya, sehingga tidak ada komputasi tambahan yang terjadi pada inferensi.

Apa peran yang dimainkan oleh hyperparameter alfa di SmoothQuant?

Alpha (umumnya 0,5) menyeimbangkan faktor penghalusan, menentukan seberapa besar kesulitan kuantisasi dipindahkan dari aktivasi dan ke bobot.