ٹیکنیکل گائیڈ

اسموتھ کوانٹ اور ایکٹیویشن کوانٹائزیشن

سموتھ کوانٹ ایک ایسی تکنیک ہے جس کی مدد سے بڑے لینگویج ماڈلز کو 8 بٹ انٹیجرز تک کمپریس کرنا ممکن بناتا ہے اور دوبارہ تربیت کے بغیر وزن اور ایکٹیویشن دونوں کے لیے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

گہرا غوطہ

جب آپ کسی ماڈل کو 16-بٹ فلوٹس سے 8-بٹ انٹیجرز تک سکڑتے ہیں، تو وزن آسانی سے سکیڑ جاتا ہے لیکن ایکٹیویشن پریشانی کا باعث ہے: کچھ چینلز باقی سے 10 سے 100 گنا بڑی قدریں رکھتے ہیں، اور انہیں موٹے انٹیجر گرڈ میں زبردستی کرنے سے درستگی ختم ہو جاتی ہے۔ SmoothQuant، Xiao et al نے متعارف کرایا۔ 2022 میں، مشاہدہ کرتا ہے کہ وزن ہموار اور کوانٹائز کرنے میں آسان ہے جبکہ ایکٹیویشنز تیز ہیں۔ لہذا یہ ریاضی کے لحاظ سے مشکل کو منتقل کرتا ہے: یہ ایکٹیویشن چینلز کو فی چینل پیمانے سے تقسیم کرتا ہے اور اسی پیمانے سے متعلقہ وزن کو ضرب دیتا ہے۔ دونوں آپریشنز منسوخ ہو جاتے ہیں، جس سے ماڈل آؤٹ پٹ میں کوئی تبدیلی نہیں ہوتی، لیکن اب دونوں ٹینسر دوستانہ حدود میں بیٹھے ہیں۔ نتیجہ W8A8 (8 بٹ وزن اور ایکٹیویشن) کا اندازہ ہے جس میں صفر کے قریب درستگی کے نقصان اور تقریباً 2x رفتار اور میموری کی بچت ہوتی ہے۔

تکنیکی بصیرت

بنیادی چال ایک فی چینل ہموار کرنے والا عنصر ہے جس کا شمار s = max(|X|)^alpha/max(|W|)^(1-alpha) کے طور پر کیا جاتا ہے۔ ایکٹیویشنز کو 1/s سے اور وزن کو s سے چھوٹا کیا جاتا ہے، اس لیے میٹرکس پروڈکٹ XW محفوظ ہے۔ چونکہ اسکیلنگ پچھلی پرت کے وزن یا فیوزڈ آپریشن میں آف لائن جذب ہوتی ہے، اس سے رن ٹائم لاگت میں صفر اضافہ ہوتا ہے۔ الفا ہائپر پیرامیٹر (اکثر 0.5) کنٹرول کرتا ہے کہ ایکٹیویشن سے وزن پر کتنا بیرونی بوجھ منتقل ہوتا ہے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

اسموتھ کوانٹ اور ایکٹیویشن کوانٹائزیشن کا مستقبل

سموتھ کوانٹ نے قائم کیا کہ ایکٹیویشن آؤٹ لیرز ناگزیر ہونے کے بجائے ہجرت کے قابل ہیں، اور یہ خیال اب پروڈکشن INT8 اور FP8 کو پیش کرنے کو اہمیت دیتا ہے۔ ہر گروپ کوانٹائزیشن، سیکھی ہوئی اسکیلنگ، اور 4 بٹ ایکٹیویشن ریسرچ (مثلاً باہر سے آگاہی کے طریقے) جیسی باریک اسکیموں کے ساتھ ہموار ہونے کی توقع کریں۔ جیسے جیسے FP8 ہارڈویئر (ہوپپر، بلیک ویل) پختہ ہوتا جائے گا، ہموار طرز کا توازن کمپائلر اور انفرنس-انجن پائپ لائنوں میں پکایا جاتا رہے گا تاکہ کوانٹائزیشن تقریباً مفت رہے۔

حقیقی دنیا کا نفاذ

W8A8 پر 70B-پیرامیٹر LLM کو کم GPUs پر پیش کرنا میموری اور میٹرکس ضرب لاگت دونوں کو آدھا کر کے

NVIDIA Hopper/Blackwell tensor cores پر INT8 inference کو فعال کرنا جو مقامی طور پر 8-bit انٹیجر ریاضی کو تیز کرتا ہے۔

لاگت کے محدود کلاؤڈ اینڈ پوائنٹس پر چیٹ ماڈلز کی تعیناتی جہاں تھرو پٹ کو دوگنا کرنے سے فی ٹوکن بل براہ راست کٹ جاتا ہے۔

آن ڈیوائس اسپیچ یا ترجمے کے لیے ٹرانسفارمر انکوڈرز کو کمپریس کرنا جہاں 8 بٹ کرنل تیز اور ٹھنڈے چلتے ہیں

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

ایکٹیویشن اسٹیئرنگ اور ریپریزنٹیشن انجینئرنگ

اکثر پوچھے گئے سوالات

What is SmoothQuant and Activation Quantization?

سموتھ کوانٹ ایک ایسی تکنیک ہے جس کی مدد سے بڑے لینگویج ماڈلز کو 8 بٹ انٹیجرز تک کمپریس کرنا ممکن بناتا ہے اور دوبارہ تربیت کے بغیر وزن اور ایکٹیویشن دونوں کے لیے۔ یہ اہمیت رکھتا ہے کیونکہ بڑے ماڈلز میں ایکٹیویشنز میں انتہائی آؤٹ لیرز ہوتے ہیں جو عام طور پر کم درستگی والے ریاضی کو برباد کر دیتے ہیں، اور سموتھ کوانٹ ان پر قابو پاتے ہیں۔

اسموتھ کوانٹ خاص طور پر کم درستگی کے تخمینے میں کس مسئلے کو حل کرتا ہے؟

SmoothQuant ان بڑی بیرونی اقدار کو نشانہ بناتا ہے جو مخصوص ایکٹیویشن چینلز میں ظاہر ہوتی ہیں، جو بصورت دیگر جب ایکٹیویشن کو 8 بٹس تک کوانٹائز کیا جاتا ہے تو درستگی کو ختم کر دیتا ہے۔

اسموتھ کوانٹ کس طرح ایکٹیویشن کو کوانٹائز کرنا آسان بناتا ہے؟

یہ ایکٹیویشن چینلز کو فی چینل پیمانے سے تقسیم کرتا ہے اور اس پیمانے سے مماثل وزن کو ضرب دیتا ہے، اس لیے پروڈکٹ میں کوئی تبدیلی نہیں ہوتی لیکن دونوں ٹینسرز کو کوانٹائز کرنا آسان ہو جاتا ہے۔

اشارے W8A8 کا کیا مطلب ہے؟

W8A8 وزن (W) اور ایکٹیویشن (A) دونوں کے لیے 8 بٹ کوانٹائزیشن کی نشاندہی کرتا ہے، نظام سموتھ کوانٹ کم سے کم درستگی کے نقصان کے ساتھ قابل بناتا ہے۔

اسموتھ کوانٹ کی اسکیلنگ میں بنیادی طور پر کوئی رن ٹائم اوور ہیڈ کیوں شامل نہیں ہوتا ہے؟

ہموار کرنے والے ترازو کو پچھلی پرت کے وزن میں یا وقت سے پہلے جوڑ دیا جاتا ہے، لہذا تخمینہ میں کوئی اضافی حساب نہیں ہوتا ہے۔

SmoothQuant میں الفا ہائپر پیرامیٹر کیا کردار ادا کرتا ہے؟

الفا (عام طور پر 0.5) ہموار کرنے والے عنصر کو متوازن کرتا ہے، یہ فیصلہ کرتا ہے کہ مقدار سازی کی دشواری کا کتنا حصہ ایکٹیویشنز سے ہٹ کر وزن پر ہے۔