GPTQ اور AWQ پوسٹ ٹریننگ کوانٹائزیشن
GPTQ اور AWQ پہلے سے تربیت یافتہ لینگویج ماڈلز کو 4 بٹ درستگی تک سکڑنے کے لیے دو سرکردہ طریقے ہیں تاکہ وہ سستے، چھوٹے ہارڈ ویئر پر چلیں۔
جائزہ
They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.
گہرا غوطہ
پوسٹ ٹریننگ کوانٹائزیشن (PTQ) ایک تیار شدہ ماڈل کو دوبارہ تربیت دیے بغیر کمپریس کرتا ہے، اعلیٰ درستگی کے وزن کو 4 بٹس تک نیچے میپ کرتا ہے تاکہ میموری کو تقریباً چوتھائی کر سکے۔ چیلنج درستگی کو تباہ کیے بغیر یہ کرنا ہے۔ GPTQ (OBQ کی اصلاح) باقی وزن کو ایڈجسٹ کرنے اور ہر گول کی خرابی کی تلافی کرنے کے لیے چھوٹے کیلیبریشن ڈیٹاسیٹ سے سیکنڈ آرڈر کی معلومات کا استعمال کرتے ہوئے، پرت کے حساب سے وزن کی تہہ کو مقدار بخشتا ہے۔ AWQ (ایکٹیویشن سے آگاہ ویٹ کوانٹائزیشن) ایک مختلف زاویہ اختیار کرتا ہے: یہ مشاہدہ کرتا ہے کہ وزن کے چینلز کا ایک چھوٹا سا حصہ غیر متناسب طور پر اہم ہے، جس کی شناخت ایکٹیویشن میگنیٹیوڈز کو دیکھ کر کی جاتی ہے، اور ان نمایاں چینلز کو جارحانہ انداز میں کوانٹائز کرنے کے بجائے اسکیلنگ کرکے ان کی حفاظت کرتا ہے۔ دونوں نے Llama جیسے ماڈل کو 4-bit میں چلنے دیا ہے، اور ٹولز جیسے vLLM، llama.cpp، اور AutoGPTQ نے انہیں مقامی اور لاگت سے موثر اندازے کے لیے مرکزی دھارے میں شامل کر دیا ہے۔
تکنیکی بصیرت
GPTQ یہ فیصلہ کرنے کے لیے Hessian (نقصان کا گھماؤ) کے تخمینے کا استعمال کرتا ہے کہ کس طرح ایک وزن کو دوسرے وزن کو دھکیلنا چاہیے، متعارف کرائی گئی غلطی کو کم سے کم کرتے ہوئے۔ AWQ Hessians کو مکمل طور پر چھوڑ دیتا ہے: یہ فی چینل اسکیلنگ فیکٹر کی گنتی کرتا ہے تاکہ اہم وزنی چینلز اپنی مؤثر درستگی کو برقرار رکھیں، پھر یکساں طور پر مقدار کو درست کریں۔ دونوں ایکٹیویشن کو زیادہ درستگی میں رکھتے ہیں اور صرف وزن کو کم کرتے ہیں، کیونکہ وزن میموری پر حاوی ہوتا ہے جبکہ ایکٹیویشن کوانٹائزیشن درستگی کو زیادہ نقصان پہنچاتی ہے۔
اسٹریٹجک اثر
لاگت اور بجٹ
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
واضح فیصلے
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
کوالٹی کنٹرول
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
GPTQ اور AWQ پوسٹ ٹریننگ کوانٹائزیشن کا مستقبل
کوانٹائزیشن 4 بٹس سے نیچے 3-بٹ، 2-بٹ، اور مخلوط صحت سے متعلق اسکیموں کی طرف دھکیل رہی ہے، جو اکثر اسپارسٹی کے ساتھ مل جاتی ہے۔ پیش کرنے والے انجنوں کے ساتھ قریبی جوڑے کی توقع کریں تاکہ کوانٹائزیشن، KV-کیشے کمپریشن، اور قیاس آرائی پر مبنی ضابطہ کشائی ایک ساتھ کام کریں۔ NVFP4 اور MXFP4 جیسے کم بٹ فارمیٹس کے لیے ہارڈویئر سپورٹ پختہ ہو رہا ہے، اور خودکار ٹولز تیزی سے فی پرت بٹ چوڑائی کا انتخاب کریں گے۔ وسیع مقصد ڈیفالٹ کے طور پر تقریباً نقصان کے بغیر 4 بٹ (اور کم) ہے، جو مضبوط ماڈلز کو ہر جگہ پیش کرنے کے لیے سستا بناتا ہے۔
حقیقی دنیا کا نفاذ
4 بٹ GPTQ وزن کا استعمال کرتے ہوئے ایک 24 GB کنزیومر GPU پر 70-بلین پیرامیٹر لاما ماڈل چلانا۔
AWQ- کوانٹائزڈ ماڈلز vLLM میں اعلی تھرو پٹ پر لاگت سے موثر پروڈکشن APIs کے لیے پیش کیے گئے۔
llama.cpp لیپ ٹاپ CPU پر مقامی طور پر لینگویج ماڈل چلانے کے لیے کوانٹائزڈ GGUF وزن کا استعمال کر رہا ہے۔
Hugging Face کی AutoGPTQ اور AutoAWQ لائبریریاں جو ڈویلپرز کو ڈاؤن لوڈ کردہ ماڈل کو کوڈ کی چند سطروں میں کوانٹائز کرنے دیتی ہیں۔
خطرات اور گارڈریلز
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ کا روڈ میپ
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPTQ and AWQ Post-Training Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
ڈیٹا انتساب کی تربیت کے لیے اثر و رسوخ کے افعال
اکثر پوچھے گئے سوالات
What is GPTQ and AWQ Post-Training Quantization?
GPTQ اور AWQ پہلے سے تربیت یافتہ لینگویج ماڈلز کو 4 بٹ درستگی تک سکڑنے کے لیے دو سرکردہ طریقے ہیں تاکہ وہ سستے، چھوٹے ہارڈ ویئر پر چلیں۔ یہی وجہ ہے کہ آپ ڈیٹا سینٹر ریک کے بجائے واحد صارف GPU پر ایک قابل ماڈل چلا سکتے ہیں۔
'پوسٹ ٹریننگ کوانٹائزیشن' کا کیا مطلب ہے؟
تربیت کے بعد کوانٹائزیشن ایک تیار شدہ ماڈل کے وزن کی درستگی کو کم کر دیتی ہے (مثلاً، 4 بٹس تک) اسے شروع سے دوبارہ تربیت دیے بغیر۔
کوانٹائزنگ کرتے وقت راؤنڈنگ غلطیوں کی تلافی کے لیے GPTQ کون سی معلومات استعمال کرتا ہے؟
GPTQ یہ سمجھنے کے لیے ایک تخمینی ہیسیئن کا استعمال کرتا ہے کہ کس طرح ایک وزن کی مقدار نقصان کو متاثر کرتی ہے، پھر اس کی تلافی کے لیے باقی وزن کو ایڈجسٹ کرتا ہے۔
کون سی کلیدی بصیرت AWQ (ایکٹیویشن سے آگاہ وزن کوانٹائزیشن) چلاتی ہے؟
AWQ ایکٹیویشن میگنیٹیوڈس کا استعمال کرتے ہوئے نمایاں وزن والے چینلز کی نشاندہی کرتا ہے اور اسکیلنگ کے ذریعے ان کی حفاظت کرتا ہے، کیونکہ کچھ چینلز غیر متناسب طور پر اہمیت رکھتے ہیں۔
4 بٹ کوانٹائزیشن 16 بٹ وزن کے مقابلے میں کتنی میموری بچاتی ہے؟
16 بٹس سے 4 بٹس فی وزن تک جانے سے وزن کی یادداشت تقریباً ایک چوتھائی رہ جاتی ہے، تقریباً 4x کمی۔
جی پی ٹی کیو اور اے ڈبلیو کیو دونوں ہی عام طور پر وزن کو کوانٹائز کیوں کرتے ہیں لیکن ایکٹیویشن کو زیادہ درستگی پر کیوں رکھتے ہیں؟
وزن میموری کی اہم قیمت ہیں، جبکہ ایکٹیویشنز درستگی کے نقصان کے لیے زیادہ حساس ہوتی ہیں، اس لیے صرف وزن کی کوانٹائزیشن ایک عام میٹھی جگہ ہے۔