زبان AI گائیڈ

کوانٹائزیشن

کوانٹائزیشن ایک AI ماڈل کو اس کے نمبروں کو کم درستگی پر ذخیرہ کرکے سکڑتی ہے، لہذا ایک ماڈل جس کو ڈیٹا سینٹر GPU کی ضرورت ہوتی ہے وہ کبھی کبھی لیپ ٹاپ یا فون پر چل سکتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It is the main trick that makes large language models cheap and fast enough to deploy widely.

گہرا غوطہ

نیورل نیٹ ورک زیادہ تر نمبروں کا ایک بڑا ڈھیر ہوتا ہے جسے وزن کہا جاتا ہے، عام طور پر 16- یا 32-بٹ فلوٹنگ پوائنٹ ویلیوز کے طور پر ذخیرہ کیا جاتا ہے۔ کوانٹائزیشن ان وزنوں کو کم بٹس، عام طور پر 8 بٹ (INT8) یا حتیٰ کہ 4 بٹ انٹیجرز کا استعمال کرتے ہوئے دوبارہ اسٹور کرتی ہے۔ 16-بٹ سے 4-بٹ تک جانے سے میموری تقریباً چار گنا کم ہو جاتی ہے، اس لیے 70-بلین پیرامیٹر ماڈل جس کو 16-بٹ پر تقریباً 140GB کی ضرورت ہوتی ہے وہ 4-بٹ پر تقریباً 35GB میں فٹ ہو سکتا ہے۔ چھوٹی تعداد بھی میموری کے ذریعے تیزی سے حرکت کرتی ہے، جو عام طور پر نسل کو تیز کرتی ہے۔ کیچ درستگی ہے: قدروں کی ایک وسیع رینج کو چند سطحوں میں نچوڑنا راؤنڈنگ ایرر متعارف کرواتا ہے۔ اچھے طریقے اسکیلنگ کے عوامل کو احتیاط سے منتخب کرکے اور انتہائی حساس وزن کی حفاظت کرکے اس نقصان کو کم کرتے ہیں، اس لیے وسائل کا ایک حصہ استعمال کرتے ہوئے ماڈل تقریباً ایک جیسا برتاؤ کرتا ہے۔

تکنیکی بصیرت

وزن کے ہر گروپ کو ایک پیمانے کا عنصر ملتا ہے جو عدد کے چھوٹے سیٹ پر حقیقی اقدار کا نقشہ بناتا ہے۔ پیمانے سے واپس ضرب کرنے سے تقریباً اصل نمبر کی تشکیل نو ہو جاتی ہے۔ بعد از تربیت کوانٹائزیشن کے طریقے جیسے GPTQ اور AWQ ایک چھوٹے انشانکن ڈیٹاسیٹ کا تجزیہ کرتے ہیں تاکہ یہ فیصلہ کیا جا سکے کہ کون سا وزن سب سے زیادہ اہمیت رکھتا ہے اور ہر چیز کو آنکھ بند کر کے گول کرنے کے بجائے آؤٹ پٹ کی خرابی کو کم کرنے کے لیے ترازو سیٹ کرتا ہے۔ ایکٹیویشن کو اکثر زیادہ درستگی پر رکھا جاتا ہے کیونکہ وہ رن ٹائم میں زیادہ مختلف ہوتی ہیں۔ نتیجہ ایک ایسا ماڈل ہے جو 4 بٹ انٹیجرز کو اسٹور کرتا ہے لیکن نتائج کو مکمل درستگی والے ورژن کے انتہائی قریب شمار کرتا ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

کوانٹائزیشن کا مستقبل

توقع ہے کہ کوانٹائزیشن اصلاح کے بجائے ڈیفالٹ بن جائے گی۔ ہارڈ ویئر فروش مقامی 4 بٹ اور یہاں تک کہ لوئر بٹ سپورٹ شامل کر رہے ہیں، اور تکنیک جیسے کوانٹائزیشن سے آگاہ ٹریننگ شروع سے ہی ماڈل میں کم درستگی کے لیے برداشت کو بیک کر رہی ہے، جس سے درستگی کے نقصان کو مزید کم کیا جا رہا ہے۔ 2-bit اور 1-bit (بائنری) نمائندگیوں میں تحقیق فعال ہے، جس کا مقصد فونز اور ایمبیڈڈ چپس پر قابل ماڈلز چلانا ہے۔ جیسے جیسے آن ڈیوائس اور پرائیویٹ AI بڑھتا جائے گا، موثر کوانٹائزڈ ماڈل کلاؤڈ کو ڈیٹا بھیجے بغیر مقامی طور پر اسسٹنٹس کو چلانے کے لیے مرکزی ہوں گے۔

حقیقی دنیا کا نفاذ

ایک سے زیادہ ڈیٹا سینٹر کارڈز کی ضرورت کے بجائے 4 بٹ GGUF یا GPTQ فائلوں کا استعمال کرتے ہوئے صارف GPU پر مقامی طور پر Llama جیسا چیٹ ماڈل چلانا۔

فون پر آن ڈیوائس اسسٹنٹس، جہاں 8 بٹ یا 4 بٹ ماڈل اسپیچ اور ٹیکسٹ فیچر کو نیٹ ورک کنکشن کے بغیر چلنے دیتے ہیں۔

INT8 ماڈل پیش کرکے، ہر GPU پر مزید درخواستوں کو فٹ کر کے کسٹمر سپورٹ بوٹ کے لیے کلاؤڈ انفرنس لاگت کو کم کرنا۔

ایج ڈیوائسز جیسے کہ سمارٹ کیمرے یا IoT سینسرز جو کومپیکٹ کوانٹائزڈ وژن لینگویج ماڈل چلاتے ہیں میموری کی سخت حدود میں۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

بقایا ویکٹر کوانٹائزیشن

اکثر پوچھے گئے سوالات

What is Quantization?

کوانٹائزیشن ایک AI ماڈل کو اس کے نمبروں کو کم درستگی پر ذخیرہ کرکے سکڑتی ہے، لہذا ایک ماڈل جس کو ڈیٹا سینٹر GPU کی ضرورت ہوتی ہے وہ کبھی کبھی لیپ ٹاپ یا فون پر چل سکتا ہے۔ یہ ایک اہم چال ہے جو بڑے زبان کے ماڈلز کو سستا اور تیز تر بناتی ہے تاکہ وسیع پیمانے پر تعینات ہو سکے۔

کوانٹائزیشن بنیادی طور پر اعصابی نیٹ ورک کے بارے میں کیا بدلتی ہے؟

کوانٹائزیشن ماڈل کے وزن کو کم عددی درستگی پر دوبارہ ذخیرہ کرتی ہے، جیسے کہ 16- یا 32 بٹ فلوٹس کی بجائے 8 بٹ یا 4 بٹ انٹیجرز۔

وزن کو 16 بٹ سے 4 بٹ میں منتقل کرنے سے تقریبا کتنی میموری محفوظ ہوتی ہے؟

4 بٹس 16 بٹس کا ایک چوتھائی حصہ ہے، اس لیے وزن کا ذخیرہ تقریباً ایک چوتھائی رہ جاتا ہے، تقریباً 4x کمی۔

جارحانہ کوانٹائزیشن کا بنیادی نقصان کیا ہے؟

کم سطحوں کے ساتھ اقدار کی نمائندگی کرنے سے راؤنڈنگ ایرر متعارف ہوتا ہے، جو احتیاط سے منظم نہ ہونے پر آؤٹ پٹ کوالٹی کو گرا سکتا ہے۔

GPTQ اور AWQ جیسے طریقے ایک چھوٹا انشانکن ڈیٹاسیٹ کس کے لیے استعمال کرتے ہیں؟

تربیت کے بعد کے یہ طریقے پیمانہ سازی کے عوامل کو سیٹ کرنے اور آؤٹ پٹس کو اصل کے قریب رکھتے ہوئے، حساس وزن کی حفاظت کے لیے چند نمونوں کی معلومات کا تجزیہ کرتے ہیں۔

کوانٹائزیشن اکثر ماڈل کو تیز کیوں بناتی ہے، نہ صرف چھوٹا؟

کم درستگی والی قدریں لوڈ اور منتقل ہونے میں کم میموری بینڈوڈتھ لیتی ہیں، جو کہ نسل کے دوران اکثر رکاوٹ ہوتی ہے، اس لیے تخمینہ کی رفتار تیز ہوجاتی ہے۔