ٹیکنیکل گائیڈ

ماڈل کوانٹائزیشن

ماڈل کوانٹائزیشن ایک نیورل نیٹ ورک کو اس کے نمبروں کو کم بٹس میں محفوظ کرکے سکڑتی ہے، اس لیے وہی ماڈل تیز اور چھوٹے ہارڈ ویئر پر چلتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It is the main reason large models can fit on a single GPU, a laptop, or even a phone.

گہرا غوطہ

تربیت یافتہ ماڈل عام طور پر ہر وزن کو 32 بٹ یا 16 بٹ فلوٹنگ پوائنٹ نمبر کے طور پر محفوظ کرتے ہیں۔ کوانٹائزیشن کم درستگی والے فارمیٹس جیسے 8 بٹ انٹیجرز (INT8) یا 4 بٹ ویلیوز (INT4) کی جگہ لے لیتی ہے، میموری کو تقریباً 4x سے 8x تک کاٹتا ہے۔ ایک 70-بلین پیرامیٹر ماڈل جس کو 16-بٹ میں تقریباً 140GB کی ضرورت ہوتی ہے، 4-bit پر 35GB کے قریب گر سکتا ہے، جو ایک صارف GPU پر فٹ بیٹھتا ہے۔ کیچ درستگی ہے: قدروں کی ایک وسیع رینج کو 256 یا 16 بالٹیوں میں نچوڑنا تفصیل کھو دیتا ہے۔ جدید طریقے جیسے GPTQ، AWQ، اور NF4 فارمیٹ QLoRA میں استعمال ہونے والے سمارٹ اسکیلنگ کے عوامل کو چنتے ہیں اور انتہائی حساس وزن کی حفاظت کرتے ہیں، اس لیے معیار کا نقصان اکثر کم ہوتا ہے۔ کوانٹائزیشن یہی وجہ ہے کہ llama.cpp اور Ollama جیسے ٹولز ڈیٹا سینٹر کے بغیر مقامی طور پر قابل ماڈل چلا سکتے ہیں۔

تکنیکی بصیرت

کوانٹائزیشن ایک پیمانے اور صفر پوائنٹ کا استعمال کرتے ہوئے حقیقی قدروں کو چھوٹے عددی گرڈ پر نقش کرتی ہے: stored_int = راؤنڈ(قدر/اسکیل) + صفر_پوائنٹ۔ پیمانے کو اچھی طرح سے منتخب کرنا سارا کھیل ہے۔ فی چینل یا فی گروپ پیمانہ وزن میٹرکس کے ٹکڑوں کے لیے الگ الگ پیمانہ رکھتا ہے، جہاں اس کی اہمیت ہوتی ہے اس کی درستگی کو محفوظ رکھتا ہے۔ تربیت کے بعد کوانٹائزیشن صرف ایک تیار شدہ ماڈل کو تبدیل کرتی ہے، جبکہ کوانٹائزیشن سے آگاہی تربیت کے دوران راؤنڈنگ کی نقل کرتی ہے لہذا نیٹ ورک اسے برداشت کرنا سیکھتا ہے، عام طور پر بہتر کم درستگی دیتا ہے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

ماڈل کوانٹائزیشن کا مستقبل

ہمیشہ کم صحت سے متعلق معمول بننے کی توقع کریں۔ تحقیق قابل اعتماد 4 بٹ، 2 بٹ، اور یہاں تک کہ بائنری وزن کے علاوہ مخلوط درستگی کی اسکیموں کو آگے بڑھا رہی ہے جو حساس تہوں کو اونچا رکھتی ہیں۔ ہارڈ ویئر مندرجہ ذیل ہے: GPUs اور فون چپس میں اب مقامی INT8، INT4، اور FP8 ریاضی کی اکائیاں شامل ہیں۔ FP8 اور MXFP4 جیسے فارمیٹس کا مقصد فلوٹس کی رینج کو عدد کے سائز کے ساتھ جوڑنا ہے۔ QLoRA جیسی تکنیکوں کے ساتھ مل کر، کوانٹائزیشن فرنٹیئر پیمانے کے ماڈلز کو چلانے کے لیے سستا اور روزمرہ کے آلات پر فائن ٹیون بناتی رہے گی۔

حقیقی دنیا کا نفاذ

4 بٹ GGUF فائلوں کا استعمال کرتے ہوئے llama.cpp یا Ollama کے ساتھ لیپ ٹاپ پر 7B یا 13B Llama ماڈل چلانا۔

QLoRA 4-bit NF4 میں بنیادی وزن کو منجمد رکھ کر ایک واحد GPU پر ایک بڑے ماڈل کو ٹھیک کرتا ہے۔

آن ڈیوائس رن ٹائم والے فونز پر INT8 ماڈلز کو تعینات کرنا تاکہ معاونین آف لائن اور نجی طور پر کام کریں۔

سستے API اینڈ پوائنٹس کی خدمت کرنا جہاں INT8/FP8 کوانٹائزیشن تھرو پٹ کو تقریباً دوگنا کرتا ہے اور میموری کی لاگت کو کم کرتا ہے۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Model Quantization?

ماڈل کوانٹائزیشن ایک نیورل نیٹ ورک کو اس کے نمبروں کو کم بٹس میں محفوظ کرکے سکڑتی ہے، اس لیے وہی ماڈل تیز اور چھوٹے ہارڈ ویئر پر چلتا ہے۔ یہ بنیادی وجہ ہے کہ بڑے ماڈلز ایک ہی GPU، ایک لیپ ٹاپ، یا یہاں تک کہ ایک فون پر فٹ ہو سکتے ہیں۔

ماڈل کوانٹائزیشن بنیادی طور پر اعصابی نیٹ ورک کے بارے میں کیا بدلتی ہے؟

کوانٹائزیشن ایک ہی پیرامیٹرز کو کم بٹس میں اسٹور کرتی ہے (مثال کے طور پر 16- یا 32 بٹ فلوٹس کی بجائے INT8 یا INT4)، میموری کو کم کرتی ہے اور ریاضی کو تیز کرتی ہے۔

ایک ماڈل کو 16 بٹ سے 4 بٹ میں تبدیل کرنے سے تقریباً کتنی میموری محفوظ ہو سکتی ہے؟

16 بٹس فی وزن سے 4 بٹس تک جانے سے سٹوریج میں تقریباً چار کے فیکٹر کی کمی آتی ہے، یہی وجہ ہے کہ بڑے ماڈلز ایک ہی GPU پر فٹ ہو سکتے ہیں۔

جارحانہ کم بٹ کوانٹائزیشن کا بنیادی نقصان کیا ہے؟

قدروں کی ایک وسیع رینج کو چند مجرد سطحوں پر نقش کرنے سے تفصیل ختم ہو جاتی ہے، جو معیار کو کم کر سکتی ہے جب تک کہ سمارٹ سکیلنگ حساس وزن کی حفاظت نہ کرے۔

کوانٹائزیشن سے آگاہی تربیت پوسٹ ٹریننگ کوانٹائزیشن سے کیسے مختلف ہے؟

کوانٹائزیشن سے آگاہ ٹریننگ ٹریننگ لوپ میں راؤنڈنگ کی خرابی پیدا کرتی ہے، اس لیے نیٹ ورک ڈھال لیتا ہے اور عام طور پر کم چوڑائی پر زیادہ درستگی رکھتا ہے۔

کون سی تکنیک 4 بٹ کوانٹائزیشن کا استعمال کرتی ہے تاکہ ایک GPU پر فائن ٹیوننگ بڑے ماڈلز کو سستی بنایا جا سکے؟

QLoRA بیس ماڈل کو 4 بٹ NF4 فارمیٹ میں منجمد رکھتا ہے اور چھوٹے اڈاپٹر کے وزن کو تربیت دیتا ہے، جس سے بڑے ماڈلز کو معمولی ہارڈ ویئر پر ٹھیک بنایا جا سکتا ہے۔