QLoRA اور 4 بٹ فائن ٹیوننگ
QLoRA ایک ایسی تکنیک ہے جو آپ کو صرف 4 بٹس فی وزن میں منجمد ماڈل کو ذخیرہ کرکے ایک صارف GPU پر ایک بڑے زبان کے ماڈل کو ٹھیک کرنے دیتی ہے۔
جائزہ
It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.
گہرا غوطہ
عام طور پر، ایک بڑے ماڈل کو ٹھیک کرنے کا مطلب ہے کہ ہر وزن کو 16 بٹ درستگی میں لوڈ کرنا اور ان سب کو اپ ڈیٹ کرنا، جس کے لیے بہت زیادہ میموری کی ضرورت ہوتی ہے۔ QLoRA دو خیالات کو یکجا کرتا ہے۔ سب سے پہلے، یہ پہلے سے تربیت یافتہ ماڈل کو منجمد کرتا ہے اور اسے 4 بٹس تک کم کرتا ہے، جس سے میموری کو تقریباً چار گنا کم کیا جاتا ہے۔ دوسرا، یہ LoRA کا استعمال کرتا ہے: بڑے وزن والے میٹرکس کو اپ ڈیٹ کرنے کے بجائے، یہ ان کے ساتھ ساتھ چھوٹے تربیت کے قابل کم درجے کے اڈاپٹر میٹرکس کو انجیکٹ کرتا ہے، اس لیے صرف چند ملین پیرامیٹرز کو اپ ڈیٹ کیا جاتا ہے۔ 4 بٹ بیس فکس رہتا ہے جب کہ گریڈیئنٹس صرف چھوٹے اڈاپٹر سے گزرتے ہیں۔ Dettmers اور ساتھیوں کے ذریعہ 2023 میں متعارف کرایا گیا، QLoRA نے دکھایا کہ ایک 48GB GPU پر 65B ماڈل کو فائن ٹیوننگ مکمل 16 بٹ فائن ٹیوننگ کے معیار سے مماثل ہو سکتی ہے۔
تکنیکی بصیرت
QLoRA نے تین چالیں متعارف کروائیں۔ NF4 (4-bit NormalFloat) ایک ڈیٹا کی قسم ہے جسے اعصابی وزن کی گھنٹی وکر کی تقسیم کے لیے بہتر بنایا گیا ہے، جو سادہ int4 سے بہتر درستگی دیتا ہے۔ ڈبل کوانٹائزیشن کوانٹائزیشن مستقل کو خود ہی کمپریس کرتی ہے، اضافی میموری کو بچاتی ہے۔ پیجڈ آپٹیمائزر GPU-CPU یونیفائیڈ میموری استعمال کرتے ہیں تاکہ لمبے تسلسل کے دوران اسپائکس کو جذب کر سکیں، میموری سے باہر ہونے والے کریشوں کو روکتے ہیں۔ فارورڈ اور بیکورڈ پاس کے دوران، میٹرکس ضرب کے لیے 4-بٹ وزن کو 16-بٹ صرف وقت میں کم کر دیا جاتا ہے، پھر ضائع کر دیا جاتا ہے۔
اسٹریٹجک اثر
رفتار اور پیمانہ
زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔
رسائی اور رسائی
یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔
واضح فیصلے
ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔
QLoRA اور 4 بٹ فائن ٹیوننگ کا مستقبل
4 بٹ فائن ٹیوننگ معیاری پریکٹس بن چکی ہے، اور تحقیق اب اور بھی کم درستگی کی طرف دھکیلتی ہے، بشمول 2-بٹ اور 1-بٹ (ٹرنری) نمائندگی۔ کوانٹائزیشن کی نئی اسکیمیں جیسے AWQ، GPTQ، اور HQQ درستگی کو مزید بہتر کرتی ہیں، جبکہ QA-LoRA جیسی تکنیکوں کا مقصد اڈیپٹرز کو ضم کرنے کے بعد بھی ماڈل کو مقدار کے مطابق رکھنا ہے۔ جیسے جیسے کھلے وزن والے ماڈلز بڑھتے ہیں، ایسے ٹولنگ کی توقع کریں جو شوق رکھنے والوں کو ایک واحد گیمنگ GPU پر 70B-plus ماڈلز کو معمول کے مطابق بنانے، جمہوری تخصیص کو معمول کے مطابق بنانے دیتی ہے۔
حقیقی دنیا کا نفاذ
ایک سٹارٹ اپ 70B Llama ماڈل کو سنگل 48GB GPU پر ٹھیک کرتا ہے تاکہ سرور کلسٹر کو کرائے پر لیے بغیر اپنی برانڈ کی آواز میں کسٹمر سپورٹ اسسٹنٹ بنایا جا سکے۔
ایک صارف RTX 4090 والا ایک محقق راتوں رات ایک مخصوص طبی سوالوں کے جواب دینے والے ڈیٹاسیٹ کے لیے کھلے ماڈل کو ڈھال لیتا ہے۔
ایک ڈویلپر مختلف کاموں کے لیے درجنوں چھوٹے، بدلنے کے قابل LoRA اڈاپٹر بناتا ہے، یہ سبھی میموری میں بھرے ہوئے ایک 4 بٹ بیس ماڈل کو شیئر کرتے ہیں۔
ایک شوق رکھنے والا اپنے ذاتی چیٹ لاگز پر ایک ماڈل کو ٹھیک بناتا ہے تاکہ مفت Colab-گریڈ ہارڈ ویئر کا استعمال کرتے ہوئے لکھنے کے مخصوص انداز کی نقل کر سکے۔
خطرات اور گارڈریلز
گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔
فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔
اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔
نفاذ کا روڈ میپ
رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔
جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔
ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔
ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the QLoRA and 4-Bit Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
ریجیکشن سیمپلنگ فائن ٹیوننگ
اکثر پوچھے گئے سوالات
What is QLoRA and 4-Bit Fine-Tuning?
QLoRA ایک ایسی تکنیک ہے جو آپ کو صرف 4 بٹس فی وزن میں منجمد ماڈل کو ذخیرہ کرکے ایک صارف GPU پر ایک بڑے زبان کے ماڈل کو ٹھیک کرنے دیتی ہے۔ اس نے ہارڈ ویئر پر 65B-پیرامیٹر ماڈلز کو اپنی مرضی کے مطابق بنانا ممکن بنایا جو پہلے صرف اس سائز کے ماڈلز کو ہینڈل کر سکتے تھے۔
QLoRA کے '4-bit' حصے کے پیچھے میموری کو بچانے کا بنیادی خیال کیا ہے؟
QLoRA منجمد پہلے سے تربیت یافتہ وزن کو 4 بٹس فی قدر پر ذخیرہ کرتا ہے، جس سے میموری کو 16 بٹ کے مقابلے میں تقریباً چار گنا کم کیا جاتا ہے۔
QLoRA فائن ٹیوننگ کے دوران، کون سے پیرامیٹرز درحقیقت گریڈینٹ ڈیسنٹ کے ذریعے اپ ڈیٹ ہوتے ہیں؟
بیس ماڈل منجمد ہے؛ صرف انجکشن شدہ لو رینک اڈاپٹر میٹرکس کو گریڈینٹ اپ ڈیٹ ملتا ہے، جو کہ پیرامیٹرز کا صرف ایک چھوٹا سا حصہ ہے۔
QLoRA کے تناظر میں NF4 کیا ہے؟
NF4 (NormalFloat 4-bit) ایک ڈیٹا کی قسم ہے جو سادہ int4 سے بہتر درستگی کے لیے اعصابی نیٹ ورک وزن کی گھنٹی وکر کی تقسیم کے ارد گرد ڈیزائن کی گئی ہے۔
QLoRA ایڈریس میں 'پیجڈ آپٹیمائزرز' کو کیا مسئلہ ہے؟
پیجڈ آپٹیمائزر GPU-CPU یونیفائیڈ میموری کا استعمال کرتے ہیں تاکہ میموری اسپائکس کو جذب کر سکیں، طویل ان پٹ پر تربیت کے دوران میموری سے باہر ہونے والے کریشوں کو روکتے ہیں۔
ٹریننگ کے دوران 4 بٹ وزن کو کب واپس اعلیٰ درستگی میں تبدیل کیا جاتا ہے؟
4-بٹ وزن کو ہر میٹرکس ضرب کے لیے اڑتے وقت 16-بٹ درستگی کے لیے کم کر دیا جاتا ہے، پھر میموری کو بچانے کے لیے اعلیٰ درستی والی کاپی پھینک دی جاتی ہے۔