علم کشید
علم کشید ایک چھوٹے 'طالب علم' ماڈل کو ایک بڑے، درست 'استاد' ماڈل کی نقل کرنے کی تربیت دیتا ہے۔
جائزہ
It matters because it shrinks powerful models so they run cheaply on phones and servers while keeping much of the accuracy.
گہرا غوطہ
بڑے ماڈل درست ہیں لیکن تعینات کرنے میں سست اور مہنگے ہیں۔ نالج ڈسٹلیشن طالب علم کو صرف سخت لیبلز سے سیکھنے کے بجائے استاد کے نتائج سے سیکھنے پر مجبور کر کے ان کی صلاحیت کو ایک کمپیکٹ ماڈل میں منتقل کرتا ہے۔ ہنٹن اور ساتھیوں کی طرف سے اہم بصیرت یہ ہے کہ ایک استاد کی مکمل امکانی تقسیم میں 'تاریک علم' ہوتا ہے: یہاں تک کہ جب یہ 'کتے' کی پیشین گوئی کرتا ہے، 'بھیڑیا' بمقابلہ 'کار' کے متعلقہ امکانات یہ ظاہر کرتے ہیں کہ استاد کس طرح مماثلت کو دیکھتا ہے۔ درجہ حرارت کے ساتھ ان امکانات کو نرم کرنا اس ساخت کو بے نقاب کرتا ہے، اور طالب علم کو اکثر حقیقی لیبلز کے ساتھ، اس سے ملنے کی تربیت دی جاتی ہے۔ نتیجہ ایک چھوٹا، تیز ماڈل ہے جو اکیلے لیبل پر تربیت یافتہ سے بہتر عام کرتا ہے۔ DistilBERT اور TinyBERT ڈسٹل لینگویج کے معروف ماڈل ہیں۔
تکنیکی بصیرت
کلاسک نقصان ایک ڈسٹلیشن اصطلاح (طالب علم اور استاد کی نرمی کے امکانات کے درمیان KL فرق) کو حقیقی لیبلز پر معیاری کراس اینٹروپی کے ساتھ جوڑتا ہے۔ نرم کرنا سافٹ میکس میں درجہ حرارت T کا استعمال کرتا ہے: زیادہ T تقسیم کو ہموار کرتا ہے لہذا چھوٹی بین طبقاتی مماثلتیں سیکھنے کے قابل سگنل بن جاتی ہیں۔ ڈسٹلیشن گریڈینٹ کو عام طور پر T-squared سے پیمانہ کیا جاتا ہے۔ متغیرات آؤٹ پٹ سے آگے بڑھتے ہیں: خصوصیت پر مبنی کشید درمیانی چھپی ہوئی تہوں سے میل کھاتا ہے، اور رشتہ پر مبنی کشید مثالوں کے درمیان تعلقات سے میل کھاتا ہے۔
اسٹریٹجک اثر
لاگت اور بجٹ
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
واضح فیصلے
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
کوالٹی کنٹرول
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
علم کشید کا مستقبل
کشید اب موثر ماڈلز کی ترسیل میں ایک معیاری قدم ہے اور چھوٹے، قابل کھلے ماڈلز کی آج کی لہر میں مرکزی حیثیت رکھتا ہے۔ ایک تیزی سے بڑھتا ہوا رجحان بڑے لینگویج ماڈلز سے تسلسل کی سطح پر کشید کرنا ہے، جہاں ایک مضبوط ماڈل چھوٹے طلباء کو سکھانے کے لیے تربیتی ڈیٹا یا استدلال کے نشانات (بشمول چین آف تھیٹ) تیار کرتا ہے، مصنوعی ڈیٹا کے ساتھ لائن کو دھندلا کرتا ہے۔ کوانٹائزیشن اور کٹائی کے ساتھ سخت جوڑی کی توقع کریں، ڈیوائس پر مزید تعیناتی، اور لائسنسنگ اور معیار کے بارے میں جاری بحث جب ملکیتی ماڈلز سے ڈسٹل کرتے ہیں جن کے نتائج حریف کی تربیت کا اشارہ بن جاتے ہیں۔
حقیقی دنیا کا نفاذ
DistilBERT BERT کو تقریباً 40% کم پیرامیٹرز تک کمپریس کرتا ہے جبکہ تیز تر اندازہ کے لیے اپنی زیادہ تر زبان کی سمجھ کو برقرار رکھتا ہے۔
ایک بڑے وژن ماڈل کو سکڑنا تاکہ تصویر کا درجہ بندی سمارٹ فون کیمرہ ایپ پر حقیقی وقت میں چل سکے۔
ایک بڑے ماڈل کی چین آف تھیٹ استدلال کو ایک چھوٹے ماڈل میں ڈسٹل کرنا تاکہ یہ ریاضی یا کوڈنگ کے سوالات کا زیادہ سستا جواب دے سکے۔
ماڈلز کے ایک جوڑے کو ایک طالب علم میں کمپریس کرنا تاکہ پیداوار کی خدمت کی لاگت اور تاخیر سے زیادہ درستگی کے نقصان کے بغیر کمی واقع ہو۔
خطرات اور گارڈریلز
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ کا روڈ میپ
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Knowledge Distillation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
اے آئی نالج مینجمنٹ
اکثر پوچھے گئے سوالات
What is Knowledge Distillation?
علم کشید ایک چھوٹے 'طالب علم' ماڈل کو ایک بڑے، درست 'استاد' ماڈل کی نقل کرنے کی تربیت دیتا ہے۔ یہ اہمیت رکھتا ہے کیونکہ یہ طاقتور ماڈلز کو سکڑتا ہے لہذا وہ زیادہ تر درستگی کو برقرار رکھتے ہوئے فون اور سرورز پر سستے دوڑتے ہیں۔
علم کشید کا مقصد کیا ہے؟
کشید ایک بڑے استاد کی صلاحیت کو ایک کمپیکٹ، تیز ترین طالب علم ماڈل میں منتقل کرتی ہے۔
استاد کے 'تاریک علم' سے کیا مراد ہے؟
گہرا علم استاد کی مکمل امکانی تقسیم میں ڈھانچہ ہے، جیسا کہ 'بھیڑیا' 'کتے' سے کتنا ملتا جلتا ہے، نہ کہ صرف اوپر کا جواب۔
کشید میں درجہ حرارت (T) کیا کردار ادا کرتا ہے؟
زیادہ درجہ حرارت امکانات کی تقسیم کو ہموار کرتا ہے، جو طالب علم کو سیکھنے والی نسبتی مماثلتوں کو ظاہر کرتا ہے۔
کلاسک ڈسٹلیشن نقصان کن دو اجزاء کو ملاتا ہے؟
طالب علم استاد کی نرم تقسیم (KL اصطلاح) سے میل کھاتا ہے جبکہ زمینی سچائی کے لیبل (کراس اینٹروپی) کو بھی فٹ کرتا ہے۔
کون سی ایک کشید زبان کے ماڈل کی مثال ہے؟
DistilBERT ایک معروف ماڈل ہے جسے BERT سے ڈسٹل کیا گیا ہے، جو بہت کم پیرامیٹرز کے ساتھ زیادہ تر کارکردگی کو برقرار رکھتا ہے۔