نقلی سیکھنا
نقلی سیکھنا ایک AI کو آزمائش اور غلطی کے انعامات سے سیکھنے کے بجائے ماہرانہ مظاہروں کی کاپی کرکے ایک کام انجام دینا سکھاتا ہے۔
جائزہ
It matters because for many real tasks — driving, surgery, manipulation — it is far easier to show good behavior than to write a reward function.
گہرا غوطہ
مشابہت سیکھنے میں ماہر کی ریکارڈ شدہ مثالوں سے پالیسی کی تربیت ہوتی ہے جو کسی ماحول میں کام کرتے ہیں، عام طور پر مشاہدات کے جوڑے اور ماہر کے کیے گئے اقدامات۔ سب سے آسان شکل، رویے کی کلوننگ، اسے سادہ زیر نگرانی سیکھنے کے طور پر مانتی ہے: ریاست کو دیکھتے ہوئے ماہر کی کارروائی کی پیش گوئی کریں۔ یہ دلکش ہوتا ہے جب انعامات کی وضاحت کرنا مشکل ہوتا ہے لیکن مظاہرے بہت زیادہ ہوتے ہیں، جیسا کہ انسانی اسٹیئرنگ لاگز یا ٹیلی آپریشن کے ذریعے سکھائے جانے والے روبوٹس پر تربیت یافتہ سیلف ڈرائیونگ کاروں میں۔ کلاسک کمزوری ڈسٹری بیوشن شفٹ، یا کمپاؤنڈنگ ایرر ہے: چھوٹی پیشین گوئی کی غلطیاں ایجنٹ کو ایسی ریاستوں میں دھکیل دیتی ہیں جہاں ماہر نے کبھی دورہ نہیں کیا تھا، جہاں اس کی کوئی رہنمائی نہیں ہوتی اور وہ آگے بڑھ جاتا ہے۔ ڈیگر جیسے طریقے ماہر سے بار بار ان ریاستوں کے بارے میں استفسار کرکے اسے ٹھیک کرتے ہیں جہاں سیکھنے والا حقیقت میں پہنچتا ہے۔
تکنیکی بصیرت
طرز عمل کی کلوننگ پیش گوئی شدہ اور ظاہر کردہ اعمال کے درمیان نگرانی شدہ نقصان کو کم کرتی ہے، لیکن یہ فرض کرتی ہے کہ ریاستیں آزاد اور یکساں طور پر تقسیم شدہ ہیں - ترتیب وار کنٹرول میں غلط۔ DAgger (Dataset Aggregation) موجودہ پالیسی کو تکراری طور پر رول آؤٹ کرکے، ماہر سے دورہ شدہ ریاستوں کو لیبل کرنے کے لیے، اور بڑھتے ہوئے مجموعی ڈیٹاسیٹ پر دوبارہ تربیت دے کر اس مفروضے کو توڑتا ہے۔ یہ تربیتی اعداد و شمار کو سیکھنے والے کی اپنی ریاستی تقسیم کے ساتھ منسلک رکھتا ہے، جس سے طویل افق پر پیچیدہ غلطیوں کو ڈرامائی طور پر کم کیا جاتا ہے۔
اسٹریٹجک اثر
لاگت اور بجٹ
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
واضح فیصلے
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
کوالٹی کنٹرول
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
تقلید سیکھنے کا مستقبل
روبوٹ فاؤنڈیشن ماڈلز کے عروج کے لیے مشابہت سیکھنا مرکزی حیثیت رکھتا ہے، جہاں ایک ہی پالیسی کو بہت بڑے ملٹی ٹاسک ٹیلی آپریشن ڈیٹا سیٹس پر تربیت دی جاتی ہے اور نئی مہارتوں کے لیے بہتر بنایا جاتا ہے۔ زبان اور وژن کے ساتھ سخت فیوژن کی توقع کریں تاکہ روبوٹ ویڈیوز یا ہدایات سے نقل کریں، نیز ہائبرڈ جو کلوننگ کے ساتھ بوٹسٹریپ کرتے ہیں پھر کمک سیکھنے کے ذریعے بہتر ہوتے ہیں۔ تخروپن اور کراؤڈ سورس ہیومن پلے ڈیٹا کے ذریعے سستے طریقے سے مظاہرے کے جمع کرنے کی پیمائش کرنا، کلیدی رکاوٹ اور فعال محاذ بنا ہوا ہے۔
حقیقی دنیا کا نفاذ
لاگ ان انسانی ڈرائیونگ پر تربیت یافتہ سیلف ڈرائیونگ کار پرسیپشن ٹو اسٹیئرنگ ماڈلز
روبوٹ کے ہتھیار ٹیلی آپریٹڈ مظاہروں سے لانڈری یا اشیاء کو اسٹیک کرنا سیکھ رہے ہیں۔
گیم کھیلنے والے ایجنٹوں کو RL کے ساتھ ٹھیک ٹیوننگ سے پہلے ریکارڈ شدہ انسانی ری پلے سے بوٹسٹریپ کیا جاتا ہے۔
جراحی اور معاون روبوٹ ماہر آپریٹر کے مظاہروں سے حرکات سیکھ رہے ہیں۔
خطرات اور گارڈریلز
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ کا روڈ میپ
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Imitation Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
آف لائن کمک سیکھنا
اکثر پوچھے گئے سوالات
What is Imitation Learning?
نقلی سیکھنا ایک AI کو آزمائش اور غلطی کے انعامات سے سیکھنے کے بجائے ماہرانہ مظاہروں کی کاپی کرکے ایک کام انجام دینا سکھاتا ہے۔ یہ اہمیت رکھتا ہے کیونکہ بہت سے حقیقی کاموں - ڈرائیونگ، سرجری، ہیرا پھیری - کے لیے انعامی فنکشن لکھنے کے مقابلے میں اچھا برتاؤ دکھانا بہت آسان ہے۔
تقلید سیکھنے کے پیچھے بنیادی خیال کیا ہے؟
مشابہت سیکھنا ایک ایجنٹ کو تربیت دیتا ہے کہ وہ ماہرانہ مظاہروں میں دکھائے گئے رویے کو دوبارہ پیش کرے نہ کہ انعام سے چلنے والی آزمائش اور غلطی کے ذریعے رویے کو دریافت کرے۔
طرز عمل کی کلوننگ مشابہت سیکھنے کو کس قسم کا مسئلہ بناتی ہے؟
طرز عمل کی کلوننگ مظاہروں کو لیبل لگائے گئے ڈیٹا کے طور پر دیکھتی ہے اور ہر مشاہدہ شدہ حالت کے لیے ماہر کی کارروائی کی پیشین گوئی کرنا سیکھتی ہے، بالکل ایسے ہی جیسے زیر نگرانی تعلیم۔
طویل کارروائی کے سلسلے میں رویے کی کلوننگ کے ناکام ہونے کا کیا مسئلہ ہے؟
چھوٹی چھوٹی غلطیاں ایجنٹ کو ایسی ریاستوں میں دھکیل دیتی ہیں جس کا ماہر نے کبھی مظاہرہ نہیں کیا۔ بغیر کسی رہنمائی کے، غلطیاں جمع ہو جاتی ہیں اور ایجنٹ ماہر کی رفتار سے مزید دور ہو جاتا ہے۔
ڈیگر الگورتھم اس کمزوری کو کیسے دور کرتا ہے؟
ڈیگر موجودہ پالیسی کو رول آؤٹ کرتا ہے، ماہر کے پاس نئی آنے والی ریاستوں پر لیبل لگا ہوا ہے، اور مجموعی ڈیٹاسیٹ پر دوبارہ تربیت دیتا ہے تاکہ تربیتی ڈیٹا سیکھنے والے کی اپنی ریاستی تقسیم سے میل کھاتا ہے۔
نقلی سیکھنے کو اکثر ڈرائیونگ جیسے کاموں کے لیے کمک سیکھنے پر ترجیح کیوں دی جاتی ہے؟
پیچیدہ حقیقی دنیا کے کاموں کے لیے، اچھے رویے کو حاصل کرنے والا انعام لکھنا مشکل ہے، جبکہ اچھے برتاؤ کی مثالیں دکھانا (انسانی ڈرائیونگ لاگز) نسبتاً آسان ہے۔