روبوٹ کنٹرول کے لیے پھیلاؤ کی پالیسی
ڈفیوژن پالیسی روبوٹ کنٹرول پر اسٹیبل ڈفیوژن جیسے امیج جنریٹرز کے پیچھے اسی منکر خیال کو لاگو کرتی ہے: کسی ایک اگلی کارروائی کی پیشین گوئی کرنے کے بجائے، یہ شور کو تکراری طور پر بہتر کرکے مستقبل کی کارروائیوں کا ایک مکمل مختصر سلسلہ تیار کرتی ہے۔
جائزہ
It matters because it handles the messy, multi-modal nature of real manipulation far better than older methods.
گہرا غوطہ
کولمبیا، MIT، اور ٹویوٹا ریسرچ انسٹی ٹیوٹ کے محققین کی طرف سے 2023 میں متعارف کرائی گئی، ڈفیوژن پالیسی ویزومیٹر لرننگ کو مشروط ڈینوائزنگ کے طور پر ری فریم کرتی ہے۔ حالیہ کیمرہ امیجز اور روبوٹ کی حالت کو دیکھتے ہوئے، یہ بے ترتیب شور سے شروع ہوتا ہے اور 'ایکشن چنک' پیدا کرنے کے لیے کئی ڈینوائزنگ مراحل چلاتا ہے - کہے کہ اینڈ-ایفیکٹر پوز کے اگلے 8 سے 16 ٹائم سٹیپس۔ بڑی جیت ملٹی موڈیلٹی ہے: جب کسی کام کے کئی درست حل ہوتے ہیں (آپ بائیں یا دائیں سے ایک پیالا پکڑ سکتے ہیں)، روایتی رجعت انہیں اوسطاً ایک خراب درمیانی کارروائی میں بدل دیتی ہے، جب کہ ایک بازی ماڈل صاف طور پر ایک موڈ پر کام کر سکتا ہے۔ یہ انسانی مظاہروں (رویے کی کلوننگ) سے بھی مستقل طور پر سیکھتا ہے اور اعلی جہتی ایکشن اسپیس کے ساتھ اچھی طرح سے مقابلہ کرتا ہے، جس سے یہ بہت سے جدید ہیرا پھیری کے نظاموں میں پہلے سے طے شدہ انتخاب بن جاتا ہے۔
تکنیکی بصیرت
تربیت گاوسی شور کو مظاہرے شدہ عمل کے سلسلے میں شامل کرتی ہے اور ایک نیٹ ورک (اکثر U-Net یا ٹرانسفارمر) کو اس شور کی پیشین گوئی کرنے کے لیے سکھاتی ہے، جو بصری اور proprioceptive مشاہدات پر مشروط ہے۔ رن ٹائم کے دوران یہ مٹھی بھر اقدامات (DDPM/DDIM) پر بے ترتیب نمونوں سے ایکشن ٹریجیکٹری حاصل کرنے کی تردید کرتا ہے۔ ٹکڑوں کی پیشن گوئی کے علاوہ 'گھٹتے ہوئے افق' کی دوبارہ منصوبہ بندی نئے مشاہدات پر رد عمل کے ساتھ رہتے ہوئے وقتی مستقل مزاجی فراہم کرتی ہے۔
اسٹریٹجک اثر
رفتار اور پیمانہ
بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔
Build choices
تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔
Team and workflow
آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔
روبوٹ کنٹرول کے لیے پھیلاؤ کی پالیسی کا مستقبل
کام (مستقل ماڈلز اور فلو میچنگ کے ذریعے) کو ختم کرنے والے اقدامات کی تعداد کو کم کر رہا ہے لہذا پالیسیاں حقیقی ہارڈ ویئر پر اعلی کنٹرول کی شرح پر چلتی ہیں۔ وی ایل اے بنانے کے لیے ڈفیوژن ایکشن ہیڈز کو بڑے وژن لینگویج بیک بونز پر باندھا جا رہا ہے، اور 3D سے آگاہی اور مساوی شکلیں نمونے کی کارکردگی کو بہتر بناتی ہیں۔ توقع ہے کہ پھیلاؤ پر مبنی کنٹرول جنرلسٹ روبوٹ 'دماغ' کو طاقت بخش اور دو ہاتھی کاموں میں ایک بنیادی جزو رہے گا۔
حقیقی دنیا کا نفاذ
ایک روبوٹ بازو T کے سائز کے بلاک کو ہدف کے پوز میں دھکیل رہا ہے، ایک بینچ مارک جہاں ڈفیوژن پالیسی نے خاص طور پر رویے کی کلوننگ کے سابقہ طریقوں سے بہتر کارکردگی کا مظاہرہ کیا۔
دو مینوئل روبوٹ باورچی خانے کے نازک کام سیکھ رہے ہیں جیسے کھانے کو پلٹنا یا انسانی ٹیلی آپریشن ڈیمو سے پرزے جمع کرنا
بے ترتیبی سے چننا جہاں ایک سے زیادہ درست گرفت موجود ہے اور پالیسی اوسط کے بجائے ایک پر عمل کرتی ہے
وژن-لینگویج-ایکشن سسٹم کے اندر ایکشن-ہیڈ ماڈیول جو ماہر ہاتھوں کے لیے ہموار ہائی فریکوئنسی حرکت پیدا کرتا ہے
خطرات اور گارڈریلز
تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔
ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔
جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔
نفاذ کا روڈ میپ
درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔
اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔
کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔
کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Policy for Robot Control quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
Stable Diffusion
اکثر پوچھے گئے سوالات
What is Diffusion Policy for Robot Control?
ڈفیوژن پالیسی روبوٹ کنٹرول پر اسٹیبل ڈفیوژن جیسے امیج جنریٹرز کے پیچھے اسی منکر خیال کو لاگو کرتی ہے: کسی ایک اگلی کارروائی کی پیشین گوئی کرنے کے بجائے، یہ شور کو تکراری طور پر بہتر کرکے مستقبل کی کارروائیوں کا ایک مکمل مختصر سلسلہ تیار کرتی ہے۔ یہ اہمیت رکھتا ہے کیونکہ یہ پرانے طریقوں سے کہیں بہتر حقیقی ہیرا پھیری کی گندی، کثیر موڈل نوعیت کو ہینڈل کرتا ہے۔
ایک ڈفیوژن پالیسی ہر فیصلہ کن نقطہ پر کیا پیدا کرتی ہے؟
ڈفیوژن پالیسی ایک الگ تھلگ کمانڈ کی بجائے ڈینوائزنگ کے ذریعے ایک ایکشن ٹکڑا تیار کرتی ہے - اعمال کے کئی مستقبل کے اوقات۔
ڈفیوژن پالیسی امیج AI سے کون سی تخلیقی تکنیک لیتی ہے؟
امیج ڈفیوژن ماڈلز کی طرح، یہ شور سے شروع ہوتا ہے اور تکراری طور پر انکار کرتا ہے، لیکن یہاں آؤٹ پٹ ایک عمل کی رفتار ہے جو مشاہدات پر مشروط ہے۔
ملٹی موڈل ٹاسک کا کون سا مسئلہ ڈفیوژن پالیسی سادہ رجعت سے بہتر حل کرتا ہے؟
جب کئی اعمال درست ہوتے ہیں (مثلاً، بائیں یا دائیں کو پکڑیں)، رجعت ان کو ایک غریب درمیانی آپشن میں بدل دیتی ہے۔ بازی ایک ہی موڈ میں صاف طور پر ارتکاب کر سکتی ہے۔
تربیت کے دوران، ڈفیوژن پالیسی میں نیٹ ورک کیا ہے جو پیشین گوئی کرنا سکھایا جاتا ہے؟
گاوسی شور کو مظاہرے شدہ اعمال میں شامل کیا جاتا ہے اور نیٹ ورک اس شور (مشاہدات پر مشروط) کی پیشن گوئی کرنا سیکھتا ہے، معیاری denoising مقصد۔
ڈفیوژن پالیسی میں 'ریسڈنگ ہورائزن' ریپلاننگ کیا ہے؟
پالیسی عمل کے ایک حصے کی پیش گوئی کرتی ہے لیکن وقتاً فوقتاً نئے مشاہدات کا استعمال کرتے ہوئے دوبارہ منصوبہ بندی کرتی ہے، رد عمل کے ساتھ وقتی مستقل مزاجی کو متوازن کرتی ہے۔