دليل الذكاء الاصطناعي المرئي

سياسة الانتشار للتحكم في الروبوت

تطبق سياسة الانتشار نفس فكرة تقليل الضوضاء وراء مولدات الصور مثل Stable Diffusion على التحكم في الروبوت: فبدلاً من التنبؤ بإجراء واحد تالٍ، فإنها تولد تسلسلًا قصيرًا كاملاً من الإجراءات المستقبلية عن طريق تحسين الضوضاء بشكل متكرر.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it handles the messy, multi-modal nature of real manipulation far better than older methods.

الغوص العميق

تم تقديم سياسة الانتشار في عام 2023 من قبل باحثين في كولومبيا ومعهد ماساتشوستس للتكنولوجيا ومعهد تويوتا للأبحاث، وهي تعيد صياغة التعلم الحركي البصري باعتباره تقليلًا مشروطًا للضوضاء. نظرًا لصور الكاميرا الحديثة وحالة الروبوت، فإنه يبدأ من الضوضاء العشوائية ويقوم بعدة خطوات لتقليل الضوضاء لإنتاج "جزء من الحركة" - على سبيل المثال، الخطوات الزمنية التالية من 8 إلى 16 من أوضاع المستجيب النهائي. الفوز الكبير هو تعدد الوسائط: عندما يكون لمهمة ما عدة حلول صالحة (يمكنك الحصول على قدح من اليسار أو اليمين)، فإن الانحدار التقليدي يحولها إلى إجراء متوسط ​​سيئ، في حين أن نموذج الانتشار يمكن أن يلتزم بشكل واضح بوضع واحد. كما أنها تتعلم بشكل ثابت من العروض البشرية (استنساخ السلوك) وتتأقلم بشكل جيد مع مساحات الحركة عالية الأبعاد، مما يجعلها خيارًا افتراضيًا في العديد من أنظمة المعالجة الحديثة.

البصيرة الفنية

يضيف التدريب ضوضاء غاوسية إلى تسلسلات الحركة الموضحة ويعلم شبكة (غالبًا شبكة U أو محول) للتنبؤ بهذه الضوضاء، مشروطة بالملاحظات البصرية واستقبال الحس العميق. في وقت التشغيل، يتم تقليل الضوضاء من العينات العشوائية عبر عدد قليل من الخطوات (DDPM/DDIM) لإنتاج مسار العمل. إن التنبؤ بالأجزاء بالإضافة إلى إعادة التخطيط "لتراجع الأفق" يعطي اتساقًا زمنيًا مع البقاء متفاعلاً مع الملاحظات الجديدة.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل سياسة الانتشار للتحكم في الروبوتات

يعمل العمل على تقليل عدد خطوات تقليل الضوضاء (من خلال نماذج الاتساق ومطابقة التدفق) بحيث تعمل السياسات بمعدلات تحكم عالية على الأجهزة الحقيقية. يتم تثبيت رؤوس عمل الانتشار على أعمدة فقرية كبيرة للغة الرؤية لتكوين VLAs، وتعمل المتغيرات ثلاثية الأبعاد والمتغيرة على تحسين كفاءة العينة. توقع أن يظل التحكم القائم على الانتشار عنصرًا أساسيًا في "أدمغة" الروبوتات العامة التي تعمل على تشغيل المهام الحاذقة وثنائية اليد.

التنفيذ في العالم الحقيقي

ذراع روبوتية تدفع كتلة على شكل حرف T إلى وضعية الهدف، وهو معيار حيث تفوقت سياسة الانتشار بشكل ملحوظ على أساليب استنساخ السلوك السابقة

تتعلم الروبوتات ثنائية اليدين مهام المطبخ الدقيقة مثل تقليب الطعام أو تجميع الأجزاء من عروض التشغيل عن بعد البشرية

انتقاء الصناديق المزدحمة في حالة وجود عدة فهمات صالحة وتلتزم السياسة بواحدة بدلاً من المتوسط

وحدة رأس الحركة داخل أنظمة رؤية ولغة الحركة تولد حركة سلسة عالية التردد للأيدي الماهرة

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Policy for Robot Control quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is Diffusion Policy for Robot Control?

تطبق سياسة الانتشار نفس فكرة تقليل الضوضاء وراء مولدات الصور مثل Stable Diffusion على التحكم في الروبوت: فبدلاً من التنبؤ بإجراء واحد تالٍ، فإنها تولد تسلسلًا قصيرًا كاملاً من الإجراءات المستقبلية عن طريق تحسين الضوضاء بشكل متكرر. إنه أمر مهم لأنه يتعامل مع الطبيعة الفوضوية ومتعددة الوسائط للتلاعب الحقيقي بشكل أفضل بكثير من الأساليب القديمة.

ما الذي تولده سياسة الانتشار عند كل نقطة قرار؟

تنتج سياسة الانتشار جزءًا من الإجراء - عدة خطوات زمنية مستقبلية - عن طريق تقليل الضوضاء، بدلاً من أمر واحد معزول.

ما هي التقنية التوليدية التي تقترضها سياسة الانتشار من الذكاء الاصطناعي للصورة؟

مثل نماذج نشر الصور، يبدأ الأمر من الضوضاء ثم يقلل الضوضاء بشكل متكرر، ولكن هنا يكون الناتج عبارة عن مسار عمل مشروط بالملاحظات.

ما هي مشكلة المهام متعددة الوسائط التي تحلها سياسة الانتشار بشكل أفضل من الانحدار البسيط؟

عندما تكون هناك عدة إجراءات صالحة (على سبيل المثال، الإمساك باليسار أو اليمين)، فإن الانحدار يؤدي إلى تحويلها إلى خيار متوسط ​​ضعيف؛ يمكن أن يلتزم الانتشار بشكل نظيف بوضع واحد.

أثناء التدريب، ما هي الشبكة التي يتم تدريسها للتنبؤ بها في سياسة الانتشار؟

تتم إضافة الضوضاء الغوسية إلى الإجراءات الموضحة وتتعلم الشبكة التنبؤ بهذه الضوضاء (مشروطة بالملاحظات)، وهو الهدف القياسي لتقليل الضوضاء.

ما هو إعادة التخطيط "الأفق المتراجع" في سياسة الانتشار؟

تتنبأ السياسة بمجموعة كبيرة من الإجراءات، ولكنها تعيد التخطيط بشكل دوري باستخدام ملاحظات جديدة، وموازنة الاتساق الزمني مع التفاعل.