ভিজ্যুয়াল এআই গাইড

রোবট নিয়ন্ত্রণের জন্য ডিফিউশন নীতি

ডিফিউশন পলিসি রোবট নিয়ন্ত্রণে স্টেবল ডিফিউশনের মতো ইমেজ জেনারেটরের পিছনে একই ডিনোইসিং ধারণা প্রয়োগ করে: একটি একক পরবর্তী ক্রিয়া ভবিষ্যদ্বাণী করার পরিবর্তে, এটি পুনরাবৃত্তিমূলকভাবে শোরগোল পরিমার্জন করে ভবিষ্যতের ক্রিয়াগুলির একটি সম্পূর্ণ সংক্ষিপ্ত ক্রম তৈরি করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It matters because it handles the messy, multi-modal nature of real manipulation far better than older methods.

গভীর ডুব

কলাম্বিয়া, এমআইটি এবং টয়োটা রিসার্চ ইনস্টিটিউটের গবেষকদের দ্বারা 2023 সালে প্রবর্তিত, ডিফিউশন পলিসি ভিসুওমোটর লার্নিংকে শর্তসাপেক্ষ ডিনোইসিং হিসাবে পুনরায় ফ্রেম করে। সাম্প্রতিক ক্যামেরা ইমেজ এবং রোবট অবস্থা প্রদত্ত, এটি এলোমেলো শব্দ থেকে শুরু হয় এবং একটি 'অ্যাকশন চাঙ্ক' তৈরি করার জন্য বেশ কয়েকটি ডিনোইসিং ধাপ চালায় — শেষ-প্রভাবক ভঙ্গির পরবর্তী 8 থেকে 16 টাইমস্টেপ বলুন। বড় জয় হল মাল্টিমোডালিটি: যখন একটি টাস্কের বেশ কয়েকটি বৈধ সমাধান থাকে (আপনি বাম বা ডান দিক থেকে একটি মগ ধরতে পারেন), প্রথাগত রিগ্রেশন গড়ে তাদের একটি খারাপ মধ্যম অ্যাকশনে পরিণত করে, যখন একটি ডিফিউশন মডেল পরিষ্কারভাবে একটি মোডে প্রতিশ্রুতিবদ্ধ হতে পারে। এটি মানুষের প্রদর্শন (আচরণ ক্লোনিং) থেকে স্থিরভাবে শেখে এবং উচ্চ-মাত্রিক অ্যাকশন স্পেসগুলির সাথে ভালভাবে মোকাবেলা করে, এটি অনেক আধুনিক ম্যানিপুলেশন সিস্টেমে একটি ডিফল্ট পছন্দ করে তোলে।

প্রযুক্তিগত অন্তর্দৃষ্টি

প্রশিক্ষণটি প্রদর্শিত অ্যাকশন সিকোয়েন্সে গাউসিয়ান শব্দ যোগ করে এবং একটি নেটওয়ার্ক (প্রায়শই একটি ইউ-নেট বা ট্রান্সফরমার) সেই শব্দের পূর্বাভাস দিতে শেখায়, যা ভিজ্যুয়াল এবং প্রোপ্রিওসেপ্টিভ পর্যবেক্ষণের উপর শর্তযুক্ত। রান টাইমে এটি একটি ক্রিয়া ট্র্যাজেক্টোরি ফলানোর জন্য কয়েকটি ধাপে (DDPM/DDIM) এলোমেলো নমুনা থেকে অস্বীকার করে। ভবিষ্যদ্বাণী করা অংশগুলি প্লাস 'রিসিডিং-হরাইজন' রিপ্ল্যানিং নতুন পর্যবেক্ষণে প্রতিক্রিয়াশীল থাকার সময় সাময়িক ধারাবাহিকতা দেয়।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।

পছন্দগুলি তৈরি করুন

সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।

টিম এবং ওয়ার্কফ্লো

অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।

রোবট নিয়ন্ত্রণের জন্য ডিফিউশন নীতির ভবিষ্যত

কাজটি ডিনোইসিং ধাপের সংখ্যা হ্রাস করছে (সঙ্গতিপূর্ণ মডেল এবং ফ্লো ম্যাচিংয়ের মাধ্যমে) তাই নীতিগুলি বাস্তব হার্ডওয়্যারে উচ্চ নিয়ন্ত্রণ হারে চলে। ডিফিউশন অ্যাকশন হেডগুলি ভিএলএ গঠনের জন্য বৃহৎ দৃষ্টি-ভাষা ব্যাকবোনে বোল্ট করা হচ্ছে, এবং 3D-সচেতন এবং সমতুল্য রূপগুলি নমুনার দক্ষতা উন্নত করে। ডিফিউশন-ভিত্তিক নিয়ন্ত্রণ আশা করুন সাধারণ রোবট 'মস্তিষ্কের' একটি মূল উপাদান হিসেবে থাকবে যা দক্ষ এবং দ্বিমুখী কাজগুলিকে শক্তি দেয়।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি রোবট বাহু একটি টি-আকৃতির ব্লককে লক্ষ্য ভঙ্গিতে ঠেলে দেয়, একটি বেঞ্চমার্ক যেখানে ডিফিউশন নীতি উল্লেখযোগ্যভাবে পূর্বের আচরণ-ক্লোনিং পদ্ধতিগুলিকে ছাড়িয়ে গেছে

বাইম্যানুয়াল রোবট রান্নাঘরের সূক্ষ্ম কাজ শেখে যেমন খাবার উল্টানো বা মানুষের টেলিঅপারেশন ডেমো থেকে অংশগুলি একত্রিত করা

বিশৃঙ্খল-বিন বাছাই যেখানে একাধিক বৈধ উপলব্ধি বিদ্যমান এবং নীতি গড়ের পরিবর্তে একটিতে প্রতিশ্রুতিবদ্ধ

দৃষ্টি-ভাষা-অ্যাকশন সিস্টেমের মধ্যে অ্যাকশন-হেড মডিউল দক্ষ হাতের জন্য মসৃণ উচ্চ-ফ্রিকোয়েন্সি গতি তৈরি করে

ঝুঁকি এবং প্রহরী

প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।

মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।

আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।

2

প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।

3

কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।

4

মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Policy for Robot Control quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Diffusion Policy for Robot Control?

ডিফিউশন পলিসি রোবট নিয়ন্ত্রণে স্টেবল ডিফিউশনের মতো ইমেজ জেনারেটরের পিছনে একই ডিনোইসিং ধারণা প্রয়োগ করে: একটি একক পরবর্তী ক্রিয়া ভবিষ্যদ্বাণী করার পরিবর্তে, এটি পুনরাবৃত্তিমূলকভাবে শোরগোল পরিমার্জন করে ভবিষ্যতের ক্রিয়াগুলির একটি সম্পূর্ণ সংক্ষিপ্ত ক্রম তৈরি করে। এটি গুরুত্বপূর্ণ কারণ এটি বাস্তব ম্যানিপুলেশনের অগোছালো, মাল্টি-মডেল প্রকৃতিকে পুরানো পদ্ধতির চেয়ে অনেক ভালোভাবে পরিচালনা করে।

একটি ডিফিউশন নীতি প্রতিটি সিদ্ধান্তের পয়েন্টে কী তৈরি করে?

ডিফিউশন পলিসি একটি বিচ্ছিন্ন কমান্ডের পরিবর্তে একটি অ্যাকশন খণ্ড তৈরি করে — অ্যাকশনের বেশ কয়েকটি ভবিষ্যত টাইমস্টেপ — ডিনোইসিংয়ের মাধ্যমে।

ডিফিউশন পলিসি ইমেজ এআই থেকে কোন উত্পাদনশীল কৌশল ধার করে?

ইমেজ ডিফিউশন মডেলের মতো, এটি শব্দ থেকে শুরু হয় এবং পুনরাবৃত্তিমূলকভাবে অস্বীকার করে, কিন্তু এখানে আউটপুটটি পর্যবেক্ষণের উপর শর্তযুক্ত একটি অ্যাকশন ট্র্যাজেক্টোরি।

মাল্টি-মোডাল টাস্কের কোন সমস্যাটি ডিফিউশন পলিসি সাধারণ রিগ্রেশনের চেয়ে ভাল সমাধান করে?

যখন বেশ কিছু ক্রিয়া বৈধ হয় (যেমন, বাম বা ডানে ধরুন), রিগ্রেশন গড় তাদের একটি দুর্বল মধ্যম বিকল্পে পরিণত করে; বিস্তার একটি একক মোড পরিষ্কারভাবে প্রতিশ্রুতিবদ্ধ করতে পারেন.

প্রশিক্ষণের সময়, ডিফিউশন পলিসিতে নেটওয়ার্ককে কী ভবিষ্যদ্বাণী করতে শেখানো হয়?

গাউসিয়ান আওয়াজ প্রদর্শিত ক্রিয়াগুলিতে যোগ করা হয় এবং নেটওয়ার্কটি সেই শব্দ (পর্যবেক্ষণের শর্তযুক্ত) ভবিষ্যদ্বাণী করতে শেখে, যা স্ট্যান্ডার্ড ডিনোইসিং উদ্দেশ্য।

ডিফিউশন পলিসিতে 'রিসিডিং-হরাইজন' রিপ্ল্যানিং কী?

নীতিটি কর্মের একটি অংশের ভবিষ্যদ্বাণী করে কিন্তু পর্যায়ক্রমে নতুন পর্যবেক্ষণ ব্যবহার করে পুনরায় পরিকল্পনা করে, প্রতিক্রিয়াশীলতার সাথে সাময়িক সামঞ্জস্যের ভারসাম্য বজায় রাখে।