মাল্টি-এজেন্ট শক্তিবৃদ্ধি শিক্ষা
মাল্টি-এজেন্ট রিইনফোর্সমেন্ট লার্নিং (MARL) বেশ কয়েকটি লার্নিং এজেন্টকে প্রশিক্ষণ দেয় যারা একটি পরিবেশ ভাগ করে নেয়, প্রত্যেকে তার আচরণকে মানিয়ে নেয় এবং অন্যরাও মানিয়ে নেয়।
ওভারভিউ
It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.
গভীর ডুব
একক-এজেন্ট শক্তিবৃদ্ধি শেখার ক্ষেত্রে, একজন এজেন্ট একটি নির্দিষ্ট পরিবেশে সর্বোচ্চ পুরস্কারের মাধ্যমে একটি নীতি শিখে। MARL আরও এজেন্ট যোগ করে, এবং এটি সবকিছু পরিবর্তন করে: প্রতিটি এজেন্টের দৃষ্টিকোণ থেকে, পরিবেশ অস্থির কারণ অন্যরা তাদের নীতি পরিবর্তন করতে থাকে। এজেন্টরা সমবায় হতে পারে (একটি দলের পুরষ্কার ভাগ করে নেওয়া, যেমন ফুটবল খেলা রোবট), প্রতিযোগিতামূলক (শূন্য-সমষ্টি, যেমন জুজু বা সাধনা-চঞ্চলতা) বা মিশ্র। গবেষকরা মার্কভ গেমস (স্টোকাস্টিক গেমস) এর মতো আনুষ্ঠানিকতা ব্যবহার করেন যা একক-এজেন্ট মার্কভ সিদ্ধান্ত প্রক্রিয়াকে সাধারণীকরণ করে। বিখ্যাত ফলাফলগুলির মধ্যে রয়েছে DeepMind-এর AlphaStar StarCraft II-এ গ্র্যান্ডমাস্টারে পৌঁছানো এবং OpenAI পাঁচটি পেশাদার ডোটা 2 দলকে পরাজিত করে, উভয়ই স্ব-খেলার মাধ্যমে একে অপরের বিরুদ্ধে প্রশিক্ষিত এজেন্টদের জনসংখ্যার উপর নির্ভর করে।
প্রযুক্তিগত অন্তর্দৃষ্টি
একটি মূল চ্যালেঞ্জ হল অ-স্থিরতা: যেহেতু প্রতিটি এজেন্ট তার নীতি আপডেট করে, অন্যরা একটি চলমান লক্ষ্যের মুখোমুখি হয়, তাই নির্বোধ স্বাধীন শিক্ষা একত্রিত হতে ব্যর্থ হতে পারে। একটি জনপ্রিয় সমাধান হল বিকেন্দ্রীভূত এক্সিকিউশন (CTDE) সহ কেন্দ্রীভূত প্রশিক্ষণ, যা MADDPG এবং QMIX এর মত অ্যালগরিদম দ্বারা ব্যবহৃত হয়। প্রশিক্ষণের সময়, একজন সমালোচক স্থিতিশীল গ্রেডিয়েন্ট গণনা করার জন্য সমস্ত এজেন্টদের পর্যবেক্ষণ এবং ক্রিয়াগুলি দেখেন, কিন্তু স্থাপনার সময় প্রতিটি এজেন্ট শুধুমাত্র নিজস্ব স্থানীয় পর্যবেক্ষণ ব্যবহার করে কাজ করে — ব্যবহারিক, স্বাধীন অপারেশনের সাথে সমন্বিত শিক্ষার সমন্বয়।
কৌশলগত প্রভাব
সুস্পষ্ট সিদ্ধান্ত
এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।
খরচ ও বাজেট
অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।
টিম এবং ওয়ার্কফ্লো
ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।
মাল্টি-এজেন্ট শক্তিবৃদ্ধি শিক্ষার ভবিষ্যত
MARL বৃহত্তর, আরও উন্মুক্ত সিস্টেমের দিকে অগ্রসর হচ্ছে যেখানে এজেন্টরা প্রবেশ করে এবং চলে যায় এবং LLM-ভিত্তিক এজেন্টদের দলগুলির দিকে যারা আলোচনা করে, প্রতিনিধিত্ব করে এবং একসাথে সরঞ্জামগুলি ব্যবহার করে। স্কেলযোগ্য ক্রেডিট অ্যাসাইনমেন্টে অগ্রগতি আশা করুন (যারা একটি বড় দলে পুরষ্কারের যোগ্য), জরুরি যোগাযোগ প্রোটোকল এবং প্রতিযোগী এজেন্টদের জন্য নিরাপত্তা গ্যারান্টি। যেহেতু স্বায়ত্তশাসিত যানবাহন, এনার্জি গ্রিড এবং ট্রেডিং সিস্টেমগুলি ক্রমবর্ধমানভাবে ইন্টারঅ্যাক্ট করছে, শক্তিশালী মাল্টি-এজেন্ট সমন্বয় — এবং মিলন এড়ানো বা প্রতিক্রিয়া লুপগুলিকে অস্থিতিশীল করা — একটি কেন্দ্রীয় ব্যবহারিক এবং নিয়ন্ত্রক উদ্বেগ হয়ে উঠেছে।
বাস্তব-বিশ্ব বাস্তবায়ন
গুদামঘর রোবটের বহরের সমন্বয় করা যাতে তারা আইলগুলিতে সংঘর্ষ বা অচলাবস্থা ছাড়াই প্যাকেজগুলিকে রুট করে
ট্রাফিক-সিগন্যাল নিয়ন্ত্রণ যেখানে প্রতিটি চৌরাস্তা একটি এজেন্ট যা শহর জুড়ে যানজট কমাতে শেখে
অনেক এজেন্টদের মধ্যে স্ব-খেলার মাধ্যমে OpenAI Five (Dota 2) এবং AlphaStar (StarCraft II) এর মতো প্রশিক্ষণ গেম
একটি স্মার্ট ইলেক্ট্রিসিটি গ্রিডে বিতরণ করা ব্যাটারি এবং বাড়ির মধ্যে বিড পরিচালনা এবং চাহিদার প্রতিক্রিয়া
ঝুঁকি এবং প্রহরী
বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।
বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।
ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।
বাস্তবায়ন রোডম্যাপ
আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।
পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।
একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷
নথি যেখানে মাল্টি-এজেন্ট রিইনফোর্সমেন্ট লার্নিং সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Agent Reinforcement Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
শক্তিবৃদ্ধি শিক্ষা
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Multi-Agent Reinforcement Learning?
মাল্টি-এজেন্ট রিইনফোর্সমেন্ট লার্নিং (MARL) বেশ কয়েকটি লার্নিং এজেন্টকে প্রশিক্ষণ দেয় যারা একটি পরিবেশ ভাগ করে নেয়, প্রত্যেকে তার আচরণকে মানিয়ে নেয় এবং অন্যরাও মানিয়ে নেয়। এটি গুরুত্বপূর্ণ কারণ বেশিরভাগ বাস্তব-বিশ্বের সমস্যাগুলি - ট্রাফিক, বাজার, রোবটের দল - অনেক সিদ্ধান্ত গ্রহণকারীকে জড়িত করে, একটি নয়।
MARL-এ একজন এজেন্টের দৃষ্টিকোণ থেকে পরিবেশকে কী 'অস্থির' করে তোলে?
যেহেতু প্রতিটি এজেন্ট প্রশিক্ষণের সময় তার নীতি আপডেট করে, প্রতিটি এজেন্ট কার্যকরভাবে একটি চলমান লক্ষ্যের মুখোমুখি হয় — অন্যরা শেখার সাথে সাথে পরিবেশের গতিশীলতা পরিবর্তিত হয়।
'বিকেন্দ্রীভূত এক্সিকিউশন সহ কেন্দ্রীভূত প্রশিক্ষণ' (CTDE) এর অর্থ কী?
CTDE পদ্ধতি যেমন MADDPG এবং QMIX স্থিতিশীল শিক্ষার জন্য বিশ্বব্যাপী তথ্য ব্যবহার করে, যখন প্রতিটি এজেন্ট শুধুমাত্র নিজস্ব পর্যবেক্ষণ ব্যবহার করে সম্পাদন করে।
কোন গাণিতিক কাঠামো একক-এজেন্ট এমডিপিকে একাধিক এজেন্টে সাধারণীকরণ করে?
মার্কোভ গেমস (এটিকে স্টোকাস্টিক গেমসও বলা হয়) একাধিক সিদ্ধান্ত গ্রহণকারীদের মধ্যে যৌথ অ্যাকশন এবং প্রতি-এজেন্ট পুরস্কারের মাধ্যমে MDPs প্রসারিত করে।
একটি বিশুদ্ধভাবে সমবায়ী MARL সেটিংয়ে, সাধারণত কীভাবে পুরষ্কার গঠন করা হয়?
সমবায় সেটিংস এজেন্টদের একটি ভাগ করা উদ্দেশ্য দেয়, তাই চ্যালেঞ্জটি হয়ে ওঠে সমন্বিত ক্রিয়াকলাপ এবং দলের মধ্যে ক্রেডিট বরাদ্দ করা।
কোন কৌশলগুলি মানুষের গেমপ্লে ডেটা ছাড়াই OpenAI ফাইভ এবং আলফাস্টারের মতো সিস্টেমগুলিকে উন্নত করতে দেয়?
ক্রমবর্ধমান শক্তিশালী প্রতিপক্ষের একটি স্বয়ংক্রিয় পাঠ্যক্রম তৈরি করে নিজেদের বিকশিত সংস্করণগুলির বিরুদ্ধে স্ব-প্লে পিট এজেন্ট।