बुनियादी गाइड

मल्टी-एजेंट सुदृढीकरण सीखना

मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (एमएआरएल) कई शिक्षण एजेंटों को प्रशिक्षित करता है जो एक वातावरण साझा करते हैं, प्रत्येक अपने व्यवहार को अनुकूलित करता है जबकि अन्य भी अनुकूलन करते हैं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

गहरा गोता

एकल-एजेंट सुदृढीकरण सीखने में, एक एजेंट एक निश्चित वातावरण में इनाम को अधिकतम करके एक नीति सीखता है। MARL अधिक एजेंट जोड़ता है, और इससे सब कुछ बदल जाता है: प्रत्येक एजेंट के दृष्टिकोण से, वातावरण गैर-स्थिर है क्योंकि अन्य लोग अपनी नीतियां बदलते रहते हैं। एजेंट सहयोगी हो सकते हैं (टीम का इनाम साझा करना, जैसे फुटबॉल खेलने वाले रोबोट), प्रतिस्पर्धी (शून्य-राशि, जैसे पोकर या पीछा-चोरी), या मिश्रित। शोधकर्ता मार्कोव गेम (स्टोकेस्टिक गेम) जैसी औपचारिकताओं का उपयोग करते हैं जो एकल-एजेंट मार्कोव निर्णय प्रक्रिया को सामान्यीकृत करते हैं। प्रसिद्ध परिणामों में डीपमाइंड के अल्फास्टार का स्टारक्राफ्ट II में ग्रैंडमास्टर तक पहुंचना और OpenAI पांच पेशेवर Dota 2 टीमों को हराना शामिल है, दोनों स्वयं-खेल के माध्यम से एक-दूसरे के खिलाफ प्रशिक्षित एजेंटों की आबादी पर निर्भर हैं।

तकनीकी अंतर्दृष्टि

एक मुख्य चुनौती गैर-स्थिरता है: जैसे-जैसे प्रत्येक एजेंट अपनी नीति को अद्यतन करता है, दूसरों को एक गतिशील लक्ष्य का सामना करना पड़ता है, इसलिए अनुभवहीन स्वतंत्र शिक्षा एकजुट होने में विफल हो सकती है। एक लोकप्रिय समाधान विकेन्द्रीकृत निष्पादन (CTDE) के साथ केंद्रीकृत प्रशिक्षण है, जिसका उपयोग MADDPG और QMIX जैसे एल्गोरिदम द्वारा किया जाता है। प्रशिक्षण के दौरान, एक आलोचक स्थिर ग्रेडिएंट की गणना करने के लिए सभी एजेंटों के अवलोकन और कार्यों को देखता है, लेकिन तैनाती के समय प्रत्येक एजेंट केवल अपने स्वयं के स्थानीय अवलोकनों का उपयोग करके कार्य करता है - व्यावहारिक, स्वतंत्र संचालन के साथ समन्वित शिक्षण का संयोजन।

सामरिक प्रभाव

स्पष्ट निर्णय

यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।

लागत और बजट

आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।

टीम और वर्कफ़्लो

साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।

मल्टी-एजेंट सुदृढीकरण सीखने का भविष्य

एमएआरएल बड़ी, अधिक खुली प्रणालियों की ओर बढ़ रहा है जहां एजेंट प्रवेश करते हैं और चले जाते हैं, और एलएलएम-आधारित एजेंटों की टीमों की ओर बढ़ रहे हैं जो एक साथ बातचीत करते हैं, सौंपते हैं और उपकरणों का उपयोग करते हैं। स्केलेबल क्रेडिट असाइनमेंट (जो एक बड़ी टीम में इनाम के हकदार हैं), उभरते संचार प्रोटोकॉल और प्रतिस्पर्धी एजेंटों के लिए सुरक्षा गारंटी पर प्रगति की उम्मीद करें। जैसे-जैसे स्वायत्त वाहन, ऊर्जा ग्रिड और ट्रेडिंग सिस्टम तेजी से बातचीत कर रहे हैं, मजबूत मल्टी-एजेंट समन्वय - और मिलीभगत या अस्थिर फीडबैक लूप से बचना - एक केंद्रीय व्यावहारिक और नियामक चिंता का विषय बन गया है।

वास्तविक विश्व कार्यान्वयन

गोदाम रोबोटों के बेड़े का समन्वय करना ताकि वे गलियारों में टकराव या गतिरोध के बिना पैकेजों को रूट कर सकें

ट्रैफ़िक-सिग्नल नियंत्रण जहां प्रत्येक चौराहा शहर-व्यापी भीड़भाड़ को कम करने के लिए सीखने वाला एक एजेंट है

कई एजेंटों के बीच सेल्फ-प्ले के माध्यम से OpenAI फाइव (Dota 2) और अल्फास्टार (StarCraft II) जैसे प्रशिक्षण गेम AI

स्मार्ट बिजली ग्रिड में वितरित बैटरियों और घरों के बीच बोलियों और मांग प्रतिक्रिया का प्रबंधन करना

जोखिम और रेलिंग

अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।

बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।

डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।

कार्यान्वयन रोडमैप

1

आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।

2

परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।

3

प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।

4

दस्तावेज़ जहां मल्टी-एजेंट सुदृढीकरण सीखना मदद करता है और जहां सरल तरीके बेहतर हैं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Multi-Agent Reinforcement Learning?

मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (एमएआरएल) कई शिक्षण एजेंटों को प्रशिक्षित करता है जो एक वातावरण साझा करते हैं, प्रत्येक अपने व्यवहार को अनुकूलित करता है जबकि अन्य भी अनुकूलन करते हैं। यह मायने रखता है क्योंकि अधिकांश वास्तविक दुनिया की समस्याएं - यातायात, बाजार, रोबोट की टीमें - इसमें एक नहीं बल्कि कई निर्णय लेने वाले शामिल होते हैं।

MARL में एक एजेंट के दृष्टिकोण से पर्यावरण को 'गैर-स्थिर' क्या बनाता है?

क्योंकि प्रत्येक एजेंट प्रशिक्षण के दौरान अपनी नीति को अद्यतन करता है, प्रत्येक एजेंट प्रभावी ढंग से एक गतिशील लक्ष्य का सामना करता है - जैसे-जैसे अन्य लोग सीखते हैं, पर्यावरण की गतिशीलता बदल जाती है।

'विकेंद्रीकृत निष्पादन के साथ केंद्रीकृत प्रशिक्षण' (सीटीडीई) का क्या मतलब है?

MADDPG और QMIX जैसी CTDE विधियां स्थिर सीखने के लिए वैश्विक जानकारी का उपयोग करती हैं, जबकि प्रत्येक एजेंट केवल अपने स्वयं के अवलोकनों का उपयोग करके कार्यान्वित करता है।

कौन सा गणितीय ढांचा एकल-एजेंट एमडीपी को कई एजेंटों के लिए सामान्यीकृत करता है?

मार्कोव गेम्स (जिन्हें स्टोकेस्टिक गेम्स भी कहा जाता है) कई निर्णय निर्माताओं के बीच संयुक्त कार्रवाई और प्रति-एजेंट पुरस्कार देकर एमडीपी का विस्तार करते हैं।

विशुद्ध रूप से सहकारी MARL सेटिंग में, इनाम को आम तौर पर कैसे संरचित किया जाता है?

सहकारी सेटिंग्स एजेंटों को एक साझा उद्देश्य देती हैं, इसलिए टीम के भीतर कार्यों का समन्वय करना और श्रेय देना चुनौती बन जाती है।

कौन सी तकनीक मानव गेमप्ले डेटा के बिना OpenAI फाइव और अल्फास्टार जैसे सिस्टम को बेहतर बनाती है?

सेल्फ-प्ले एजेंटों को स्वयं के विकसित होते संस्करणों के विरुद्ध खड़ा करता है, जिससे तेजी से मजबूत विरोधियों का एक स्वचालित पाठ्यक्रम तैयार होता है।