Mafunzo ya Kuimarisha Ajenti nyingi
Mafunzo ya Kuimarisha Ajenti nyingi (MARL) hufunza mawakala kadhaa wa kujifunza wanaoshiriki mazingira, kila mmoja akirekebisha tabia yake huku wengine wakibadilika pia.
Muhtasari
It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.
Dive ya kina
Katika ujifunzaji wa uimarishaji wa wakala mmoja, wakala mmoja hujifunza sera kwa kuongeza zawadi katika mazingira yasiyobadilika. MARL inaongeza mawakala zaidi, na hiyo inabadilisha kila kitu: kutoka kwa maoni ya kila wakala, mazingira sio tuli kwa sababu wengine wanaendelea kubadilisha sera zao. Mawakala wanaweza kuwa na ushirikiano (kushiriki zawadi ya timu, kama vile roboti zinazocheza soka), washindani (sufuri-jumla, kama poker au kukwepa kufuatilia), au mchanganyiko. Watafiti hutumia taratibu kama vile michezo ya Markov (michezo ya kistaarabu) ambayo hujumlisha Mchakato wa Uamuzi wa wakala mmoja wa Markov. Matokeo maarufu ni pamoja na AlphaStar ya DeepMind kufikia Grandmaster katika StarCraft II na OpenAI Timu tano za Dota 2 za kitaalamu zinazoshinda, zote zinategemea idadi ya mawakala waliofunzwa dhidi ya kila mmoja wao kwa kucheza binafsi.
Ufahamu wa Kiufundi
Changamoto kuu ni kutokuwa na msimamo: kila wakala anaposasisha sera yake, wengine hukabiliana na shabaha inayosonga, kwa hivyo kujifunza kwa kujitegemea kwa ujinga kunaweza kushindwa kuungana. Marekebisho maarufu ni mafunzo ya kati na utekelezaji uliogatuliwa (CTDE), unaotumiwa na algoriti kama MADDPG na QMIX. Wakati wa mafunzo, mkosoaji huona uchunguzi na vitendo vya mawakala wote ili kukokotoa viwango thabiti, lakini wakati wa kusambaza kila wakala hutenda kwa kutumia uchunguzi wake wa ndani pekee - kuchanganya ujifunzaji ulioratibiwa na uendeshaji wa vitendo, unaojitegemea.
Athari za kimkakati
Maamuzi ya wazi zaidi
Inakusaidia kutenganisha madai ya wazi ya kiufundi kutoka kwa lugha ya uuzaji.
Cost and budget
Unaweza kuuliza maswali ya utekelezaji bora kabla ya kutumia pesa au wakati.
Timu na mtiririko wa kazi
Timu zenye uelewa wa pamoja hufanya maamuzi bora ya bidhaa, sera na mafunzo.
Mustakabali wa Mafunzo ya Uimarishaji wa Wakala Wengi
MARL inaelekea kwenye mifumo mikubwa, iliyo wazi zaidi ambapo mawakala huingia na kuondoka, na kuelekea timu za mawakala wa LLM ambao hujadiliana, kukabidhi na kutumia zana pamoja. Tarajia maendeleo katika ugawaji wa mikopo unaoweza kuongezeka (ambaye anastahili zawadi katika timu kubwa), itifaki za mawasiliano ibuka, na hakikisho la usalama kwa mawakala washindani. Huku magari yanayojiendesha, gridi za nishati, na mifumo ya biashara inavyozidi kuingiliana, uratibu thabiti wa mawakala wengi - na kuepuka kula njama au mizunguko ya kuleta uthabiti - inakuwa jambo kuu la kiutendaji na la udhibiti.
Utekelezaji wa Ulimwengu Halisi
Kuratibu meli za roboti za ghala ili zipitishe vifurushi bila kugongana au kukwama kwenye njia.
Udhibiti wa ishara za trafiki ambapo kila makutano ni wakala anayejifunza kupunguza msongamano wa jiji zima
Mchezo wa mafunzo wa AI kama OpenAI Tano (Dota 2) na AlphaStar (StarCraft II) kupitia kujicheza kati ya mawakala wengi
Kusimamia zabuni na mwitikio wa mahitaji kati ya betri na nyumba zilizosambazwa katika gridi ya umeme mahiri
Hatari & Walinzi
Timu tofauti zinaweza kutumia neno moja tofauti, kwa hivyo fafanua upeo mapema.
Vigezo vinaweza kuonekana kuwa na nguvu ilhali utendakazi wa ulimwengu halisi haufanani.
Kupuuza ubora wa data na mipango ya tathmini mara nyingi huleta matokeo tete.
Ramani ya Utekelezaji
Anza na ufafanuzi wa lugha rahisi wa matokeo unayohitaji.
Chagua kipimo kimoja cha mafanikio na hali moja ya kutofaulu kabla ya kujaribu.
Tekeleza majaribio madogo yenye data wakilishi, si seti ya onyesho iliyoboreshwa.
Hati ambapo Mafunzo ya Uimarishaji wa Wakala Wengi husaidia na ambapo mbinu rahisi ni bora zaidi.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Agent Reinforcement Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Mafunzo ya Kuimarisha
Maswali yanayoulizwa mara kwa mara
What is Multi-Agent Reinforcement Learning?
Mafunzo ya Kuimarisha Ajenti nyingi (MARL) hufunza mawakala kadhaa wa kujifunza wanaoshiriki mazingira, kila mmoja akirekebisha tabia yake huku wengine wakibadilika pia. Ni muhimu kwa sababu matatizo mengi ya ulimwengu halisi - trafiki, masoko, timu za roboti - huhusisha watoa maamuzi wengi, sio mmoja.
Ni nini hufanya mazingira kuwa 'yasiyosimama' kutoka kwa mtazamo wa wakala mmoja katika MARL?
Kwa sababu kila wakala husasisha sera yake wakati wa mafunzo, kila wakala hukabiliana kikamilifu na lengo linalosonga - mienendo ya mazingira hubadilika wengine wanapojifunza.
Je, 'mafunzo ya kati yenye utekelezaji wa madaraka' (CTDE) inamaanisha nini?
Mbinu za CTDE kama vile MADDPG na QMIX hutumia taarifa za kimataifa kwa ujifunzaji thabiti, huku kila wakala anatekeleza kwa kutumia uchunguzi wake pekee.
Ni mfumo upi wa hisabati unaofanya MDP ya wakala mmoja kuwa mawakala wengi?
Michezo ya Markov (pia inaitwa michezo ya muda mfupi) huongeza MDP kwa kuwa na vitendo vya pamoja na zawadi za kila wakala kwa watoa maamuzi wengi.
Katika mpangilio wa MARL wa ushirika, zawadi hupangwaje kwa kawaida?
Mipangilio ya vyama vya ushirika huwapa mawakala lengo la pamoja, hivyo changamoto inakuwa kuratibu vitendo na kutoa mikopo ndani ya timu.
Ni mbinu gani huruhusu mifumo kama OpenAI Five na AlphaStar kuboresha bila data ya uchezaji wa binadamu?
Mawakala wa mchezo wa kujitegemea hushindana na matoleo yao yanayobadilika, na kuunda mtaala wa kiotomatiki wa wapinzani wanaozidi kuwa na nguvu.