MUONGOZO wa Misingi

Mafunzo ya Kuimarisha Ajenti nyingi

Mafunzo ya Kuimarisha Ajenti nyingi (MARL) hufunza mawakala kadhaa wa kujifunza wanaoshiriki mazingira, kila mmoja akirekebisha tabia yake huku wengine wakibadilika pia.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

Dive ya kina

Katika ujifunzaji wa uimarishaji wa wakala mmoja, wakala mmoja hujifunza sera kwa kuongeza zawadi katika mazingira yasiyobadilika. MARL inaongeza mawakala zaidi, na hiyo inabadilisha kila kitu: kutoka kwa maoni ya kila wakala, mazingira sio tuli kwa sababu wengine wanaendelea kubadilisha sera zao. Mawakala wanaweza kuwa na ushirikiano (kushiriki zawadi ya timu, kama vile roboti zinazocheza soka), washindani (sufuri-jumla, kama poker au kukwepa kufuatilia), au mchanganyiko. Watafiti hutumia taratibu kama vile michezo ya Markov (michezo ya kistaarabu) ambayo hujumlisha Mchakato wa Uamuzi wa wakala mmoja wa Markov. Matokeo maarufu ni pamoja na AlphaStar ya DeepMind kufikia Grandmaster katika StarCraft II na OpenAI Timu tano za Dota 2 za kitaalamu zinazoshinda, zote zinategemea idadi ya mawakala waliofunzwa dhidi ya kila mmoja wao kwa kucheza binafsi.

Ufahamu wa Kiufundi

Changamoto kuu ni kutokuwa na msimamo: kila wakala anaposasisha sera yake, wengine hukabiliana na shabaha inayosonga, kwa hivyo kujifunza kwa kujitegemea kwa ujinga kunaweza kushindwa kuungana. Marekebisho maarufu ni mafunzo ya kati na utekelezaji uliogatuliwa (CTDE), unaotumiwa na algoriti kama MADDPG na QMIX. Wakati wa mafunzo, mkosoaji huona uchunguzi na vitendo vya mawakala wote ili kukokotoa viwango thabiti, lakini wakati wa kusambaza kila wakala hutenda kwa kutumia uchunguzi wake wa ndani pekee - kuchanganya ujifunzaji ulioratibiwa na uendeshaji wa vitendo, unaojitegemea.

Athari za kimkakati

Maamuzi ya wazi zaidi

Inakusaidia kutenganisha madai ya wazi ya kiufundi kutoka kwa lugha ya uuzaji.

Cost and budget

Unaweza kuuliza maswali ya utekelezaji bora kabla ya kutumia pesa au wakati.

Timu na mtiririko wa kazi

Timu zenye uelewa wa pamoja hufanya maamuzi bora ya bidhaa, sera na mafunzo.

Mustakabali wa Mafunzo ya Uimarishaji wa Wakala Wengi

MARL inaelekea kwenye mifumo mikubwa, iliyo wazi zaidi ambapo mawakala huingia na kuondoka, na kuelekea timu za mawakala wa LLM ambao hujadiliana, kukabidhi na kutumia zana pamoja. Tarajia maendeleo katika ugawaji wa mikopo unaoweza kuongezeka (ambaye anastahili zawadi katika timu kubwa), itifaki za mawasiliano ibuka, na hakikisho la usalama kwa mawakala washindani. Huku magari yanayojiendesha, gridi za nishati, na mifumo ya biashara inavyozidi kuingiliana, uratibu thabiti wa mawakala wengi - na kuepuka kula njama au mizunguko ya kuleta uthabiti - inakuwa jambo kuu la kiutendaji na la udhibiti.

Utekelezaji wa Ulimwengu Halisi

Kuratibu meli za roboti za ghala ili zipitishe vifurushi bila kugongana au kukwama kwenye njia.

Udhibiti wa ishara za trafiki ambapo kila makutano ni wakala anayejifunza kupunguza msongamano wa jiji zima

Mchezo wa mafunzo wa AI kama OpenAI Tano (Dota 2) na AlphaStar (StarCraft II) kupitia kujicheza kati ya mawakala wengi

Kusimamia zabuni na mwitikio wa mahitaji kati ya betri na nyumba zilizosambazwa katika gridi ya umeme mahiri

Hatari & Walinzi

Timu tofauti zinaweza kutumia neno moja tofauti, kwa hivyo fafanua upeo mapema.

Vigezo vinaweza kuonekana kuwa na nguvu ilhali utendakazi wa ulimwengu halisi haufanani.

Kupuuza ubora wa data na mipango ya tathmini mara nyingi huleta matokeo tete.

Ramani ya Utekelezaji

1

Anza na ufafanuzi wa lugha rahisi wa matokeo unayohitaji.

2

Chagua kipimo kimoja cha mafanikio na hali moja ya kutofaulu kabla ya kujaribu.

3

Tekeleza majaribio madogo yenye data wakilishi, si seti ya onyesho iliyoboreshwa.

4

Hati ambapo Mafunzo ya Uimarishaji wa Wakala Wengi husaidia na ambapo mbinu rahisi ni bora zaidi.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Mafunzo ya Kuimarisha

Maswali yanayoulizwa mara kwa mara

What is Multi-Agent Reinforcement Learning?

Mafunzo ya Kuimarisha Ajenti nyingi (MARL) hufunza mawakala kadhaa wa kujifunza wanaoshiriki mazingira, kila mmoja akirekebisha tabia yake huku wengine wakibadilika pia. Ni muhimu kwa sababu matatizo mengi ya ulimwengu halisi - trafiki, masoko, timu za roboti - huhusisha watoa maamuzi wengi, sio mmoja.

Ni nini hufanya mazingira kuwa 'yasiyosimama' kutoka kwa mtazamo wa wakala mmoja katika MARL?

Kwa sababu kila wakala husasisha sera yake wakati wa mafunzo, kila wakala hukabiliana kikamilifu na lengo linalosonga - mienendo ya mazingira hubadilika wengine wanapojifunza.

Je, 'mafunzo ya kati yenye utekelezaji wa madaraka' (CTDE) inamaanisha nini?

Mbinu za CTDE kama vile MADDPG na QMIX hutumia taarifa za kimataifa kwa ujifunzaji thabiti, huku kila wakala anatekeleza kwa kutumia uchunguzi wake pekee.

Ni mfumo upi wa hisabati unaofanya MDP ya wakala mmoja kuwa mawakala wengi?

Michezo ya Markov (pia inaitwa michezo ya muda mfupi) huongeza MDP kwa kuwa na vitendo vya pamoja na zawadi za kila wakala kwa watoa maamuzi wengi.

Katika mpangilio wa MARL wa ushirika, zawadi hupangwaje kwa kawaida?

Mipangilio ya vyama vya ushirika huwapa mawakala lengo la pamoja, hivyo changamoto inakuwa kuratibu vitendo na kutoa mikopo ndani ya timu.

Ni mbinu gani huruhusu mifumo kama OpenAI Five na AlphaStar kuboresha bila data ya uchezaji wa binadamu?

Mawakala wa mchezo wa kujitegemea hushindana na matoleo yao yanayobadilika, na kuunda mtaala wa kiotomatiki wa wapinzani wanaozidi kuwa na nguvu.