Awọn ipilẹ Itọsọna

Multi-Agent Imudara Ẹkọ

Ẹkọ Imudara Aṣoju Olona-Aṣoju (MARL) ṣe ikẹkọ ọpọlọpọ awọn aṣoju ikẹkọ ti o pin agbegbe kan, ọkọọkan ṣe adaṣe ihuwasi rẹ lakoko ti awọn miiran tun ṣe deede.

2 min kakẹhin imudojuiwọn

Akopọ

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

Jin Dive

Ni ẹkọ imuduro oluranlowo ẹyọkan, aṣoju kan kọ ẹkọ eto imulo nipa mimu ẹsan pọ si ni agbegbe ti o wa titi. MARL ṣe afikun awọn aṣoju diẹ sii, ati pe o yi ohun gbogbo pada: lati oju-ọna aṣoju kọọkan, agbegbe ko ni iduro nitori awọn miiran n yipada awọn eto imulo wọn. Awọn aṣoju le jẹ ifọwọsowọpọ (pinpin ere ẹgbẹ kan, bii awọn roboti-bọọlu afẹsẹgba), ifigagbaga (apapọ-odo, bii ere ere ere tabi ilepa-sapa), tabi idapọpọ. Awọn oniwadi lo awọn ilana ilana gẹgẹbi awọn ere Markov (awọn ere stochastic) ti o ṣe gbogbogbo ilana ilana ipinnu Markov aṣoju-ọkan. Awọn abajade olokiki pẹlu DeepMind's AlphaStar ti o de Grandmaster ni StarCraft II ati OpenAI Awọn ẹgbẹ Dota 2 ti o ṣẹgun ọjọgbọn, mejeeji gbarale awọn olugbe ti awọn aṣoju ti o kọkọ si ara wọn nipasẹ ere-ara-ẹni.

Imọ-imọ-ẹrọ

Ipenija pataki kan kii ṣe iduro: bi gbogbo aṣoju ṣe n ṣe imudojuiwọn eto imulo rẹ, awọn miiran dojukọ ibi-afẹde gbigbe kan, nitorinaa ikẹkọ ominira alaigbọran le kuna lati pejọ. Atunṣe olokiki jẹ ikẹkọ ti aarin pẹlu ipaniyan isọdọtun (CTDE), ti a lo nipasẹ awọn algoridimu bii MADDPG ati QMIX. Lakoko ikẹkọ, alariwisi kan rii gbogbo awọn akiyesi awọn aṣoju ati awọn iṣe lati ṣe iṣiro awọn gradients iduroṣinṣin, ṣugbọn ni imuṣiṣẹ aṣoju kọọkan n ṣiṣẹ ni lilo awọn akiyesi agbegbe tirẹ nikan - apapọ ẹkọ iṣọpọ pẹlu adaṣe, iṣẹ ominira.

Ipa Ilana

Awọn ipinnu diẹ sii

O ṣe iranlọwọ fun ọ lati ya sọtọ awọn iṣeduro imọ-ẹrọ lati ede tita.

Iye owo ati isuna

O le beere awọn ibeere imuse to dara julọ ṣaaju lilo owo tabi akoko.

Ẹgbẹ ati ṣiṣan iṣẹ

Awọn ẹgbẹ pẹlu oye pinpin ṣe ọja to dara julọ, eto imulo, ati awọn ipinnu ikẹkọ.

Ọjọ iwaju ti Ẹkọ Imudara Aṣoju pupọ

MARL n lọ si ọna ti o tobi, awọn ọna ṣiṣe ṣiṣi silẹ nibiti awọn aṣoju ti nwọle ati lọ kuro, ati si awọn ẹgbẹ ti awọn aṣoju LLM ti o ṣe idunadura, aṣoju, ati lo awọn irinṣẹ papọ. Reti ilọsiwaju lori iṣẹ iyansilẹ kirẹditi ti iwọn (ẹniti o yẹ ere ni ẹgbẹ nla kan), awọn ilana ibaraẹnisọrọ pajawiri, ati awọn iṣeduro aabo fun awọn aṣoju idije. Bii awọn ọkọ ayọkẹlẹ adase, awọn grids agbara, ati awọn eto iṣowo npọ si ibaraenisepo, isọdọkan aṣoju-pupọ - ati yago fun ifọkanbalẹ tabi awọn iṣiparọ awọn iṣiparọ esi - di iwulo aringbungbun ati ibakcdun ilana.

Real-World imuse

Ṣiṣakoṣo awọn ọkọ oju-omi kekere ti awọn roboti ile-ipamọ nitori wọn ṣe itọsọna awọn idii laisi ikọlu tabi titiipa ni awọn ọna

Iṣakoso-ifihan agbara ijabọ nibiti ikorita kọọkan jẹ aṣoju ti nkọ ẹkọ lati dinku idinku jakejado ilu

Ere ikẹkọ AI bii OpenAI marun (Dota 2) ati AlphaStar (StarCraft II) nipasẹ ere-ara ẹni laarin ọpọlọpọ awọn aṣoju

Ṣiṣakoṣo awọn idu ati idahun ibeere laarin awọn batiri ti a pin kaakiri ati awọn ile ni akoj ina mọnamọna ọlọgbọn

Awọn ewu & Awọn ọna iṣọ

Awọn ẹgbẹ oriṣiriṣi le lo ọrọ kanna ni oriṣiriṣi, nitorinaa ṣalaye iwọn ni kutukutu.

Awọn aṣepari le wo lagbara lakoko ti iṣẹ-aye gidi ko ṣe deede.

Aibikita didara data ati awọn ero igbelewọn nigbagbogbo ṣẹda awọn abajade ẹlẹgẹ.

Ilana Ilana imuse

1

Bẹrẹ pẹlu itumọ-ede itele ti abajade ti o nilo.

2

Mu metiriki aṣeyọri kan ati ipo ikuna kan ṣaaju idanwo.

3

Ṣiṣe awakọ kekere kan pẹlu data aṣoju, kii ṣe eto demo didan.

4

Iwe-ipamọ nibiti Ẹkọ Imudara Aṣoju pupọ ṣe iranlọwọ ati nibiti awọn ọna ti o rọrun dara julọ.

Tesiwaju Ṣiṣawari

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bẹrẹ adanwo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Awọn ibeere ti a beere nigbagbogbo

What is Multi-Agent Reinforcement Learning?

Ẹkọ Imudara Aṣoju Olona-Aṣoju (MARL) ṣe ikẹkọ ọpọlọpọ awọn aṣoju ikẹkọ ti o pin agbegbe kan, ọkọọkan ṣe adaṣe ihuwasi rẹ lakoko ti awọn miiran tun ṣe deede. O ṣe pataki nitori ọpọlọpọ awọn iṣoro gidi-aye - ijabọ, awọn ọja, awọn ẹgbẹ ti awọn roboti - kan ọpọlọpọ awọn oluṣe ipinnu, kii ṣe ọkan.

Kini o jẹ ki ayika naa jẹ 'ti kii ṣe iduro' lati irisi aṣoju kan ni MARL?

Nitoripe gbogbo aṣoju ṣe imudojuiwọn eto imulo rẹ lakoko ikẹkọ, aṣoju kọọkan ni imunadoko dojukọ ibi-afẹde gbigbe kan - awọn agbara ayika yipada bi awọn miiran ṣe kọ ẹkọ.

Kini 'ikẹkọ ti aarin pẹlu ipaniyan isọdọtun' (CTDE) tumọ si?

Awọn ọna CTDE bii MADDPG ati QMIX lo nilokulo alaye agbaye fun ẹkọ iduroṣinṣin, lakoko ti aṣoju kọọkan ṣiṣẹ ni lilo awọn akiyesi tirẹ nikan.

Iru ilana mathematiki wo ni o ṣe akopọ MDP aṣoju-ọkan si awọn aṣoju pupọ?

Awọn ere Markov (ti a tun pe ni awọn ere sitokasitik) fa awọn MDPs pọ si nipa nini awọn iṣe apapọ ati awọn ere aṣoju-kọọkan kọja awọn oluṣe ipinnu pupọ.

Ninu eto MARL ti o ni ifọwọsowọpọ, bawo ni ẹsan ṣe jẹ eto deede?

Awọn eto ifọwọsowọpọ fun awọn aṣoju ni ibi-afẹde ti o pin, nitorinaa ipenija naa di awọn iṣe iṣakojọpọ ati yiyan kirẹditi laarin ẹgbẹ naa.

Ilana wo ni o jẹ ki awọn ọna ṣiṣe bii OpenAI marun ati AlphaStar ni ilọsiwaju laisi data imuṣere eniyan?

Iṣere-ara ẹni ṣe awọn aṣoju lodi si awọn ẹya ti o dagbasoke ti ara wọn, ṣiṣẹda iwe-ẹkọ adaṣe adaṣe ti awọn alatako ti o lagbara pupọ si.