Alapok ÚTMUTATÓ

Többügynök-megerősítő tanulás

A Multi-Agent Reforcement Learning (MARL) több olyan tanuló ágenst képez ki, akiknek közös a környezetük, és mindegyik alkalmazkodik a viselkedéséhez, míg a többiek is alkalmazkodnak.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

Mély merülés

Az együgynökkel végzett megerősítő tanulás során az egyik ügynök úgy tanul meg egy szabályzatot, hogy maximalizálja a jutalmat egy rögzített környezetben. A MARL több ügynököt ad hozzá, és ez mindent megváltoztat: mindegyik ügynök szempontjából a környezet nem stacionárius, mert a többiek folyamatosan változtatják az irányelveiket. Az ügynökök lehetnek együttműködőek (csapatjutalom megosztása, például futballozó robotok), versenyképesek (nulla összegűek, például póker vagy üldözés-elkerülés) vagy vegyesek. A kutatók olyan formalizmusokat használnak, mint a Markov-játékok (sztochasztikus játékok), amelyek általánosítják az együgynök Markov-döntési folyamatát. A híres eredmények közé tartozik a DeepMind AlphaStar, aki elérte a Grandmastert a StarCraft II-ben, és OpenAI Öt profi Dota 2 csapatot győzött le, mindkettő az önjátékon keresztül egymás ellen kiképzett ügynökpopulációra támaszkodik.

Technikai betekintés

Az alapvető kihívás a nem stacionaritás: ahogy minden ügynök frissíti a politikáját, a többiek mozgó célponttal néznek szembe, így a naiv független tanulás nem közelíthet egymáshoz. Egy népszerű megoldás a decentralizált végrehajtással (CTDE) végzett központosított képzés, amelyet olyan algoritmusok használnak, mint a MADDPG és a QMIX. A képzés során a kritikus látja az összes ügynök megfigyelését és tevékenységét a stabil gradiensek kiszámításához, de bevetéskor minden ügynök csak a saját helyi megfigyelései alapján cselekszik – a koordinált tanulást gyakorlati, független működéssel kombinálva.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

A többszereplős megerősítő tanulás jövője

A MARL a nagyobb, nyitottabb rendszerek felé halad, ahol ügynökök lépnek be és távoznak, valamint az LLM-alapú ügynökcsoportok felé, amelyek együtt tárgyalnak, delegálnak és használnak eszközöket. Előrelépésre számíthat a méretezhető hitelkiosztás (aki megérdemli a jutalmat egy nagy csapatban), a kialakuló kommunikációs protokollok és a versenytárs ügynökök biztonsági garanciái terén. Ahogy az autonóm járművek, az energiahálózatok és a kereskedelmi rendszerek egyre inkább kölcsönhatásba lépnek egymással, a robusztus többügynök koordináció – és az összejátszások és a visszacsatolási hurkok destabilizálása – központi gyakorlati és szabályozási szemponttá válik.

Valós megvalósítás

Raktári robotok flottáinak koordinálása, hogy a csomagokat anélkül irányítsák, hogy a folyosókon ütköznének vagy elakadnának

Közlekedési jelzések vezérlése, ahol minden kereszteződés egy ügynök, amely megtanulja csökkenteni a városi torlódásokat

Oktatójátékos mesterséges intelligencia, mint például a OpenAI Five (Dota 2) és az AlphaStar (StarCraft II) számos ügynökön keresztül

Ajánlatok és keresleti válaszok kezelése az elosztott akkumulátorok és otthonok között egy intelligens elektromos hálózatban

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, hol segít a Multi-Agent Reforcement Learning, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Multi-Agent Reinforcement Learning?

A Multi-Agent Reforcement Learning (MARL) több olyan tanuló ágenst képez ki, akiknek közös a környezetük, és mindegyik alkalmazkodik a viselkedéséhez, míg a többiek is alkalmazkodnak. Ez azért fontos, mert a legtöbb valós probléma – forgalom, piacok, robotcsapatok – sok döntéshozót érint, nem egyet.

Mi teszi a környezetet „nem stacionáriussá” egy ügynök szemszögéből a MARL-ban?

Mivel minden ügynök frissíti szabályzatát a képzés során, minden ügynök ténylegesen egy mozgó célponttal néz szembe – a környezet dinamikája változik, ahogy mások tanulnak.

Mit jelent a „centralizált képzés decentralizált végrehajtással” (CTDE)?

A CTDE metódusok, mint például a MADDPG és a QMIX, a globális információkat használják ki a stabil tanulás érdekében, miközben mindegyik ágens csak a saját megfigyeléseit használja.

Melyik matematikai keret általánosítja az együgynökös MDP-t több ügynökre?

A Markov-játékok (más néven sztochasztikus játékok) kiterjesztik az MDP-ket azáltal, hogy több döntéshozó közös akcióit és ügynökenként jutalmazza.

A tisztán együttműködő MARL-környezetben hogyan épül fel általában a jutalom?

Az együttműködési beállítások közös célt adnak az ügynököknek, így a kihívás a tevékenységek összehangolása és a csapaton belüli hitelek kiosztása lesz.

Melyik technika teszi lehetővé az olyan rendszerek, mint a OpenAI Five és az AlphaStar fejlesztését emberi játékadatok nélkül?

Az önjáték szembeállítja az ügynököket önmaguk fejlődő verzióival, és létrehozza az egyre erősebb ellenfelek automatikus tantervét.