Uczenie się ze wzmocnieniem wieloagentowym
Uczenie się przez wieloagentowe wzmacnianie (MARL) szkoli kilku agentów uczących się, którzy korzystają ze wspólnego środowiska, a każdy z nich dostosowuje swoje zachowanie, podczas gdy inni też się dostosowują.
Przegląd
It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.
Głębokie nurkowanie
W uczeniu się przez wzmacnianie z udziałem jednego agenta jeden agent uczy się polityki poprzez maksymalizację nagrody w ustalonym środowisku. MARL dodaje więcej agentów, a to wszystko zmienia: z punktu widzenia każdego agenta środowisko jest niestacjonarne, ponieważ pozostali zmieniają swoje zasady. Agenci mogą współpracować (dzielić się nagrodą zespołową, jak roboty grające w piłkę nożną), rywalizować (o sumie zerowej, jak poker lub unikanie pościgu) lub mieszani. Badacze posługują się formalizmami, takimi jak gry Markowa (gry stochastyczne), które uogólniają proces decyzyjny Markowa z jednym agentem. Do słynnych wyników należą: AlphaStar firmy DeepMind, która osiągnęła arcymistrza w StarCraft II oraz OpenAI Pięć pokonanych profesjonalnych drużyn Dota 2, obie opierające się na populacjach agentów szkolonych przeciwko sobie w grze samodzielnej.
Wgląd techniczny
Podstawowym wyzwaniem jest niestacjonarność: gdy każdy agent aktualizuje swoją politykę, pozostali stają w obliczu ruchomego celu, więc naiwne, niezależne uczenie się może nie być zbieżne. Popularną poprawką jest scentralizowane szkolenie ze zdecentralizowanym wykonaniem (CTDE), używane przez algorytmy takie jak MADDPG i QMIX. Podczas szkolenia krytyk widzi obserwacje i działania wszystkich agentów, aby obliczyć stabilne gradienty, ale podczas wdrażania każdy agent działa, korzystając wyłącznie z własnych lokalnych obserwacji, łącząc skoordynowane uczenie się z praktycznym, niezależnym działaniem.
Wpływ strategiczny
Jaśniejsze decyzje
Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.
Koszt i budżet
Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.
Zespół i przepływ pracy
Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.
Przyszłość uczenia się ze wzmocnieniem wieloagentowym
MARL zmierza w kierunku większych, bardziej otwartych systemów, w których agenci wchodzą i wychodzą, oraz w kierunku zespołów agentów opartych na LLM, które wspólnie negocjują, delegują i korzystają z narzędzi. Oczekuj postępu w zakresie skalowalnego przypisywania punktów (kto zasługuje na nagrodę w dużym zespole), nowych protokołów komunikacyjnych i gwarancji bezpieczeństwa dla konkurencyjnych agentów. W miarę coraz większej interakcji pojazdów autonomicznych, sieci energetycznych i systemów handlu, solidna koordynacja wielu agentów – oraz unikanie zmowy lub destabilizujących pętli sprzężenia zwrotnego – staje się głównym problemem praktycznym i regulacyjnym.
Implementacja w świecie rzeczywistym
Koordynowanie flot robotów magazynowych, aby kierować paczki bez kolizji i zakleszczeń w korytarzach
Sterowanie sygnalizacją świetlną, gdzie każde skrzyżowanie jest agentem uczącym się zmniejszania zatorów w całym mieście
Gra szkoleniowa AI, taka jak OpenAI Five (Dota 2) i AlphaStar (StarCraft II), poprzez samodzielną grę wśród wielu agentów
Zarządzanie ofertami i odpowiedzią na zapotrzebowanie wśród rozproszonych baterii i domów w inteligentnej sieci energetycznej
Zagrożenia i poręcze
Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.
Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.
Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.
Plan wdrożenia
Zacznij od jasnej definicji potrzebnego wyniku.
Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.
Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.
Dokument, w którym pomaga wieloagentowe uczenie się ze wzmocnieniem i gdzie lepsze są prostsze metody.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Agent Reinforcement Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Uczenie się przez wzmacnianie
Często zadawane pytania
What is Multi-Agent Reinforcement Learning?
Uczenie się przez wieloagentowe wzmacnianie (MARL) szkoli kilku agentów uczących się, którzy korzystają ze wspólnego środowiska, a każdy z nich dostosowuje swoje zachowanie, podczas gdy inni też się dostosowują. Ma to znaczenie, ponieważ większość problemów w świecie rzeczywistym – ruch uliczny, rynki, zespoły robotów – angażuje wielu decydentów, a nie jednego.
Co sprawia, że środowisko jest „niestacjonarne” z perspektywy jednego agenta w MARL?
Ponieważ każdy agent aktualizuje swoje zasady podczas szkolenia, każdy agent skutecznie stawia czoła ruchomemu celowi — dynamika środowiska zmienia się w miarę uczenia się innych.
Co oznacza „scentralizowane szkolenie ze zdecentralizowaną realizacją” (CTDE)?
Metody CTDE, takie jak MADDPG i QMIX, wykorzystują informacje globalne do stabilnego uczenia się, podczas gdy każdy agent wykonuje działanie, korzystając wyłącznie z własnych obserwacji.
Które ramy matematyczne uogólniają MDP jednego agenta na wielu agentów?
Gry Markowa (zwane także grami stochastycznymi) rozszerzają MDP poprzez wspólne działania i nagrody dla poszczególnych agentów u wielu decydentów.
Jak zazwyczaj skonstruowana jest nagroda w środowisku MARL opartym wyłącznie na współpracy?
Warunki współpracy dają agentom wspólny cel, więc wyzwaniem staje się koordynacja działań i przypisywanie zasług w zespole.
Która technika pozwala na ulepszanie systemów takich jak OpenAI Five i AlphaStar bez konieczności korzystania z danych dotyczących rozgrywki przez człowieka?
W grze samodzielnej agenci walczą z ewoluującymi wersjami samych siebie, tworząc automatyczny program obejmujący coraz silniejszych przeciwników.