GHID de fundamente

Învățare de întărire multi-agenți

Multi-Agent Reinforcement Learning (MARL) antrenează mai mulți agenți de învățare care împărtășesc un mediu, fiecare adaptându-și comportamentul, în timp ce ceilalți se adaptează și ei.

2 minute de lecturăUltima actualizare

Prezentare generală

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

Scufundare în profunzime

În învățarea prin consolidare cu un singur agent, un agent învață o politică prin maximizarea recompensei într-un mediu fix. MARL adaugă mai mulți agenți, iar asta schimbă totul: din punctul de vedere al fiecărui agent, mediul nu este staționar, deoarece ceilalți continuă să își schimbe politicile. Agenții pot fi cooperanți (împart o recompensă de echipă, cum ar fi roboții care joacă fotbal), competitivi (cu sumă zero, cum ar fi pokerul sau urmărirea-evaziune) sau mixți. Cercetătorii folosesc formalisme precum jocurile Markov (jocuri stocastice) care generalizează Procesul de decizie Markov cu un singur agent. Rezultatele celebre includ AlphaStar de la DeepMind care ajunge la Grandmaster în StarCraft II și OpenAI Cinci echipe profesioniste Dota 2 care au învins, ambele bazându-se pe populații de agenți antrenați unul împotriva celuilalt prin joc propriu.

Perspectivă tehnică

O provocare de bază este non-staționaritatea: pe măsură ce fiecare agent își actualizează politica, ceilalți se confruntă cu o țintă în mișcare, astfel încât învățarea independentă naivă nu poate converge. O remediere populară este antrenamentul centralizat cu execuție descentralizată (CTDE), utilizat de algoritmi precum MADDPG și QMIX. În timpul antrenamentului, un critic vede observațiile și acțiunile tuturor agenților pentru a calcula gradienți stabili, dar la desfășurare fiecare agent acționează folosind doar propriile observații locale - combinând învățarea coordonată cu operarea practică, independentă.

Impact strategic

Decizii mai clare

Vă ajută să separați afirmațiile tehnice clare de limbajul de marketing.

Cost și buget

Puteți pune întrebări de implementare mai bune înainte de a cheltui bani sau timp.

Echipa și fluxul de lucru

Echipele cu înțelegere comună iau decizii mai bune despre produse, politici și învățare.

Viitorul învățării prin întărire multi-agenți

MARL se îndreaptă către sisteme mai mari, mai deschise, în care agenții intră și ies, și către echipe de agenți bazați pe LLM care negociază, delegă și folosesc instrumente împreună. Așteptați-vă la progrese în ceea ce privește atribuirea de credite scalabile (cine merită recompensa într-o echipă mare), protocoalele de comunicare emergente și garanțiile de siguranță pentru agenții concurenți. Pe măsură ce vehiculele autonome, rețelele energetice și sistemele de tranzacționare interacționează din ce în ce mai mult, coordonarea robustă cu mai mulți agenți - și evitarea coluziunii sau a buclelor de feedback destabilizatoare - devine o preocupare practică și de reglementare centrală.

Implementare în lumea reală

Coordonarea flotelor de roboți de depozit, astfel încât să direcționeze pachetele fără să se ciocnească sau să se blocheze pe culoare

Controlul semnalelor de trafic în care fiecare intersecție este un agent care învață să reducă aglomerația la nivel de oraș

Joc de antrenament AI precum OpenAI Five (Dota 2) și AlphaStar (StarCraft II) prin auto-play printre mulți agenți

Gestionarea ofertelor și a răspunsului la cerere între bateriile distribuite și casele într-o rețea de electricitate inteligentă

Riscuri și balustrade

Echipe diferite pot folosi același termen în mod diferit, așa că definiți domeniul de aplicare din timp.

Benchmark-urile pot părea puternice, în timp ce performanța în lumea reală este neuniformă.

Ignorarea calității datelor și a planurilor de evaluare generează adesea rezultate fragile.

Foaia de parcurs de implementare

1

Începeți cu o definiție simplă a rezultatului de care aveți nevoie.

2

Alegeți o măsură de succes și o condiție de eșec înainte de testare.

3

Rulați un pilot mic cu date reprezentative, nu un set demonstrativ bine definit.

4

Documente unde ajută învățarea prin întărire cu mai mulți agenți și unde metodele mai simple sunt mai bune.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Învățare prin întărire

Întrebări frecvente

What is Multi-Agent Reinforcement Learning?

Multi-Agent Reinforcement Learning (MARL) antrenează mai mulți agenți de învățare care împărtășesc un mediu, fiecare adaptându-și comportamentul, în timp ce ceilalți se adaptează și ei. Contează pentru că majoritatea problemelor din lumea reală — trafic, piețe, echipe de roboți — implică mulți factori de decizie, nu unul singur.

Ce face mediul „non-staționar” din perspectiva unui agent în MARL?

Deoarece fiecare agent își actualizează politica în timpul instruirii, fiecare agent se confruntă efectiv cu o țintă în mișcare — dinamica mediului se schimbă pe măsură ce ceilalți învață.

Ce înseamnă „instruire centralizată cu execuție descentralizată” (CTDE)?

Metodele CTDE precum MADDPG și QMIX exploatează informațiile globale pentru o învățare stabilă, în timp ce fiecare agent execută folosind doar propriile observații.

Ce cadru matematic generalizează MDP cu un singur agent la mai mulți agenți?

Jocurile Markov (numite și jocuri stocastice) extind MDP-urile prin acțiuni comune și recompense per agent pentru mai mulți factori de decizie.

Într-un cadru MARL pur cooperativ, cum este de obicei structurată recompensa?

Setările de cooperare oferă agenților un obiectiv comun, astfel încât provocarea devine coordonarea acțiunilor și atribuirea creditului în cadrul echipei.

Care tehnică permite sistemelor precum OpenAI Five și AlphaStar să se îmbunătățească fără date de joc umane?

Jocul propriu îi pune pe agenți împotriva unor versiuni în evoluție ale lor, creând un curriculum automat al adversarilor din ce în ce mai puternici.