MUHIMMAN JAGORA

Koyon Ƙarfafa Ƙwararrun Wakilai

Multi-Agent Reinforcement Learning (MARL) yana horar da wakilan ilmantarwa da yawa waɗanda ke raba yanayi, kowannensu yana daidaita halayensa yayin da sauran kuma suka dace.

2 min karatuAn sabunta ta ƙarshe

Dubawa

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

Zurfafa nutsewa

A cikin koyon ƙarfafawa wakili guda ɗaya, wakili ɗaya yana koyon manufa ta hanyar haɓaka lada a ƙayyadaddun yanayi. MARL yana ƙara ƙarin wakilai, kuma hakan yana canza komai: daga ra'ayin kowane wakili, yanayin ba na tsaye bane saboda sauran suna ci gaba da canza manufofinsu. Wakilai na iya zama masu haɗin kai (raba lada, kamar mutummutumi na wasan ƙwallon ƙafa), gasa (jimillar sifili, kamar karta ko guje-guje), ko gauraye. Masu bincike suna amfani da ƙa'idodi irin su Markov games (wasannin stochastic) waɗanda ke ba da cikakken tsari na yanke shawara Markov wakili ɗaya. Shahararrun sakamako sun haɗa da DeepMind's AlphaStar isa Grandmaster a cikin StarCraft II da OpenAI ƙwararrun ƙwararrun Dota 2 sun sha kashi biyar, dukansu sun dogara ga yawan wakilai da aka horar da juna ta hanyar wasan kai.

Fahimtar Fasaha

Babban ƙalubale shine rashin tsayawa: yayin da kowane wakili ke sabunta manufofinsa, sauran suna fuskantar manufa mai motsi, don haka koyo mai zaman kansa na butulci zai iya kasa haɗuwa. Shahararren gyare-gyare shine horo na tsakiya tare da aiwatar da yanke hukunci (CTDE), wanda algorithms kamar MADDPG da QMIX ke amfani dashi. A lokacin horo, mai suka yana ganin duk abubuwan lura da ayyuka na wakilai don ƙididdige gradients masu tsayayye, amma yayin tura kowane wakili yana yin amfani da abubuwan lura na cikin gida kawai - haɗa haɗin ilmantarwa tare da aiki mai zaman kansa.

Dabarun Tasiri

Shawarwari masu haske

Yana taimaka muku keɓance bayyanannen da'awar fasaha daga harshen talla.

Kudin da kasafin kuɗi

Kuna iya yin mafi kyawun tambayoyin aiwatarwa kafin kashe kuɗi ko lokaci.

Ƙungiya da aikin aiki

Ƙungiyoyin da ke da fahimtar juna suna yin mafi kyawun samfura, manufofi, da yanke shawara na koyo.

Makomar Ƙarfafa Ƙwararrun Wakilai da yawa

MARL yana matsawa zuwa mafi girma, ƙarin buɗaɗɗen tsarin inda wakilai ke shiga da fita, kuma zuwa ga ƙungiyoyin wakilai na LLM waɗanda ke yin shawarwari, wakilai, da amfani da kayan aiki tare. Yi tsammanin ci gaba akan aikin ƙima mai ƙima (wanda ya cancanci lada a cikin babbar ƙungiya), ƙa'idodin sadarwa na gaggawa, da garantin aminci ga wakilai masu fafatawa. Kamar yadda motoci masu cin gashin kansu, grid makamashi, da tsarin ciniki ke ƙara yin hulɗa, ƙaƙƙarfan haɗin kai na wakilai da yawa - da guje wa haɗa baki ko wargaza madaukai na amsa - ya zama babban abin damuwa na aiki da tsari.

Aiwatar da Gaskiyar Duniya

Haɓaka rundunonin na'urorin mutum-mutumi na sito don haka suna bin fakitin ba tare da yin karo ko kashewa a cikin tituna ba

Sarrafa siginar zirga-zirga inda kowane tsaka-tsaki wakili ne mai koyo don rage cunkoso a cikin birni

Wasan horarwa AI kamar OpenAI Biyar (Dota 2) da AlphaStar (StarCraft II) ta hanyar wasan kai tsakanin wakilai da yawa

Sarrafa tallace-tallace da amsa buƙatu a tsakanin batura da gidaje da aka rarraba a cikin grid ɗin wutar lantarki mai wayo

Hatsari & Tsare-tsare

Ƙungiyoyi daban-daban na iya amfani da kalmar iri ɗaya daban, don haka ayyana iyaka da wuri.

Alamomi na iya yin kama da ƙarfi yayin da aikin zahirin duniya bai yi daidai ba.

Yin watsi da ingancin bayanai da tsare-tsaren kimantawa galibi yana haifar da sakamako mara ƙarfi.

Taswirar Hanya

1

Fara da ma'anar harshe a sarari na sakamakon da kuke buƙata.

2

Zaɓi ma'aunin nasara ɗaya da yanayin gazawa ɗaya kafin gwaji.

3

Gudun ƙaramin matukin jirgi tare da bayanan wakilci, ba saitin demo da aka goge ba.

4

Daftarin aiki inda Ilmantar Ƙarfafawar Wakilai da yawa ke taimakawa kuma inda hanyoyin mafi sauƙi suka fi kyau.

Ci gaba da Bincike

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Fara tambayoyi

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Tambayoyin da ake yawan yi

What is Multi-Agent Reinforcement Learning?

Multi-Agent Reinforcement Learning (MARL) yana horar da wakilan ilmantarwa da yawa waɗanda ke raba yanayi, kowannensu yana daidaita halayensa yayin da sauran kuma suka dace. Yana da mahimmanci saboda yawancin matsalolin duniya - zirga-zirga, kasuwanni, ƙungiyoyin robots - sun haɗa da masu yanke shawara da yawa, ba ɗaya ba.

Menene ya sa yanayin ya zama 'ba na tsaye' daga mahallin wakili ɗaya a cikin MARL?

Saboda kowane wakili yana sabunta manufofinsa yayin horo, kowane wakili yana fuskantar manufa mai motsi yadda yakamata - yanayin yanayin yana canzawa yayin da wasu ke koyo.

Menene ma'anar ' horo na tsakiya tare da yanke hukuncin kisa '' (CTDE)?

Hanyoyin CTDE kamar MADDPG da QMIX suna amfani da bayanan duniya don kwanciyar hankali koyo, yayin da kowane wakili yana aiwatar da abubuwan lura nasa kawai.

Wanne tsarin lissafin lissafi ya haɗa MDP mai wakili guda ɗaya zuwa wakilai da yawa?

Wasannin Markov (wanda kuma ake kira wasannin stochastic) suna haɓaka MDPs ta hanyar samun ayyukan haɗin gwiwa da kowane wakili a cikin masu yanke shawara da yawa.

A cikin saitin MARL na haɗin gwiwa kawai, ta yaya ake tsara lada?

Saitunan haɗin gwiwar suna ba wakilai manufa guda ɗaya, don haka ƙalubalen ya zama daidaita ayyuka da ba da ƙima a cikin ƙungiyar.

Wace dabara ce ke barin tsarin kamar OpenAI Biyar da AlphaStar su inganta ba tare da bayanan wasan mutum ba?

Wasa-kai yana jefa wakilai a kan sauye-sauyen nau'ikan nasu, ƙirƙirar tsari ta atomatik na abokan adawar masu ƙarfi.