Ntụziaka ntọala

Ịmụta nkwado ọtụtụ ndị nnọchi anya

Multi-Agent Reinforcement Learning (MARL) na-azụ ọtụtụ ndị ọrụ mmụta na-ekerịta gburugburu ebe obibi, nke ọ bụla na-emegharị omume ya ebe ndị ọzọ na-emegharịkwa.

2 nkeji na-agụEmelitere ikpeazụ

Nchịkọta

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

Ime miri emi

Na mmụta nkwado otu onye nnọchite anya, otu onye nnọchi anya na-amụta amụma site n'ịkwalite ụgwọ ọrụ na gburugburu ebe edobere. MARL na-agbakwụnye ndị ọrụ ndị ọzọ, nke ahụ na-agbanwekwa ihe niile: site n'echiche onye ọrụ ọ bụla, gburugburu ebe obibi adịghị adị n'ihi na ndị ọzọ na-agbanwe usoro iwu ha. Ndị nnọchi anya nwere ike imekọ ihe ọnụ (ịkekọrịta ụgwọ ọrụ otu, dị ka roboti na-egwu bọl), asọmpi (ego efu, dị ka poker ma ọ bụ ịchụpụ-nchụpụ), ma ọ bụ agwakọta. Ndị na-eme nchọpụta na-eji usoro ihe omume dịka egwuregwu Markov (egwuregwu stochastic) nke na-eme ka usoro mkpebi mkpebi Markov bụrụ otu onye. Nsonaazụ a ma ama gụnyere DeepMind's AlphaStar na-erute Grandmaster na StarCraft II na OpenAI Ndị otu Dota 2 ndị ọkachamara meriri ise, ha abụọ na-adabere na ọnụ ọgụgụ ndị ọrụ zụrụ azụ megide ibe ha site na egwuregwu onwe.

Nghọta nka nka

Isi ihe ịma aka bụ enweghị kwụ ọtọ: ka onye ọrụ ọ bụla na-emelite amụma ya, ndị ọzọ na-eche ebumnuche na-akpali akpali, yabụ mmụta nke enweghị onwe ya nwere ike ịghara ịgbakọta. Ndozi na-ewu ewu bụ ọzụzụ nke etinyere n'etiti ya na mkpochapụ nke enweghị isi (CTDE), nke algọridim dị ka MADDPG na QMIX na-eji. N'oge ọzụzụ, onye nkatọ na-ahụ nleba anya na omume ndị ọrụ niile iji gbakọọ gradients kwụsiri ike, mana na mbugharị onye ọrụ ọ bụla na-eji naanị ihe nleba anya mpaghara ya - na-ejikọta mmụta achikọtara na arụ ọrụ nwere onwe.

Mmetụta atụmatụ

Mkpebi doro anya

Ọ na-enyere gị aka ikewapụta nkwupụta ọrụ aka doro anya na asụsụ ahịa.

Ọnụ ego na mmefu ego

Ị nwere ike ịjụ ajụjụ mmejuputa iwu ka mma tupu itinye ego ma ọ bụ oge.

Team na usoro ọrụ

Ndị otu nwere nghọta na-eme ka ngwaahịa, amụma na mkpebi mmụta ka mma.

Ọdịnihu nke mmụta nkwado ọtụtụ ndị nnọchi anya

MARL na-aga n'ihu na sistemu mepere emepe ka ukwuu ebe ndị ọrụ na-abanye ma na-apụ, na n'ebe otu ndị ọrụ LLM na-akparịta ụka, nyefee, na iji ngwa ọrụ ọnụ. Na-atụ anya ọganihu na ọrụ kredit nwere ike ịba ụba (onye kwesịrị ụgwọ ọrụ n'ime otu nnukwu ìgwè), usoro nzikọrịta ozi ngwa ngwa, na nkwa nchekwa maka ndị nnọchi anya asọmpi. Dị ka ụgbọ ala kwụụrụ onwe, grids ike, na sistemu azụmaahịa na-enwewanye mmekọrịta, nchikota ọtụtụ ndị nnọchite anya siri ike - yana ịzere njikọkọ ma ọ bụ na-emebi loops nzaghachi - na-aghọ nchegbu dị mkpa na usoro iwu.

Mmejuputa n'ezie n'ụwa

Na-ahazi ụgbọ mmiri nke robots ụlọ nkwakọba ihe ka ha na-ebugharị ngwugwu na-enweghị mgbakọ ma ọ bụ kpọchie n'ọnụ ụzọ

Njikwa mgbaama okporo ụzọ ebe nrụrụ aka ọ bụla bụ onye nnọchi anya na-amụta ibelata mkpọkọ obodo

Egwuregwu ọzụzụ AI dị ka OpenAI ise (Dota 2) na AlphaStar (StarCraft II) site na egwuregwu onwe ya n'etiti ọtụtụ ndị ọrụ.

Ijikwa ọnụahịa na nzaghachi chọrọ n'etiti batrị na ụlọ na-ekesa na grid ọkụ eletrik

Ihe ize ndụ & okporo ụzọ nche

Otu dị iche iche nwere ike iji otu okwu ahụ mee ihe n'ụzọ dị iche, yabụ kọwapụta oge n'oge.

Ihe nrịbama nwere ike ịdị ike ebe arụmọrụ ụwa na-adaghị adaba.

Ileghara ogo data na atụmatụ nyocha anya na-emepụtakarị nsonaazụ na-adịghị mma.

Map mmejuputa

1

Malite na nkọwa asụsụ dị larịị nke nsonaazụ ịchọrọ.

2

Họrọ otu metrik ịga nke ọma na otu ọnọdụ ọdịda tupu nnwale.

3

Gbaa obere onye na-anya ụgbọ elu nwere data nnọchite anya, ọ bụghị ihe ngosi ngosi na-egbu maramara.

4

Detuo ebe mmụta mmụta nkwado ọtụtụ ndị nnọchite anya na-enyere aka yana ebe ụzọ ndị dị mfe dị mma.

Nọgide na-eme nchọpụta

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Malite ajụjụ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ajụjụ a na-ajụkarị

What is Multi-Agent Reinforcement Learning?

Multi-Agent Reinforcement Learning (MARL) na-azụ ọtụtụ ndị ọrụ mmụta na-ekerịta gburugburu ebe obibi, nke ọ bụla na-emegharị omume ya ebe ndị ọzọ na-emegharịkwa. Ọ dị mkpa n'ihi na ọtụtụ nsogbu ndị dị n'ụwa - okporo ụzọ, ahịa, ìgwè nke robots - gụnyere ọtụtụ ndị na-eme mkpebi, ọ bụghị otu.

Kedu ihe na-eme ka gburugburu ebe obibi 'abụghị nke kwụ ọtọ' site na otu onye ọrụ na MARL?

N'ihi na onye ọrụ ọ bụla na-emelite amụma ya n'oge ọzụzụ, onye ọrụ ọ bụla na-eche ihu ebumnuche na-akpali akpali - mgbanwe gburugburu ebe obibi na-agbanwe ka ndị ọzọ na-amụta.

Kedu ihe 'ọzụzụ ndị gbasasịrị n'etiti ya na mkpochapụ nke enweghị isi' (CTDE) pụtara?

Ụzọ CTDE dị ka MADDPG na QMIX na-erigbu ozi zuru ụwa ọnụ maka mmụta kwụsiri ike, ebe onye ọrụ ọ bụla na-eji naanị nyocha nke ya.

Kedu usoro mgbakọ na mwepụ na-achịkọta otu onye nnọchite anya MDP nye ọtụtụ ndị ọrụ?

Egwuregwu Markov (nke a na-akpọkwa egwuregwu stochastic) na-agbatị MDP site n'inwe ihe jikọrọ ọnụ na ụgwọ ọrụ onye ọ bụla n'ofe ọtụtụ ndị na-eme mkpebi.

Na ntọala MARL na-akwado ya, kedu ka esi ahazi ụgwọ ọrụ?

Ntọala nkwado na-enye ndị nnọchi anya otu ebumnobi na-ekerịta, yabụ ihe ịma aka ahụ na-aghọ mmemme nhazi na inye otuto n'ime otu.

Kedu usoro na-eme ka sistemu dị ka OpenAI Five na AlphaStar kwalite na-enweghị data egwuregwu mmadụ?

Egwuregwu onwe onye na-emegide ndị nnọchi anya na-agbanwe ụdị onwe ha, na-eke usoro ọmụmụ akpaka nke ndị mmegide siri ike.