Jagorar Fasaha

Koyon Ƙarfafa Ƙarfafawa

Koyon ƙarfafawa mai jujjuyawar (IRL) yana jujjuya daidaitattun RL: maimakon a ba shi lada da nemo manufa, yana kallon halayen ƙwararru kuma yana ba da aikin ladan ɓoye wanda ke bayyana shi.

2 min karatuAn sabunta ta ƙarshe

Dubawa

This matters because a recovered reward generalizes to new situations far better than directly copied actions.

Zurfafa nutsewa

Koyon ƙarfafa juzu'i yana tambaya: wace manufa dole ne ƙwararren ya bi don ya kasance kamar yadda suka yi? Idan aka ba da zanga-zangar, IRL ta dawo da aikin lada wanda a ƙarƙashinsa wannan ɗabi'ar ta yi kama da mafi kyau (ko kusa-mafi kyau), sannan tana amfani da daidaitaccen RL don samun manufa. Ƙa'idar ita ce haɓakawa - lada mai ilmantarwa yana kama dalilin da yasa a baya hali, don haka wakili zai iya yin aiki da hankali a cikin jihohin da zanga-zangar da ba a rufe ba, ba kamar kullun ɗabi'a wanda kawai ke kwaikwayon ayyuka ba. Matsalar ba ta da tushe: yawancin ayyukan lada suna bayyana ɗabi'a iri ɗaya, gami da marasa ƙarfi. Hanyoyi masu mahimmanci suna warware wannan shubuha, gami da mafi girman hanyoyin da suka fi son lada don sanya gwani a fili mafi kyau, da matsakaicin-entropy IRL, wanda ke ɗaukar mafi ƙarancin rarraba lada daidai da bayanan.

Fahimtar Fasaha

Kalubale na tsakiya shine shubuha: lada na sifili akai-akai yana sa kowace manufa ta zama mafi kyawu, don haka lada da yawa mara iyaka suna bayyana kowace zanga-zanga. Matsakaicin-entropy IRL yana warware wannan ta hanyar yin zane-zane kamar yadda aka zana daga rarraba inda yuwuwar yanayin ke girma da yawa tare da jimillar lada. This yields a unique, well-defined objective and naturally handles noisy, imperfect experts, since suboptimal trajectories simply receive lower but nonzero probability rather than being ruled out.

Dabarun Tasiri

Kudin da kasafin kuɗi

Hukunce-hukuncen gine-gine suna haifar da aiki da tsadar aiki na shekaru.

Shawarwari masu haske

Ilimin fasaha yana taimaka wa ƙungiyoyi su zaɓi tari mai kyau, ba kawai sabon abu ba.

Kula da inganci

Zaɓuɓɓukan injiniya mafi kyau suna rage abin dogaro a cikin samarwa.

Makomar Koyon Ƙarfafa Ƙarfafawa

IRL yana ƙara haɓaka koyo don daidaitawa: maimakon lada na code na ɗan adam, tsarin yana ba da ƙimar abin da mutane ke ƙima daga halaye da amsawa. Yi tsammanin hanyoyin haɗin gwiwa tare da ƙarfafa koyo daga ra'ayoyin ɗan adam da koyan fifiko, ƙira zuwa ƙirar harshe da saitunan mutum-mutumi. Bincike yana matsawa zuwa ga maido da lada daga danyen bidiyo da kallo, da kuma zuwa ga tabbataccen lada waɗanda ke ƙin satar lada da matsalolin shubuha waɗanda ke addabar hanyoyin yau.

Aiwatar da Gaskiyar Duniya

Motoci masu cin gashin kansu waɗanda ke da alaƙa da abubuwan da ake so na tuƙi (lalata, iyakokin tsaro) daga direbobin ɗan adam

Robots koyan makasudin ɗawainiya daga zanga-zangar ɗan adam zuwa gabaɗaya zuwa sabbin shimfidu

Samfuran masu tafiya a ƙasa ko motsin dabba ta hanyar dawo da manufofin da ke bayan abubuwan da aka lura

Ƙididdigar lada don daidaitawar AI, koyan ƙimar ɗan adam daga zaɓin da aka nuna

Hatsari & Tsare-tsare

Haɓaka ma'auni ɗaya na iya ɓoye manyan raunin tsarin.

Sau da yawa ana raina kayan more rayuwa da kuma kuɗin kulawa.

Tsaro da gibin lura na iya girma yayin da tsarin ke ƙara haɓaka.

Taswirar Hanya

1

Ƙayyade latency, inganci, da maƙasudin farashi kafin aiwatarwa.

2

Alamar ma'auni a ƙarƙashin ainihin kaya da yanayin bayanai.

3

Kula da kayan aiki don kurakurai, ɗigo, da tasirin mai amfani.

4

Shirya bijirowa da hanyoyin mayar da martani kafin sikeli.

Ci gaba da Bincike

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Inverse Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Fara tambayoyi

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Jagora na gaba

Ƙarfafa Koyo Daga Sauraron Dan Adam

Tambayoyin da ake yawan yi

What is Inverse Reinforcement Learning?

Koyon ƙarfafawa mai jujjuyawar (IRL) yana jujjuya daidaitattun RL: maimakon a ba shi lada da nemo manufa, yana kallon halayen ƙwararru kuma yana ba da aikin ladan ɓoye wanda ke bayyana shi. Wannan yana da mahimmanci saboda ladan da aka kwato ya bambanta zuwa sabbin yanayi fiye da ayyukan da aka kwafi kai tsaye.

Menene koyarwar ƙarfafawar juzu'i ke nufin murmurewa?

IRL tana ɗaukar nunin nuni azaman shigarwa kuma tana ƙaddamar da aikin lada wanda a ƙarƙashinsa halayen ƙwarar suka bayyana mafi kyau.

Me yasa aka kwatanta matsalar IRL a matsayin rashin lafiya ko rashin tabbas?

Ayyukan lada da yawa, gami da lada mara ƙarancin sifili, na iya sa halayen da aka lura su zama mafi kyawu, don haka ba a ƙayyade lada ta musamman ta hanyar zanga-zanga kaɗai ba.

Wane mahimmin fa'ida ne maido da lada sama da cloning ɗabi'a?

Aikin lada yana ɓoye dalilin da ya sa ƙwararren ya yi aiki kamar yadda ya yi, yana barin manufofin da aka samo su yi aiki da hankali a cikin sabbin jihohi, yayin da rufewa kawai kwafin ayyukan da aka gani a cikin bayanan.

Ta yaya matsakaicin-entropy IRL ke warware shubuhar lada?

Max-entropy IRL yana ɗaukan yanayin lada mai girma ya fi yuwuwa, yana ba da manufa ta musamman wacce kuma ke jure wa ƙwararrun ajizai, masu hayaniya.

Bayan IRL ta dawo da aikin lada, menene yawanci ake yi na gaba?

IRL yana samar da lada, wanda sannan a mika shi ga al'adar RL algorithm don ƙididdige ingantacciyar manufa a ƙarƙashin wannan haƙiƙa.