Jagorar Fasaha

Q-Learning

Q-Learning shine ƙarfafawa koyo algorithm wanda ke koyar da wakili wanda ayyuka suka fi dacewa ta hanyar koyon ƙimar kowane motsi ta hanyar gwaji da kuskure.

2 min karatuAn sabunta ta ƙarshe

Dubawa

It matters because it can find optimal behavior without ever being told the rules of its environment.

Zurfafa nutsewa

Q-Learning yana koyon aikin da ake kira Q(s, a): lada na dogon lokaci da ake tsammanin ɗaukar mataki 'a' a cikin jaha's' sannan kuma yayi aiki da kyau bayan haka. Wakilin ya fara sanin komai, yana gwada ayyuka, kuma yana lura da lada. Bayan kowane mataki yana ƙididdige ƙimar Q-darajar sa zuwa ga ladan da aka karɓa tare da mafi kyawun ƙima mai rangwame na gaba da yake tsammani daga jiha ta gaba. Mahimmanci, ba shi da 'kayan siyasa' da 'kyakkyawan tsari': yana iya koyan mafi kyawun manufa yayin bincike ba da gangan ba, kuma baya buƙatar samfurin yadda duniya ke canzawa. Idan aka ba da isasshen bincike na kowane nau'i-nau'i na jihohi, ƙimar Q-ƙimar suna iya haɗuwa zuwa mafi kyawun dabi'u, kuma mafi kyawun aiki a kowace jiha shine kawai wanda yake da mafi girman Q.

Fahimtar Fasaha

Babban shine sabunta Bellman: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a'Q(s',a') - Q(s,a)]. Alpha shine ƙimar koyo, gamma rangwamen ma'auni mai nauyin lada na gaba, kuma madaidaicin lokaci shine kuskuren bambancin ɗan lokaci. Babban 'max' a kan ayyuka na gaba shine abin da ya sa ya zama mara amfani kuma yana ba shi damar koyon ingantacciyar manufa ko da yayin bincike. Ana gudanar da bincike yawanci tare da zaɓin aikin epsilon-m.

Dabarun Tasiri

Kudin da kasafin kuɗi

Hukunce-hukuncen gine-gine suna haifar da aiki da tsadar aiki na shekaru.

Shawarwari masu haske

Ilimin fasaha yana taimaka wa ƙungiyoyi su zaɓi tari mai kyau, ba kawai sabon abu ba.

Kula da inganci

Zaɓuɓɓukan injiniya mafi kyau suna rage abin dogaro a cikin samarwa.

Makomar Q-Learning

Q-Learning na al'ada yana gwagwarmaya lokacin da jihohi suka yi yawa don adanawa a cikin tebur. Babban jagora yana haɗa shi tare da cibiyoyin sadarwa na jijiyoyi, kamar a cikin Deep Q-Networks (DQN), waɗanda ke ƙayyadaddun ƙimar Q daga albarkatun albarkatun kamar pixels. Bincike ya ci gaba da tabbatar da wannan tare da sake kunnawa gogewa, cibiyoyin sadarwa da aka yi niyya, da bambance-bambancen karatu kamar Double DQN da Q-Learning na rarraba wanda ke rage girman ƙima kuma yana wakiltar cikakken rabon dawowa maimakon matsakaita guda ɗaya.

Aiwatar da Gaskiyar Duniya

Wakilan wasan Atari (DeepMind's DQN) koyan kunna Breakout da Pong kai tsaye daga pixels allo

Haɓaka lokacin hasken zirga-zirga a tsaka-tsaki don rage jimlar lokacin jiran abin hawa

Kewayawa Robot ta hanyar grid ko maze inda mutum-mutumi ya koyi mafi guntun hanya mafi girman lada

Madaidaicin farashin farashi da yanke shawarar ƙira inda wakili ya koyi ayyukan da ke haɓaka riba mai tsayi

Hatsari & Tsare-tsare

Haɓaka ma'auni ɗaya na iya ɓoye manyan raunin tsarin.

Sau da yawa ana raina kayan more rayuwa da kuma kuɗin kulawa.

Tsaro da gibin lura na iya girma yayin da tsarin ke ƙara haɓaka.

Taswirar Hanya

1

Ƙayyade latency, inganci, da maƙasudin farashi kafin aiwatarwa.

2

Alamar ma'auni a ƙarƙashin ainihin kaya da yanayin bayanai.

3

Kula da kayan aiki don kurakurai, ɗigo, da tasirin mai amfani.

4

Shirya bijirowa da hanyoyin mayar da martani kafin sikeli.

Ci gaba da Bincike

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Q-Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Fara tambayoyi

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Jagora na gaba

Jadawalin Yawan Koyo

Tambayoyin da ake yawan yi

What is Q-Learning?

Q-Learning shine ƙarfafawa koyo algorithm wanda ke koyar da wakili wanda ayyuka suka fi dacewa ta hanyar koyon ƙimar kowane motsi ta hanyar gwaji da kuskure. Yana da mahimmanci saboda yana iya samun kyakkyawan hali ba tare da an gaya masa ƙa'idodin muhallinsa ba.

Menene Q-darajar Q(s, a) ke wakilta?

Q(s, a) yana ƙididdige jimillar lada mai rangwame na gaba daga ɗaukar mataki a cikin jihohi da kuma nuna kyakkyawan hali bayan haka, ba kawai lada nan take ba.

Me yasa aka siffanta Q-Learning a matsayin 'kayan siyasa'?

Max a kan ayyuka na gaba yana nufin Q-Learning yana koyon ƙimar ingantacciyar manufa ko da yayin da wakili ya bincika da wata manufar ɗabi'a ta daban.

A cikin ka'idar sabuntawa, menene rangwamen gamma ke sarrafa?

Gamma (tsakanin 0 da 1) yana rangwamen lada na gaba; dabi'u a kusa da 1 suna sa wakilin ya zama mai hangen nesa, ƙimar kusa da 0 suna sa shi gajeriyar hangen nesa.

Menene bambancin ɗan lokaci (TD) a cikin Q-Learning?

Kuskuren TD shine tazarar da ke tsakanin sabon kiyasin manufa (lada da mafi kyawun rangwamen ƙima na gaba) da tsohuwar ƙimayar Q; sabuntawa yana raguwa da wannan rata.

Me yasa a sarari Q-Learning ke gwagwarmaya tare da manyan matsaloli kamar wasannin bidiyo daga pixels?

Teburin dubawa yana buƙatar shigarwa kowane nau'i-nau'i-nau'i na jiha, wanda ba zai yuwu ba lokacin da jihohi ke da adadin biliyoyin, yana ƙarfafa kusantar cibiyar sadarwa kamar DQN.