Q-Learning
Q-Learning shine ƙarfafawa koyo algorithm wanda ke koyar da wakili wanda ayyuka suka fi dacewa ta hanyar koyon ƙimar kowane motsi ta hanyar gwaji da kuskure.
Dubawa
It matters because it can find optimal behavior without ever being told the rules of its environment.
Zurfafa nutsewa
Q-Learning yana koyon aikin da ake kira Q(s, a): lada na dogon lokaci da ake tsammanin ɗaukar mataki 'a' a cikin jaha's' sannan kuma yayi aiki da kyau bayan haka. Wakilin ya fara sanin komai, yana gwada ayyuka, kuma yana lura da lada. Bayan kowane mataki yana ƙididdige ƙimar Q-darajar sa zuwa ga ladan da aka karɓa tare da mafi kyawun ƙima mai rangwame na gaba da yake tsammani daga jiha ta gaba. Mahimmanci, ba shi da 'kayan siyasa' da 'kyakkyawan tsari': yana iya koyan mafi kyawun manufa yayin bincike ba da gangan ba, kuma baya buƙatar samfurin yadda duniya ke canzawa. Idan aka ba da isasshen bincike na kowane nau'i-nau'i na jihohi, ƙimar Q-ƙimar suna iya haɗuwa zuwa mafi kyawun dabi'u, kuma mafi kyawun aiki a kowace jiha shine kawai wanda yake da mafi girman Q.
Fahimtar Fasaha
Babban shine sabunta Bellman: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a'Q(s',a') - Q(s,a)]. Alpha shine ƙimar koyo, gamma rangwamen ma'auni mai nauyin lada na gaba, kuma madaidaicin lokaci shine kuskuren bambancin ɗan lokaci. Babban 'max' a kan ayyuka na gaba shine abin da ya sa ya zama mara amfani kuma yana ba shi damar koyon ingantacciyar manufa ko da yayin bincike. Ana gudanar da bincike yawanci tare da zaɓin aikin epsilon-m.
Dabarun Tasiri
Kudin da kasafin kuɗi
Hukunce-hukuncen gine-gine suna haifar da aiki da tsadar aiki na shekaru.
Shawarwari masu haske
Ilimin fasaha yana taimaka wa ƙungiyoyi su zaɓi tari mai kyau, ba kawai sabon abu ba.
Kula da inganci
Zaɓuɓɓukan injiniya mafi kyau suna rage abin dogaro a cikin samarwa.
Makomar Q-Learning
Q-Learning na al'ada yana gwagwarmaya lokacin da jihohi suka yi yawa don adanawa a cikin tebur. Babban jagora yana haɗa shi tare da cibiyoyin sadarwa na jijiyoyi, kamar a cikin Deep Q-Networks (DQN), waɗanda ke ƙayyadaddun ƙimar Q daga albarkatun albarkatun kamar pixels. Bincike ya ci gaba da tabbatar da wannan tare da sake kunnawa gogewa, cibiyoyin sadarwa da aka yi niyya, da bambance-bambancen karatu kamar Double DQN da Q-Learning na rarraba wanda ke rage girman ƙima kuma yana wakiltar cikakken rabon dawowa maimakon matsakaita guda ɗaya.
Aiwatar da Gaskiyar Duniya
Wakilan wasan Atari (DeepMind's DQN) koyan kunna Breakout da Pong kai tsaye daga pixels allo
Haɓaka lokacin hasken zirga-zirga a tsaka-tsaki don rage jimlar lokacin jiran abin hawa
Kewayawa Robot ta hanyar grid ko maze inda mutum-mutumi ya koyi mafi guntun hanya mafi girman lada
Madaidaicin farashin farashi da yanke shawarar ƙira inda wakili ya koyi ayyukan da ke haɓaka riba mai tsayi
Hatsari & Tsare-tsare
Haɓaka ma'auni ɗaya na iya ɓoye manyan raunin tsarin.
Sau da yawa ana raina kayan more rayuwa da kuma kuɗin kulawa.
Tsaro da gibin lura na iya girma yayin da tsarin ke ƙara haɓaka.
Taswirar Hanya
Ƙayyade latency, inganci, da maƙasudin farashi kafin aiwatarwa.
Alamar ma'auni a ƙarƙashin ainihin kaya da yanayin bayanai.
Kula da kayan aiki don kurakurai, ɗigo, da tasirin mai amfani.
Shirya bijirowa da hanyoyin mayar da martani kafin sikeli.
Ci gaba da Bincike
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Q-Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Jagora na gaba
Jadawalin Yawan Koyo
Tambayoyin da ake yawan yi
What is Q-Learning?
Q-Learning shine ƙarfafawa koyo algorithm wanda ke koyar da wakili wanda ayyuka suka fi dacewa ta hanyar koyon ƙimar kowane motsi ta hanyar gwaji da kuskure. Yana da mahimmanci saboda yana iya samun kyakkyawan hali ba tare da an gaya masa ƙa'idodin muhallinsa ba.
Menene Q-darajar Q(s, a) ke wakilta?
Q(s, a) yana ƙididdige jimillar lada mai rangwame na gaba daga ɗaukar mataki a cikin jihohi da kuma nuna kyakkyawan hali bayan haka, ba kawai lada nan take ba.
Me yasa aka siffanta Q-Learning a matsayin 'kayan siyasa'?
Max a kan ayyuka na gaba yana nufin Q-Learning yana koyon ƙimar ingantacciyar manufa ko da yayin da wakili ya bincika da wata manufar ɗabi'a ta daban.
A cikin ka'idar sabuntawa, menene rangwamen gamma ke sarrafa?
Gamma (tsakanin 0 da 1) yana rangwamen lada na gaba; dabi'u a kusa da 1 suna sa wakilin ya zama mai hangen nesa, ƙimar kusa da 0 suna sa shi gajeriyar hangen nesa.
Menene bambancin ɗan lokaci (TD) a cikin Q-Learning?
Kuskuren TD shine tazarar da ke tsakanin sabon kiyasin manufa (lada da mafi kyawun rangwamen ƙima na gaba) da tsohuwar ƙimayar Q; sabuntawa yana raguwa da wannan rata.
Me yasa a sarari Q-Learning ke gwagwarmaya tare da manyan matsaloli kamar wasannin bidiyo daga pixels?
Teburin dubawa yana buƙatar shigarwa kowane nau'i-nau'i-nau'i na jiha, wanda ba zai yuwu ba lokacin da jihohi ke da adadin biliyoyin, yana ƙarfafa kusantar cibiyar sadarwa kamar DQN.