Q-Jàng
Q-Learning algorithm la buy jàngal nit ñi ban jëf mooy gëna am njariñ, ci di jàng ndànk-ndànk njariñu jéego bu nekk ci jéem ak njuumte.
Résumé
It matters because it can find optimal behavior without ever being told the rules of its environment.
Plongeur bu xóot
Q-Learning dafay jàng benn fonction bu tuddu Q(s, a): neexal bi ñuy seentu ci diir bu yàgg ci jël jëf 'a' ci stade 's' ba noppi jëfandikoo ci anam wu gën ginaaw ga. Agent bi tàmbali xam dara, jéem jëf, di seetlu neexal yi. Ginaaw jéego bu nekk dafay nudge Q-valeur estimation ci neexal bi mu jota jot boole ci valeur future bi gëna baax bi mu xaar ci etaa bi ci topp. Li gëna am solo mooy 'amul benn xeetu politik' te 'amul benn misaal': mën na jàng politik bi gëna baax ci di banneexu ci lu bari, te soxlawul benn misaal buy wane ni àdduna bi di jaar. Buñu sukkandikoo ci jàngat bu doy ci bepp jëf-jëf, Q-valeur yi dañuy jëm ci valeur yi gëna baax, te jëf ji gëna baax ci bépp etaa mooy bi am Q bi gëna kawe.
Gis-gis xarala
Li gëna am solo mooy yeesali Bellman: Q(s,a) <- Q(s,a) + alpha [r + gamma*max_a' Q(s',a') - Q(s,a)]. Alpha mooy tolluwaayu jàng bi, gamma mooy factëru wàññi giy pondéree neexal yi ci ëlëg, ba noppi tur wiñ bind ci biir parenthèse mooy njuumteg wuute gi ci diir bi. 'Max' ci kaw jëf yi ci topp moo tax mu génn ci politik te may ko mu jàng politik bu baax bi doonte dafay banneexu. Exploration dañu koy faral di def ci tànneef jëf epsilon-greedy.
njeextalu pexe
Njëgg ak budget
Dogal yi architecture di jël dañuy indi njariñ ak njëgu liggéey bi ay at ci ginaaw.
dogal yu gëna leer
Njàngalem xarala yi dafay jàppale ekip yi ñu tànn li gën, te baña yam ci li gëna bees daal.
Xool kalite
Tanneef yu gëna baax ci wàllu ingeñër dina wàññi jafe-jafe yi ci wàllu wóor ci liggéey bi.
Ëlëgu Q-Jàng
Q-Learning tablo bu yàgg dafay am jafe-jafe su etaa yi bari lool ba mënu ñu leen denc ci benn tablo. Li gëna am solo mooy boole ko ak reso neuronal, lu melni ci Deep Q-Networks (DQN), ñuy xayma valeur Q yu bawoo ci ay dugal yu melni pixel. Gëstu dafay wéy di dakkal lii ak jaar-jaar ak jaar-jaar, reso yuñ teg, ak anam yu melni Double DQN ak Q-Learning buy wàññi njuumte bu ëpp ba noppi di wane distribution yu mat te baña am benn moyenne.
Doxal ci àdduna dëgg
Agent yiy jouer jeu Atari (DQN bu DeepMind) di jàng jouer Breakout ak Pong ci pixel yu ekraŋ bi
Xaarandi waxtu siñaal yi ci korosma yi ngir wàññi diir bi oto yi di xaar
Navigation robot ci biir griy wala labyrinthe fu robot bi di jàngee yoon wi gëna gàtt ngir am mbégte
Njëg yuy soppeeku ak dogal ci invànteer, di barab bi ab ndawu liggéey di jàngee ban jëf mooy gëna yokk benefiis bi ci diir bu xawa yàgg
Risk yi ak balustrade yi
Optimize benn benchmark mën na nëbb ñakk kattan yu gëna yaatu ci sistem bi.
Njëg li ñuy fay ci infrastructure yi ak ci toppatoo dañuy faral di suufeel.
Bu sistem yi di gëna xawa jafee xam, jafe-jafe yi am ci wàllu kaaraange ak seetlu mën nañu gëna bari.
Roadmap ngir samp gi
Mandargal latency, kalite, ak njëg yi laata ngay jëfandikoo.
Benchmark ci biir sargal ak done yu dëggu.
Jumtukaay bi di saytu njuumte yi, derive bi ak njeextalu jëfandikukat bi.
Waajal rollback ak yooni tontu ci jafe-jafe yi laata ngay eskale.
Weyal di banneexu
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Q-Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Gis bi ci topp
Jamonoy Njàngale
Laaj yi ñuy faral di laaj
What is Q-Learning?
Q-Learning algorithm la buy jàngal nit ñi ban jëf mooy gëna am njariñ, ci di jàng ndànk-ndànk njariñu jéego bu nekk ci jéem ak njuumte. Dafa am solo ndax mën na am jikko ju baax te kenn duko wax sàrti environmaa bi mu nekk.
Lu Q-valeur Q(s, a) di màndargaal?
Q(s, a) xayma limu wàññi ëlëg neexal ci jël jëf a ci réew s ak doxal bu baax ci ganaw, du neexal ci saasi.
Lan moo waral ñuy wax ni Q-Learning nekkul ci wàllu politik?
Max ci kaw jëf yi ci topp dafay tekki ni Q-Learning jàng valeur bu politik bu baax bu ñàkka doylu doonte ndawu liggéey bi dafay banneexu ak politiku doxalin bu wuute.
Ci sàrtu yeesal bi, lan la fakteer gamma biy wàññi?
Gamma (diggante 0 ak 1) dafay wàññi neexal yi ci kanam; valeur yu jege 1 dañuy tax agent bi gis fu sori, valeur yi jege 0 dañu koy def mu sori gis.
Lan moy njuumte ci diggante jamono (TD) ci Q-Learning?
Jumtukaayu TD mooy diggante xayma bu bees biñ nara def (neexal boole ci valeur future bi gëna baax) ak xayma Q bu yàgg bi; yeesal bi dafay wàññi bërëb bi.
Lan moo waral Q-Learning bu tablo bu leer di xeex ak jafe-jafe yu mag yu melni jeu video yu bawoo ci pixel yi?
Tablo seetlu dafa soxla duggal ci peer jëf-etaa, te loolu mënul am sudee etaa yi dañu tollu ci ay miliyaar, di ñaax aproximatëri reso neuronal yu melni DQN.