Q-Kujifunza
Q-Learning ni kanuni ya uimarishaji ya kujifunza ambayo hufundisha wakala ni hatua gani hulipa vizuri zaidi kwa kujifunza hatua kwa hatua thamani ya kila hatua kupitia majaribio na makosa.
Muhtasari
It matters because it can find optimal behavior without ever being told the rules of its environment.
Dive ya kina
Q-Learning hujifunza chaguo la kukokotoa liitwalo Q(s, a): thawabu ya muda mrefu inayotarajiwa ya kuchukua hatua 'a' katika hali 's' na kisha kutenda ipasavyo baadaye. Wakala huanza kujua chochote, anajaribu vitendo, na anaona zawadi. Baada ya kila hatua inaelekeza makadirio yake ya thamani ya Q kuelekea zawadi ambayo imepokelewa hivi karibuni pamoja na punguzo bora zaidi la thamani inayotarajia kutoka katika hali inayofuata. Muhimu zaidi, ni 'isiyo na sera' na 'isiyo na kielelezo': inaweza kujifunza sera bora huku ikigundua bila mpangilio, na haihitaji kamwe mfano wa jinsi ulimwengu unavyobadilika. Kwa kuzingatia ugunduzi wa kutosha wa kila jozi ya hatua ya serikali, thamani za Q zinaungana hadi maadili bora zaidi, na hatua bora zaidi katika hali yoyote ni ile iliyo na Q ya juu zaidi.
Ufahamu wa Kiufundi
Msingi ni sasisho la Bellman: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. Alpha ni kiwango cha kujifunza, gamma kipengele cha punguzo kinachoweka uzito wa zawadi za siku zijazo, na neno lililowekwa kwenye mabano ni kosa la tofauti ya muda. 'Upeo' juu ya hatua zinazofuata ndio huifanya kuwa nje ya sera na kuiruhusu kujifunza sera bora ya uchoyo hata wakati wa kuchunguza. Ugunduzi kwa kawaida hushughulikiwa na uteuzi wa vitendo vya uchoyo wa epsilon.
Athari za kimkakati
Cost and budget
Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.
Maamuzi ya wazi zaidi
Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.
Quality control
Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.
Mustakabali wa Kujifunza Q
Tabular ya kawaida ya Kujifunza kwa Q-inatatizika wakati hali ni nyingi sana kuhifadhi katika jedwali. Mwelekeo mkuu ni kuichanganya na mitandao ya neva, kama ilivyo kwa Deep Q-Networks (DQN), ambayo inakadiria thamani za Q kutoka kwa ingizo ghafi kama vile saizi. Utafiti unaendelea kuhusu kuleta utulivu huu kwa kucheza tena uzoefu, mitandao lengwa, na vibadala kama vile DQN Maradufu na Mafunzo ya Usambazaji ya Q ambayo hupunguza upendeleo wa kukadiria kupita kiasi na kuwakilisha ugawaji kamili wa faida badala ya wastani mmoja.
Utekelezaji wa Ulimwengu Halisi
Mawakala wa kucheza mchezo wa Atari (DeepMind's DQN) wakijifunza kucheza Breakout na Pong moja kwa moja kutoka kwa saizi za skrini.
Kuboresha muda wa mwanga wa trafiki kwenye makutano ili kupunguza jumla ya muda wa kusubiri wa gari
Urambazaji wa roboti kupitia gridi ya taifa au maze ambapo roboti hujifunza njia fupi ya kuongeza zawadi
Uamuzi wa bei thabiti na orodha ambapo wakala hujifunza ni hatua gani huongeza faida ya muda mrefu.
Hatari & Walinzi
Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.
Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.
Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.
Ramani ya Utekelezaji
Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.
Benchmark chini ya mzigo halisi na hali ya data.
Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.
Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Q-Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Kupanga Kiwango cha Kujifunza
Maswali yanayoulizwa mara kwa mara
What is Q-Learning?
Q-Learning ni kanuni ya uimarishaji ya kujifunza ambayo hufundisha wakala ni hatua gani hulipa vizuri zaidi kwa kujifunza hatua kwa hatua thamani ya kila hatua kupitia majaribio na makosa. Ni muhimu kwa sababu inaweza kupata tabia bora bila kuambiwa sheria za mazingira yake.
Q-thamani Q(s, a) inawakilisha nini?
Maswali, a) hukadiria jumla ya punguzo la zawadi ya baadaye kutokana na kuchukua hatua katika jimbo na kutenda vyema baada ya hapo, si tu zawadi ya papo hapo.
Kwa nini Q-Learning inaelezewa kama 'isiyo ya sera'?
Upeo zaidi ya hatua zinazofuata unamaanisha Mafunzo ya Q hujifunza thamani ya sera bora ya uchoyo hata wakati wakala anachunguza kwa kutumia sera tofauti ya tabia.
Katika sheria ya sasisho, kipengele cha punguzo cha gamma kinadhibiti nini?
Gamma (kati ya 0 na 1) inapunguza zawadi za siku zijazo; thamani karibu na 1 hufanya wakala kuona mbali, thamani karibu na 0 huifanya kuwa na uoni fupi.
Je, ni kosa gani la tofauti ya muda (TD) katika Q-Learning?
Hitilafu ya TD ni pengo kati ya makadirio mapya ya lengo (zawadi pamoja na thamani iliyopunguzwa zaidi ya siku zijazo) na makadirio ya zamani ya Q; sasisho hupunguza pengo hili.
Kwa nini mafunzo ya Q-Learning ya jedwali yanapambana na matatizo makubwa kama vile michezo ya video kutoka kwa saizi?
Jedwali la uchunguzi linahitaji ingizo kwa kila jozi ya hatua ya serikali, ambayo haiwezekani wakati mataifa yanafikia mabilioni, na hivyo kuhamasisha wakadiriaji wa mtandao wa neva kama vile DQN.