Q-Learning
A Q-Learning egy megerősítő tanulási algoritmus, amely megtanítja az ügynöknek, hogy mely tevékenységek kifizetődőek a legjobban azáltal, hogy próbálgatásokon és tévedéseken keresztül fokozatosan megtanulják az egyes lépések értékét.
Áttekintés
It matters because it can find optimal behavior without ever being told the rules of its environment.
Mély merülés
A Q-Learning megtanulja a Q(s, a) nevű függvényt: a várt hosszú távú jutalmat, ha az 's' állapotban végrehajtja az 'a' műveletet, majd utána optimálisan cselekszik. Az ügynök semmit sem tud, cselekményeket próbál, és megfigyeli a jutalmakat. Minden egyes lépés után a Q-érték becslését az imént kapott jutalom és a legjobb diszkontált jövőbeli érték felé tolja, amelyet a következő állapottól vár. Lényeges, hogy „politikán kívüli” és „modellmentes”: a legjobb politikát tanulhatja meg véletlenszerű felfedezés közben, és nincs szüksége modellre a világ átalakulásáról. Ha minden állapot-művelet pár kellőképpen feltárja, a Q-értékek bizonyíthatóan az optimális értékekhez konvergálnak, és bármely állapotban a legjobb cselekvés egyszerűen az, amelyik a legmagasabb Q-val rendelkezik.
Technikai betekintés
A mag a Bellman frissítés: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. Az alfa a tanulási sebesség, a gamma a jövőbeli jutalmakat súlyozó diszkonttényező, a zárójelben szereplő tag pedig az időbeli különbség hiba. A következő lépések „maximuma” az, ami a politika hatályon kívül helyezi, és lehetővé teszi, hogy a mohó optimális politikát még felfedezés közben is megtanulja. A felfedezést általában epszilon-mohó akcióválasztással kezelik.
Stratégiai hatás
Költség és költségvetés
Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.
Tisztább döntések
A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.
Minőségellenőrzés
A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.
A Q-Learning jövője
A klasszikus táblázatos Q-Learning nehézségekkel küzd, amikor túl sok állapot van ahhoz, hogy egy táblázatban tároljuk. A domináns irány a neurális hálózatokkal való kombinálás, mint például a Deep Q-Networks (DQN) esetében, amely a Q-értékeket a nyers bemenetekből, például pixelekből közelíti meg. Folytatódnak a kutatások ennek stabilizálására tapasztalat-visszajátszással, célhálózatokkal és olyan változatokkal, mint a Double DQN és a disztribúciós Q-Learning, amelyek csökkentik a túlbecslési torzítást, és teljes hozameloszlást képviselnek, nem pedig egyedi átlagokat.
Valós megvalósítás
Az Atari játékügynökei (DeepMind's DQN) megtanulják a Breakout és a Pong játékot közvetlenül a képernyő képpontjairól
A közlekedési lámpák időzítésének optimalizálása a kereszteződésekben a jármű teljes várakozási idejének minimalizálása érdekében
Robotnavigáció egy rácson vagy labirintuson keresztül, ahol a robot megtanulja a legrövidebb jutalommaximalizáló utat
Dinamikus árképzési és készletezési döntések, ahol az ügynök megtanulja, hogy mely műveletek maximalizálják a hosszú távú profitot
Kockázatok és védőkorlátok
Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.
Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.
A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.
Végrehajtási ütemterv
Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.
Benchmark reális terhelési és adatviszonyok mellett.
Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.
A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Q-Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Tanulási ütem ütemezése
Gyakran ismételt kérdések
What is Q-Learning?
A Q-Learning egy megerősítő tanulási algoritmus, amely megtanítja az ügynöknek, hogy mely tevékenységek kifizetődőek a legjobban azáltal, hogy próbálgatásokon és tévedéseken keresztül fokozatosan megtanulják az egyes lépések értékét. Ez azért fontos, mert képes megtalálni az optimális viselkedést anélkül, hogy megmondanák neki a környezete szabályait.
Mit jelent a Q(s, a) Q-érték?
A Q(s, a) a teljes diszkontált jövőbeli jutalmat becsüli meg az s állapotban végrehajtott a cselekvésből, és azt követően optimálisan viselkedik, nem csak az azonnali jutalmat.
Miért nevezik a Q-Learninget „irányzaton kívülinek”?
A következő műveletek maximuma azt jelenti, hogy a Q-Learning megtanulja a mohó optimális irányelv értékét, még akkor is, ha az ügynök más viselkedési politikával kutat.
A frissítési szabályban mit szabályoz a diszkonttényező gamma?
A gamma (0 és 1 között) kedvezményeket biztosít a jövőbeni jutalmakhoz; az 1-hez közeli értékek az ügynököt távollátóvá, a 0-hoz közeli értékek rövidlátóvá teszik.
Mi az időbeli különbség (TD) hiba a Q-Learningben?
A TD hiba az új célbecslés (jutalom plusz legjobb diszkontált jövőbeli érték) és a régi Q-becslés közötti különbség; a frissítés csökkenti ezt a rést.
Miért küzd az egyszerű táblázatos Q-Learning olyan nagy problémákkal, mint a pixelekből származó videojátékok?
A keresési táblához állapot-művelet páronként be kell írni, ami nem kivitelezhető, ha az állapotok száma milliárdokban haladja meg a neurális hálózati közelítőket, például a DQN-t.