Műszaki ÚTMUTATÓ

Q-Learning

A Q-Learning egy megerősítő tanulási algoritmus, amely megtanítja az ügynöknek, hogy mely tevékenységek kifizetődőek a legjobban azáltal, hogy próbálgatásokon és tévedéseken keresztül fokozatosan megtanulják az egyes lépések értékét.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it can find optimal behavior without ever being told the rules of its environment.

Mély merülés

A Q-Learning megtanulja a Q(s, a) nevű függvényt: a várt hosszú távú jutalmat, ha az 's' állapotban végrehajtja az 'a' műveletet, majd utána optimálisan cselekszik. Az ügynök semmit sem tud, cselekményeket próbál, és megfigyeli a jutalmakat. Minden egyes lépés után a Q-érték becslését az imént kapott jutalom és a legjobb diszkontált jövőbeli érték felé tolja, amelyet a következő állapottól vár. Lényeges, hogy „politikán kívüli” és „modellmentes”: a legjobb politikát tanulhatja meg véletlenszerű felfedezés közben, és nincs szüksége modellre a világ átalakulásáról. Ha minden állapot-művelet pár kellőképpen feltárja, a Q-értékek bizonyíthatóan az optimális értékekhez konvergálnak, és bármely állapotban a legjobb cselekvés egyszerűen az, amelyik a legmagasabb Q-val rendelkezik.

Technikai betekintés

A mag a Bellman frissítés: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. Az alfa a tanulási sebesség, a gamma a jövőbeli jutalmakat súlyozó diszkonttényező, a zárójelben szereplő tag pedig az időbeli különbség hiba. A következő lépések „maximuma” az, ami a politika hatályon kívül helyezi, és lehetővé teszi, hogy a mohó optimális politikát még felfedezés közben is megtanulja. A felfedezést általában epszilon-mohó akcióválasztással kezelik.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A Q-Learning jövője

A klasszikus táblázatos Q-Learning nehézségekkel küzd, amikor túl sok állapot van ahhoz, hogy egy táblázatban tároljuk. A domináns irány a neurális hálózatokkal való kombinálás, mint például a Deep Q-Networks (DQN) esetében, amely a Q-értékeket a nyers bemenetekből, például pixelekből közelíti meg. Folytatódnak a kutatások ennek stabilizálására tapasztalat-visszajátszással, célhálózatokkal és olyan változatokkal, mint a Double DQN és a disztribúciós Q-Learning, amelyek csökkentik a túlbecslési torzítást, és teljes hozameloszlást képviselnek, nem pedig egyedi átlagokat.

Valós megvalósítás

Az Atari játékügynökei (DeepMind's DQN) megtanulják a Breakout és a Pong játékot közvetlenül a képernyő képpontjairól

A közlekedési lámpák időzítésének optimalizálása a kereszteződésekben a jármű teljes várakozási idejének minimalizálása érdekében

Robotnavigáció egy rácson vagy labirintuson keresztül, ahol a robot megtanulja a legrövidebb jutalommaximalizáló utat

Dinamikus árképzési és készletezési döntések, ahol az ügynök megtanulja, hogy mely műveletek maximalizálják a hosszú távú profitot

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Q-Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Tanulási ütem ütemezése

Gyakran ismételt kérdések

What is Q-Learning?

A Q-Learning egy megerősítő tanulási algoritmus, amely megtanítja az ügynöknek, hogy mely tevékenységek kifizetődőek a legjobban azáltal, hogy próbálgatásokon és tévedéseken keresztül fokozatosan megtanulják az egyes lépések értékét. Ez azért fontos, mert képes megtalálni az optimális viselkedést anélkül, hogy megmondanák neki a környezete szabályait.

Mit jelent a Q(s, a) Q-érték?

A Q(s, a) a teljes diszkontált jövőbeli jutalmat becsüli meg az s állapotban végrehajtott a cselekvésből, és azt követően optimálisan viselkedik, nem csak az azonnali jutalmat.

Miért nevezik a Q-Learninget „irányzaton kívülinek”?

A következő műveletek maximuma azt jelenti, hogy a Q-Learning megtanulja a mohó optimális irányelv értékét, még akkor is, ha az ügynök más viselkedési politikával kutat.

A frissítési szabályban mit szabályoz a diszkonttényező gamma?

A gamma (0 és 1 között) kedvezményeket biztosít a jövőbeni jutalmakhoz; az 1-hez közeli értékek az ügynököt távollátóvá, a 0-hoz közeli értékek rövidlátóvá teszik.

Mi az időbeli különbség (TD) hiba a Q-Learningben?

A TD hiba az új célbecslés (jutalom plusz legjobb diszkontált jövőbeli érték) és a régi Q-becslés közötti különbség; a frissítés csökkenti ezt a rést.

Miért küzd az egyszerű táblázatos Q-Learning olyan nagy problémákkal, mint a pixelekből származó videojátékok?

A keresési táblához állapot-művelet páronként be kell írni, ami nem kivitelezhető, ha az állapotok száma milliárdokban haladja meg a neurális hálózati közelítőket, például a DQN-t.