Технічний КЕРІВНИЦТВО

Q-навчання

Q-Learning — це алгоритм навчання з підкріпленням, який навчає агента, які дії окупаються найкраще, шляхом поступового вивчення цінності кожного кроку методом проб і помилок.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it can find optimal behavior without ever being told the rules of its environment.

Глибоке занурення

Q-Learning вивчає функцію під назвою Q(s, a): очікувана довгострокова винагорода за виконання дії «a» у стані «», а потім оптимальні дії після цього. Агент починає нічого не знати, пробує дії та спостерігає за винагородами. Після кожного кроку він підштовхує свою оцінку Q-value до щойно отриманої винагороди плюс найкращої зниженої майбутньої вартості, яку він очікує від наступного стану. Важливо те, що він «поза політикою» і «без моделей»: він може вивчати найкращу політику під час випадкового дослідження, і йому ніколи не потрібна модель того, як змінюється світ. При достатньому дослідженні кожної пари стан-дія, значення Q доведено збігаються до оптимальних значень, і найкращою дією в будь-якому стані є просто дія з найвищим Q.

Технічне розуміння

Основою є оновлення Bellman: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. Альфа – це швидкість навчання, гамма – коефіцієнт дисконтування, що зважує майбутні винагороди, а термін у дужках – це помилка часової різниці. «Максимум» над наступними діями робить його поза політикою та дозволяє йому вивчати жадібну оптимальну політику навіть під час дослідження. Дослідження, як правило, обробляється за допомогою епсилон-жадного вибору дій.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє Q-Learning

Класичне табличне Q-навчання має труднощі, коли станів забагато для зберігання в таблиці. Домінуючим напрямком є ​​поєднання його з нейронними мережами, як-от Deep Q-Networks (DQN), які апроксимують Q-значення з необроблених вхідних даних, таких як пікселі. Дослідження продовжують стабілізувати це за допомогою відтворення досвіду, цільових мереж і таких варіантів, як подвійний DQN і розподільне Q-навчання, які зменшують упередження переоцінки та представляють повні розподіли прибутку, а не окремі середні значення.

Реалізація в реальному світі

Ігрові агенти Atari (DQN DeepMind) навчаються грати в Breakout і Pong безпосередньо з екранних пікселів

Оптимізація часу роботи світлофора на перехрестях для мінімізації загального часу очікування транспортного засобу

Навігація робота сіткою або лабіринтом, де робот вивчає найкоротший шлях, що максимізує винагороду

Динамічне ціноутворення та рішення щодо запасів, коли агент дізнається, які дії максимізують довгостроковий прибуток

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Q-Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Планування темпів навчання

Часті запитання

What is Q-Learning?

Q-Learning — це алгоритм навчання з підкріпленням, який навчає агента, які дії окупаються найкраще, шляхом поступового вивчення цінності кожного кроку методом проб і помилок. Це важливо, тому що він може знайти оптимальну поведінку, навіть не дізнавшись про правила свого середовища.

Що означає Q-значення Q(s, a)?

Q(s, a) оцінює загальну знижену майбутню винагороду від виконання дії a у стані s та оптимальної поведінки після цього, а не лише негайну винагороду.

Чому Q-Learning названо «поза політикою»?

Максимальна кількість наступних дій означає, що Q-Learning вивчає цінність жадібної оптимальної політики, навіть коли агент досліджує за допомогою іншої політики поведінки.

Чим керує гамма коефіцієнта дисконтування в правилі оновлення?

Гамма (між 0 і 1) знижує майбутні винагороди; значення біля 1 роблять агента далекозорим, значення біля 0 роблять його короткозорим.

Що таке помилка часової різниці (TD) у Q-Learning?

Помилка TD — це розрив між новою цільовою оцінкою (винагорода плюс найкраща дисконтована майбутня вартість) і старою оцінкою Q; оновлення скорочує цю прогалину.

Чому простий табличний Q-Learning бореться з такими великими проблемами, як відеоігри з пікселів?

Пошукова таблиця потребує запису для пари стан-дія, що неможливо, коли стани нараховуються мільярдами, що мотивує апроксиматори нейронних мереж, такі як DQN.