Q-обучение
Q-Learning е алгоритъм за обучение с подсилване, който учи агент кои действия се отплащат най-добре, като постепенно научава стойността на всеки ход чрез проба и грешка.
Преглед
It matters because it can find optimal behavior without ever being told the rules of its environment.
Дълбоко гмуркане
Q-Learning научава функция, наречена Q(s, a): очакваната дългосрочна награда за предприемане на действие 'a' в състояние '' и след това оптимално действие след това. Агентът започва да не знае нищо, опитва действия и наблюдава награди. След всяка стъпка той избутва своята оценка на Q-стойността към току-що получената награда плюс най-добрата намалена бъдеща стойност, която очаква от следващото състояние. Най-важното е, че е „извън политиката“ и „без модели“: може да научи най-добрата политика, докато проучва произволно, и никога не се нуждае от модел за това как светът се променя. Като се има предвид достатъчно проучване на всяка двойка състояние-действие, Q-стойностите доказуемо се сближават с оптималните стойности и най-доброто действие във всяко състояние е просто това с най-висок Q.
Техническа информация
Ядрото е актуализацията на Bellman: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. Алфа е степента на обучение, гама е факторът на отстъпка, претеглящ бъдещите награди, а терминът в скоби е грешката във времевата разлика. „Максимумът“ над следващите действия е това, което го прави извън политиката и му позволява да научи алчната оптимална политика дори докато проучва. Изследването обикновено се извършва с епсилон-алчен избор на действие.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на Q-Learning
Класическото таблично Q-обучение се бори, когато състоянията са твърде много за съхраняване в таблица. Доминиращата посока е комбинирането му с невронни мрежи, като в Deep Q-Networks (DQN), които приближават Q-стойности от необработени входове като пиксели. Изследванията продължават да стабилизират това с повторение на опит, целеви мрежи и варианти като Double DQN и разпределително Q-обучение, които намаляват пристрастията на надценяването и представляват пълно разпределение на възвращаемостта, а не единични средни стойности.
Внедряване в реалния свят
Агенти за игра на Atari (DQN на DeepMind), които се учат да играят Breakout и Pong директно от екранни пиксели
Оптимизиране на времето на светофара на кръстовищата, за да се сведе до минимум общото време за изчакване на превозното средство
Навигация на робота през решетка или лабиринт, където роботът научава най-краткия път за максимално възнаграждение
Динамични решения за ценообразуване и инвентар, при които агент научава кои действия максимизират дългосрочната печалба
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Q-Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Планиране на скоростта на обучение
Frequently asked questions
What is Q-Learning?
Q-Learning е алгоритъм за обучение с подсилване, който учи агент кои действия се отплащат най-добре, като постепенно научава стойността на всеки ход чрез проба и грешка. Има значение, защото може да намери оптимално поведение, без изобщо да му се казват правилата на неговата среда.
Какво представлява Q-стойността Q(s, a)?
Q(s, a) оценява общата намалена бъдеща награда от предприемане на действие a в състояние s и оптимално поведение след това, а не само незабавната награда.
Защо Q-Learning е описан като „извън правилата“?
Максимумът при следващите действия означава, че Q-Learning научава стойността на алчната оптимална политика, дори докато агентът изследва с различна политика на поведение.
В правилото за актуализиране какво контролира гама-факторът на отстъпка?
Гама (между 0 и 1) намалява бъдещите награди; стойности близо до 1 правят агента далновиден, стойности близо до 0 го правят късоглед.
Каква е грешката във времевата разлика (TD) в Q-Learning?
TD грешката е разликата между новата целева оценка (награда плюс най-добрата намалена бъдеща стойност) и старата Q оценка; актуализацията свива тази празнина.
Защо обикновеният табличен Q-Learning се бори с големи проблеми като видеоигрите от пиксели?
Справочната таблица се нуждае от запис за двойка състояние-действие, което е невъзможно, когато състоянията са милиарди, мотивирайки апроксиматорите на невронни мрежи като DQN.