Многоагентное обучение с подкреплением
Многоагентное обучение с подкреплением (MARL) обучает несколько обучающихся агентов, которые используют общую среду, каждый из которых адаптирует свое поведение, в то время как другие тоже адаптируются.
Обзор
It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.
Глубокое погружение
При обучении с подкреплением с одним агентом один агент изучает политику, максимизируя вознаграждение в фиксированной среде. MARL добавляет больше агентов, и это меняет все: с точки зрения каждого агента среда нестационарна, потому что остальные продолжают менять свою политику. Агенты могут быть совместными (разделять командную награду, как роботы, играющие в футбол), соревновательными (с нулевой суммой, как покер или преследование-уклонение) или смешанными. Исследователи используют формализмы, такие как марковские игры (стохастические игры), которые обобщают марковский процесс принятия решений с одним агентом. Среди известных результатов — AlphaStar от DeepMind, достигшая уровня гроссмейстера в StarCraft II, и OpenAI, победившие пять профессиональных команд Dota 2, обе из которых полагаются на группы агентов, обученных друг против друга посредством самостоятельной игры.
Техническая информация
Основной проблемой является нестационарность: поскольку каждый агент обновляет свою политику, остальные сталкиваются с движущейся целью, поэтому наивное независимое обучение может не совпасть. Популярным решением является централизованное обучение с децентрализованным выполнением (CTDE), используемое такими алгоритмами, как MADDPG и QMIX. Во время обучения критик видит наблюдения и действия всех агентов, чтобы вычислить стабильные градиенты, но при развертывании каждый агент действует, используя только свои собственные локальные наблюдения, сочетая скоординированное обучение с практической независимой работой.
Стратегическое воздействие
Более четкие решения
Это поможет вам отделить четкие технические заявления от маркетингового языка.
Стоимость и бюджет
Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.
Команда и рабочий процесс
Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.
Будущее многоагентного обучения с подкреплением
MARL движется к более крупным и открытым системам, в которые агенты входят и выходят, а также к командам агентов на базе LLM, которые вместе договариваются, делегируют и используют инструменты. Ожидайте прогресса в области масштабируемого присвоения кредитов (кто заслуживает вознаграждения в большой команде), новых протоколов связи и гарантий безопасности для конкурирующих агентов. Поскольку автономные транспортные средства, энергетические сети и торговые системы все чаще взаимодействуют, надежная межагентная координация и предотвращение сговора или дестабилизирующих петель обратной связи становятся центральной практической и нормативной проблемой.
Реальная реализация
Координация парков складских роботов, чтобы они направляли пакеты без столкновений и блокировок в проходах.
Управление светофором, где каждый перекресток является агентом, который учится уменьшать пробки в масштабе города.
Обучение искусственного интеллекта в играх, таких как OpenAI Five (Dota 2) и AlphaStar (StarCraft II), посредством самостоятельной игры среди множества агентов.
Управление предложениями и реагированием спроса между распределенными батареями и домами в интеллектуальной электросети
Риски и ограничения
Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.
Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.
Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.
Дорожная карта реализации
Начните с простого определения желаемого результата.
Перед тестированием выберите один показатель успеха и одно условие отказа.
Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.
Документ, в котором помогает многоагентное обучение с подкреплением и где более простые методы лучше.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Agent Reinforcement Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Обучение с подкреплением
Часто задаваемые вопросы
What is Multi-Agent Reinforcement Learning?
Многоагентное обучение с подкреплением (MARL) обучает несколько обучающихся агентов, которые используют общую среду, каждый из которых адаптирует свое поведение, в то время как другие тоже адаптируются. Это важно, потому что большинство реальных проблем — дорожное движение, рынки, команды роботов — затрагивают многих лиц, принимающих решения, а не одного.
Что делает среду «нестационарной» с точки зрения одного агента в MARL?
Поскольку каждый агент обновляет свою политику во время обучения, каждый агент фактически сталкивается с движущейся целью — динамика среды меняется по мере обучения других.
Что означает «централизованное обучение с децентрализованным исполнением» (CTDE)?
Методы CTDE, такие как MADDPG и QMIX, используют глобальную информацию для стабильного обучения, в то время как каждый агент выполняет, используя только свои собственные наблюдения.
Какая математическая основа обобщает одноагентный MDP на несколько агентов?
Марковские игры (также называемые стохастическими играми) расширяют возможности MDP за счет совместных действий и вознаграждений для каждого агента среди нескольких лиц, принимающих решения.
Как обычно структурируется вознаграждение в условиях чисто кооперативного MARL?
Кооперативные условия дают агентам общую цель, поэтому задачей становится координация действий и распределение заслуг внутри команды.
Какой метод позволяет улучшить такие системы, как OpenAI Five и AlphaStar, без данных об игровом процессе, выполняемых человеком?
Самостоятельная игра сталкивает агентов с развивающимися версиями самих себя, автоматически создавая учебную программу из все более сильных противников.