다중 에이전트 강화 학습
MARL(Multi-Agent Reinforcement Learning)은 환경을 공유하는 여러 학습 에이전트를 교육하며, 각 에이전트는 동작을 조정하고 다른 에이전트도 이에 적응합니다.
개요
교통, 시장, 로봇 팀 등 대부분의 실제 문제에는 한 사람이 아닌 많은 의사결정자가 참여하기 때문에 이는 중요합니다.
심층 분석
단일 에이전트 강화 학습에서는 하나의 에이전트가 고정된 환경에서 보상을 최대화하여 정책을 학습합니다. MARL은 더 많은 에이전트를 추가하고 모든 것을 변경합니다. 각 에이전트의 관점에서 보면 다른 에이전트가 정책을 계속 변경하기 때문에 환경은 고정적이지 않습니다. 에이전트는 협력적(축구 경기 로봇과 같은 팀 보상 공유), 경쟁적(포커 또는 추격-회피와 같은 제로섬) 또는 혼합적일 수 있습니다. 연구자들은 단일 에이전트 마르코프 결정 프로세스를 일반화하는 마르코프 게임(확률적 게임)과 같은 형식론을 사용합니다. 유명한 결과로는 DeepMind의 AlphaStar가 StarCraft II에서 Grandmaster에 도달한 것과 OpenAI 5개의 프로 Dota 2 팀이 패배한 것 등이 있습니다. 두 팀 모두 셀프 플레이를 통해 서로 훈련된 요원 집단에 의존합니다.
기술적 통찰력
핵심 과제는 비정상성입니다. 모든 에이전트가 정책을 업데이트하면 다른 에이전트는 움직이는 목표에 직면하게 되므로 순진한 독립적 학습이 수렴되지 않을 수 있습니다. 널리 사용되는 수정 방법은 MADDPG 및 QMIX와 같은 알고리즘에서 사용되는 CTDE(분산 실행을 통한 중앙 집중식 교육)입니다. 훈련 중에 비평가는 안정적인 기울기를 계산하기 위해 모든 에이전트의 관찰과 동작을 확인하지만 배포 시 각 에이전트는 자체 로컬 관찰만 사용하여 동작합니다. 즉, 조정된 학습과 실용적이고 독립적인 작업을 결합합니다.
전략적 영향
더 명확한 결정들
이는 명확한 기술적 주장과 마케팅 언어를 구분하는 데 도움이 됩니다.
비용 및 예산
돈이나 시간을 들이기 전에 더 나은 구현 질문을 할 수 있습니다.
팀과 워크플로우
이해를 공유한 팀은 더 나은 제품, 정책 및 학습 결정을 내립니다.
다중 에이전트 강화 학습의 미래
MARL은 에이전트가 들어오고 나가는 더 크고 개방적인 시스템과 도구를 함께 협상하고 위임하고 사용하는 LLM 기반 에이전트 팀으로 나아가고 있습니다. 확장 가능한 신용 할당(대규모 팀에서 보상을 받을 자격이 있는 사람), 긴급 통신 프로토콜 및 경쟁 에이전트에 대한 안전 보장에 대한 진전을 기대합니다. 자율 주행 차량, 에너지 그리드 및 거래 시스템이 점점 더 상호 작용함에 따라 강력한 다중 에이전트 조정 및 공모 방지 또는 불안정한 피드백 루프가 핵심적인 실무 및 규제 문제가 됩니다.
실제 구현
통로에서 충돌이나 교착 상태 없이 패키지를 라우팅할 수 있도록 여러 창고 로봇을 조정합니다.
각 교차로가 도시 전체의 혼잡을 줄이기 위해 학습하는 에이전트인 교통 신호 제어
OpenAI Five(Dota 2) 및 AlphaStar(StarCraft II)와 같은 게임 AI를 여러 에이전트 간의 셀프 플레이를 통해 교육합니다.
스마트 전력망에서 분산 배터리와 주택 간의 입찰 및 수요 반응 관리
위험 및 가드레일
팀마다 동일한 용어를 다르게 사용할 수 있으므로 범위를 조기에 정의하세요.
벤치마크는 강력해 보이지만 실제 성능은 고르지 않을 수 있습니다.
데이터 품질 및 평가 계획을 무시하면 취약한 결과가 발생하는 경우가 많습니다.
구현 로드맵
필요한 결과에 대한 일반 언어 정의부터 시작하세요.
테스트하기 전에 하나의 성공 지표와 하나의 실패 조건을 선택하세요.
세련된 데모 세트가 아닌 대표 데이터를 사용하여 소규모 파일럿을 실행하세요.
다중 에이전트 강화 학습이 도움이 되는 부분과 더 간단한 방법이 더 나은 부분을 문서화하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Agent Reinforcement Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
강화 학습
자주 묻는 질문
다중 에이전트 강화 학습이란 무엇입니까?
MARL(Multi-Agent Reinforcement Learning)은 환경을 공유하는 여러 학습 에이전트를 교육하며, 각 에이전트는 동작을 조정하고 다른 에이전트도 이에 적응합니다. 교통, 시장, 로봇 팀 등 대부분의 실제 문제에는 한 사람이 아닌 많은 의사결정자가 참여하기 때문에 이는 중요합니다.
MARL의 한 에이전트의 관점에서 환경을 '비정상'으로 만드는 것은 무엇입니까?
모든 에이전트는 훈련 중에 정책을 업데이트하기 때문에 각 에이전트는 움직이는 목표, 즉 다른 에이전트가 학습함에 따라 환경의 역학 변화에 효과적으로 직면합니다.
'분산 실행을 통한 중앙 집중식 훈련'(CTDE)은 무엇을 의미합니까?
MADDPG 및 QMIX와 같은 CTDE 방법은 안정적인 학습을 위해 전역 정보를 활용하는 반면, 각 에이전트는 자체 관측값만 사용하여 실행합니다.
단일 에이전트 MDP를 여러 에이전트로 일반화하는 수학적 프레임워크는 무엇입니까?
마르코프 게임(확률적 게임이라고도 함)은 여러 의사결정자에 걸쳐 공동 작업과 에이전트별 보상을 제공하여 MDP를 확장합니다.
순전히 협력적인 MARL 환경에서 보상은 일반적으로 어떻게 구성됩니까?
협력 설정은 상담원에게 공유 목표를 제공하므로 팀 내에서 작업을 조정하고 크레딧을 할당하는 것이 과제입니다.
OpenAI Five 및 AlphaStar와 같은 시스템을 인간의 게임 플레이 데이터 없이 개선할 수 있는 기술은 무엇입니까?
셀프 플레이는 에이전트가 자신의 진화하는 버전에 맞서 싸우도록 하여 점점 더 강력한 상대에 대한 자동 커리큘럼을 만듭니다.