Học tăng cường đa tác nhân
Học tăng cường đa tác nhân (MARL) đào tạo một số tác nhân học tập dùng chung một môi trường, mỗi tác nhân điều chỉnh hành vi của mình trong khi những tác nhân khác cũng thích ứng.
Tổng quan
Điều này quan trọng vì hầu hết các vấn đề thực tế — giao thông, thị trường, nhóm robot — đều liên quan đến nhiều người ra quyết định, không chỉ một.
Lặn sâu
Trong học tăng cường một tác nhân, một tác nhân học chính sách bằng cách tối đa hóa phần thưởng trong một môi trường cố định. MARL bổ sung thêm nhiều tác nhân và điều đó làm thay đổi mọi thứ: theo quan điểm của mỗi tác nhân, môi trường không cố định vì những tác nhân khác liên tục thay đổi chính sách của họ. Các đại lý có thể hợp tác (chia sẻ phần thưởng của đội, như robot chơi bóng đá), cạnh tranh (tổng bằng 0, như poker hoặc trốn tránh truy đuổi) hoặc hỗn hợp. Các nhà nghiên cứu sử dụng các hình thức như trò chơi Markov (trò chơi ngẫu nhiên) để khái quát hóa Quy trình ra quyết định Markov của một tác nhân duy nhất. Các kết quả nổi tiếng bao gồm AlphaStar của DeepMind đạt tới Grandmaster trong StarCraft II và OpenAI Năm đánh bại các đội Dota 2 chuyên nghiệp, cả hai đều dựa vào số lượng đặc vụ được huấn luyện để chống lại nhau thông qua việc tự chơi.
Hiểu biết kỹ thuật
Thách thức cốt lõi là tính không cố định: khi mọi tác nhân cập nhật chính sách của mình, những tác nhân khác phải đối mặt với một mục tiêu đang di chuyển, do đó việc học độc lập ngây thơ có thể không hội tụ. Một cách khắc phục phổ biến là đào tạo tập trung với thực thi phi tập trung (CTDE), được sử dụng bởi các thuật toán như MADDPG và QMIX. Trong quá trình đào tạo, người phê bình sẽ thấy tất cả các quan sát và hành động của tác nhân để tính toán độ dốc ổn định, nhưng khi triển khai, mỗi tác nhân chỉ hành động bằng cách sử dụng các quan sát cục bộ của riêng mình — kết hợp việc học phối hợp với hoạt động độc lập, thực tế.
Tác động chiến lược
Quyết định rõ ràng hơn
Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.
Chi phí và ngân sách
Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.
Nhóm và quy trình làm việc
Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.
Tương lai của việc học tăng cường đa tác nhân
MARL đang hướng tới các hệ thống lớn hơn, cởi mở hơn, nơi các đại lý ra vào cũng như hướng tới các nhóm gồm các đại lý dựa trên LLM để đàm phán, ủy quyền và sử dụng các công cụ cùng nhau. Mong đợi sự tiến bộ trong việc phân công tín dụng có thể mở rộng (người xứng đáng được khen thưởng trong một nhóm lớn), các giao thức liên lạc khẩn cấp và đảm bảo an toàn cho các đại lý cạnh tranh. Khi các phương tiện tự hành, lưới năng lượng và hệ thống thương mại ngày càng tương tác với nhau, sự phối hợp mạnh mẽ giữa nhiều tác nhân - và tránh sự thông đồng hoặc gây mất ổn định các vòng phản hồi - trở thành mối quan tâm thực tế và quy định trọng tâm.
Triển khai trong thế giới thực
Phối hợp các đội robot kho để họ định tuyến các gói hàng mà không va chạm hoặc bế tắc trên lối đi
Kiểm soát tín hiệu giao thông trong đó mỗi giao lộ là một tác nhân học cách giảm tắc nghẽn trên toàn thành phố
Huấn luyện trò chơi AI như OpenAI Five (Dota 2) và AlphaStar (StarCraft II) thông qua việc tự chơi giữa nhiều đặc vụ
Quản lý giá thầu và đáp ứng nhu cầu giữa các loại pin được phân phối và nhà ở trong lưới điện thông minh
Rủi ro & lan can
Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.
Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.
Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.
Lộ trình thực hiện
Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.
Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.
Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.
Tài liệu nơi Học tập tăng cường đa tác nhân hữu ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Agent Reinforcement Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Học tăng cường
Câu hỏi thường gặp
Học Tăng cường đa tác nhân là gì?
Học tăng cường đa tác nhân (MARL) đào tạo một số tác nhân học tập dùng chung một môi trường, mỗi tác nhân điều chỉnh hành vi của mình trong khi những tác nhân khác cũng thích ứng. Điều này quan trọng vì hầu hết các vấn đề trong thế giới thực - giao thông, thị trường, đội robot - đều liên quan đến nhiều người ra quyết định chứ không phải một.
Điều gì khiến môi trường trở nên 'không cố định' theo quan điểm của một tác nhân trong MARL?
Vì mọi tổng đài viên đều cập nhật chính sách của mình trong quá trình đào tạo nên mỗi tổng đài viên đều phải đối mặt với một mục tiêu đang di chuyển một cách hiệu quả — động lực của môi trường thay đổi khi những tổng đài viên khác học hỏi.
'Đào tạo tập trung với thực thi phi tập trung' (CTDE) nghĩa là gì?
Các phương pháp CTDE như MADDPG và QMIX khai thác thông tin toàn cầu để học ổn định, trong khi mỗi tác nhân chỉ thực hiện bằng cách sử dụng các quan sát của riêng mình.
Khung toán học nào khái quát hóa MDP một tác nhân cho nhiều tác nhân?
Trò chơi Markov (còn gọi là trò chơi ngẫu nhiên) mở rộng MDP bằng cách có các hành động chung và phần thưởng cho mỗi tác nhân đối với nhiều người ra quyết định.
Trong bối cảnh MARL thuần túy hợp tác, phần thưởng thường được cấu trúc như thế nào?
Cài đặt hợp tác mang lại cho các đại lý một mục tiêu chung, do đó, thách thức trở thành việc phối hợp các hành động và phân công công lao trong nhóm.
Kỹ thuật nào giúp các hệ thống như OpenAI Five và AlphaStar cải thiện mà không cần dữ liệu lối chơi của con người?
Các tác nhân tự chơi chống lại các phiên bản đang phát triển của chính chúng, tạo ra một chương trình giảng dạy tự động về các đối thủ ngày càng mạnh.