คู่มือพื้นฐาน

การเรียนรู้การเสริมกำลังแบบหลายตัวแทน

Multi-Agent Reinforcement Learning (MARL) ฝึกตัวแทนการเรียนรู้หลายรายที่มีสภาพแวดล้อมเหมือนกัน โดยแต่ละตัวแทนจะปรับพฤติกรรมของตนในขณะที่ตัวแทนอื่นๆ ก็ปรับตัวเช่นกัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

เจาะลึก

ในการเรียนรู้การเสริมกำลังแบบตัวแทนเดี่ยว ตัวแทนคนหนึ่งจะเรียนรู้นโยบายโดยการเพิ่มรางวัลสูงสุดในสภาพแวดล้อมที่ตายตัว MARL เพิ่มเจ้าหน้าที่มากขึ้น และนั่นทำให้ทุกอย่างเปลี่ยนแปลง: จากมุมมองของเจ้าหน้าที่แต่ละราย สภาพแวดล้อมจะไม่นิ่งเนื่องจากตัวแทนคนอื่นๆ คอยเปลี่ยนแปลงนโยบายของตนอยู่ตลอดเวลา เอเจนต์สามารถร่วมมือกันได้ (แบ่งปันรางวัลให้กับทีม เช่น หุ่นยนต์เล่นฟุตบอล) การแข่งขัน (ผลรวมเป็นศูนย์ เช่น โป๊กเกอร์หรือการไล่ตาม) หรือผสมกันก็ได้ นักวิจัยใช้รูปแบบที่เป็นทางการ เช่น เกมมาร์คอฟ (เกมสุ่ม) ที่สรุปกระบวนการตัดสินใจของมาร์คอฟตัวแทนเดี่ยว ผลลัพธ์อันโด่งดัง ได้แก่ AlphaStar ของ DeepMind เข้าถึงระดับปรมาจารย์ใน StarCraft II และ OpenAI ทีม Dota 2 มืออาชีพที่เอาชนะห้าทีม ทั้งสองทีมอาศัยจำนวนตัวแทนที่ได้รับการฝึกฝนซึ่งกันและกันผ่านการเล่นด้วยตนเอง

ข้อมูลเชิงลึกทางเทคนิค

ความท้าทายหลักคือการไม่อยู่กับที่ เนื่องจากตัวแทนทุกรายอัปเดตนโยบายของตน ตัวแทนรายอื่นๆ ต้องเผชิญกับเป้าหมายที่เคลื่อนไหว ดังนั้นการเรียนรู้อย่างอิสระที่ไร้เดียงสาจึงอาจล้มเหลวในการมาบรรจบกัน การแก้ไขที่ได้รับความนิยมคือการฝึกอบรมแบบรวมศูนย์ด้วยการดำเนินการแบบกระจายอำนาจ (CTDE) ซึ่งใช้โดยอัลกอริธึมเช่น MADDPG และ QMIX ในระหว่างการฝึกอบรม นักวิจารณ์มองเห็นการสังเกตและการดำเนินการของตัวแทนทั้งหมดเพื่อคำนวณการไล่ระดับสีที่เสถียร แต่ในการปรับใช้ เจ้าหน้าที่แต่ละรายจะดำเนินการโดยใช้การสังเกตเฉพาะที่ของตนเองเท่านั้น ผสมผสานการเรียนรู้แบบประสานงานเข้ากับการปฏิบัติงานที่เป็นอิสระและใช้งานได้จริง

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของการเรียนรู้การเสริมกำลังแบบหลายตัวแทน

MARL กำลังเคลื่อนไปสู่ระบบที่ใหญ่ขึ้นและเปิดกว้างมากขึ้น ซึ่งเจ้าหน้าที่เข้าและออก และมุ่งสู่ทีมของตัวแทนที่ใช้ LLM ที่เจรจา มอบหมาย และใช้เครื่องมือร่วมกัน คาดหวังความคืบหน้าในการมอบหมายเครดิตที่ปรับขนาดได้ (ผู้ที่สมควรได้รับรางวัลในทีมใหญ่) โปรโตคอลการสื่อสารที่เกิดขึ้น และการรับประกันความปลอดภัยสำหรับตัวแทนที่แข่งขันกัน ในขณะที่ยานพาหนะที่ขับเคลื่อนอัตโนมัติ โครงข่ายพลังงาน และระบบการซื้อขายมีปฏิสัมพันธ์กันมากขึ้น การประสานงานหลายตัวแทนที่แข็งแกร่ง และการหลีกเลี่ยงการสมรู้ร่วมคิดหรือวงจรป้อนกลับที่ไม่เสถียร กลายเป็นข้อกังวลหลักในทางปฏิบัติและด้านกฎระเบียบ

การใช้งานจริงในโลกแห่งความเป็นจริง

การประสานงานกลุ่มหุ่นยนต์ในคลังสินค้าเพื่อกำหนดเส้นทางพัสดุโดยไม่ชนกันหรือหยุดชะงักในทางเดิน

การควบคุมสัญญาณไฟจราจรโดยแต่ละทางแยกเป็นตัวแทนการเรียนรู้เพื่อลดความแออัดทั่วเมือง

ฝึกฝนเกม AI เช่น OpenAI Five (Dota 2) และ AlphaStar (StarCraft II) ผ่านการเล่นด้วยตนเองท่ามกลางตัวแทนมากมาย

การจัดการการเสนอราคาและการตอบสนองความต้องการระหว่างแบตเตอรี่แบบกระจายและบ้านในระบบโครงข่ายไฟฟ้าอัจฉริยะ

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่การเรียนรู้การเสริมกำลังแบบหลายตัวแทนช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเรียนรู้แบบเสริมกำลัง

คำถามที่พบบ่อย

What is Multi-Agent Reinforcement Learning?

Multi-Agent Reinforcement Learning (MARL) ฝึกตัวแทนการเรียนรู้หลายรายที่มีสภาพแวดล้อมเหมือนกัน โดยแต่ละตัวแทนจะปรับพฤติกรรมของตนในขณะที่ตัวแทนอื่นๆ ก็ปรับตัวเช่นกัน สิ่งสำคัญคือปัญหาในโลกแห่งความเป็นจริงส่วนใหญ่ เช่น การจราจร ตลาด ทีมหุ่นยนต์ เกี่ยวข้องกับผู้มีอำนาจตัดสินใจหลายคน ไม่ใช่คนเดียว

อะไรทำให้สภาพแวดล้อม 'ไม่อยู่กับที่' จากมุมมองของตัวแทนคนหนึ่งใน MARL

เนื่องจากตัวแทนทุกคนอัปเดตนโยบายของตนในระหว่างการฝึกอบรม เจ้าหน้าที่แต่ละคนต้องเผชิญกับเป้าหมายที่เคลื่อนไหวอย่างมีประสิทธิภาพ — พลวัตของสภาพแวดล้อมเปลี่ยนแปลงไปในขณะที่ผู้อื่นเรียนรู้

'การฝึกอบรมแบบรวมศูนย์พร้อมการดำเนินการแบบกระจายอำนาจ' (CTDE) หมายความว่าอย่างไร

วิธี CTDE เช่น MADDPG และ QMIX ใช้ประโยชน์จากข้อมูลทั่วโลกเพื่อการเรียนรู้ที่มีความเสถียร ในขณะที่เอเจนต์แต่ละตัวดำเนินการโดยใช้เพียงการสังเกตของตัวเองเท่านั้น

กรอบงานทางคณิตศาสตร์ใดสรุป MDP แบบเอเจนต์เดียวให้เป็นแบบหลายเอเจนต์

เกม Markov (หรือที่เรียกว่าเกมสุ่ม) ขยาย MDP โดยการร่วมกันดำเนินการและให้รางวัลต่อตัวแทนจากผู้มีอำนาจตัดสินใจหลายคน

ในการตั้งค่า MARL ที่ให้ความร่วมมืออย่างแท้จริง โดยทั่วไปแล้วรางวัลจะมีโครงสร้างอย่างไร

การตั้งค่าความร่วมมือทำให้เจ้าหน้าที่มีวัตถุประสงค์ร่วมกัน ดังนั้นความท้าทายจึงกลายเป็นการประสานงานและมอบหมายเครดิตภายในทีม

เทคนิคใดที่ช่วยให้ระบบอย่าง OpenAI Five และ AlphaStar ปรับปรุงได้โดยไม่ต้องใช้ข้อมูลการเล่นเกมของมนุษย์

การเล่นด้วยตนเองเป็นหลุมตัวแทนต่อต้านเวอร์ชันที่พัฒนาของตัวเอง สร้างหลักสูตรอัตโนมัติสำหรับคู่ต่อสู้ที่แข็งแกร่งยิ่งขึ้น