دليل الأساسيات

التعلم المعزز متعدد الوكلاء

يقوم التعلم المعزز متعدد الوكلاء (MARL) بتدريب العديد من وكلاء التعلم الذين يتشاركون في بيئة واحدة، حيث يقوم كل منهم بتكييف سلوكه بينما يتكيف الآخرون أيضًا.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

الغوص العميق

في التعلم المعزز لوكيل واحد، يتعلم وكيل واحد سياسة من خلال تعظيم المكافأة في بيئة ثابتة. تضيف MARL المزيد من الوكلاء، وهذا يغير كل شيء: من وجهة نظر كل وكيل، تكون البيئة غير ثابتة لأن الآخرين يستمرون في تغيير سياساتهم. يمكن أن يكون الوكلاء متعاونين (يتقاسمون مكافأة الفريق، مثل الروبوتات التي تلعب كرة القدم)، أو تنافسيين (محصلتهم صفر، مثل البوكر أو التهرب من المطاردة)، أو مختلطين. يستخدم الباحثون شكليات مثل ألعاب ماركوف (الألعاب العشوائية) التي تعمم عملية اتخاذ قرار ماركوف ذات الوكيل الواحد. تشمل النتائج الشهيرة وصول AlphaStar من DeepMind إلى Grandmaster في StarCraft II وOpenAI خمسة فرق محترفة مهزومة في Dota 2، وكلاهما يعتمد على مجموعات من العملاء المدربين ضد بعضهم البعض من خلال اللعب الذاتي.

البصيرة الفنية

ويتمثل التحدي الأساسي في عدم الجمود: فبينما يقوم كل وكيل بتحديث سياسته، يواجه الآخرون هدفاً متحركاً، وبالتالي فإن التعلم المستقل الساذج قد يفشل في التقارب. الحل الشائع هو التدريب المركزي مع التنفيذ اللامركزي (CTDE)، الذي تستخدمه خوارزميات مثل MADDPG وQMIX. أثناء التدريب، يرى الناقد جميع ملاحظات الوكلاء وإجراءاتهم لحساب التدرجات المستقرة، ولكن عند النشر، يتصرف كل وكيل باستخدام ملاحظاته المحلية فقط - ويجمع بين التعلم المنسق والتشغيل العملي المستقل.

التأثير الاستراتيجي

قرارات أوضح

يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.

التكلفة والميزانية

يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.

الفريق وسير العمل

تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.

مستقبل التعلم المعزز متعدد الوكلاء

تتجه MARL نحو أنظمة أكبر وأكثر انفتاحًا حيث يدخل الوكلاء ويخرجون، ونحو فرق من الوكلاء المعتمدين على LLM الذين يتفاوضون ويفوضون ويستخدمون الأدوات معًا. توقع إحراز تقدم في تخصيص الائتمان القابل للتطوير (من يستحق المكافأة في فريق كبير)، وبروتوكولات الاتصال الناشئة، وضمانات السلامة للوكلاء المتنافسين. ومع التفاعل المتزايد بين المركبات ذاتية القيادة وشبكات الطاقة وأنظمة التجارة، يصبح التنسيق القوي بين الوكلاء ــ وتجنب التواطؤ أو حلقات ردود الفعل المزعزعة للاستقرار ــ مصدر قلق عملي وتنظيمي رئيسي.

التنفيذ في العالم الحقيقي

تنسيق أساطيل روبوتات المستودعات حتى يتمكنوا من توجيه الطرود دون الاصطدام أو الوصول إلى طريق مسدود في الممرات

التحكم في إشارات المرور حيث يكون كل تقاطع بمثابة وكيل يتعلم كيفية تقليل الازدحام على مستوى المدينة

لعبة تدريب الذكاء الاصطناعي مثل OpenAI Five (Dota 2) وAlphaStar (StarCraft II) عبر اللعب الذاتي بين العديد من العملاء

إدارة العطاءات واستجابة الطلب بين البطاريات الموزعة والمنازل في شبكة الكهرباء الذكية

المخاطر والدرابزين

قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.

يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.

غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.

خارطة طريق التنفيذ

1

ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.

2

اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.

3

قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.

4

قم بالتوثيق حيث يساعد التعلم المعزز متعدد الوكلاء وأين تكون الطرق الأبسط أفضل.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is Multi-Agent Reinforcement Learning?

يقوم التعلم المعزز متعدد الوكلاء (MARL) بتدريب العديد من وكلاء التعلم الذين يتشاركون في بيئة واحدة، حيث يقوم كل منهم بتكييف سلوكه بينما يتكيف الآخرون أيضًا. وهو أمر مهم لأن معظم مشاكل العالم الحقيقي - حركة المرور، والأسواق، وفرق الروبوتات - تنطوي على العديد من صناع القرار، وليس واحدا.

ما الذي يجعل البيئة "غير ثابتة" من وجهة نظر أحد الوكلاء في MARL؟

نظرًا لأن كل عميل يقوم بتحديث سياسته أثناء التدريب، فإن كل عميل يواجه بشكل فعال هدفًا متحركًا - تتغير ديناميكيات البيئة مع تعلم الآخرين.

ماذا يعني "التدريب المركزي مع التنفيذ اللامركزي" (CTDE)؟

تستغل أساليب CTDE مثل MADDPG وQMIX المعلومات العالمية للتعلم المستقر، بينما ينفذ كل وكيل باستخدام ملاحظاته الخاصة فقط.

ما هو الإطار الرياضي الذي يعمم MDP ذو الوكيل الفردي على وكلاء متعددين؟

تعمل ألعاب ماركوف (وتسمى أيضًا الألعاب العشوائية) على توسيع نطاق MDPs من خلال وجود إجراءات مشتركة ومكافآت لكل وكيل عبر العديد من صناع القرار.

في بيئة MARL التعاونية البحتة، كيف يتم تنظيم المكافأة عادةً؟

تمنح الإعدادات التعاونية الوكلاء هدفًا مشتركًا، وبالتالي يصبح التحدي هو تنسيق الإجراءات وتخصيص الائتمان داخل الفريق.

ما هي التقنية التي تسمح لأنظمة مثل OpenAI Five وAlphaStar بالتحسين بدون بيانات اللعب البشرية؟

اللعب الذاتي يضع العملاء في مواجهة الإصدارات المتطورة من أنفسهم، مما يؤدي إلى إنشاء منهج تلقائي لخصوم أقوياء بشكل متزايد.