س-التعلم
Q-Learning عبارة عن خوارزمية تعلم معززة تعلم الوكيل الإجراءات التي تؤتي ثمارها بشكل أفضل من خلال التعلم التدريجي لقيمة كل خطوة من خلال التجربة والخطأ.
نظرة عامة
It matters because it can find optimal behavior without ever being told the rules of its environment.
الغوص العميق
يتعلم Q-Learning وظيفة تسمى Q(s, a): المكافأة المتوقعة على المدى الطويل لاتخاذ الإجراء "a" في الحالة ثم التصرف على النحو الأمثل بعد ذلك. يبدأ الوكيل في عدم معرفة أي شيء، ويجرب الإجراءات، ويلاحظ المكافآت. بعد كل خطوة، تقوم بدفع تقدير قيمة Q الخاص بها نحو المكافأة التي حصلت عليها للتو بالإضافة إلى أفضل قيمة مستقبلية مخفضة تتوقعها من الحالة التالية. والأهم من ذلك، أنها "خارجة عن السياسة" و"خالية من النماذج": فهي قادرة على تعلم أفضل السياسات مع الاستكشاف العشوائي، ولا تحتاج أبدًا إلى نموذج لكيفية تحول العالم. بالنظر إلى الاستكشاف الكافي لكل زوج من حالات الفعل، فمن المؤكد أن قيم Q تتقارب مع القيم المثلى، وأفضل إجراء في أي حالة هو ببساطة الإجراء الذي يتمتع بأعلى Q.
البصيرة الفنية
الجوهر هو تحديث بيلمان: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. ألفا هو معدل التعلم، وغاما هو عامل الخصم الذي يرجح المكافآت المستقبلية، والمصطلح بين قوسين هو خطأ الفرق الزمني. "الحد الأقصى" للإجراءات التالية هو ما يجعلها خارج السياسة وتسمح لها بتعلم السياسة المثالية الجشعة حتى أثناء الاستكشاف. يتم التعامل مع الاستكشاف عادةً من خلال تحديد الإجراء epsilon-greedy.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل Q-Learning
يكافح برنامج Q-Learning الجدولي الكلاسيكي عندما تكون الحالات كثيرة جدًا بحيث لا يمكن تخزينها في الجدول. الاتجاه السائد هو دمجها مع الشبكات العصبية، كما هو الحال في Deep Q-Networks (DQN)، والتي تقارب قيم Q من المدخلات الأولية مثل البكسل. تستمر الأبحاث في تحقيق الاستقرار من خلال إعادة تشغيل التجربة والشبكات المستهدفة والمتغيرات مثل Double DQN وQ-Learning التوزيعية التي تقلل من تحيز المبالغة في التقدير وتمثل توزيعات العائد الكامل بدلاً من المتوسطات الفردية.
التنفيذ في العالم الحقيقي
وكلاء ألعاب Atari (DQN التابع لـ DeepMind) يتعلمون لعب Breakout وPong مباشرةً من وحدات بكسل الشاشة
تحسين توقيت إشارات المرور عند التقاطعات لتقليل إجمالي وقت انتظار السيارة
يتنقل الروبوت عبر شبكة أو متاهة حيث يتعلم الروبوت أقصر مسار لزيادة المكافأة
قرارات التسعير والمخزون الديناميكية حيث يتعلم الوكيل الإجراءات التي تزيد من الربح على المدى الطويل
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Q-Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
جدولة معدل التعلم
الأسئلة المتداولة
What is Q-Learning?
Q-Learning عبارة عن خوارزمية تعلم معززة تعلم الوكيل الإجراءات التي تؤتي ثمارها بشكل أفضل من خلال التعلم التدريجي لقيمة كل خطوة من خلال التجربة والخطأ. إنه مهم لأنه يمكنه العثور على السلوك الأمثل دون أن يتم إخباره بقواعد بيئته.
ماذا تمثل قيمة Q-Q(s,a)؟
تقوم Q(s,a) بتقدير إجمالي المكافأة المستقبلية المخصومة من اتخاذ الإجراء أ في الحالة والتصرف على النحو الأمثل بعد ذلك، وليس فقط المكافأة الفورية.
لماذا يوصف Q-Learning بأنه "خارج عن السياسة"؟
الحد الأقصى للإجراءات التالية يعني أن Q-Learning يتعلم قيمة السياسة المثالية الجشعة حتى أثناء استكشاف الوكيل بسياسة سلوك مختلفة.
في قاعدة التحديث، ما الذي يتحكم فيه عامل الخصم جاما؟
تقوم جاما (بين 0 و1) بخصم المكافآت المستقبلية؛ القيم القريبة من 1 تجعل العامل بعيد النظر، والقيم القريبة من 0 تجعله قصير النظر.
ما هو خطأ الفرق الزمني (TD) في Q-Learning؟
خطأ TD هو الفجوة بين تقدير الهدف الجديد (المكافأة بالإضافة إلى أفضل قيمة مستقبلية مخصومة) وتقدير Q القديم؛ التحديث يقلص هذه الفجوة.
لماذا يواجه Q-Learning الجدولي البسيط مشكلات كبيرة مثل ألعاب الفيديو من وحدات البكسل؟
يحتاج جدول البحث إلى إدخال لكل زوج من إجراءات الحالة، وهو أمر غير ممكن عندما يكون عدد الحالات بالمليارات، مما يحفز أدوات تقريب الشبكات العصبية مثل DQN.