دليل الشركات

ألفا جو وألفا زيرو

لقد كان AlphaGo هو برنامج DeepMind الذي تغلب على أفضل لاعبي Go في العالم، وهو إنجاز كبير كنا نفكر فيه منذ عقود.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

الغوص العميق

لدى Go مواضع محتملة على اللوحة أكثر من الذرات الموجودة في الكون المرئي، مما يجعل بحث القوة الغاشمة ميئوسًا منه والحدس ضروريًا. في عام 2016، هزم AlphaGo البطل الأسطوري Lee Sedol 4-1، بفضل تقنية "Move 37" الشهيرة التي أذهلت الخبراء باعتبارها غير بشرية بشكل إبداعي. لقد تعلم برنامج AlphaGo من ألعاب الخبراء البشرية بالإضافة إلى اللعب الذاتي. في عام 2017، ذهب AlphaZero إلى أبعد من ذلك: بدءًا من القواعد فقط وبدون بيانات بشرية، علم نفسه من خلال لعب ملايين الألعاب ضد نفسه، متجاوزًا أفضل برامج Go، والشطرنج، وshogi في غضون ساعات إلى أيام. وهناك نظام لاحق، MuZero، تعلم قواعد الألعاب من تلقاء نفسه. أظهرت هذه المعالم كيف يمكن للتعلم المعزز بالإضافة إلى البحث اكتشاف استراتيجيات تتجاوز المعرفة البشرية.

البصيرة الفنية

يجمع AlphaZero بين الشبكة العصبية العميقة وبحث شجرة مونت كارلو (MCTS). تُخرج الشبكة سياسة (تبدو التحركات واعدة) وقيمة (من المرجح أن يفوز)، مما يؤدي إلى توجيه البحث لاستكشاف الخطوط الأكثر صلة فقط بدلاً من كل فرع. من خلال التعلم المعزز باللعب الذاتي، تعزز تنبؤات الشبكة ونتائج البحث بعضها البعض، وتتحسن بشكل مطرد. ليست هناك حاجة إلى ألعاب بشرية أو وظائف تقييم مصنوعة يدويًا، فقط القواعد ومكافأة الفوز.

التأثير الاستراتيجي

استراتيجية البائع

تؤثر خرائط طريق البائع على الميزات التي يمكن لفريقك إنشاءها بعد ذلك.

التكلفة والميزانية

تؤثر الشروط التجارية وخيارات النشر على التكلفة والمخاطر على المدى الطويل.

المخاطر والسلامة

تعمل حوافز الشركة على تشكيل الإعدادات الافتراضية للمنتج، ووضعية السلامة، والانفتاح.

مستقبل AlphaGo وAlphaZero

إن وصفة AlphaZero، التي تعتمد على التعلم من خلال اللعب الذاتي الموجه بالبحث، تؤثر الآن على الروبوتات والاكتشافات العلمية واستدلال نماذج اللغة الكبيرة، حيث تقوم النماذج "بالبحث" عبر خطوات الحل. يطبق أحفاد مثل MuZero وAlphaProof هذه الأفكار على التخطيط بدون قواعد معروفة وعلى الرياضيات. توقع أن يؤدي اللعب الذاتي والبحث الشجري إلى الحفاظ على أنظمة التشغيل التي يجب أن تخطط وتضع إستراتيجيات وتكتشف حلولًا جديدة، وتندمج بشكل متزايد مع تقنيات التفكير التي تظهر الآن في نماذج الذكاء الاصطناعي الحدودية.

التنفيذ في العالم الحقيقي

هزيمة أبطال العالم في Go Lee Sedol (2016) وKe Jie (2017) في المباريات التاريخية

تقوم AlphaZero بتعليم نفسها لعبة الشطرنج الخارقة في ساعات، وتكشف عن أفكار افتتاحية وتضحية جديدة درسها كبار الأساتذة

يتقن MuZero ألعاب Go، والشطرنج، وshogi، وAtari دون أن يتم إخباره بالقواعد

تُستخدم الآن أساليب اللعب والبحث الملهمة في الروبوتات والرياضيات (AlphaProof) والاستدلال في ماجستير إدارة الأعمال

المخاطر والدرابزين

قد تتجاوز إعلانات الإطلاق الاستقرار في سير عمل الإنتاج الحقيقي.

يمكن أن يؤدي تسعير واجهة برمجة التطبيقات (API) أو تغيرات السياسة إلى كسر الافتراضات بين عشية وضحاها.

يؤدي الاعتماد على بائع واحد إلى زيادة تكاليف الحجز والترحيل.

خارطة طريق التنفيذ

1

قم بتقييم مقدمي الخدمة باستخدام المهام ومجموعات البيانات الخاصة بك.

2

راجع الخصوصية والأمان والمصطلحات القانونية قبل التكامل.

3

احتفظ بخطة احتياطية عبر النماذج أو البائعين.

4

راقب ملاحظات الإصدار حتى لا تفاجئ التغييرات في خارطة الطريق الفرق.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is AlphaGo and AlphaZero?

لقد كان AlphaGo هو برنامج DeepMind الذي تغلب على أفضل لاعبي Go في العالم، وهو إنجاز كبير كنا نفكر فيه منذ عقود. أتقن AlphaZero بعد ذلك لعبة Go، والشطرنج، وshogi بالكامل من خلال اللعب الذاتي، وتعلم مهارات خارقة من الصفر.

لماذا تعتبر لعبة Go صعبة بشكل خاص على أجهزة الكمبيوتر؟

إن عامل التفرع الهائل في Go يجعل البحث باستخدام القوة الغاشمة غير ممكن، لذا فإن النجاح يتطلب حدسًا مكتسبًا.

من الذي هزم AlphaGo 4-1 في عام 2016؟

فاز AlphaGo على بطل Go الأول Lee Sedol 4-1 في مباراة تمت مشاهدتها على نطاق واسع عام 2016.

كيف تعلم AlphaZero العزف، على عكس AlphaGo؟

بدأ AlphaZero من القواعد فقط وتعلم فقط من خلال اللعب ضد نفسه، بدون بيانات اللعبة البشرية.

ما هي طريقة البحث التي يقرنها AlphaZero بشبكته العصبية؟

يستخدم AlphaZero تطبيق Monte Carlo Tree Search مسترشدًا بسياسة الشبكة العصبية وتنبؤات القيمة.

ما الشيئين اللذين تتوقعهما شبكة AlphaZero العصبية لتوجيه بحثها؟

تبدو مخرجات الشبكة التي تتحرك واعدة (سياسة) وتقديرا لمن سيفوز (قيمة)، مع التركيز على البحث.