AlphaGo ve AlphaZero
AlphaGo, dünyanın en iyi Go oyuncularını yenen DeepMind programıydı; bu, onlarca yıl uzakta olduğu düşünülen bir dönüm noktasıydı.
Genel Bakış
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Derin Dalış
Go'nun gözlemlenebilir evrendeki atomlardan daha fazla olası tahta konumu vardır, bu da kaba kuvvet aramasını umutsuz hale getirir ve sezgiyi vazgeçilmez kılar. 2016 yılında AlphaGo, yaratıcı bir şekilde insan olmayan ünlü 'Move 37' çarpıcı uzmanlarıyla efsanevi şampiyon Lee Sedol'u 4-1 mağlup etti. AlphaGo, insanların uzman oyunlarından ve kendi kendine oynamasından öğrendi. 2017'de AlphaZero daha da ileri gitti: Yalnızca kurallarla başladı ve hiçbir insan verisi olmadan, kendisine karşı milyonlarca oyun oynayarak kendi kendini öğretti ve en iyi Go, satranç ve shogi programlarını saatler ya da günler içinde geride bıraktı. Daha sonraki bir sistem olan MuZero, oyunların kurallarını bile kendi başına öğrendi. Bu kilometre taşları, takviyeli öğrenme artı aramanın insan bilgisinin ötesindeki stratejileri nasıl keşfedebileceğini gösterdi.
Teknik Bilgi
AlphaZero, derin bir sinir ağını Monte Carlo Ağaç Arama (MCTS) ile birleştirir. Ağ, aramayı her dal yerine yalnızca en alakalı satırları keşfetmeye yönlendiren bir politika (gelecek vaat eden bir hareket) ve bir değer (muhtemelen kim kazanıyor) üretir. Kendi kendine oyun destekli öğrenme yoluyla, ağın tahminleri ve arama sonuçları birbirini güçlendirerek istikrarlı bir şekilde gelişiyor. Hiçbir insan oyununa veya el yapımı değerlendirme işlevine ihtiyaç yoktur; yalnızca kurallar ve kazanmanın ödülü vardır.
Stratejik Etki
Vendor strategy
Satıcı yol haritaları, ekibinizin bundan sonra hangi özellikleri geliştirebileceğini etkiler.
Maliyet ve bütçe
Ticari şartlar ve dağıtım seçenekleri uzun vadeli maliyet ve riski etkiler.
Risk and safety
Şirket teşvikleri ürün temerrütlerini, güvenlik duruşunu ve açıklığı şekillendirir.
AlphaGo ve AlphaZero'nun Geleceği
Arama rehberliğinde kendi kendine oynayarak öğrenen AlphaZero tarifi artık robot bilimini, bilimsel keşfi ve modellerin çözüm adımları üzerinde 'arama yaptığı' geniş dil modeli akıl yürütmeyi etkiliyor. MuZero ve AlphaProof gibi torunları, bu fikirleri bilinen kurallar olmadan planlamaya ve matematiğe uyguluyor. Kendi kendine oynama ve ağaç aramanın, planlama yapması, strateji oluşturması ve yeni çözümler keşfetmesi gereken sistemleri güçlendirmeye devam etmesini ve artık öncü yapay zeka modellerinde ortaya çıkan akıl yürütme teknikleriyle giderek daha fazla kaynaşmasını bekleyin.
Gerçek Dünya Uygulaması
Dönüm noktası niteliğindeki maçlarda dünya Go şampiyonları Lee Sedol (2016) ve Ke Jie'yi (2017) mağlup etmek
AlphaZero saatler içinde kendi kendine insanüstü satrancı öğretiyor ve büyükustaların incelediği yeni açılış ve fedakarlık fikirlerini ortaya çıkarıyor
MuZero Go, satranç, shogi ve Atari oyunlarında kurallar söylenmeden ustalaşıyor
Artık robot biliminde, matematikte (AlphaProof) ve LLM muhakemesinde kullanılan ilham verici kendi kendine oynama ve arama yöntemleri
Riskler ve Korkuluklar
Lansman duyuruları, gerçek üretim iş akışlarında istikrarın önüne geçebilir.
API fiyatlandırması veya politika değişiklikleri, varsayımları bir gecede boşa çıkarabilir.
Tek satıcıya bağımlılık, bağlılık ve geçiş maliyetlerini artırır.
Uygulama Yol Haritası
Sağlayıcıları kendi görevlerinizi ve veri kümelerinizi kullanarak değerlendirin.
Entegrasyondan önce gizlilik, güvenlik ve yasal şartları inceleyin.
Modeller veya satıcılar arasında bir geri dönüş planı sürdürün.
Yol haritası değişikliklerinin ekipleri şaşırtmaması için sürüm notlarını izleyin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Zhipu GLM Modelleri
Sık sorulan sorular
What is AlphaGo and AlphaZero?
AlphaGo, dünyanın en iyi Go oyuncularını yenen DeepMind programıydı; bu, onlarca yıl uzakta olduğu düşünülen bir dönüm noktasıydı. AlphaZero daha sonra Go, satranç ve shogi'de tamamen kendi kendine oynayarak ustalaştı ve insanüstü becerileri sıfırdan öğrendi.
Go oyununun neden özellikle bilgisayarlar için zor olduğu düşünülüyordu?
Go'nun muazzam dallanma faktörü, kaba kuvvet aramasını olanaksız hale getiriyor, bu nedenle başarı, öğrenilmiş sezgiyi gerektiriyordu.
AlphaGo 2016'da kimi 4-1 mağlup etti?
AlphaGo, 2016'da çokça izlenen bir maçta en iyi Go şampiyonu Lee Sedol'u 4-1 yendi.
AlphaZero, AlphaGo'nun aksine oynamayı nasıl öğrendi?
AlphaZero sadece kurallarla başladı ve insan oyun verileri olmadan yalnızca kendine karşı oynayarak öğrendi.
AlphaZero sinir ağıyla hangi arama yöntemini eşleştiriyor?
AlphaZero, bir sinir ağının politikası ve değer tahminleri tarafından yönlendirilen Monte Carlo Ağaç Aramasını kullanır.
AlphaZero'nun sinir ağı, aramasına rehberlik etmek için hangi iki şeyi öngörüyor?
Aramaya odaklanan, hareket eden ağ çıktıları umut verici görünüyor (politika) ve kimin kazanacağına dair bir tahmin (değer).