Şirketler KILAVUZU

AlphaGo ve AlphaZero

AlphaGo, dünyanın en iyi Go oyuncularını yenen DeepMind programıydı; bu, onlarca yıl uzakta olduğu düşünülen bir dönüm noktasıydı.

2 min readSon güncelleme

Genel Bakış

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Derin Dalış

Go'nun gözlemlenebilir evrendeki atomlardan daha fazla olası tahta konumu vardır, bu da kaba kuvvet aramasını umutsuz hale getirir ve sezgiyi vazgeçilmez kılar. 2016 yılında AlphaGo, yaratıcı bir şekilde insan olmayan ünlü 'Move 37' çarpıcı uzmanlarıyla efsanevi şampiyon Lee Sedol'u 4-1 mağlup etti. AlphaGo, insanların uzman oyunlarından ve kendi kendine oynamasından öğrendi. 2017'de AlphaZero daha da ileri gitti: Yalnızca kurallarla başladı ve hiçbir insan verisi olmadan, kendisine karşı milyonlarca oyun oynayarak kendi kendini öğretti ve en iyi Go, satranç ve shogi programlarını saatler ya da günler içinde geride bıraktı. Daha sonraki bir sistem olan MuZero, oyunların kurallarını bile kendi başına öğrendi. Bu kilometre taşları, takviyeli öğrenme artı aramanın insan bilgisinin ötesindeki stratejileri nasıl keşfedebileceğini gösterdi.

Teknik Bilgi

AlphaZero, derin bir sinir ağını Monte Carlo Ağaç Arama (MCTS) ile birleştirir. Ağ, aramayı her dal yerine yalnızca en alakalı satırları keşfetmeye yönlendiren bir politika (gelecek vaat eden bir hareket) ve bir değer (muhtemelen kim kazanıyor) üretir. Kendi kendine oyun destekli öğrenme yoluyla, ağın tahminleri ve arama sonuçları birbirini güçlendirerek istikrarlı bir şekilde gelişiyor. Hiçbir insan oyununa veya el yapımı değerlendirme işlevine ihtiyaç yoktur; yalnızca kurallar ve kazanmanın ödülü vardır.

Stratejik Etki

Vendor strategy

Satıcı yol haritaları, ekibinizin bundan sonra hangi özellikleri geliştirebileceğini etkiler.

Maliyet ve bütçe

Ticari şartlar ve dağıtım seçenekleri uzun vadeli maliyet ve riski etkiler.

Risk and safety

Şirket teşvikleri ürün temerrütlerini, güvenlik duruşunu ve açıklığı şekillendirir.

AlphaGo ve AlphaZero'nun Geleceği

Arama rehberliğinde kendi kendine oynayarak öğrenen AlphaZero tarifi artık robot bilimini, bilimsel keşfi ve modellerin çözüm adımları üzerinde 'arama yaptığı' geniş dil modeli akıl yürütmeyi etkiliyor. MuZero ve AlphaProof gibi torunları, bu fikirleri bilinen kurallar olmadan planlamaya ve matematiğe uyguluyor. Kendi kendine oynama ve ağaç aramanın, planlama yapması, strateji oluşturması ve yeni çözümler keşfetmesi gereken sistemleri güçlendirmeye devam etmesini ve artık öncü yapay zeka modellerinde ortaya çıkan akıl yürütme teknikleriyle giderek daha fazla kaynaşmasını bekleyin.

Gerçek Dünya Uygulaması

Dönüm noktası niteliğindeki maçlarda dünya Go şampiyonları Lee Sedol (2016) ve Ke Jie'yi (2017) mağlup etmek

AlphaZero saatler içinde kendi kendine insanüstü satrancı öğretiyor ve büyükustaların incelediği yeni açılış ve fedakarlık fikirlerini ortaya çıkarıyor

MuZero Go, satranç, shogi ve Atari oyunlarında kurallar söylenmeden ustalaşıyor

Artık robot biliminde, matematikte (AlphaProof) ve LLM muhakemesinde kullanılan ilham verici kendi kendine oynama ve arama yöntemleri

Riskler ve Korkuluklar

Lansman duyuruları, gerçek üretim iş akışlarında istikrarın önüne geçebilir.

API fiyatlandırması veya politika değişiklikleri, varsayımları bir gecede boşa çıkarabilir.

Tek satıcıya bağımlılık, bağlılık ve geçiş maliyetlerini artırır.

Uygulama Yol Haritası

1

Sağlayıcıları kendi görevlerinizi ve veri kümelerinizi kullanarak değerlendirin.

2

Entegrasyondan önce gizlilik, güvenlik ve yasal şartları inceleyin.

3

Modeller veya satıcılar arasında bir geri dönüş planı sürdürün.

4

Yol haritası değişikliklerinin ekipleri şaşırtmaması için sürüm notlarını izleyin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Zhipu GLM Modelleri

Sık sorulan sorular

What is AlphaGo and AlphaZero?

AlphaGo, dünyanın en iyi Go oyuncularını yenen DeepMind programıydı; bu, onlarca yıl uzakta olduğu düşünülen bir dönüm noktasıydı. AlphaZero daha sonra Go, satranç ve shogi'de tamamen kendi kendine oynayarak ustalaştı ve insanüstü becerileri sıfırdan öğrendi.

Go oyununun neden özellikle bilgisayarlar için zor olduğu düşünülüyordu?

Go'nun muazzam dallanma faktörü, kaba kuvvet aramasını olanaksız hale getiriyor, bu nedenle başarı, öğrenilmiş sezgiyi gerektiriyordu.

AlphaGo 2016'da kimi 4-1 mağlup etti?

AlphaGo, 2016'da çokça izlenen bir maçta en iyi Go şampiyonu Lee Sedol'u 4-1 yendi.

AlphaZero, AlphaGo'nun aksine oynamayı nasıl öğrendi?

AlphaZero sadece kurallarla başladı ve insan oyun verileri olmadan yalnızca kendine karşı oynayarak öğrendi.

AlphaZero sinir ağıyla hangi arama yöntemini eşleştiriyor?

AlphaZero, bir sinir ağının politikası ve değer tahminleri tarafından yönlendirilen Monte Carlo Ağaç Aramasını kullanır.

AlphaZero'nun sinir ağı, aramasına rehberlik etmek için hangi iki şeyi öngörüyor?

Aramaya odaklanan, hareket eden ağ çıktıları umut verici görünüyor (politika) ve kimin kazanacağına dair bir tahmin (değer).