PANDUAN Syarikat

AlphaGo dan AlphaZero

AlphaGo ialah program DeepMind yang menewaskan pemain Go terbaik dunia, satu pencapaian yang telah lama difikirkan beberapa dekad lagi.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Menyelam dalam

Go mempunyai lebih banyak kemungkinan kedudukan papan daripada atom dalam alam semesta yang boleh diperhatikan, menjadikan pencarian kekerasan sia-sia dan intuisi penting. Pada 2016, AlphaGo mengalahkan juara legenda Lee Sedol 4-1, dengan pakar menakjubkan 'Move 37' yang terkenal sebagai bukan manusia secara kreatif. AlphaGo belajar daripada permainan pakar manusia serta permainan sendiri. Pada 2017, AlphaZero pergi lebih jauh: bermula dengan hanya peraturan dan tiada data manusia, ia mengajar dirinya sendiri dengan bermain berjuta-juta permainan menentang dirinya sendiri, mengatasi program Go, catur dan shogi terbaik dalam beberapa jam hingga beberapa hari. Sistem yang lebih baru, MuZero, juga mempelajari peraturan permainan dengan sendirinya. Pencapaian ini mempamerkan cara pembelajaran pengukuhan serta carian boleh menemui strategi di luar pengetahuan manusia.

Wawasan Teknikal

AlphaZero menggabungkan rangkaian saraf dalam dengan Carian Pokok Monte Carlo (MCTS). Rangkaian mengeluarkan dasar (yang bergerak kelihatan menjanjikan) dan nilai (yang berkemungkinan menang), membimbing carian untuk meneroka hanya baris yang paling berkaitan dan bukannya setiap cawangan. Melalui pembelajaran pengukuhan main kendiri, ramalan rangkaian dan hasil carian saling menguatkan antara satu sama lain, bertambah baik. Tiada permainan manusia atau fungsi penilaian buatan tangan diperlukan, hanya peraturan dan ganjaran untuk menang.

Kesan Strategik

Strategi vendor

Peta jalan vendor mempengaruhi ciri yang boleh dibina oleh pasukan anda seterusnya.

Kos dan bajet

Terma komersial dan pilihan penggunaan mempengaruhi kos dan risiko jangka panjang.

Risiko dan keselamatan

Insentif syarikat membentuk keingkaran produk, postur keselamatan dan keterbukaan.

Masa Depan AlphaGo dan AlphaZero

Resipi AlphaZero, belajar melalui permainan sendiri berpandukan carian, kini mempengaruhi robotik, penemuan saintifik dan penaakulan model bahasa besar, di mana model 'mencari' langkah penyelesaian. Keturunan seperti MuZero dan AlphaProof menggunakan idea ini pada perancangan tanpa peraturan yang diketahui dan kepada matematik. Jangkakan permainan kendiri dan carian pokok untuk mengekalkan sistem kuasa yang mesti merancang, menyusun strategi dan menemui penyelesaian baru, yang semakin digabungkan dengan teknik penaakulan yang kini muncul dalam model AI sempadan.

Pelaksanaan Dunia Sebenar

Mengalahkan juara dunia Go Lee Sedol (2016) dan Ke Jie (2017) dalam perlawanan mercu tanda

AlphaZero mengajar dirinya sendiri catur manusia luar biasa dalam beberapa jam, mendedahkan idea pembukaan dan pengorbanan baru yang dipelajari oleh grandmaster

MuZero menguasai permainan Go, catur, shogi, dan Atari tanpa diberitahu peraturannya

Kaedah permainan kendiri dan carian yang memberi inspirasi kini digunakan dalam robotik, matematik (AlphaProof) dan penaakulan LLM

Risiko & Pengawal

Pengumuman pelancaran mungkin melebihi kestabilan dalam aliran kerja pengeluaran sebenar.

Harga API atau anjakan dasar boleh memecahkan andaian semalaman.

Kebergantungan vendor tunggal meningkatkan kos kunci masuk dan penghijrahan.

Hala Tuju Pelaksanaan

1

Nilai penyedia menggunakan tugasan dan set data anda sendiri.

2

Semak privasi, keselamatan dan syarat undang-undang sebelum penyepaduan.

3

Kekalkan pelan sandaran merentas model atau vendor.

4

Pantau nota keluaran supaya perubahan peta jalan tidak mengejutkan pasukan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Model Zhipu GLM

Soalan lazim

What is AlphaGo and AlphaZero?

AlphaGo ialah program DeepMind yang menewaskan pemain Go terbaik dunia, satu pencapaian yang telah lama difikirkan beberapa dekad lagi. AlphaZero kemudiannya menguasai Go, catur, dan shogi sepenuhnya melalui permainan sendiri, mempelajari kemahiran manusia luar dari awal.

Mengapakah permainan Go dianggap sukar untuk komputer?

Faktor percabangan besar Go menjadikan pencarian kekerasan tidak dapat dilaksanakan, jadi kejayaan memerlukan intuisi yang dipelajari.

Siapa yang terkenal dengan kekalahan AlphaGo 4-1 pada 2016?

AlphaGo menewaskan juara utama Go Lee Sedol 4-1 dalam perlawanan 2016 yang ditonton ramai.

Bagaimanakah AlphaZero belajar bermain, tidak seperti AlphaGo?

AlphaZero bermula daripada hanya peraturan dan belajar semata-mata dengan bermain menentang dirinya sendiri, tanpa data permainan manusia.

Kaedah carian manakah yang AlphaZero berpasangan dengan rangkaian sarafnya?

AlphaZero menggunakan Carian Pokok Monte Carlo berpandukan dasar rangkaian saraf dan ramalan nilai.

Apakah dua perkara yang diramalkan oleh rangkaian saraf AlphaZero untuk membimbing cariannya?

Output rangkaian yang bergerak kelihatan menjanjikan (dasar) dan anggaran siapa yang akan menang (nilai), memfokuskan carian.