PANDUAN Perusahaan

AlphaGo dan AlphaZero

AlphaGo adalah program DeepMind yang mengalahkan pemain Go terbaik dunia, sebuah pencapaian yang sudah lama dipikirkan beberapa dekade lagi.

2 min readTerakhir diperbarui

Ikhtisar

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Menyelam Lebih Dalam

Go memiliki lebih banyak kemungkinan posisi papan daripada atom di alam semesta yang dapat diamati, sehingga pencarian brute-force tidak ada harapan dan intuisi menjadi penting. Pada tahun 2016, AlphaGo mengalahkan juara legendaris Lee Sedol 4-1, dengan 'Move 37' yang terkenal yang memukau para ahli yang bukan manusia secara kreatif. AlphaGo belajar dari permainan ahli manusia ditambah permainan mandiri. Pada tahun 2017, AlphaZero melangkah lebih jauh: dimulai hanya dengan aturan dan tanpa data manusia, ia belajar sendiri dengan memainkan jutaan permainan melawan dirinya sendiri, melampaui program Go, catur, dan shogi terbaik dalam hitungan jam hingga hari. Sistem selanjutnya, MuZero, bahkan mempelajari aturan permainannya sendiri. Pencapaian ini menunjukkan bagaimana pembelajaran penguatan dan penelusuran dapat menemukan strategi di luar pengetahuan manusia.

Wawasan Teknis

AlphaZero menggabungkan jaringan saraf dalam dengan Monte Carlo Tree Search (MCTS). Jaringan tersebut mengeluarkan sebuah kebijakan (yang pergerakannya terlihat menjanjikan) dan sebuah nilai (yang kemungkinan besar akan menang), yang memandu pencarian untuk hanya mengeksplorasi jalur yang paling relevan, bukan setiap cabang. Melalui pembelajaran penguatan permainan mandiri, prediksi jaringan dan hasil pencarian saling memperkuat dan terus meningkat. Tidak diperlukan permainan manusia atau fungsi evaluasi buatan tangan, hanya aturan dan hadiah untuk kemenangan.

Dampak Strategis

Vendor strategy

Peta jalan vendor memengaruhi fitur apa yang dapat dibangun tim Anda selanjutnya.

Cost and budget

Persyaratan komersial dan opsi penerapan memengaruhi biaya dan risiko jangka panjang.

Risk and safety

Insentif perusahaan membentuk standar produk, postur keselamatan, dan keterbukaan.

Masa Depan AlphaGo dan AlphaZero

Resep AlphaZero, belajar melalui permainan mandiri yang dipandu oleh pencarian, kini memengaruhi robotika, penemuan ilmiah, dan penalaran model bahasa besar, di mana model 'mencari' langkah-langkah solusi. Keturunan seperti MuZero dan AlphaProof menerapkan ide-ide ini pada perencanaan tanpa aturan yang diketahui dan pada matematika. Harapkan permainan mandiri dan penelusuran pohon untuk terus mendukung sistem yang harus merencanakan, menyusun strategi, dan menemukan solusi baru, yang semakin menyatu dengan teknik penalaran yang kini muncul dalam model AI terdepan.

Implementasi Dunia Nyata

Mengalahkan juara dunia Go Lee Sedol (2016) dan Ke Jie (2017) dalam pertandingan penting

AlphaZero mengajari dirinya sendiri catur manusia super dalam hitungan jam, mengungkapkan ide-ide pembukaan dan pengorbanan baru yang dipelajari oleh para grandmaster

MuZero menguasai permainan Go, catur, shogi, dan Atari tanpa diberitahu aturannya

Metode permainan mandiri dan pencarian yang menginspirasi sekarang digunakan dalam robotika, matematika (AlphaProof), dan penalaran LLM

Risiko & Pagar Pembatas

Pengumuman peluncuran mungkin melampaui stabilitas alur kerja produksi sebenarnya.

Penetapan harga API atau perubahan kebijakan dapat mematahkan asumsi dalam sekejap.

Ketergantungan pada vendor tunggal meningkatkan biaya lock-in dan migrasi.

Peta Jalan Implementasi

1

Evaluasi penyedia menggunakan tugas dan kumpulan data Anda sendiri.

2

Tinjau persyaratan privasi, keamanan, dan hukum sebelum integrasi.

3

Pertahankan rencana cadangan di seluruh model atau vendor.

4

Pantau catatan rilis agar perubahan peta jalan tidak mengejutkan tim.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model Zhipu GLM

Pertanyaan yang sering diajukan

What is AlphaGo and AlphaZero?

AlphaGo adalah program DeepMind yang mengalahkan pemain Go terbaik dunia, sebuah pencapaian yang sudah lama dipikirkan beberapa dekade lagi. AlphaZero kemudian menguasai Go, catur, dan shogi sepenuhnya melalui permainan mandiri, mempelajari keterampilan manusia super dari awal.

Mengapa permainan Go dianggap sangat sulit untuk komputer?

Faktor percabangan Go yang sangat besar membuat pencarian brute-force menjadi tidak mungkin dilakukan, sehingga keberhasilan memerlukan intuisi yang dipelajari.

Siapa yang terkenal dikalahkan AlphaGo 4-1 pada tahun 2016?

AlphaGo mengalahkan juara Go teratas Lee Sedol 4-1 dalam pertandingan tahun 2016 yang banyak ditonton.

Bagaimana AlphaZero belajar bermain, tidak seperti AlphaGo?

AlphaZero memulai dari sekedar aturan dan belajar hanya dengan bermain melawan dirinya sendiri, tanpa data permainan manusia.

Metode pencarian manakah yang dipasangkan AlphaZero dengan jaringan sarafnya?

AlphaZero menggunakan Pencarian Pohon Monte Carlo yang dipandu oleh kebijakan jaringan saraf dan prediksi nilai.

Apa dua hal yang diprediksi oleh jaringan saraf AlphaZero untuk memandu pencariannya?

Output jaringan yang bergerak terlihat menjanjikan (kebijakan) dan perkiraan siapa yang akan menang (nilai), memfokuskan pencarian.