AlphaGo dan AlphaZero
AlphaGo adalah program DeepMind yang mengalahkan pemain Go terbaik dunia, sebuah pencapaian yang sudah lama dipikirkan beberapa dekade lagi.
Ikhtisar
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Menyelam Lebih Dalam
Go memiliki lebih banyak kemungkinan posisi papan daripada atom di alam semesta yang dapat diamati, sehingga pencarian brute-force tidak ada harapan dan intuisi menjadi penting. Pada tahun 2016, AlphaGo mengalahkan juara legendaris Lee Sedol 4-1, dengan 'Move 37' yang terkenal yang memukau para ahli yang bukan manusia secara kreatif. AlphaGo belajar dari permainan ahli manusia ditambah permainan mandiri. Pada tahun 2017, AlphaZero melangkah lebih jauh: dimulai hanya dengan aturan dan tanpa data manusia, ia belajar sendiri dengan memainkan jutaan permainan melawan dirinya sendiri, melampaui program Go, catur, dan shogi terbaik dalam hitungan jam hingga hari. Sistem selanjutnya, MuZero, bahkan mempelajari aturan permainannya sendiri. Pencapaian ini menunjukkan bagaimana pembelajaran penguatan dan penelusuran dapat menemukan strategi di luar pengetahuan manusia.
Wawasan Teknis
AlphaZero menggabungkan jaringan saraf dalam dengan Monte Carlo Tree Search (MCTS). Jaringan tersebut mengeluarkan sebuah kebijakan (yang pergerakannya terlihat menjanjikan) dan sebuah nilai (yang kemungkinan besar akan menang), yang memandu pencarian untuk hanya mengeksplorasi jalur yang paling relevan, bukan setiap cabang. Melalui pembelajaran penguatan permainan mandiri, prediksi jaringan dan hasil pencarian saling memperkuat dan terus meningkat. Tidak diperlukan permainan manusia atau fungsi evaluasi buatan tangan, hanya aturan dan hadiah untuk kemenangan.
Dampak Strategis
Vendor strategy
Peta jalan vendor memengaruhi fitur apa yang dapat dibangun tim Anda selanjutnya.
Cost and budget
Persyaratan komersial dan opsi penerapan memengaruhi biaya dan risiko jangka panjang.
Risk and safety
Insentif perusahaan membentuk standar produk, postur keselamatan, dan keterbukaan.
Masa Depan AlphaGo dan AlphaZero
Resep AlphaZero, belajar melalui permainan mandiri yang dipandu oleh pencarian, kini memengaruhi robotika, penemuan ilmiah, dan penalaran model bahasa besar, di mana model 'mencari' langkah-langkah solusi. Keturunan seperti MuZero dan AlphaProof menerapkan ide-ide ini pada perencanaan tanpa aturan yang diketahui dan pada matematika. Harapkan permainan mandiri dan penelusuran pohon untuk terus mendukung sistem yang harus merencanakan, menyusun strategi, dan menemukan solusi baru, yang semakin menyatu dengan teknik penalaran yang kini muncul dalam model AI terdepan.
Implementasi Dunia Nyata
Mengalahkan juara dunia Go Lee Sedol (2016) dan Ke Jie (2017) dalam pertandingan penting
AlphaZero mengajari dirinya sendiri catur manusia super dalam hitungan jam, mengungkapkan ide-ide pembukaan dan pengorbanan baru yang dipelajari oleh para grandmaster
MuZero menguasai permainan Go, catur, shogi, dan Atari tanpa diberitahu aturannya
Metode permainan mandiri dan pencarian yang menginspirasi sekarang digunakan dalam robotika, matematika (AlphaProof), dan penalaran LLM
Risiko & Pagar Pembatas
Pengumuman peluncuran mungkin melampaui stabilitas alur kerja produksi sebenarnya.
Penetapan harga API atau perubahan kebijakan dapat mematahkan asumsi dalam sekejap.
Ketergantungan pada vendor tunggal meningkatkan biaya lock-in dan migrasi.
Peta Jalan Implementasi
Evaluasi penyedia menggunakan tugas dan kumpulan data Anda sendiri.
Tinjau persyaratan privasi, keamanan, dan hukum sebelum integrasi.
Pertahankan rencana cadangan di seluruh model atau vendor.
Pantau catatan rilis agar perubahan peta jalan tidak mengejutkan tim.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Model Zhipu GLM
Pertanyaan yang sering diajukan
What is AlphaGo and AlphaZero?
AlphaGo adalah program DeepMind yang mengalahkan pemain Go terbaik dunia, sebuah pencapaian yang sudah lama dipikirkan beberapa dekade lagi. AlphaZero kemudian menguasai Go, catur, dan shogi sepenuhnya melalui permainan mandiri, mempelajari keterampilan manusia super dari awal.
Mengapa permainan Go dianggap sangat sulit untuk komputer?
Faktor percabangan Go yang sangat besar membuat pencarian brute-force menjadi tidak mungkin dilakukan, sehingga keberhasilan memerlukan intuisi yang dipelajari.
Siapa yang terkenal dikalahkan AlphaGo 4-1 pada tahun 2016?
AlphaGo mengalahkan juara Go teratas Lee Sedol 4-1 dalam pertandingan tahun 2016 yang banyak ditonton.
Bagaimana AlphaZero belajar bermain, tidak seperti AlphaGo?
AlphaZero memulai dari sekedar aturan dan belajar hanya dengan bermain melawan dirinya sendiri, tanpa data permainan manusia.
Metode pencarian manakah yang dipasangkan AlphaZero dengan jaringan sarafnya?
AlphaZero menggunakan Pencarian Pohon Monte Carlo yang dipandu oleh kebijakan jaringan saraf dan prediksi nilai.
Apa dua hal yang diprediksi oleh jaringan saraf AlphaZero untuk memandu pencariannya?
Output jaringan yang bergerak terlihat menjanjikan (kebijakan) dan perkiraan siapa yang akan menang (nilai), memfokuskan pencarian.