PRZEWODNIK FIRM

AlphaGo i AlphaZero

AlphaGo był programem DeepMind, który pokonał najlepszych graczy Go na świecie, co było kamieniem milowym, o którym myślano od dawna od dawna.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.

Głębokie nurkowanie

Go ma więcej możliwych pozycji na planszy niż atomów w obserwowalnym wszechświecie, co sprawia, że ​​poszukiwania metodą brute-force są beznadziejne, a intuicja niezbędna. W 2016 roku AlphaGo pokonało legendarnego mistrza Lee Sedola 4:1, a jego słynni eksperci „Move 37” jako twórczo nie byli ludźmi. AlphaGo uczyła się na podstawie gier eksperckich prowadzonych przez ludzi oraz samodzielnej zabawy. W 2017 roku AlphaZero poszła dalej: zaczynając od samych zasad i bez danych ludzkich, uczyła się sama, grając przeciwko sobie w miliony gier, pokonując najlepsze programy Go, szachy i shogi w ciągu kilku godzin lub dni. Późniejszy system, MuZero, nawet sam nauczył się zasad gry. Te kamienie milowe pokazały, jak uczenie się przez wzmacnianie w połączeniu z wyszukiwaniem może odkryć strategie wykraczające poza ludzką wiedzę.

Wgląd techniczny

AlphaZero łączy głęboką sieć neuronową z wyszukiwaniem drzew Monte Carlo (MCTS). Sieć generuje politykę (które ruchy wyglądają obiecująco) i wartość (kto prawdopodobnie wygra), kierując wyszukiwaniem tak, aby eksplorować tylko najbardziej odpowiednie linie, a nie każdą gałąź. Dzięki samodzielnemu uczeniu się przez wzmacnianie przewidywania sieci i wyniki wyszukiwania wzmacniają się nawzajem i stale się poprawiają. Nie są potrzebne żadne ludzkie gry ani ręcznie wykonane funkcje oceny, wystarczą zasady i nagroda za wygraną.

Wpływ strategiczny

Strategia dostawcy

Plany dostawców wpływają na to, jakie funkcje Twój zespół będzie mógł dalej tworzyć.

Koszt i budżet

Warunki handlowe i opcje wdrożenia wpływają na długoterminowe koszty i ryzyko.

Ryzyko i bezpieczeństwo

Zachęty firmowe kształtują wady produktów, postawę bezpieczeństwa i otwartość.

Przyszłość AlphaGo i AlphaZero

Recepta AlphaZero, polegająca na uczeniu się poprzez zabawę i wyszukiwanie, ma teraz wpływ na robotykę, odkrycia naukowe i rozumowanie w oparciu o modele wielkojęzykowe, w których modele „przeszukują” etapy rozwiązania. Potomkowie, tacy jak MuZero i AlphaProof, stosują te pomysły do ​​planowania bez znanych reguł i do matematyki. Spodziewaj się, że samodzielna zabawa i przeszukiwanie drzew zapewnią zasilanie systemom, które muszą planować, opracowywać strategie i odkrywać nowatorskie rozwiązania, w coraz większym stopniu połączone z technikami wnioskowania pojawiającymi się obecnie w pionierskich modelach sztucznej inteligencji.

Implementacja w świecie rzeczywistym

Pokonanie mistrzów świata w Go Lee Sedola (2016) i Ke Jie (2017) w przełomowych meczach

AlphaZero w ciągu kilku godzin uczy się gry w nadludzkie szachy, odkrywając nowe pomysły na otwarcie i poświęcenie studiowane przez arcymistrzów

MuZero opanowuje gry Go, szachy, shogi i Atari bez znajomości zasad

Inspirujące metody samodzielnej zabawy i wyszukiwania stosowane obecnie w robotyce, matematyce (AlphaProof) i rozumowaniu LLM

Zagrożenia i poręcze

Ogłoszenia o wprowadzeniu na rynek mogą przekroczyć stabilność w rzeczywistych przepływach pracy.

Ceny interfejsów API lub zmiany zasad mogą z dnia na dzień złamać założenia.

Zależność od jednego dostawcy zwiększa koszty uzależnienia i migracji.

Plan wdrożenia

1

Oceniaj dostawców, korzystając z własnych zadań i zbiorów danych.

2

Przed integracją przejrzyj warunki dotyczące prywatności, bezpieczeństwa i prawa.

3

Utrzymuj plan awaryjny dla różnych modeli i dostawców.

4

Monitoruj informacje o wersji, aby zmiany w planie działania nie zaskoczyły zespołów.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is AlphaGo and AlphaZero?

AlphaGo był programem DeepMind, który pokonał najlepszych graczy Go na świecie, co było kamieniem milowym, o którym myślano od dawna od dawna. Następnie AlphaZero opanował Go, szachy i shogi całkowicie samodzielnie, ucząc się od podstaw nadludzkich umiejętności.

Dlaczego grę w Go uznano za szczególnie trudną dla komputerów?

Ogromny współczynnik rozgałęzień Go sprawia, że ​​wyszukiwanie metodą brute-force jest niewykonalne, więc sukces wymaga wyuczonej intuicji.

Kogo AlphaGo słynnie pokonało 4:1 w 2016 roku?

AlphaGo pokonało czołowego mistrza Go Lee Sedola 4:1 w szeroko oglądanym meczu w 2016 roku.

Jak AlphaZero nauczył się grać, w przeciwieństwie do AlphaGo?

AlphaZero zaczynała od zasad i uczyła się wyłącznie grając przeciwko sobie, bez danych gry prowadzonych przez ludzi.

Którą metodę wyszukiwania AlphaZero łączy ze swoją siecią neuronową?

AlphaZero korzysta z wyszukiwania drzew Monte Carlo, kierując się polityką sieci neuronowej i przewidywaniami wartości.

Jakie dwie rzeczy przewiduje sieć neuronowa AlphaZero, które pomogą jej w wyszukiwaniu?

Wyniki sieci, które się poruszają, wyglądają obiecująco (polityka) i szacunkowo, kto wygra (wartość), skupiając poszukiwania.