회사 가이드

알파고와 알파제로

AlphaGo는 세계 최고의 바둑 선수들을 이긴 DeepMind 프로그램으로, 수십 년 후에 이정표를 세울 수 있을 것으로 생각되었습니다.

2분 읽기마지막 업데이트

개요

그런 다음 AlphaZero는 셀프 플레이를 통해 바둑, 체스, 장기를 완전히 마스터하고 처음부터 초인적인 기술을 학습했습니다.

심층 분석

Go has more possible board positions than atoms in the observable universe, making brute-force search hopeless and intuition essential. In 2016, AlphaGo defeated legendary champion Lee Sedol 4-1, with its famous 'Move 37' stunning experts as creatively non-human. AlphaGo learned from human expert games plus self-play. 2017년에 AlphaZero는 더 나아갔습니다. 인간의 데이터 없이 규칙만 가지고 시작하여 수백만 개의 게임을 스스로 학습하여 몇 시간에서 며칠 내에 최고의 바둑, 체스, 장기 프로그램을 능가했습니다. A later system, MuZero, even learned the rules of games on its own. These milestones showcased how reinforcement learning plus search can discover strategies beyond human knowledge.

기술적 통찰력

AlphaZero combines a deep neural network with Monte Carlo Tree Search (MCTS). 네트워크는 정책(유망해 보이는 움직임)과 값(승리할 가능성이 있는 사람)을 출력하여 모든 지점 대신 가장 관련성이 높은 라인만 탐색하도록 검색을 안내합니다. Through self-play reinforcement learning, the network's predictions and the search results reinforce each other, steadily improving. No human games or hand-crafted evaluation functions are needed, just the rules and a reward for winning.

전략적 영향

벤더 전략

공급업체 로드맵은 팀이 다음에 구축할 수 있는 기능에 영향을 미칩니다.

비용 및 예산

상업적 조건과 배포 옵션은 장기적인 비용과 위험에 영향을 미칩니다.

위험과 안전

회사 인센티브는 제품 기본값, 안전 태세 및 개방성을 형성합니다.

알파고와 알파제로의 미래

검색을 통해 스스로 플레이하여 학습하는 AlphaZero 레시피는 이제 모델이 솔루션 단계를 '검색'하는 로봇 공학, 과학적 발견 및 대규모 언어 모델 추론에 영향을 미칩니다. Descendants like MuZero and AlphaProof apply these ideas to planning without known rules and to mathematics. 새로운 솔루션을 계획하고, 전략화하고, 발견해야 하는 시스템을 계속 구동하고 현재 최첨단 AI 모델에 나타나는 추론 기술과 점점 더 융합되는 셀프 플레이 및 트리 검색을 기대합니다.

실제 구현

세계 바둑 챔피언 이세돌(2016년)과 커제(2017년)를 랜드마크 경기에서 꺾은 것

AlphaZero는 몇 시간 만에 스스로 초인적인 체스를 가르치며 그랜드마스터들이 연구한 새로운 오프닝과 희생 아이디어를 공개합니다.

MuZero는 규칙을 듣지 않고도 바둑, 체스, 장기, 아타리 게임을 마스터합니다.

이제 로봇 공학, 수학(AlphaProof) 및 LLM 추론에 사용되는 영감을 주는 셀프 플레이 및 검색 방법

위험 및 가드레일

출시 발표는 실제 생산 워크플로의 안정성보다 앞설 수 있습니다.

API 가격 책정이나 정책 변경으로 인해 하룻밤 사이에 가정이 깨질 수 있습니다.

단일 공급업체 종속성은 종속 및 마이그레이션 비용을 증가시킵니다.

구현 로드맵

1

자체 작업과 데이터 세트를 사용하여 공급자를 평가합니다.

2

통합하기 전에 개인정보 보호, 보안, 법적 약관을 검토하세요.

3

모델이나 공급업체 전반에 걸쳐 대체 계획을 유지합니다.

4

로드맵 변경으로 인해 팀이 놀라지 않도록 릴리스 노트를 모니터링하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AlphaGo and AlphaZero quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

알파고(AlphaGo)와 알파제로(AlphaZero)란 무엇인가?

AlphaGo는 세계 최고의 바둑 선수들을 이긴 DeepMind 프로그램으로, 수십 년 후에 이정표를 세울 수 있을 것으로 생각되었습니다. AlphaZero는 셀프 플레이를 통해 바둑, 체스, 장기를 완전히 마스터하고 처음부터 초인적인 기술을 학습했습니다.

바둑 게임이 컴퓨터에게 특히 어려운 게임으로 간주된 이유는 무엇입니까?

Go의 엄청난 분기 요인으로 인해 무차별 검색이 불가능하므로 성공하려면 학습된 직관이 필요했습니다.

2016년 알파고가 4-1로 승리한 것으로 유명한 사람은 누구입니까?

AlphaGo는 널리 시청된 2016년 경기에서 최고의 바둑 챔피언 이세돌을 4-1로 이겼습니다.

AlphaZero는 AlphaGo와 달리 어떻게 플레이하는 법을 배웠나요?

AlphaZero는 규칙만으로 시작하여 인간의 게임 데이터 없이 오로지 자신과 대결하여 학습했습니다.

AlphaZero는 신경망과 어떤 검색 방법을 결합합니까?

AlphaZero는 신경망의 정책과 가치 예측에 따라 몬테카를로 트리 검색을 사용합니다.

AlphaZero의 신경망이 검색을 안내할 것으로 예측하는 두 가지는 무엇입니까?

이동하는 네트워크 출력은 유망해 보이고(정책) 누가 이길 것인지에 대한 추정(가치)을 검색에 집중합니다.