อัลฟ่าโก และอัลฟ่าซีโร
AlphaGo เป็นโปรแกรม DeepMind ที่เอาชนะผู้เล่น Go ที่เก่งที่สุดในโลก ซึ่งเป็นก้าวสำคัญที่คิดมานานหลายทศวรรษ
ภาพรวม
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
เจาะลึก
Go มีตำแหน่งบนกระดานที่เป็นไปได้มากกว่าอะตอมในจักรวาลที่สังเกตได้ ทำให้การค้นหาแบบเดรัจฉานบังคับสิ้นหวังและสัญชาตญาณเป็นสิ่งจำเป็น ในปี 2016 AlphaGo เอาชนะแชมป์เปี้ยนระดับตำนาน Lee Sedol 4-1 โดยผู้เชี่ยวชาญอันน่าทึ่ง 'Move 37' อันโด่งดังในฐานะที่ไม่ใช่มนุษย์อย่างสร้างสรรค์ AlphaGo เรียนรู้จากเกมผู้เชี่ยวชาญที่เป็นมนุษย์และการเล่นด้วยตนเอง ในปี 2017 AlphaZero ก้าวไปไกลกว่านั้น โดยเริ่มจากกฎเท่านั้นและไม่มีข้อมูลของมนุษย์ โดย AlphaZero จะสอนตัวเองด้วยการเล่นเกมนับล้านกับตัวเอง เหนือกว่าโปรแกรม Go หมากรุก และโชกิที่ดีที่สุดภายในไม่กี่ชั่วโมงต่อวัน ระบบต่อมา MuZero ได้เรียนรู้กฎของเกมด้วยตัวมันเอง เหตุการณ์สำคัญเหล่านี้แสดงให้เห็นว่าการเรียนรู้แบบเสริมกำลังและการค้นหาสามารถค้นพบกลยุทธ์ที่นอกเหนือไปจากความรู้ของมนุษย์ได้อย่างไร
ข้อมูลเชิงลึกทางเทคนิค
AlphaZero รวมโครงข่ายประสาทเทียมระดับลึกเข้ากับ Monte Carlo Tree Search (MCTS) เครือข่ายจะแสดงนโยบาย (ซึ่งการเคลื่อนไหวดูมีความหวัง) และคุณค่า (ผู้ที่มีแนวโน้มว่าจะชนะ) เพื่อเป็นแนวทางในการค้นหาเพื่อสำรวจเฉพาะสายที่เกี่ยวข้องมากที่สุดแทนที่จะสำรวจทุกสาขา ด้วยการเรียนรู้แบบเสริมการเล่นด้วยตนเอง การคาดการณ์ของเครือข่ายและผลการค้นหาจะเสริมสร้างซึ่งกันและกัน พัฒนาอย่างต่อเนื่อง ไม่จำเป็นต้องมีเกมของมนุษย์หรือฟังก์ชันการประเมินที่สร้างขึ้นด้วยมือ มีเพียงกฎและรางวัลสำหรับการชนะเท่านั้น
ผลกระทบเชิงกลยุทธ์
กลยุทธ์ของผู้ขาย
โรดแมปของผู้จำหน่ายมีอิทธิพลต่อฟีเจอร์ที่ทีมของคุณสามารถสร้างได้ต่อไป
ต้นทุนและงบประมาณ
ข้อกำหนดทางการค้าและตัวเลือกการใช้งานส่งผลต่อต้นทุนและความเสี่ยงในระยะยาว
ความเสี่ยงและความปลอดภัย
สิ่งจูงใจของบริษัทจะกำหนดค่าเริ่มต้นของผลิตภัณฑ์ ท่าทางที่ปลอดภัย และความเปิดกว้าง
อนาคตของ AlphaGo และ AlphaZero
สูตร AlphaZero การเรียนรู้โดยการเล่นด้วยตนเองและการค้นหา มีอิทธิพลต่อวิทยาการหุ่นยนต์ การค้นพบทางวิทยาศาสตร์ และการให้เหตุผลด้วยแบบจำลองภาษาขนาดใหญ่ โดยที่แบบจำลองจะ 'ค้นหา' เหนือขั้นตอนการแก้ปัญหา ผู้สืบทอดเช่น MuZero และ AlphaProof นำแนวคิดเหล่านี้ไปใช้กับการวางแผนโดยไม่มีกฎเกณฑ์ที่รู้และกับคณิตศาสตร์ คาดหวังการเล่นด้วยตนเองและการค้นหาแบบต้นไม้เพื่อรักษาระบบขับเคลื่อนที่ต้องวางแผน วางกลยุทธ์ และค้นพบโซลูชันใหม่ๆ ซึ่งหลอมรวมเข้ากับเทคนิคการใช้เหตุผลมากขึ้นเรื่อยๆ ที่ปรากฏในโมเดล AI ระดับแนวหน้า
การใช้งานจริงในโลกแห่งความเป็นจริง
เอาชนะแชมป์โลก Go Lee Sedol (2016) และ Ke Jie (2017) ในการแข่งขันครั้งสำคัญ
AlphaZero สอนหมากรุกเหนือมนุษย์ให้ตัวเองได้ในเวลาไม่กี่ชั่วโมง เผยให้เห็นแนวคิดใหม่ๆ และการเสียสละที่ศึกษาโดยปรมาจารย์
MuZero เชี่ยวชาญเกม Go, หมากรุก, โชกิ และ Atari โดยไม่ได้รับการบอกกล่าวกฎเกณฑ์
วิธีการเล่นด้วยตนเองและการค้นหาที่สร้างแรงบันดาลใจในปัจจุบันถูกนำมาใช้ในวิทยาการหุ่นยนต์ คณิตศาสตร์ (AlphaProof) และการใช้เหตุผล LLM
ความเสี่ยงและรั้ว
การประกาศเปิดตัวอาจแซงหน้าความเสถียรในขั้นตอนการทำงานจริง
การกำหนดราคา API หรือการเปลี่ยนแปลงนโยบายสามารถทำลายสมมติฐานได้ในชั่วข้ามคืน
การพึ่งพาผู้ขายรายเดียวจะเพิ่มค่าใช้จ่ายในการล็อคอินและการย้ายข้อมูล
แผนงานการดำเนินงาน
ประเมินผู้ให้บริการโดยใช้งานและชุดข้อมูลของคุณเอง
ตรวจสอบความเป็นส่วนตัว ความปลอดภัย และข้อกำหนดทางกฎหมายก่อนรวมระบบ
รักษาแผนสำรองสำหรับรุ่นหรือผู้จำหน่าย
ตรวจสอบบันทึกประจำรุ่นเพื่อให้การเปลี่ยนแปลงแผนงานไม่ทำให้ทีมแปลกใจ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
โมเดล Zipu GLM
คำถามที่พบบ่อย
What is AlphaGo and AlphaZero?
AlphaGo เป็นโปรแกรม DeepMind ที่เอาชนะผู้เล่น Go ที่เก่งที่สุดในโลก ซึ่งเป็นก้าวสำคัญที่คิดมานานหลายทศวรรษ จากนั้น AlphaZero ก็เชี่ยวชาญโกะ หมากรุก และโชกิผ่านการเล่นด้วยตนเอง โดยเรียนรู้ทักษะเหนือมนุษย์ตั้งแต่เริ่มต้น
เหตุใดเกม Go จึงถือว่ายากสำหรับคอมพิวเตอร์เป็นพิเศษ
ปัจจัยการแตกแขนงมหาศาลของ Go ทำให้การค้นหาแบบเดรัจฉานบังคับเป็นไปไม่ได้ ดังนั้นความสำเร็จจึงต้องใช้สัญชาตญาณในการเรียนรู้
AlphaGo เอาชนะใครได้อย่างโด่งดังด้วยสกอร์ 4-1 ในปี 2016?
AlphaGo เอาชนะแชมป์ Go ชั้นนำ Lee Sedol 4-1 ในการแข่งขันปี 2016 ที่มีผู้ชมอย่างกว้างขวาง
AlphaZero เรียนรู้การเล่นอย่างไร ต่างจาก AlphaGo
AlphaZero เริ่มต้นจากกฎเกณฑ์และเรียนรู้จากการเล่นแข่งกับตัวเองเท่านั้น โดยไม่มีข้อมูลเกมของมนุษย์
AlphaZero จับคู่กับโครงข่ายประสาทเทียมด้วยวิธีการค้นหาใด
AlphaZero ใช้ Monte Carlo Tree Search ตามนโยบายของโครงข่ายประสาทเทียมและการคาดการณ์มูลค่า
โครงข่ายประสาทเทียมของ AlphaZero ทำนายสองสิ่งใดเพื่อเป็นแนวทางในการค้นหา
ผลลัพธ์ของเครือข่ายที่เคลื่อนไหวมีแนวโน้มดี (นโยบาย) และการประมาณการว่าใครจะเป็นผู้ชนะ (มูลค่า) โดยเน้นไปที่การค้นหา