AlphaGo και AlphaZero
Το AlphaGo ήταν το πρόγραμμα DeepMind που κέρδισε τους καλύτερους παίκτες Go στον κόσμο, ένα ορόσημο για πολλές δεκαετίες μακριά.
Επισκόπηση
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Βαθιά κατάδυση
Το Go έχει περισσότερες πιθανές θέσεις σανίδων από τα άτομα στο παρατηρήσιμο σύμπαν, καθιστώντας την αναζήτηση ωμής βίας απελπιστική και τη διαίσθηση απαραίτητη. Το 2016, η AlphaGo νίκησε τον θρυλικό πρωταθλητή Lee Sedol με 4-1, με τους περίφημους «Move 37» εκπληκτικούς ειδικούς ως δημιουργικά μη ανθρώπινους. Το AlphaGo έμαθε από τα παιχνίδια έμπειρων ανθρώπων και το αυτο-παιχνίδι. Το 2017, το AlphaZero προχώρησε παραπέρα: ξεκινώντας μόνο με τους κανόνες και χωρίς ανθρώπινα δεδομένα, έμαθε τον εαυτό του παίζοντας εκατομμύρια παιχνίδια εναντίον του, ξεπερνώντας τα καλύτερα προγράμματα Go, σκάκι και shogi μέσα σε λίγες μέρες. Ένα μεταγενέστερο σύστημα, το MuZero, έμαθε ακόμη και τους κανόνες των παιχνιδιών από μόνο του. Αυτά τα ορόσημα έδειξαν πώς η ενισχυτική μάθηση και η αναζήτηση μπορούν να ανακαλύψουν στρατηγικές πέρα από την ανθρώπινη γνώση.
Τεχνική διορατικότητα
Το AlphaZero συνδυάζει ένα βαθύ νευρωνικό δίκτυο με το Monte Carlo Tree Search (MCTS). Το δίκτυο εξάγει μια πολιτική (η οποία οι κινήσεις φαίνονται ελπιδοφόρες) και μια τιμή (που είναι πιθανό να κερδίσει), καθοδηγώντας την αναζήτηση για να εξερευνήσετε μόνο τις πιο σχετικές γραμμές αντί για κάθε κλάδο. Μέσω της μάθησης ενίσχυσης αυτο-παιχνιδιού, οι προβλέψεις του δικτύου και τα αποτελέσματα αναζήτησης αλληλοενισχύονται, βελτιώνοντας σταθερά. Δεν χρειάζονται ανθρώπινα παιχνίδια ή χειροποίητες λειτουργίες αξιολόγησης, μόνο οι κανόνες και μια ανταμοιβή για τη νίκη.
Στρατηγικός αντίκτυπος
Στρατηγική προμηθευτή
Οι χάρτες πορείας προμηθευτών επηρεάζουν τα χαρακτηριστικά που μπορεί να δημιουργήσει η ομάδα σας στη συνέχεια.
Κόστος και προϋπολογισμός
Οι εμπορικοί όροι και οι επιλογές ανάπτυξης επηρεάζουν το μακροπρόθεσμο κόστος και τον κίνδυνο.
Κίνδυνος και ασφάλεια
Τα κίνητρα της εταιρείας διαμορφώνουν τις προεπιλογές προϊόντων, τη στάση ασφαλείας και τη διαφάνεια.
Το μέλλον των AlphaGo και AlphaZero
Η συνταγή AlphaZero, η οποία μαθαίνει με αυτο-παιχνίδι καθοδηγούμενη από την αναζήτηση, επηρεάζει πλέον τη ρομποτική, την επιστημονική ανακάλυψη και τη συλλογιστική σε μεγάλα γλωσσικά μοντέλα, όπου τα μοντέλα «αναζητούν» τα βήματα λύσης. Απόγονοι όπως το MuZero και το AlphaProof εφαρμόζουν αυτές τις ιδέες στον προγραμματισμό χωρίς γνωστούς κανόνες και στα μαθηματικά. Αναμένετε αυτο-παιχνίδι και αναζήτηση δέντρων για να συνεχίσουν να τροφοδοτούν συστήματα που πρέπει να σχεδιάζουν, να σχεδιάζουν στρατηγική και να ανακαλύπτουν καινοτόμες λύσεις, ολοένα και περισσότερο συγχωνευμένες με τις τεχνικές συλλογιστικής που εμφανίζονται τώρα στα μοντέλα τεχνητής νοημοσύνης συνόρων.
Υλοποίηση σε πραγματικό κόσμο
Νικώντας τους παγκόσμιους πρωταθλητές Go Lee Sedol (2016) και Ke Jie (2017) σε αγώνες ορόσημο
Το AlphaZero διδάσκει υπεράνθρωπο σκάκι σε ώρες, αποκαλύπτοντας φρέσκες ιδέες για άνοιγμα και θυσίες που μελετήθηκαν από μεγάλους μάστερ
Το MuZero κατακτά παιχνίδια Go, σκάκι, shogi και Atari χωρίς να του έχουν πει τους κανόνες
Εμπνευσμένες μέθοδοι αυτοπαιχνιδιού και αναζήτησης που χρησιμοποιούνται τώρα στη ρομποτική, τα μαθηματικά (AlphaProof) και τη συλλογιστική LLM
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Οι ανακοινώσεις κυκλοφορίας ενδέχεται να ξεπεράσουν τη σταθερότητα στις πραγματικές ροές εργασιών παραγωγής.
Η τιμολόγηση API ή οι αλλαγές πολιτικής μπορούν να σπάσουν τις υποθέσεις από τη μια μέρα στην άλλη.
Η εξάρτηση από έναν προμηθευτή αυξάνει το κόστος κλειδώματος και μετεγκατάστασης.
Οδικός Χάρτης Εφαρμογής
Αξιολογήστε τους παρόχους χρησιμοποιώντας τις δικές σας εργασίες και σύνολα δεδομένων.
Ελέγξτε το απόρρητο, την ασφάλεια και τους νομικούς όρους πριν από την ενσωμάτωση.
Διατηρήστε ένα εναλλακτικό σχέδιο σε μοντέλα ή προμηθευτές.
Παρακολουθήστε τις σημειώσεις έκδοσης, ώστε οι αλλαγές στον οδικό χάρτη να μην εκπλήσσουν τις ομάδες.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AlphaGo and AlphaZero quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Μοντέλα Zhipu GLM
Συχνές ερωτήσεις
What is AlphaGo and AlphaZero?
Το AlphaGo ήταν το πρόγραμμα DeepMind που κέρδισε τους καλύτερους παίκτες Go στον κόσμο, ένα ορόσημο για πολλές δεκαετίες μακριά. Στη συνέχεια, το AlphaZero κατέκτησε το Go, το σκάκι και το shogi εξ ολοκλήρου μέσω του αυτοπαιχνιδιού, μαθαίνοντας τις υπεράνθρωπες δεξιότητες από την αρχή.
Γιατί το παιχνίδι Go θεωρήθηκε ιδιαίτερα δύσκολο για τους υπολογιστές;
Ο τεράστιος παράγοντας διακλάδωσης του Go καθιστά την αναζήτηση ωμής βίας ανέφικτη, επομένως η επιτυχία απαιτούσε μαθημένη διαίσθηση.
Ποιον νίκησε περίφημα το AlphaGo με 4-1 το 2016;
Το AlphaGo κέρδισε τον κορυφαίο πρωταθλητή Go Lee Sedol με 4-1 σε έναν αγώνα με μεγάλη προβολή του 2016.
Πώς έμαθε το AlphaZero να παίζει, σε αντίθεση με το AlphaGo;
Το AlphaZero ξεκίνησε μόνο από τους κανόνες και έμαθε μόνο παίζοντας ενάντια στον εαυτό του, χωρίς ανθρώπινα δεδομένα παιχνιδιού.
Ποια μέθοδο αναζήτησης συνδυάζει το AlphaZero με το νευρωνικό του δίκτυο;
Το AlphaZero χρησιμοποιεί Monte Carlo Tree Search με γνώμονα την πολιτική και τις προβλέψεις τιμών ενός νευρωνικού δικτύου.
Ποια δύο πράγματα προβλέπει το νευρωνικό δίκτυο του AlphaZero για να καθοδηγήσει την αναζήτησή του;
Οι έξοδοι δικτύου που κινούνται φαίνονται πολλά υποσχόμενες (πολιτική) και μια εκτίμηση για το ποιος θα κερδίσει (τιμή), εστιάζοντας την αναζήτηση.