Als nächstesNächster Leitfaden
Zhipu GLM-Modelle
Unternehmen
Leitfaden für Unternehmen
AlphaGo war das DeepMind-Programm, das die weltbesten Go-Spieler besiegte, ein Meilenstein, von dem man schon seit Jahrzehnten annahm, dass er noch Jahrzehnte entfernt war.
AlphaZero then mastered Go, chess, and shogi entirely through self-play, learning superhuman skill from scratch.
Go hat mehr mögliche Positionen auf dem Brett als Atome im beobachtbaren Universum, was eine Brute-Force-Suche hoffnungslos und Intuition unerlässlich macht. Im Jahr 2016 besiegte AlphaGo den legendären Champion Lee Sedol mit 4:1 und beeindruckte Experten mit seinem berühmten „Move 37“ als kreativ nicht menschlich. AlphaGo lernte aus menschlichen Expertenspielen und Selbstspielen. Im Jahr 2017 ging AlphaZero noch einen Schritt weiter: Es begann nur mit den Regeln und ohne menschliche Daten und brachte es sich selbst bei, indem es Millionen von Spielen gegen sich selbst spielte und die besten Go-, Schach- und Shogi-Programme innerhalb von Stunden oder Tagen übertraf. Ein späteres System, MuZero, lernte die Spielregeln sogar selbstständig. Diese Meilensteine zeigten, wie durch Verstärkungslernen und Suchen Strategien entdeckt werden können, die über das menschliche Wissen hinausgehen.
Anbieter-Roadmaps beeinflussen, welche Funktionen Ihr Team als Nächstes entwickeln kann.
Kommerzielle Bedingungen und Bereitstellungsoptionen wirken sich auf die langfristigen Kosten und Risiken aus.
Unternehmensanreize prägen Produktstandards, Sicherheitslage und Offenheit.
Das AlphaZero-Rezept, das Lernen durch selbstständiges Spielen unter Anleitung der Suche, beeinflusst nun die Robotik, wissenschaftliche Entdeckungen und das Denken großer Sprachmodelle, bei dem Modelle nach Lösungsschritten „suchen“. Nachkommen wie MuZero und AlphaProof wenden diese Ideen auf die Planung ohne bekannte Regeln und auf die Mathematik an. Erwarten Sie, dass Selbstspiel und Baumsuche weiterhin Systeme antreiben, die planen, Strategien entwickeln und neuartige Lösungen entdecken müssen, zunehmend verknüpft mit den Argumentationstechniken, die jetzt in bahnbrechenden KI-Modellen auftauchen.
Besiege die Go-Weltmeister Lee Sedol (2016) und Ke Jie (2017) in wegweisenden Spielen
AlphaZero brachte sich in wenigen Stunden übermenschliches Schach bei und enthüllte neue Eröffnungs- und Opferideen, die von Großmeistern studiert wurden
MuZero meistert Go-, Schach-, Shogi- und Atari-Spiele, ohne dass ihm die Regeln erklärt werden
Inspirierende Selbstspiel- und Suchmethoden, die jetzt in der Robotik, Mathematik (AlphaProof) und LLM-Argumentation verwendet werden
Markteinführungsankündigungen können die Stabilität realer Produktionsabläufe übertreffen.
API-Preise oder Richtlinienänderungen können Annahmen über Nacht zunichte machen.
Die Abhängigkeit von einem einzigen Anbieter erhöht die Bindungs- und Migrationskosten.
Bewerten Sie Anbieter anhand Ihrer eigenen Aufgaben und Datensätze.
Lesen Sie vor der Integration Datenschutz, Sicherheit und rechtliche Bestimmungen.
Pflegen Sie einen Fallback-Plan für alle Modelle oder Anbieter.
Überwachen Sie die Versionshinweise, damit Roadmap-Änderungen die Teams nicht überraschen.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
AlphaGo war das DeepMind-Programm, das die weltbesten Go-Spieler besiegte, ein Meilenstein, von dem man schon seit Jahrzehnten annahm, dass er noch Jahrzehnte entfernt war. AlphaZero meisterte dann Go, Schach und Shogi vollständig im Selbstspiel und lernte übermenschliche Fähigkeiten von Grund auf.
Der enorme Verzweigungsfaktor von Go macht eine Brute-Force-Suche unmöglich, sodass für den Erfolg eine erlernte Intuition erforderlich war.
AlphaGo besiegte den Top-Go-Champion Lee Sedol in einem viel beachteten Spiel im Jahr 2016 mit 4:1.
AlphaZero begann lediglich mit den Regeln und lernte ausschließlich durch das Spielen gegen sich selbst, ohne menschliche Spieldaten.
AlphaZero nutzt die Monte-Carlo-Baumsuche, die sich an den Richtlinien- und Wertvorhersagen eines neuronalen Netzwerks orientiert.
Das Netzwerk gibt aus, welche Bewegungen vielversprechend aussehen (Richtlinie) und eine Schätzung darüber, wer gewinnen wird (Wert), wodurch die Suche fokussiert wird.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Zhipu GLM-Modelle
Unternehmen