Was ist passiert?
Yandex hat AliceAI-Foundation-80B-A3B-Base, ein großes Sprachmodell mit 80 Milliarden Parametern, auf Hugging Face unter einer Apache 2.0-Lizenz veröffentlicht. Das Modell nutzt eine Mixture-of-Experts-Architektur, die nur 3 Milliarden pro Token aktiviert, ein Kontextfenster mit 262.144 Token unterstützt und auf etwa 18 Billionen Token trainiert wurde. Es ist sowohl für den kommerziellen Einsatz als auch für die akademische Forschung konzipiert und weist spezifische Optimierungen für russischsprachige Aufgaben auf.
Yandex hat AliceAI-Foundation-80B-A3B-Base auf Hugging Face unter einer Apache 2.0-Lizenz verfügbar gemacht, was eine uneingeschränkte kommerzielle Nutzung, Modifikation und Produktentwicklung ohne Lizenzgebühren ermöglicht. Das Modell ist ein 80-Milliarden--System, das sowohl für den kommerziellen Einsatz als auch für die akademische Forschung entwickelt wurde.
Die Architektur verwendet ein Mixture-of-Experts (MoE)-Design, bei dem nur 3 Milliarden für einen bestimmten Token aktiv sind. Das Routing-System wählt die zehn besten Experten aus einem Pool von 512 Experten sowie einen gemeinsamen Experten aus, der immer aktiv bleibt. Dieses Design erstreckt sich über 48 Ebenen und verwendet eine Mischung aus Kimi Delta Attention und Gated Attention und unterstützt ein Kontextfenster von bis zu 262.144 Token.
Das Modell wurde von Grund auf auf etwa 18 Billionen Token trainiert. Yandex hat es mit DeepSeek-Varianten verglichen und berichtet, dass es DeepSeek-V4-Flash-Base bei zwei neuen russischsprachigen Benchmarks übertrifft, die mit der Veröffentlichung eingeführt wurden: WikiWebFacts und HardMultiQA. Bei Codierungsaufgaben kann sich das Modell Berichten zufolge mit dem Nemotron-3-Super-120B von NVIDIA behaupten, obwohl pro Vorwärtsdurchlauf weitaus weniger aktiviert werden.
Diese Veröffentlichung folgt auf ein offenes Modell mit 35 Milliarden Parametern, das von Yandex nur zwei Wochen zuvor im September 2026 veröffentlicht wurde. Es stellt einen architektonischen Sprung von dichten Transformatordesigns zum MoE-Ansatz dar und führt die Linie der Open-Source-KI von Yandex fort, die das frühere YaLM 100B-Modell umfasst.
Quellenangaben: cryptobriefing.com ↗
Warum es wichtig ist
Diese Version bietet eine leistungsstarke, offen lizenzierte Alternative für russischsprachige Anwendungen und schließt eine Lücke, bei der die meisten offenen Modelle überwiegend auf Englisch trainiert sind. Die MoE-Architektur senkt die Hardwareanforderungen für die Bereitstellung vor Ort und macht sie für regulierte Branchen wie Recht und Medizin zugänglicher. Indem es DeepSeek-V4-Flash-Base bei neuen russischsprachigen Benchmarks übertrifft, schafft es eine wettbewerbsfähige Basis für souveräne KI-Bemühungen in der Region.
Das Modell ist ausdrücklich als souveräne KI-Lösung konzipiert und hebt die Leistung in russischen rechtlichen und medizinischen Kontexten hervor, in denen die Domänengenauigkeit von entscheidender Bedeutung ist und bestehende westliche oder chinesische Modelle aufgrund von Ungleichgewichten bei den Trainingsdaten möglicherweise nicht ausreichen.
Für Entwickler, die an russischsprachigen Anwendungen arbeiten, füllt dieses Modell eine erhebliche Lücke, da die meisten hochwertigen offenen Modelle überwiegend auf Englisch geschult sind. Die Möglichkeit, das Modell ohne Lizenzgebühren zu nutzen, senkt die Eintrittsbarrieren für Unternehmen und Forscher.
Die MoE-Architektur hat praktische Auswirkungen auf die Bereitstellungskosten. Da zu jedem Zeitpunkt nur 3 Milliarden der 80 Milliarden aktiv sind, können Unternehmen das Modell auf ihrer eigenen Infrastruktur kostengünstiger betreiben, als dies für ein vollständig dichtes 80B-Modell erforderlich wäre, wodurch die Hardwareschwelle für die Bereitstellung vor Ort in regulierten Branchen gesenkt wird.
Interaktiver Mechanismus: Wie es tatsächlich funktioniert
Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.
In AI, what are a model's "parameters"?
Was Sie als nächstes sehen sollten
Beobachten Sie die Übernahme der neuen WikiWebFacts- und HardMultiQA-Benchmarks durch die breitere KI-Community als potenzielle Standards für die Bewertung russischsprachiger Modelle. Achten Sie auf die Integration dieses Basismodells in den verbraucherorientierten Alice-Assistenten von Yandex für zukünftige Überlegungen und Agentenfunktionen. Verfolgen Sie, ob andere Organisationen das Modell für On-Premise-Bereitstellungen in regulierten Sektoren übernehmen.
Die beiden neuen Benchmarks, WikiWebFacts und HardMultiQA, könnten zu Community-Standards für die Bewertung russischsprachiger Modelle werden und Einfluss darauf haben, wie die Leistung in diesem spezifischen Sprachbereich gemessen wird.
Yandex möchte, dass dieses Basismodell als Motor für zukünftige Überlegungen und Agentenfunktionen in seinem verbraucherorientierten Alice-Assistenten dient und bevorstehende Produktaktualisierungen vorschlägt, die diese neue Infrastruktur nutzen.
Die unabhängige Überprüfung der Benchmark-Ansprüche beschränkt sich derzeit auf die eigene Berichterstattung von Yandex, da im Quellmaterial keine Bewertungen Dritter zitiert wurden.