Als nächstesNächster Leitfaden
California SB 53 und Frontier AI Transparency
Gesellschaft
Gesellschaftsführer
Ein bahnbrechendes KI-Sicherheitsrahmenwerk, beispielsweise eine verantwortungsvolle Skalierungsrichtlinie, ist eine veröffentlichte Verpflichtung eines KI-Labors, seine Modelle auf gefährliche Fähigkeiten zu testen.
Wenn ein Modell einen festgelegten Schwellenwert überschreitet, verpflichtet sich das Labor, stärkere Sicherheitsvorkehrungen zu treffen oder es erst dann einzusetzen oder weiter zu trainieren, wenn diese Sicherheitsvorkehrungen vorhanden sind. Diese Frameworks sind wichtig, weil sie derzeit die Hauptmethode zur Steuerung der fortschrittlichsten KI-Modelle für Katastrophenrisiken sind, obwohl die meisten davon freiwillig sind und von den Labors selbst geschrieben werden.
Anthropic veröffentlichte im September 2023 die erste Richtlinie zur verantwortungsvollen Skalierung. Sie führte AI Safety Levels (ASLs) ein, die lose an Biosicherheitsstufen angelehnt sind, wobei höhere Stufen stärkere Sicherheits- und Bereitstellungsschutzmaßnahmen erfordern. In einer späteren Version im Oktober 2024 wurde die Richtlinie im Hinblick auf Fähigkeitsschwellenwerte und erforderliche Schutzmaßnahmen neu formuliert und die Rolle eines Responsible Scaling Officer beschrieben. OpenAI hat sein Preparedness Framework im Dezember 2023 als Betaversion veröffentlicht. Es bewertete das Risiko in verfolgten Kategorien, darunter ursprünglich CBRN-Bedrohungen, Cybersicherheit, Überzeugung und Modellautonomie. Bei einer Überarbeitung im Jahr 2025 wurde es um die Fähigkeitsschwellenwerte „Hohe“ und „Kritisch“ herum neu organisiert und Überzeugung als verfolgte Kategorie gestrichen. Google DeepMind hat sein Frontier Safety Framework im Mai 2024 veröffentlicht und seitdem überarbeitet. Es definiert Critical Capability Levels (CCLs), die Reaktionspläne auslösen. Auf dem AI Seoul Summit im Mai 2024 unterzeichneten 16 Unternehmen die Frontier AI Safety Commitments. Sie einigten sich darauf, Sicherheitsrahmen zu veröffentlichen, Schwellenwerte für untragbare Risiken festzulegen und kein Modell zu entwickeln oder einzusetzen, wenn dessen Risiken nicht unter diesen Schwellenwerten gehalten werden könnten. Viele Frameworks wurden vor dem Paris AI Action Summit im Februar 2025 veröffentlicht. Kritiker weisen auf mehrere Schwächen hin. Labore schreiben ihre eigenen Schwellenwerte und können diese selbst überarbeiten. Formulierungen wie „sinnvoller Uplift“ lassen Raum für Interpretationen. Die externe Verifizierung ist begrenzt und der kommerzielle Wettbewerb gibt Laboren einen Anreiz, die Ergebnisse großzügig zu lesen. Ein weit verbreitetes Missverständnis ist, dass es sich bei diesen Rahmenwerken um Gesetze handelt. Die meisten sind freiwillig, obwohl sich dies ändert. Der kalifornische SB 53 verlangt von großen Frontier-Entwicklern die Veröffentlichung eines solchen Rahmenwerks, und der EU-Verhaltenskodex für allgemeine KI, ein freiwilliger Weg zum Nachweis der Einhaltung des KI-Gesetzes, fordert die Unterzeichner auf, einen solchen Rahmen zu übernehmen.
Sowohl katastrophale als auch alltägliche Schäden durch KI hängen davon ab, wer die Risiken versteht und wer handeln kann.
Die öffentliche und berufliche Bildung bestimmt, ob eine starke Sicherheitspolitik politisch möglich ist.
Klare Erklärungen reduzieren die Vereinnahmung durch Hype, Labor-PR und vages Ethik-Theater.
Rahmenwerke bewegen sich von freiwilligen Zusagen hin zu regulatorischen Erwartungen. Kalifornien verlangt jetzt von großen Frontier-Entwicklern, diese zu veröffentlichen, der Verhaltenskodex der EU verlangt von den Unterzeichnern, sie zu übernehmen, und weitere Jurisdiktionen könnten folgen. Zu den offenen Fragen gehört, wer die Einhaltung prüft, wie Schwellenwerte in allen Labors standardisiert werden und ob Bewertungen mit den sich schnell verbessernden Agentensystemen Schritt halten können. Unabhängige Prüfstellen, darunter staatliche KI-Institute, könnten bei der Überprüfung von Laborangaben eine größere Rolle übernehmen. Die zentrale Spannung wird wahrscheinlich bestehen bleiben: Labore entwerfen die Regeln, nach denen sie beurteilt werden, was Transparenz und Kontrolle von außen wichtig macht.
Vor der Veröffentlichung testet ein Labor, ob ein neues Modell jemandem, der versucht, biologische Waffen zu erwerben, einen sinnvollen Aufschwung bietet. Wenn der Schwellenwert überschritten wird, fügt das Labor vor der Bereitstellung strengere Missbrauchsfilter und Sicherheitsmaßnahmen hinzu.
Im Mai 2025 teilte Anthropic mit, dass es vorsorglich die ASL-3-Bereitstellung und den Sicherheitsschutz für Claude Opus 4 aktiviert habe, da nicht ausgeschlossen werden könne, dass das Modell die entsprechende Leistungsschwelle erreicht habe.
Das Preparedness Framework von OpenAI weist eine Sicherheitsberatungsgruppe an, Fähigkeitsberichte zu überprüfen und die Führung vor einer Freigabe darüber zu beraten, ob Sicherheitsmaßnahmen angemessen sind.
Ein Labor, das die autonome Replikation oder die Beschleunigung der KI-Forschung verfolgt, führt Agentenbewertungen durch. Diese testen, ob das Modell lange, mehrstufige Aufgaben ohne menschliche Hilfe erledigen kann.
Das existentielle Risiko wird als Science-Fiction behandelt, während sich die Fähigkeiten verstärken.
Verwechslung von Oberflächenproduktsicherheit mit Ausrichtung unter hoher Autonomie.
Nicht-englischsprachigen und nicht fachkundigen Zielgruppen stehen nur Quellen von geringer Qualität zur Verfügung.
Separate Risiken für Produktschäden, Missbrauch und Kontrollverlust/Fehlausrichtung.
Fragen Sie, welche Beweise Ihre Sicht auf Zeitpläne und Schweregrad ändern würden.
Bevorzugen Sie Primärquellen und konkrete Bewertungen gegenüber Marketingaussagen.
Identifizieren Sie einen Aktionspfad: Karriere, Politik, Finanzierung oder Fähigkeiten – nicht nur Bewusstsein.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Ein bahnbrechendes KI-Sicherheitsrahmenwerk, beispielsweise eine verantwortungsvolle Skalierungsrichtlinie, ist eine veröffentlichte Verpflichtung eines KI-Labors, seine Modelle auf gefährliche Fähigkeiten zu testen. Wenn ein Modell einen festgelegten Schwellenwert überschreitet, verpflichtet sich das Labor, stärkere Sicherheitsvorkehrungen zu treffen oder es erst dann einzusetzen oder weiter zu trainieren, wenn diese Sicherheitsvorkehrungen vorhanden sind. Diese Frameworks sind wichtig, weil sie derzeit die Hauptmethode zur Steuerung der fortschrittlichsten KI-Modelle für Katastrophenrisiken sind, obwohl die meisten davon freiwillig sind und von den Labors selbst geschrieben werden.
Diese Frameworks basieren auf Wenn-Dann-Verpflichtungen, die Fähigkeitsschwellenwerte mit erforderlichen Schutzmaßnahmen verknüpfen.
Mit der Responsible Scaling Policy von Anthropic vom September 2023 wurden ASLs eingeführt, die sich lose an den Biosicherheitsniveaus orientieren.
DeepMind verwendet Critical Capability Levels (CCLs), die bei Erreichen Reaktionspläne auslösen.
Bei den Frontier AI Safety Commitments handelte es sich um freiwillige Zusagen, Rahmenwerke zu veröffentlichen und nicht fortzufahren, wenn die Risiken nicht unter den Schwellenwerten gehalten werden können.
Durch die Überarbeitung wurde das Rahmenwerk um hohe und kritische Schwellenwerte herum neu organisiert und Überzeugung als verfolgte Kategorie entfernt.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
California SB 53 und Frontier AI Transparency
Gesellschaft