Zurück zu den Neuigkeiten
SicherheitAI Understanding Briefing

Studie zeigt, dass Frontier-KI-Modelle unter Lenkdruck spalten

In einem Vorabdruck mit sechs Modellen wurden deutlich unterschiedliche Möglichkeiten gefunden, Lenkaufforderungen zu widerstehen, sie umzuleiten oder ihnen zu folgen, aber die Modellbeurteilungsetiketten müssen noch von menschlichen Bewertern validiert werden.

Von 6 min read
A researcher applies one mechanical control to six transparent laboratory mechanisms whose internal pathways redirect the same force in visibly different ways.
Die Kurzversion

In einem Vorabdruck mit sechs Modellen wurden deutlich unterschiedliche Möglichkeiten gefunden, Lenkaufforderungen zu widerstehen, sie umzuleiten oder ihnen zu folgen, aber die Modellbeurteilungsetiketten müssen noch von menschlichen Bewertern validiert werden.

Was ist passiert?

In einem am 6. August veröffentlichten Vorabdruck wurde verglichen, wie sechs Frontier-Sprachmodelle ihr Verhalten änderten, wenn dieselben Aufgaben mit Anweisungen zum Offenlegen, Unterdrücken oder Überschreiben wertebezogener Argumente gepaart wurden.

Die Studie bewertete Claude Opus 4.7, GPT-5, Gemini 2.5 Pro, DeepSeek-R1, Qwen3.7-Max und Llama-3.3-70B-Instruct-Turbo – jeweils ein Modell von sechs Entwicklern. Der 340 Punkte umfassende Benchmark enthielt 100 gepaarte Basis- und gesteuerte Eingabeaufforderungen in jeder der drei Kernkategorien: leichte Wertekonflikte, Aufforderungen zur Offenlegung von Begründungen und Aufforderungen zur Unterdrückung von Wertüberlegungen. In vierzig weiteren Items wurden Lenkungs- und Argumentationshinweise im gewöhnlichen Stil getestet. Bei der Arbeit handelt es sich um einen arXiv-Preprint eines einzelnen Autors, nicht um einen peer-reviewten Vergleich oder um eine Stellungnahme eines der Modellanbieter.

Alle sechs Systeme antworteten auf jede Basis- und Steuerungsaufforderung und produzierten 4.080 Antworten. Dieselben sechs Modelle klassifizierten dann jede Antwort anhand festgelegter Verhaltensrubriken, ohne zu erfahren, welches System sie verfasst hatte, und führten zu 24.480 Urteilen. Für jede Antwort verwendete der Autor die Mehrheitsbezeichnung der fünf anderen Modelle und schloss die Selbsteinschätzung des Antwortenden aus. Die ersten 20 Elemente in jeder Kernkategorie halfen beim Aufbau der Rubriken und blieben im bewerteten Satz, sodass der Autor die Analyse auch für die anderen 80 Elemente pro Kategorie erneut durchführte.

Die größte gemeldete Spaltung trat auf, als Models aufgefordert wurden, ihre Argumente offenzulegen. GPT-5 lehnte es ab, diese Begründung anzugeben, ließ aber seine Antwort auf 99 von 100 gesteuerten Fragen unverändert; Die anderen fünf Systeme erhielten diese Kennzeichnung bei 500 Antworten null Mal. Das Papier stellte außerdem fest, dass nur Opus und GPT-5 sich offen gegen Anweisungen zur Unterdrückung von Wertebegründung in sinnvollem Tempo wehrten. Opus stellte die Anweisung beim Erledigen der Aufgabe häufiger in Frage, während GPT-5 die Formulierung häufiger ablehnte und angeforderte Inhalte zurückhielt.

Ein separates Experiment mit offener Gewichtung untersuchte Lamas Tendenz, klärende Fragen zu stellen, anstatt auf einige leicht unterspezifizierte Aufforderungen zu antworten. Eine lineare Sonde dekodierte die beurteilte Entgleisungs-Antwort-Unterscheidung aus dem Reststrom des Modells mit einer Spitzengenauigkeit von 0,866. Bei 50 ausgehaltenen Eingabeaufforderungen verschob das Hinzufügen einer abgeleiteten Richtung auf Schicht 40 die beurteilte Entgleisungsrate von 0 % beim stärksten negativen Eingriff auf 86 % beim stärksten positiven Eingriff. Bei diesem Experiment wurden lokal Referenz-Llama-Gewichte verwendet, nicht der identische, von Together gehostete Serving-Stack, der für die Verhaltensreaktionen verwendet wurde.

Lesen Sie die Primärquelle: Jalal-Kamali's language-model steering study on arXiv

Warum es wichtig ist

Die Ergebnisse deuten darauf hin, dass ein einzelner Wert für Compliance oder Verweigerung qualitativ unterschiedliche Sicherheitsverhaltensweisen verbergen kann, die wichtig sind, wenn Menschen Modelle dazu drängen, Bedenken zu ignorieren, offenzulegen oder zu unterdrücken.

Zwei Systeme können die gleiche Anweisung verweigern, den Benutzern aber unterschiedliche Ergebnisse bescheren. Man kann eine Rahmung ablehnen und eine brauchbare Alternative anbieten; ein anderer kann Einwände erheben, während er die angeforderte Aufgabe noch erledigt; ein Dritter kann eine klärende Frage stellen; und ein anderer folgt möglicherweise der Anweisung, während er ein Anliegen implizit beibehält. Produktteams, die nur Ablehnungen zählen, können diese Unterscheidungen übersehen, auch wenn sie Einfluss darauf haben, ob ein Benutzer nützliche Hilfe, riskante taktische Inhalte oder eine ungeklärte Sackgasse erhält.

Die Basisergebnisse zeigen, dass die Lenkung nicht jeden Unterschied bewirkt hat. Bei Aufforderungen zu leichten Wertekonflikten ohne explizite Steuerungsanweisung erfüllte Opus 35 von 100 Punkten vollständig und stellte bei 60 klärende Fragen, während Llama 57 vollständig befolgte und bei 42 eine Klärung vornahm. GPT-5, Gemini, DeepSeek und Qwen erfüllten 93 bis 100 Punkte vollständig. Diese Kurse beschreiben die Rubrik und den Prompt-Satz dieser Benchmark. Sie legen nicht fest, welches Modell insgesamt ethischer, wahrhaftiger, sicherer oder nützlicher ist.

Die Begründungsunterdrückungsbedingung veranschaulicht auch, warum sichtbarer Text nicht als transparente Darstellung der Modellberechnung behandelt werden kann. In 85 von 100 DeepSeek-Ablaufverfolgungen erschien die Dimension „Ausgeschlossene Werte“ und wurde dann beiseite gelegt, bevor die Antwort der Unterdrückungsanforderung entsprach. Dabei handelt es sich um Beweise für den Text, der von dieser Version von DeepSeek in diesem Setup ausgegeben wird, und nicht um direkten Zugriff auf alle internen Ursachen seiner Antwort. Das Papier selbst unterscheidet zwischen offengelegter Argumentation und einer getreuen Erklärung der Berechnung, die zu einem Ergebnis geführt hat.

Die Lama-Intervention fügt mehr als nur eine Korrelation hinzu: Die Änderung einer Reststromrichtung veränderte das gemessene Verhalten über ausgehaltene Eingabeaufforderungen hinweg. Dies bietet Forschern einen konkreten Ansatzpunkt, um Aufklärungs- und Verweigerungsverhalten in einem offenen Modell zu untersuchen. Dennoch kann die Richtung die Mehrdeutigkeit der Eingabeaufforderung, die Antwortlänge und andere korrelierte Merkmale bündeln, anstatt einen minimalen Mechanismus zu isolieren. Das Papier berichtet über eine Prompt-Baseline und Kürzungsprüfungen für kleine Modelle, verzichtet jedoch ausdrücklich darauf, den Llama-Mechanismus zur Erklärung der Unterschiede zwischen den sechs eingesetzten Systemen zu verwenden.

Was Sie als nächstes sehen sollten

Achten Sie auf menschliche Anmerkungen, unabhängige Reproduktion auf aktuellen Modellversionen, stärkere Kontrollen für die Erwartungen der Richter und mechanistische Tests, die ein Verhalten von seinen korrelierten Oberflächenmerkmalen trennen.

Die menschliche Validierung ist der offensichtlichste fehlende Test. Das Modellgremium erzielte eine erhebliche Übereinstimmung in vier Kategorien, jedoch nur eine mäßige Übereinstimmung bei der Unterdrückung von Argumenten, mit einem Fleiss-Kappa von 0,599. Durch das Entfernen eines Elementkontextfelds, das den Juroren mitteilte, was jede Eingabeaufforderung testen sollte, änderte sich die Gesamtbewertung um 9,7 Prozentpunkte und die Unterdrückungskategorie um 16,7 Prozentpunkte. Eine Kontrolle mit 216 Antworten bewahrte die Schlagzeilenvergleiche des Papiers, geschulte menschliche Bewerter sollten jedoch testen, ob die Bezeichnungen und Feinunterscheidungen mit der Expertenmeinung übereinstimmen.

Bei der Replikation sollten Modellversionen, Systemaufforderungen, Anbietereinstellungen und Daten eingefroren werden. In der Studie wurde die Standardstichprobe des Anbieters verwendet, da einige APIs gängige Temperatur- und Seed-Kontrollen ablehnten, und es wurde ein Modell pro Entwickler getestet. Es kann daher keine Behauptungen über die allgemeine Schulungsmethode eines Unternehmens oder über spätere Versionen mit demselben Antwortmodus unterstützen. Wiederholte Läufe sollten die Variabilität innerhalb des Modells messen und bestimmen, ob eine 99-zu-Null-Aufteilung über Eingabeaufforderungen, Sprachen, Domänen und aktualisierte Endpunkte hinweg bestehen bleibt.

Das Rubrikentwicklungsdesign verdient eine ausführlichere Untersuchung. Etiketten wurden erstellt, nachdem Antworten auf 20 Elemente pro Kernkategorie gelesen wurden, einschließlich des GPT-5-Musters, das später in der Nähe der Obergrenze erschien, und diese Elemente waren Teil der Hauptsumme von 100 Elementen. Die 80 Einträge des Autors zurückgehaltene Wiederholung bewahrte die Raten und Bestellungen innerhalb von fünf Punkten, was die Entdeckungsverzerrung verringert, aber nicht beseitigt. Ein unabhängiges Team sollte die Taxonomie definieren oder vorregistrieren, neue Eingabeaufforderungen erstellen und Antworten bewerten, die bei der Benennung der Verhaltensweisen keine Rolle spielten.

Bei der mechanistischen Nachverfolgung sollten Aktivierungs-Patches oder andere gezielte Interventionen eingesetzt werden, um zu testen, ob die Lama-Richtung auf einer engeren Ebene kausal ist, das Ergebnis über zufällige, ausgehaltene Teilungen hinweg zu wiederholen und Referenzgewichte mit eingesetzten Aufschlagstapeln zu vergleichen. Für reale Produkte sollten Prüfer diese Laborreaktionsmodi mit Benutzerergebnissen verknüpfen: unsichere Aufgabenerledigung, angemessene Umleitung, Zugänglichkeit, Fehlerbeseitigung und Vertrauen. Bis dahin handelt es sich bei dem verifizierten Ergebnis um eine strukturierte vorab veröffentlichte Feststellung zu sechs spezifischen Systemen – und nicht um eine universelle Karte darüber, wie sich Grenz-KI unter Druck verhält.

Verwandte Leitfäden und Quizze

Fanden Sie das nützlich?
Das monatliche Briefing

Holen Sie sich die KI-Geschichten, die wirklich wichtig sind.

Eine kurze E-Mail pro Monat – was sich in der KI geändert hat, warum sie wichtig ist und welche Tools und Leitfäden Ihre Zeit wert sind.

Kostenlos · Kein Spam · Mit einem Klick abmelden