Gesellschaftsführer

Modellextraktions- und Diebstahlangriffe

Mit Modellextraktionsangriffen kann ein Angreifer ein proprietäres KI-Modell klonen, indem er einfach dessen öffentliche API abfragt und einen Nachahmer auf die Antworten trainiert.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.

Tiefer Einblick

Bei einem Modellextraktions- (oder Modelldiebstahl-)Angriff wird ein eingesetztes Modell als Orakel behandelt. Der Angreifer sendet Eingaben, zeichnet Ausgaben auf und trainiert ein Ersatzmodell, um das Verhalten nachzuahmen. Da das Zielmodell selbst eine erlernte Funktion ist, die Eingaben auf Ausgaben abbildet, kann durch das Kopieren einer ausreichenden Anzahl Eingabe-Ausgabe-Paare eine genaue Näherung wiederhergestellt werden, ohne jemals die ursprünglichen Gewichte oder Trainingsdaten zu sehen. Forscher haben die Entscheidungsgrenzen von Bildklassifikatoren gestohlen und sogar die exakten Gewichte kleiner Schichten ermittelt. Im Jahr 2024 zeigte ein Team, dass Teile der Einbettungsschichten der Produktionsmodelle OpenAI und Google für weniger als ein paar hundert Dollar extrahiert werden konnten. Gestohlene Kopien untergraben kostenpflichtige Dienste, umgehen Sicherheitsfilter und ermöglichen weitere White-Box-Angriffe wie die Erstellung gegnerischer Beispiele.

Technischer Einblick

Je umfangreicher die API-Antwort ist, desto günstiger ist der Diebstahl. Durch die Rückgabe vollständiger Wahrscheinlichkeitsvektoren oder Logits gehen weitaus mehr Informationen pro Abfrage verloren als bei einem einzelnen Top-1-Label, sodass Angreifer Grenzen mit weniger Abfragen rekonstruieren. Aktive Lernstrategien wählen die informativsten Abfragen in der Nähe von Entscheidungsgrenzen aus. Ein wegweisendes Ergebnis zeigte, dass eine Abfrage knapp über der Anzahl der Ausgabedimensionen die endgültige lineare Projektionsschicht mithilfe der linearen Algebra exakt wiederherstellen kann, da es sich bei dieser Schicht praktisch um eine Matrix handelt, über die sich die Antworten erstrecken.

Strategische Auswirkungen

Risiko und Sicherheit

Sowohl katastrophale als auch alltägliche Schäden durch KI hängen davon ab, wer die Risiken versteht und wer handeln kann.

Klarere Entscheidungen

Die öffentliche und berufliche Bildung bestimmt, ob eine starke Sicherheitspolitik politisch möglich ist.

Sich durch den Hype schneiden

Klare Erklärungen reduzieren die Vereinnahmung durch Hype, Labor-PR und vages Ethik-Theater.

Die Zukunft der Modellextraktion und Diebstahlangriffe

Die Abwehrmaßnahmen verlagern sich von der Blockierung zur Erkennung und Verschlechterung: Ratenbegrenzung, Rückgabe gerundeter oder nur Top-1-Ausgaben, Hinzufügen von kalibriertem Rauschen, Markieren des Modellverhaltens mit Wasserzeichen, damit gestohlene Kopien mit einem Fingerabdruck versehen werden können, und Überwachung von Abfragemustern für Extraktionssignaturen. Erwarten Sie Regulierungs- und Lizenzbedingungen, die Extraktion als Diebstahl behandeln, sowie aktive Forschung zu nachweislich schwer zu extrahierenden Architekturen. Wenn die Modelle größer werden, bleibt die vollständige Extraktion kostspielig, aber die teilweise Extraktion wertvoller Komponenten und das Klonen im Destillationsstil bleiben eine anhaltende kommerzielle und Sicherheitsbedrohung.

Reale Umsetzung

Ein Startup fragt tausende Male die kostenpflichtige Bilderkennungs-API eines Mitbewerbers ab und trainiert einen kostenlosen Klon, der deren Genauigkeit nachbildet.

Sicherheitsforscher extrahieren die endgültige Einbettungs- und Projektionsschicht eines Produktionssprachenmodells mithilfe sorgfältig ausgearbeiteter API-Abfragen, die nur ein paar hundert Dollar kosten.

Ein Angreifer klont einen Spam- oder Betrugsklassifikator lokal, sodass er ihn offline untersuchen und Eingaben erstellen kann, die sich zuverlässig einer Erkennung entziehen.

Ein Cloud-Anbieter fügt eine Überwachung der Abfragerate hinzu, die ein Konto markiert, dessen Zugriffsmuster mit der Extraktion durch aktives Lernen übereinstimmt, und seine Antworten drosselt.

Risiken und Leitplanken

Das existentielle Risiko wird als Science-Fiction behandelt, während sich die Fähigkeiten verstärken.

Verwechslung von Oberflächenproduktsicherheit mit Ausrichtung unter hoher Autonomie.

Nicht-englischsprachigen und nicht fachkundigen Zielgruppen stehen nur Quellen von geringer Qualität zur Verfügung.

Implementierungs-Roadmap

1

Separate Risiken für Produktschäden, Missbrauch und Kontrollverlust/Fehlausrichtung.

2

Fragen Sie, welche Beweise Ihre Sicht auf Zeitpläne und Schweregrad ändern würden.

3

Bevorzugen Sie Primärquellen und konkrete Bewertungen gegenüber Marketingaussagen.

4

Identifizieren Sie einen Aktionspfad: Karriere, Politik, Finanzierung oder Fähigkeiten – nicht nur Bewusstsein.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Nächster Leitfaden

Angriffe auf Mitgliedschaftsinferenzen

Häufig gestellte Fragen

What is Model Extraction and Stealing Attacks?

Mit Modellextraktionsangriffen kann ein Angreifer ein proprietäres KI-Modell klonen, indem er einfach dessen öffentliche API abfragt und einen Nachahmer auf die Antworten trainiert. Dies ist wichtig, da Unternehmen Millionen für die Schulung von Modellen ausgeben, die für den Preis einiger tausend API-Aufrufe annähernd berechnet werden können.

Was ist die Kernidee hinter einem Modellextraktionsangriff?

Die Extraktion behandelt das bereitgestellte Modell wie ein Orakel: Der Angreifer sammelt Eingabe-Ausgabe-Paare und trainiert ein Nachahmermodell, um das Verhalten nachzuahmen, ohne jemals auf die ursprünglichen Gewichte zuzugreifen.

Warum macht die Rückgabe vollständiger Wahrscheinlichkeitsvektoren die Extraktion einfacher als die Rückgabe nur eines Top-1-Labels?

Jeder vollständige Wahrscheinlichkeitsvektor verrät weitaus mehr über die interne Entscheidungsoberfläche des Modells als eine einzelne Bezeichnung, sodass der Angreifer die Grenze mit weniger Abfragen rekonstruieren kann.

Welche Abwehrtechnik reduziert direkt die pro Abfrage durchgesickerten Informationen?

Die Vergröberung der Ausgaben, beispielsweise die Rückgabe nur der obersten Bezeichnung oder gerundeter Wahrscheinlichkeiten, verringert das Signal, das jede Antwort einem Angreifer gibt, und erhöht so die Extraktionskosten.

Ein Ergebnis aus dem Jahr 2024 zeigte, welchen Teil eines Produktionssprachenmodells genau die Angreifer kostengünstig wiederherstellen konnten?

Die Forscher zeigten, dass die endgültige lineare Projektionsschicht genau für ein paar hundert Dollar wiederhergestellt werden konnte, da ihre Antworten eine wiederherstellbare Matrix umfassen.

Warum ist ein gestohlenes Ersatzmodell über den bloßen Umsatzverlust hinaus gefährlich?

Sobald Angreifer über eine lokale Kopie verfügen, können sie diese frei untersuchen, um gegnerische Eingaben oder Umgehungsangriffe zu entwickeln, die auch das ursprünglich bereitgestellte System täuschen.