Als nächstesNächster Leitfaden
Kontradiktorische Diffusionsdestillation und Turbomodelle
Technisch
Technischer Leitfaden
Diffusionsbildmodelle erzeugen in der Regel neue Bilder. Untersuchungen haben jedoch gezeigt, dass sie manchmal bestimmte Trainingsbilder nahezu exakt reproduzieren können, insbesondere Bilder, die in den Trainingsdaten häufig vorkommen.
Dies nennt man Auswendiglernen. Dies ist für das Urheberrecht von Bedeutung, da aus einem Modell eine nahezu Kopie eines geschützten Werks entstehen kann, und für die Privatsphäre, da ein Foto einer realen Person oder ein medizinischer Scan nachgeahmt werden könnte.
Ein Diffusionsmodell lernt, einen Rauschprozess umzukehren: Während des Trainings sieht es Bilder mit hinzugefügtem Rauschen und lernt, dieses Rauschen vorherzusagen und zu entfernen. Wenn es gut verallgemeinert, lernt es die Statistik von Bildern im Allgemeinen und erzeugt neue Kombinationen. Aber neuronale Netze können auch einzelne Beispiele anpassen, und wenn ein Bild hunderte oder tausende Male in den Daten vorkommt, besteht die kostengünstigste Möglichkeit, den Trainingsverlust darauf zu reduzieren, darin, es zu speichern. Die wichtigsten Beweise stammen aus der Arbeit von Carlini und Kollegen aus dem Jahr 2023 „Extracting Training Data from Diffusion Models“. Sie generierten viele Bilder für die Bildunterschriften der am häufigsten duplizierten Trainingsbilder und markierten Ausgaben, die einem Trainingsbild sehr nahe kamen. Sie extrahierten über hundert nahezu identische Kopien von Stable Diffusion, darunter Fotos von identifizierbaren Personen, und stellten höhere Merkraten in Googles Imagen fest. Unabhängig davon zeigten Somepalli und Kollegen (2022–2023), dass Stable Diffusion häufig kopierte Teile oder Layouts von Trainingsbildern ausgibt und das Kopieren mit duplizierten Bildern und hochspezifischen Bildunterschriften verknüpft. Drei Missverständnisse sind es wert, korrigiert zu werden. Erstens ist das Auswendiglernen nicht das normale Verhalten des Modells: Extrahierte Kopien sind im Vergleich zu allen Generationen selten. Zweitens bedeutet selten nicht, dass es harmlos ist, denn ein entschlossener Benutzer kann sich auf die Bilder konzentrieren, die ihm am ehesten in Erinnerung bleiben. Drittens ist das Auswendiglernen nicht nur das exakte Kopieren von Pixeln; Modelle können Zeichen, Logos, Wasserzeichen und unverwechselbare Kompositionen reproduzieren. Diese Beweise wurden in juristischen Debatten, einschließlich Klagen wie Getty Images gegen Stability AI und Andersen gegen Stability AI, thematisiert, obwohl die Art und Weise, wie Gerichte mit Modelltraining und -ergebnissen umgehen, noch ausgearbeitet wird und von Land zu Land unterschiedlich ist. Was den Datenschutz anbelangt, sind die Bedenken bei kleinen Feinabstimmungsdatensätzen wie medizinischen oder persönlichen Fotos größer, bei denen jedes Beispiel einen größeren Einfluss hat.
Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.
Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.
Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.
Deduplizierung und Überprüfung der Ausgabeähnlichkeit werden für verantwortungsbewusste Entwickler zur Standardpraxis, und die Forschung zur Erkennung gespeicherter Eingabeaufforderungen zum Zeitpunkt der Inferenz wird fortgesetzt. Für sensible Bereiche wie die medizinische Bildgebung könnte sich eine differenzierte Privatsphäre als sinnvoll erweisen, auch wenn es weiterhin Kompromisse bei der Qualität gibt. Die rechtliche Lage ist ungeklärt: Gerichte in verschiedenen Ländern prüfen, ob Schulungen und Ergebnisse das Urheberrecht verletzen, und die Ergebnisse können unterschiedlich sein. Entwickler stehen wahrscheinlich stärker unter Druck, Trainingsdatenquellen zu dokumentieren und zu zeigen, wie sie Aufstoßen testen und begrenzen.
Forscher rufen ein Modell mit der genauen Beschriftung eines stark duplizierten Trainingsbilds auf und erhalten eine Ausgabe zurück, die nahezu pixelidentisch mit dem Originalfoto ist.
Ein Designer fragt nach dem Stil eines berühmten Gemäldes und erhält ein Bild, das die Komposition und Details eines bestimmten Kunstwerks und nicht eines neuen Werks kopiert.
Ein auf Webbilder trainierter Bildgenerator rendert gelegentlich eine verzerrte Version des Wasserzeichens einer Bildagentur und zeigt, dass es Muster aus wiederholten Quellbildern absorbiert hat.
Ein Krankenhausteam, das ein Diffusionsmodell anhand einer kleinen Anzahl von Patientenscans verfeinert, testet, ob das Modell nahezu Kopien echter Scans ausgeben kann, bevor eine gemeinsame Nutzung zulässig ist.
Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.
Infrastruktur- und Wartungskosten werden oft unterschätzt.
Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.
Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.
Benchmark unter realistischen Last- und Datenbedingungen.
Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.
Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Diffusionsbildmodelle erzeugen in der Regel neue Bilder. Untersuchungen haben jedoch gezeigt, dass sie manchmal bestimmte Trainingsbilder nahezu exakt reproduzieren können, insbesondere Bilder, die in den Trainingsdaten häufig vorkommen. Dies nennt man Auswendiglernen. Dies ist für das Urheberrecht von Bedeutung, da aus einem Modell eine nahezu Kopie eines geschützten Werks entstehen kann, und für die Privatsphäre, da ein Foto einer realen Person oder ein medizinischer Scan nachgeahmt werden könnte.
Unter Speicherung versteht man Ausgaben, bei denen es sich nicht um neue Bilder, sondern um nahezu Kopien bestimmter Trainingsbilder handelt.
Durch die wiederholte Belichtung desselben Bildes ist die Anpassung genau dieses Beispiels eine effiziente Möglichkeit, Verluste zu reduzieren.
Sie extrahierten über hundert Beinahe-Kopien von Stable Diffusion, darunter Fotos von identifizierbaren Personen, und fanden höhere Raten in Imagen.
Ein gespeichertes Bild wird unabhängig vom Startwert konsistent angezeigt, sodass enge Cluster nahezu identischer Ausgaben Kandidaten kennzeichnen.
Extrahierte Kopien sind im Vergleich zu allen Ausgaben selten, Angreifer können sich jedoch auf Bilder konzentrieren, die am wahrscheinlichsten gespeichert werden.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
Kontradiktorische Diffusionsdestillation und Turbomodelle
Technisch