Als nächstesNächster Leitfaden
KI-Bildgeneratoren im Kunstunterricht
Visuelle KI
Visueller KI-GUIDE
KI-Bildgeneratoren verwechseln die Hände, weil Hände klein, sehr flexibel, oft teilweise verborgen sind und selten in Bildunterschriften beschrieben werden.
Modelle lernen, wie Hände auf der Oberfläche aussehen, ohne ihre Struktur zuverlässig zu lernen, beispielsweise fünf Finger pro Hand. Handfehler sind zu einem bekannten Zeichen für synthetische Bilder geworden, und wenn man versteht, warum sie auftreten, erklärt sich sowohl die Verbesserung neuerer Modelle als auch, warum das Zählen der Finger nicht mehr eine zuverlässige Methode zur Erkennung von Fälschungen ist.
Diffusionsmodelle lernen aus Milliarden von Bildunterschriftenpaaren, indem sie lernen, hinzugefügtes Rauschen umzukehren. Sie beherrschen lokale visuelle Muster sehr gut: Hautstruktur, Beleuchtung, das allgemeine Aussehen einer Hand. Was sie nie erhalten, ist die ausdrückliche Regel, dass eine Hand fünf Finger hat, die in einer bestimmten Reihenfolge zu einer Handfläche verbunden sind. Mehrere Faktoren machen die Hände hart. Hände nehmen auf den meisten Fotos nur einen kleinen Teil ein, sodass sie nur wenige Pixel erhalten. Latente Diffusionsmodelle wie Stable Diffusion verkleinern Bilder vor der Generierung auch in jeder Dimension um den Faktor acht, sodass nur eine Handvoll latenter Zellen zurückbleiben können. Hände nehmen eine enorme Bandbreite an Posen ein, greifen Objekte, überlappen einander und sind oft teilweise verborgen, sodass die Trainingsdaten voller unvollständiger Ansichten sind. Finger sehen gleich aus, daher hat ein Modell, das „Finger, Finger, Finger“ sagt, kein starkes Signal, das ihm sagt, wann es aufhören soll. In Bildunterschriften werden Hände fast nie erwähnt, geschweige denn ihre Haltung, daher bietet die Eingabeaufforderung nur wenig Orientierung. Das Ergebnis ist eine Reihe bekannter Fehler: zusätzliche oder fehlende Finger, verwachsene Finger, Daumen auf der falschen Seite und Hände, die mit Gegenständen oder anderen Personen verschmelzen. Aus ähnlichen Gründen gehen Zähne, Ohren und Schmuck kaputt. Neuere Systeme haben diese Ausfälle reduziert. Größere Modelle, höhere Trainingsauflösungen, besser gefilterte und beschriftete Daten, transformatorbasierte Architekturen und die Feinabstimmung menschlicher Präferenzbewertungen haben allesamt geholfen. Die Version 5 von Midjourney im Jahr 2023 war weithin für ihre besseren Hände bekannt, und spätere Modelle aus mehreren Labors verbesserten sich weiter. Fehler sind jedoch nicht verschwunden, insbesondere bei komplexen Posen, Menschenmengen und Händen, die Dinge halten. Ein häufiges Missverständnis ist, dass das Modell „nicht zählen kann“. Genauer gesagt lernt es das Erscheinungsbild statistisch und die korrekte Struktur entsteht nur, wenn die Daten- und Modellkapazität ausreichend ist.
Visuelle KI kann Inspektions-, Erkennungs- und Kennzeichnungsaufgaben im großen Maßstab automatisieren.
Kreativteams können mit weniger manuellen Überarbeitungen schneller Prototypen von Konzepten erstellen.
Vorgänge können Bild- und Videosignale nutzen, die bisher schwer zu verarbeiten waren.
Handfehler werden wahrscheinlich weiter abnehmen, wenn die Modelle wachsen und sich die Trainingsdaten verbessern, aber ungewöhnliche Posen, verschränkte Hände und Hände, die Objekte manipulieren, bleiben schwieriger als eine einfache offene Handfläche. Bei der Videogenerierung kommt eine neue Version des Problems hinzu, da die Finger von Bild zu Bild konsistent bleiben müssen. Für jeden, der die Echtheit beurteilt, sind Handschecks ein schwaches Signal. Eine missgebildete Hand deutet immer noch darauf hin, dass ein Bild erstellt wurde, aber eine korrekte Hand beweist nichts. Provenienzaufzeichnungen und Wasserzeichen sind zuverlässiger als die Überprüfung der Anatomie.
Ein frühes Stable Diffusion-Porträt zeigt jemanden, der eine Kaffeetasse hält und sechs Finger darum legt – ein typischer Fehler, wenn ein Model viele überlappende Griffhaltungen miteinander verbindet.
In einer Gruppenszene eines älteren Models verschmelzen die Hände zweier Menschen dort, wo sie sich berühren, weil das Model keine genaue Vorstellung davon hat, wo ein Körper endet und ein anderer beginnt.
Eine Künstlerin füttert eine ControlNet OpenPose oder eine Tiefenkarte, die aus einem Foto ihrer eigenen Hand erstellt wurde, um eine korrekte Pose zu erzwingen, und malt dann alle verbleibenden Fehler ein.
Ein Faktenprüfer stellt fest, dass eine mutmaßliche Fälschung völlig normale Hände hat, was daran erinnert, dass neuere Generatoren die Hände oft richtig zeichnen und andere Hinweise erforderlich sind.
Bildrechte und Einwilligungen können zu rechtlichen Risiken werden, wenn die Herkunft unklar ist.
Die Modellleistung kann je nach Beleuchtung, Demografie und Umgebung variieren.
Fehlalarme können unbemerkt bleiben, wenn die Konfidenzschwellen nicht überwacht werden.
Definieren Sie Akzeptanzkriterien für Präzision, Rückruf und Fehlerkosten.
Testen Sie mit Daten, die den realen Produktionsbedingungen entsprechen.
Fügen Sie eine menschliche Überprüfung für Vorhersagen mit geringem Vertrauen oder großer Auswirkung hinzu.
Verfolgen Sie die Modelldrift und führen Sie nach Kamera- oder Datensatzänderungen eine erneute Validierung durch.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
KI-Bildgeneratoren verwechseln die Hände, weil Hände klein, sehr flexibel, oft teilweise verborgen sind und selten in Bildunterschriften beschrieben werden. Modelle lernen, wie Hände auf der Oberfläche aussehen, ohne ihre Struktur zuverlässig zu lernen, beispielsweise fünf Finger pro Hand. Handfehler sind zu einem bekannten Zeichen für synthetische Bilder geworden, und wenn man versteht, warum sie auftreten, erklärt sich sowohl die Verbesserung neuerer Modelle als auch, warum das Zählen der Finger nicht mehr eine zuverlässige Methode zur Erkennung von Fälschungen ist.
Modelle lernen, wie die Dinge statistisch aussehen. Nichts im Training gibt ihnen eine explizite Regel, dass eine Hand fünf Finger hat.
Eine kleine Hand, die in jeder Dimension um das Achtfache schrumpft, hat am Ende sehr wenig Platz, um fünf verschiedene Finger darzustellen.
Ohne Text, der Handhaltungen beschreibt, kann das Modell keine Aufforderungswörter mit der Handstruktur verknüpfen.
Die im Jahr 2023 veröffentlichte Version 5 von Midjourney war weithin bekannt für verbesserte Hände, Teil eines breiteren Trends zur Skalierung und besseren Daten.
Durch die Vergrößerung des Kropfes erhält die Hand während der Regeneration viel mehr latente Zellen, was ihre Struktur verbessert.
Lerne weiter
Weitere Leitfäden zu diesem Thema ausgewählt
Als nächstesNächster Leitfaden
KI-Bildgeneratoren im Kunstunterricht
Visuelle KI