Visionstransformatoren
Vision Transformers (ViTs) wenden die Transformer-Architektur, die ChatGPT antreibt, auf Bilder an und behandeln ein Bild als eine Folge von Patches statt als ein Pixelraster.
Übersicht
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
Tiefer Einblick
Jahrelang dominierten Faltungs-Neuronale Netze (CNNs) das Computersehen, indem sie kleine Filter über ein Bild scannten. Der Artikel „An Image Is Worth 16x16 Words“ von Google aus dem Jahr 2020 stellte dies in Frage, indem er ein Bild in feste Patches, typischerweise 16x16 Pixel, zerlegte, diese jeweils zu einem Vektor verflachte und die resultierende Sequenz in einen Standardtransformator einspeiste. Jeder Patch wird zu einem „Token“, ähnlich wie ein Wort in einem Satz. Das Modell nutzt dann die Selbstaufmerksamkeit, sodass jeder Patch sich direkt auf jeden anderen Patch beziehen kann, und erfasst so weitreichende Beziehungen, die ein kleiner Faltungsfilter in einem Schritt nicht erkennen kann. Der Haken: ViTs sind datenhungrig, weil ihnen die integrierten Annahmen von CNNs fehlen. Basierend auf riesigen Datensätzen wie JFT-300M erreichten oder übertrafen sie die besten CNNs und prägten so die moderne Sehforschung neu.
Technischer Einblick
Ein ViT teilt ein Bild in nicht überlappende Patches auf, projiziert jeden linear in eine Einbettung und fügt Positionskodierungen hinzu, damit das Modell weiß, wo sich jeder Patch im Originalbild befand. Ein spezieller lernbarer „Klassen-Token“ wird vorangestellt; seine endgültige Darstellung bestimmt die Klassifizierung. Durch gestapelte Selbstaufmerksamkeitsschichten kann jeder Patch die Informationen aller anderen abwägen und so ein globales Empfangsfeld aus Schicht eins ergeben. Da die Aufmerksamkeit quadratisch mit der Anzahl der Patches skaliert, werden hochauflösende Bilder teuer, weshalb Patchgröße und effiziente Aufmerksamkeitsvarianten wichtig sind.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Visuelle KI kann Inspektions-, Erkennungs- und Kennzeichnungsaufgaben im großen Maßstab automatisieren.
Bauen Sie Entscheidungen auf
Kreativteams können mit weniger manuellen Überarbeitungen schneller Prototypen von Konzepten erstellen.
Team und Arbeitsablauf
Vorgänge können Bild- und Videosignale nutzen, die bisher schwer zu verarbeiten waren.
Die Zukunft der Vision Transformer
ViTs und CNN-Transformer-Hybride treiben heute führende Vision-Systeme an, und die Architektur unterstützt multimodale Modelle, die Bilder mit Text verbinden, wie CLIP und moderne Vision-Sprachassistenten. Erwarten Sie, dass weiterhin daran gearbeitet wird, die Aufmerksamkeit für hochauflösende Videos und Videos zu verbilligen, sowie selbstüberwachtes Vortraining (z. B. Masked-Image-Modellierung), das den enormen Appetit auf markierte Daten reduziert. Mit zunehmender Rechenleistung verschwimmt die Grenze zwischen „Sprachmodell“ und „Visionsmodell“, wobei Transformatoren als gemeinsames Rückgrat für alle Modalitäten dienen und nicht als separate spezialisierte Designs.
Reale Umsetzung
Die Bildklassifizierungs- und Suchrankingsysteme von Google, die Transformer-Backbones übernahmen, nachdem ViT sich als konkurrenzfähig zu CNNs erwiesen hatte
CLIP und andere Bild-Text-Modelle, die ein ViT zum Kodieren von Bildern verwenden, sodass Fotos und Bildunterschriften in einem gemeinsamen Bereich abgeglichen werden können
Medizinische Bildgebungsforschung nutzt ViTs, um Muster über einen gesamten Scan hinweg zu erkennen und nicht nur lokale Texturen
Selbstfahrende und robotische Wahrnehmungsstapel, die die Aufmerksamkeit im ViT-Stil für das Szenenverständnis im gesamten Sichtfeld kombinieren
Risiken und Leitplanken
Bildrechte und Einwilligungen können zu rechtlichen Risiken werden, wenn die Herkunft unklar ist.
Die Modellleistung kann je nach Beleuchtung, Demografie und Umgebung variieren.
Fehlalarme können unbemerkt bleiben, wenn die Konfidenzschwellen nicht überwacht werden.
Implementierungs-Roadmap
Definieren Sie Akzeptanzkriterien für Präzision, Rückruf und Fehlerkosten.
Testen Sie mit Daten, die den realen Produktionsbedingungen entsprechen.
Fügen Sie eine menschliche Überprüfung für Vorhersagen mit geringem Vertrauen oder großer Auswirkung hinzu.
Verfolgen Sie die Modelldrift und führen Sie nach Kamera- oder Datensatzänderungen eine erneute Validierung durch.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
CLIP- und Vision-Language-Modelle
Häufig gestellte Fragen
What is Vision Transformers?
Vision Transformers (ViTs) wenden die Transformer-Architektur, die ChatGPT antreibt, auf Bilder an und behandeln ein Bild als eine Folge von Patches statt als ein Pixelraster. Sie haben bewiesen, dass Sie keine Faltungen benötigen, um eine hochmoderne Bilderkennung zu erreichen.
Wie verarbeitet ein Vision Transformer zunächst ein Eingabebild?
Ein ViT unterteilt das Bild in feste Patches (häufig 16 x 16 Pixel), bettet jeden Patch als Token ein und speist die Sequenz in einen Transformator ein.
Welcher Schlüsselmechanismus ermöglicht es einem ViT, entfernte Teile eines Bildes miteinander in Beziehung zu setzen?
Durch die Selbstaufmerksamkeit kann jeder Patch die Informationen aus jedem anderen Patch direkt abwägen und so eine globale Sicht auf die erste Ebene erhalten.
Warum benötigen einfache Vision Transformer normalerweise sehr große Trainingsdatensätze, um hervorragende Leistungen zu erbringen?
Im Gegensatz zu CNNs gehen ViTs nicht von Lokalität oder Übersetzungsinvarianz aus, daher müssen sie diese Muster aus großen Datenmengen lernen.
Welchen Zweck haben Positionskodierungen in einem Vision Transformer?
Die Selbstaufmerksamkeit ist reihenfolgeunabhängig, daher stellen Positionskodierungen die räumliche Position jedes Patches wieder her.
Welche Aussage spiegelt den Einfluss von ViT auf Computer Vision am besten wider?
ViT hat gezeigt, dass ein reiner Transformator mit ausreichend Daten und Umfang mit den besten Faltungsnetzwerken mithalten oder diese übertreffen kann.