Kostenlose KI-Bibliothek

Visuelle KI FührerFür immer kostenlos.

133 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

133Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

133 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Visuelle KI

Optische Zeichenerkennung

Die optische Zeichenerkennung (OCR) wandelt Textbilder – gescannte Dokumente, Fotos von Schildern, PDFs – in maschinenlesbaren, bearbeitbaren Text um.

2 Min. gelesenLesen
Visuelle KI

Optischer Fluss

Der optische Fluss schätzt, wie sich jedes Pixel zwischen aufeinanderfolgenden Videobildern bewegt, und erstellt so eine dichte Karte von Bewegungsvektoren.

2 Min. gelesenLesen
Visuelle KI

Monokulare Tiefenschätzung

Die monokulare Tiefenschätzung sagt voraus, wie weit jedes Pixel von einem einzelnen gewöhnlichen Foto entfernt ist – keine Stereokamera, kein Lidar oder Tiefensensor erforderlich.

2 Min. gelesenLesen
Visuelle KI

Latente Diffusionsmodelle

Modelle mit latenter Diffusion erzeugen Bilder, indem sie den Diffusionsprozess in einem komprimierten latenten Raum statt in Rohpixeln ausführen, wodurch die Rechenkosten drastisch gesenkt werden.

2 Min. gelesenLesen
Visuelle KI

ControlNet

ControlNet ist ein Add-on, das Bildgenerierungsmodellen eine präzise Strukturkontrolle ermöglicht und es Ihnen ermöglicht, die Ausgabe mit Kanten, Posen, Tiefenkarten oder Skizzen zu steuern.

2 Min. gelesenLesen
Visuelle KI

Klassifizierungsfreie Anleitung

Die klassifikatorfreie Führung ist die Technik, die dafür sorgt, dass Diffusionsmodelle Ihrer Aufforderung tatsächlich folgen und dabei etwas Diversität gegen eine viel stärkere Einhaltung eintauschen.

2 Min. gelesenLesen
Visuelle KI

Visueller SLAM

Mit Visual SLAM kann eine sich bewegende Kamera eine Karte eines unbekannten Raums erstellen und gleichzeitig ihre eigene Position innerhalb dieser Karte verfolgen.

2 Min. gelesenLesen
Visuelle KI

Sora und Text-to-Video

Sora ist das Text-zu-Video-Modell von OpenAI, das eine schriftliche Aufforderung in einen kurzen, hochauflösenden Videoclip umwandelt.

2 Min. gelesenLesen
Visuelle KI

Videodiffusionsmodelle

Videodiffusionsmodelle erzeugen bewegte Bilder, indem sie zufälliges Rauschen schrittweise in kohärente Bilder umwandeln und so die Diffusionsidee von Bildern auf die Zeit erweitern.

2 Min. gelesenLesen
Visuelle KI

Text-zu-3D-Generierung

Die Text-zu-3D-Generierung verwandelt eine schriftliche Aufforderung wie „einen Vintage-Ledersessel“ in ein vollständiges 3D-Modell, das Sie drehen, beleuchten und in ein Spiel oder eine Szene einfügen können.

2 Min. gelesenLesen
Visuelle KI

Differenzierbares Rendering

Durch differenzierbares Rendering ist der Prozess der Umwandlung einer 3D-Szene in ein 2D-Bild vollständig differenzierbar, sodass Sie Farbverläufe aus den gerenderten Pixeln berechnen können …

2 Min. gelesenLesen
Visuelle KI

U-Net-Architektur

U-Net ist ein Faltungs-Neuronales Netzwerk in Form eines „U“, das sich durch die Erzeugung pixelgenauer Ausgaben auszeichnet, ursprünglich für die Segmentierung biomedizinischer Bilder.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.