Kostenlose KI-Bibliothek

Visuelle KI FührerFür immer kostenlos.

133 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

133Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

133 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Visuelle KI

Bildharmonisierung und Compositing

Durch die Bildharmonisierung wird ein eingefügtes Vordergrundobjekt automatisch so angepasst, dass Farbe, Beleuchtung und Ton dem neuen Hintergrund entsprechen, sodass Kompositionen echt aussehen.

2 Min. gelesenLesen
Visuelle KI

SDXL und kaskadierte Diffusion

SDXL ist das hochauflösende Text-zu-Bild-Modell von Stability AI, das einen leistungsstarken Basisgenerator mit einem Refiner kombiniert, während kaskadierte Diffusionsketten mehrere…

2 Min. gelesenLesen
Visuelle KI

GLIGEN Grounded Generation

Mit GLIGEN (Grounded-Language-to-Image Generation) können Sie genau steuern, wo Objekte in einem generierten Bild erscheinen, indem Sie die Begrenzungsrahmen des Modells eingeben.

2 Min. gelesenLesen
Visuelle KI

T2I-Adapter für multibedingte Diffusionskontrolle

Erfahren Sie mehr über den T2I-Adapter für die multibedingte Diffusionssteuerung: wie er eine stabile Diffusion mit Kanten, Tiefe, Pose und anderen Bedingungen mithilfe eines leichten ... steuert.

2 Min. gelesenLesen
Visuelle KI

Nulltext-Inversion

Die Nulltext-Inversion ist eine Technik, mit der Sie ein echtes Foto mit einem textgesteuerten Diffusionsmodell wie Stable Diffusion bearbeiten und dabei alles behalten können, was Sie…

2 Min. gelesenLesen
Visuelle KI

Benutzerdefiniertes Diffusions-Multi-Concept-Tuning

Custom Diffusion ist eine leichte Feinabstimmungsmethode, die einem Text-zu-Bild-Modell neue persönliche Konzepte beibringt, wie z. B. Ihren Hund oder einen bestimmten Stuhl, von nur …

2 Min. gelesenLesen
Visuelle KI

Latente Mischung und Bildinterpolation

Latent Blending mischt Bilder, indem ihre komprimierten Darstellungen innerhalb des latenten Raums eines Modells kombiniert werden, anstatt Rohpixel zu mitteln.

2 Min. gelesenLesen
Visuelle KI

Vision-Sprache-Aktionsmodelle für die Robotik

Vision-Language-Action (VLA)-Modelle sind große neuronale Netze, die Kamerabilder sowie eine schriftliche Anweisung aufnehmen und direkt Motorbefehle des Roboters ausgeben.

2 Min. gelesenLesen
Visuelle KI

Verbreitungspolitik für Robotersteuerung

Diffusion Policy wendet die gleiche Entrauschungsidee wie Bildgeneratoren wie Stable Diffusion auf die Robotersteuerung an: Anstatt eine einzige nächste Aktion vorherzusagen ...

2 Min. gelesenLesen
Visuelle KI

Make-A-Video Text-to-Video

Make-A-Video ist das 2022-System von Meta, das eine Textaufforderung in einen kurzen Videoclip umwandelt, ohne jemals an beschrifteten Text-Video-Paaren zu trainieren.

2 Min. gelesenLesen
Visuelle KI

Bild-Video-Kaskaden

Imagen Video ist das Text-zu-Video-System 2022 von Google, das einen Clip durch eine Kaskade von sieben Diffusionsmodellen erstellt, die jeweils mehr Frames oder eine höhere Auflösung hinzufügen.

2 Min. gelesenLesen
Visuelle KI

CogVideo und CogVideoX

CogVideo (2022) war das erste groß angelegte offene Text-zu-Video-Modell, und CogVideoX (2024) ist der weitaus leistungsfähigere Open-Source-Nachfolger von Tsinghua/Zhipu AI.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.