Kostenlose KI-Bibliothek

Lernen Sie KI.Für immer kostenlos.

1019 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

1019Kostenlose Reiseführer
9Themenspuren
~2 minPro Reiseführer
~34hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

1019 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Visuelle KI

DreamFusion und Score Distillation Sampling

DreamFusion generiert 3D-Objekte aus Text, indem es ein 2D-Bilddiffusionsmodell als Kritiker verwendet und niemals auf 3D-Daten trainiert.

2 Min. gelesenLesen
Visuelle KI

Magic3D Text-zu-3D-Pipeline

Magic3D ist NVIDIAs zweistufige Antwort auf DreamFusion, die schneller hochauflösende und detailliertere 3D-Inhalte produziert.

2 Min. gelesenLesen
Sprach-KI

Tokenizer-freie Byte-Level-Modelle

Tokenizer-freie Modelle verzichten auf das feste Vokabular von Wortteilen und arbeiten direkt mit Rohbytes, sodass ein Modell jede Sprache, jeden Code oder sogar verrauschte… verarbeiten kann.

2 Min. gelesenLesen
Sprach-KI

Funktionsvektoren und Aufgabendarstellungen

Funktionsvektoren sind kompakte Richtungen innerhalb der verborgenen Zustände eines Sprachmodells, die eine gesamte Aufgabe kodieren, z. B. „Ins Französische übersetzen“ oder „Antonym zurückgeben“.

2 Min. gelesenLesen
Sprach-KI

Best-of-N-Sampling und Reranking

Beim Best-of-N-Sampling werden mehrere Kandidatenantworten aus einem Modell generiert und dann mithilfe eines separaten Bewertungsschritts die beste ausgewählt.

2 Min. gelesenLesen
Audio-KI

StyleTTS 2 Stildiffusion

StyleTTS 2 ist ein Text-to-Speech-Modell, das den „Stil“ der Stimme – Prosodie, Emotion und Klangfarbe des Sprechers – als Zufallsvariable behandelt, die mit einem Diffusionsmodell abgetastet wird …

2 Min. gelesenLesen
Audio-KI

FastPitch Pitch-steuerbares TTS

FastPitch ist ein schnelles, nicht autoregressives Text-to-Speech-Modell, das die Tonhöhe (Grundfrequenz) jedes Eingabe-Tokens explizit vorhersagt, sodass Sie…

2 Min. gelesenLesen
Audio-KI

Voicebox Flow-Matching-Sprachgenerierung

Voicebox ist das textgesteuerte Spracherzeugungsmodell von Meta, das mit einem Flow-Matching-Ziel trainiert wurde, um maskiertes Audio auszufüllen, sodass ein Modell Zero-Shot-Sprache ausführen kann …

2 Min. gelesenLesen
Technisch

SmoothQuant und Aktivierungsquantisierung

SmoothQuant ist eine Technik, die es ermöglicht, große Sprachmodelle sowohl für Gewichtungen als auch für Aktivierungen auf 8-Bit-Ganzzahlen zu komprimieren, ohne…

2 Min. gelesenLesen
Technisch

Strukturierter Schnitt und Schichtabwurf

Beim strukturierten Bereinigen werden ganze Komponenten eines neuronalen Netzwerks entfernt, z. B. Aufmerksamkeitsköpfe, Neuronen oder ganze Schichten, sodass das schlankere Modell schneller läuft …

2 Min. gelesenLesen
Technisch

Spekulatives Streaming und Multi-Token-Vorhersage

Spekulatives Streaming und Multi-Token-Vorhersage beschleunigen die Generierung von Sprachmodellen, indem mehrere zukünftige Token gleichzeitig erraten und in einem einzigen Schritt überprüft werden.

2 Min. gelesenLesen
Unternehmen

OpenAI GPT-4.5 und GPT-5

GPT-4.5 und GPT-5 sind die wichtigsten großen Sprachmodelle von OpenAI, die ChatGPT und seine API unterstützen.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.