Kostenlose KI-Bibliothek

Audio-KI FührerFür immer kostenlos.

117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

117Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Audio-KI

Cover-Song-Identifizierung

Die Cover-Song-Identifizierung erkennt, ob es sich bei zwei sehr unterschiedlich klingenden Aufnahmen tatsächlich um denselben zugrunde liegenden Song handelt – eine Live-Akustikversion, einen Remix …

2 Min. gelesenLesen
Audio-KI

DDSP Differenzierbare Audiosynthese

DDSP (Differentiable Digital Signal Processing) verbindet klassische Synthesizer-Bausteine ​​mit neuronalen Netzen, sodass Deep Learning Oszillatoren steuern kann …

2 Min. gelesenLesen
Audio-KI

VITS End-to-End-Sprachsynthese

VITS ist ein Text-to-Speech-Modell, das Text in einem einzigen trainierten System direkt in rohe Audiowellenformen umwandelt und dabei die übliche zweistufige Pipeline überspringt.

2 Min. gelesenLesen
Audio-KI

FastSpeech und nicht autoregressives TTS

FastSpeech generiert ein gesamtes Sprachspektrogramm parallel und nicht nur einen Frame nach dem anderen, wodurch die Synthese erheblich schneller und stabiler wird.

2 Min. gelesenLesen
Audio-KI

NaturalSpeech und latente Diffusion TTS

NaturalSpeech ist eine Linie der Microsoft TTS-Forschung, die auf Sprachqualität auf menschlicher Ebene abzielt. Spätere Versionen nutzen latente Diffusion, um reichhaltige, natürliche… zu erzeugen.

2 Min. gelesenLesen
Audio-KI

Sprachemotionserkennung

Speech Emotion Recognition (SER) ist eine KI, die den emotionalen Zustand eines Sprechers – Wut, Freude, Traurigkeit, Frustration – anhand des Klangs seiner Stimme erkennt, nicht nur …

2 Min. gelesenLesen
Audio-KI

Moshi-Vollduplex-Sprache

Moshi ist eine Open-Source-Echtzeit-Sprach-KI von Kyutai, die gleichzeitig spricht und zuhört – Vollduplex –, anstatt sich strikt abzuwechseln.

2 Min. gelesenLesen
Audio-KI

Sprache-zu-Sprache-Übersetzung

Bei der Speech-to-Speech-Übersetzung (S2ST) werden gesprochene Wörter in einer Sprache übernommen und in einer anderen Sprache erzeugt – im Idealfall bleiben dabei die Stimme und der Ton des Sprechers erhalten.

2 Min. gelesenLesen
Audio-KI

HiFi-GAN und GAN Vocoder

HiFi-GAN ist ein generativ-konfrontativer Vocoder, der ein Mel-Spektrogramm fast augenblicklich in eine rohe Audiowellenform umwandelt und so Sprache in Studioqualität erzeugt.

2 Min. gelesenLesen
Audio-KI

Graphem-zu-Phonem-Konvertierung

Die Graphem-zu-Phonem-Konvertierung (G2P) übersetzt geschriebene Buchstaben in die Laute, die ein Sprachsystem tatsächlich aussprechen sollte.

2 Min. gelesenLesen
Audio-KI

Textnormalisierung für Sprache

Die Textnormalisierung ist der Front-End-Schritt, bei dem roher geschriebener Text in vollständig ausgesprochene Wörter umgeschrieben wird, bevor ein Sprachsystem ihn sagt.

2 Min. gelesenLesen
Audio-KI

SoundStream Neural Codec

SoundStream ist der durchgängige neuronale Audio-Codec von Google, der Sprache und Musik auf extrem niedrige Bitraten komprimiert und dabei die Qualität beibehält.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.