Kostenlose KI-Bibliothek

Audio-KI FührerFür immer kostenlos.

117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

117Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Audio-KI

DiffWave-Diffusions-Vocoder

DiffWave ist ein diffusionsbasierter Vocoder, der Audio synthetisiert, indem er zufälliges Rauschen iterativ in eine Wellenform entrauscht, die auf einem Mel-Spektrogramm konditioniert ist.

2 Min. gelesenLesen
Audio-KI

Generatives Bark-Audiomodell

Bark ist ein Open-Source-Text-zu-Audio-Modell von Suno, das nicht nur Sprache, sondern auch Lachen, Seufzen, Musik und Soundeffekte direkt aus Textaufforderungen generiert.

2 Min. gelesenLesen
Audio-KI

Tortoise TTS Autoregressive Synthese

Tortoise TTS ist ein Open-Source-Text-to-Speech-System, das für ungewöhnlich natürliche, emotional reiche Stimmen und starkes Stimmenklonen aus nur wenigen kurzen… bekannt ist.

2 Min. gelesenLesen
Audio-KI

XTTS Sprachübergreifendes Klonen von Stimmen

XTTS ist Coquis mehrsprachiges Text-to-Speech-Modell, das eine Stimme aus einem kurzen Clip klonen und dann in vielen verschiedenen Sprachen sprechen kann, während…

2 Min. gelesenLesen
Audio-KI

SoundStorm Parallele Audioerzeugung

SoundStorm ist ein Google Audiogenerierungsmodell, das Sprache und Ton parallel und nicht jeweils einzeln erzeugt und so eine hochwertige Audiosynthese ermöglicht …

2 Min. gelesenLesen
Audio-KI

AudioGen Text-zu-Audio-Synthese

AudioGen ist ein Meta-Modell, das Textbeschreibungen in realistische Umgebungsgeräusche und Soundeffekte umwandelt, wie zum Beispiel „Hundegebell, während Vögel zwitschern“.

2 Min. gelesenLesen
Audio-KI

Stabile latente Audiodiffusion

Stable Audio ist das Text-to-Audio-System von Stability AI, das latente Diffusion nutzt, um Musik und Soundeffekte zu erzeugen, mit expliziter Kontrolle über die Cliplänge.

2 Min. gelesenLesen
Audio-KI

Kaldi-Spracherkennungs-Toolkit

Kaldi ist ein kostenloses Open-Source-Toolkit, das zur dominierenden Forschungsplattform für den Aufbau von Spracherkennungssystemen geworden ist.

2 Min. gelesenLesen
Audio-KI

Wav2Letter Faltungs-ASR

Wav2Letter ist ein End-to-End-Spracherkennungssystem von Facebook AI, das nur Faltungs-Neuronale Netze verwendet, keine Wiederholung.

2 Min. gelesenLesen
Audio-KI

Jasper und QuartzNet ASR

Jasper und QuartzNet sind NVIDIAs End-to-End-Faltungs-Spracherkennungsmodelle, wobei QuartzNet ein wesentlich kleineres, effizienteres Redesign darstellt …

2 Min. gelesenLesen
Audio-KI

Diffusionsmodelle für Audio

Diffusionsmodelle erzeugen Audio, indem sie lernen, einen schrittweisen Rauschprozess umzukehren und zufälliges Rauschen in kohärente Sprache, Musik oder Soundeffekte umzuwandeln.

2 Min. gelesenLesen
Audio-KI

Erkennung von Schallereignissen

Die Sound Event Detection (SED) identifiziert, welche Geräusche in einem Audiostream auftreten und wann genau sie beginnen und enden.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.

Audio AI AI Guides — Page 7 of 10 | AI Understanding