Kostenlose KI-Bibliothek

Audio-KI FührerFür immer kostenlos.

117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

117Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Audio-KI

Trennung des Spleeter-Stamms

Spleeter ist ein Open-Source-Tool von Deezer, das einen fertigen Song mithilfe von Deep Learning in separate Tracks (Gesang, Schlagzeug, Bass und mehr) aufteilt.

2 Min. gelesenLesen
Audio-KI

Schätzung der Kreppneigung

CREPE ist ein Deep-Learning-Modell, das die Grundfrequenz (Tonhöhe) eines monophonen Audiosignals direkt aus seiner Rohwellenform schätzt.

2 Min. gelesenLesen
Audio-KI

PESQ- und STOI-Sprachqualitätsmetriken

PESQ und STOI sind standardmäßige objektive Metriken, die bewerten, wie gut verarbeitete Sprache klingt und wie verständlich sie ist, ohne dass menschliche Zuhörer erforderlich sind.

2 Min. gelesenLesen
Audio-KI

Source-Filter Vocoding und WORLD

Ein Vocoder ist ein Werkzeug, das Sprache in ihre Bausteine zerlegt und wieder aufbaut.

2 Min. gelesenLesen
Audio-KI

Bewertung des durchschnittlichen Meinungswerts

Der Mean Opinion Score (MOS) ist eine durchschnittliche Bewertung von 1 bis 5 durch menschliche Zuhörer, die misst, wie gut synthetisierte oder übertragene Audiotöne klingen.

2 Min. gelesenLesen
Audio-KI

Constant-Q-Transformation für Audio

Die Constant-Q-Transformation (CQT) ist eine Frequenzanalyse, die anstelle der gleichmäßig verteilten Bins logarithmisch beabstandete Bins verwendet, die an die Tonhöhe der Musik angepasst sind.

2 Min. gelesenLesen
Audio-KI

Filterbank- und PLP-Funktionen

Filterbank- und Perceptual Linear Prediction (PLP)-Funktionen sind Möglichkeiten, ein Sprachsignal in kompakte, wahrnehmungsbedeutsame Zahlen zusammenzufassen, die maschinell…

2 Min. gelesenLesen
Audio-KI

StyleTTS 2 Stildiffusion

StyleTTS 2 ist ein Text-to-Speech-Modell, das den „Stil“ der Stimme – Prosodie, Emotion und Klangfarbe des Sprechers – als Zufallsvariable behandelt, die mit einem Diffusionsmodell abgetastet wird …

2 Min. gelesenLesen
Audio-KI

FastPitch Pitch-steuerbares TTS

FastPitch ist ein schnelles, nicht autoregressives Text-to-Speech-Modell, das die Tonhöhe (Grundfrequenz) jedes Eingabe-Tokens explizit vorhersagt, sodass Sie…

2 Min. gelesenLesen
Audio-KI

Voicebox Flow-Matching-Sprachgenerierung

Voicebox ist das textgesteuerte Spracherzeugungsmodell von Meta, das mit einem Flow-Matching-Ziel trainiert wurde, um maskiertes Audio auszufüllen, sodass ein Modell Zero-Shot-Sprache ausführen kann …

2 Min. gelesenLesen
Audio-KI

Herausforderung zur Tiefengeräuschunterdrückung

Die Deep Noise Suppression (DNS) Challenge ist ein von Microsoft durchgeführter Wettbewerb, der Forscher dazu drängt, neuronale Netze aufzubauen, die Hintergrundgeräusche entfernen …

2 Min. gelesenLesen
Audio-KI

Spektrale Subtraktion und Wiener-Filterung

Spektralsubtraktion und Wiener-Filterung sind die klassischen Arbeitspferde der Rauschunterdrückung vor dem Deep-Learning.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.

Audio AI AI Guides — Page 5 of 10 | AI Understanding