Kostenlose KI-Bibliothek

Audio-KI FührerFür immer kostenlos.

117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

117Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Audio-KI

Suno und Udio

Suno und Udio sind die beiden führenden KI-Musikgeneratoren für Endverbraucher, die eine kurze Textaufforderung in einen vollständigen Song in nahezu Studioqualität verwandeln – komplett mit Gesang …

2 Min. gelesenLesen
Audio-KI

Symbolische Musikgeneration

Durch die Erzeugung symbolischer Musik wird Musik als strukturierte Notation – Noten, Tonhöhen, Dauer und Timing (häufig als MIDI) – und nicht als Rohaudio erstellt.

2 Min. gelesenLesen
Audio-KI

Cepstralkoeffizienten der Mel-Frequenz

Mel-Frequency Cepstral Coefficients (MFCCs) sind eine kompakte Reihe von Zahlen, die die Form des Frequenzspektrums eines Klangs zusammenfassen, wie menschliche Ohren es wahrnehmen.

2 Min. gelesenLesen
Audio-KI

WaveNet

WaveNet wurde 2016 von DeepMind eingeführt und war ein bahnbrechendes neuronales Netzwerk, das Rohaudio Sample für Sample generiert und so eine auffallend natürliche Sprache erzeugt.

2 Min. gelesenLesen
Audio-KI

Tacotron 2

Tacotron 2 ist ein End-to-End-Text-to-Speech-System von Google (2017), das geschriebenen Text direkt in ein Mel-Spektrogramm umwandelt, das ein neuronaler Vocoder umwandelt…

2 Min. gelesenLesen
Audio-KI

Audio-Deepfake-Erkennung

Bei der Audio-Deepfake-Erkennung handelt es sich um eine Reihe von Techniken, mit denen festgestellt werden kann, ob eine Sprachaufnahme von einem echten Menschen gesprochen oder von KI synthetisiert/geklont wurde.

2 Min. gelesenLesen
Audio-KI

Prosodie-Modellierung

Durch die Prosodie-Modellierung lernen Maschinen die Melodie der Sprache, den Rhythmus, die Tonhöhe, die Betonung und das Tempo, die über den Wörtern liegen.

2 Min. gelesenLesen
Audio-KI

Emotionale Sprachsynthese

Die emotionale Sprachsynthese erzeugt Stimmen, die glücklich, traurig, wütend oder ruhig klingen, nicht nur verständlich, sondern auch glaubhaft gefühlt.

2 Min. gelesenLesen
Audio-KI

Sprachkonvertierung

Bei der Sprachkonvertierung wird die aufgezeichnete Sprache einer Person so umgewandelt, dass sie so klingt, als wäre sie von einer anderen Person gesprochen worden, wobei die ursprünglichen Wörter und das Timing erhalten bleiben.

2 Min. gelesenLesen
Audio-KI

Sprecher-Tagebuch

Die Aufzeichnung von Sprechertagebüchern beantwortet die Frage „Wer hat wann gesprochen?“ durch Aufteilen einer Audioaufnahme in Segmente, die nach Sprecheridentität gekennzeichnet sind.

2 Min. gelesenLesen
Audio-KI

Überprüfung des Sprechers

Die Sprecherüberprüfung bestätigt, ob eine Stimme mit einer bestimmten behaupteten Identität übereinstimmt, und fungiert als stimmbasiertes Passwort.

2 Min. gelesenLesen
Audio-KI

Sprachaktivitätserkennung

Die Sprachaktivitätserkennung (VAD) entscheidet von Moment zu Moment, ob ein Audiosignal menschliche Sprache oder nur Stille und Lärm enthält.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.

Audio AI AI Guides — Page 9 of 10 | AI Understanding