Kostenlose KI-Bibliothek

Audio-KI FührerFür immer kostenlos.

117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

117Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Audio-KI

EnCodec-Audiokomprimierung

EnCodec ist der hochauflösende neuronale Audio-Codec von Meta, der Sprache und Musik mit sehr niedrigen Bitraten komprimiert und dessen Qualität weitaus schwereren Formaten Konkurrenz macht.

2 Min. gelesenLesen
Audio-KI

Restvektorquantisierung

Residual Vector Quantization (RVQ) ist die Technik, die kontinuierliche Audioeinbettungen durch wiederholte Quantisierung in einen kompakten Stapel diskreter Codes umwandelt.

2 Min. gelesenLesen
Audio-KI

ECAPA-TDNN-Sprechererkennung

ECAPA-TDNN ist eine neuronale Netzwerkarchitektur, die jeden Sprachclip in eine kompakte „Sprachabdruck“-Einbettung umwandelt, sodass Maschinen erkennen können, wer spricht.

2 Min. gelesenLesen
Audio-KI

Lautsprecher-Anti-Spoofing und ASVspoof

Anti-Spoofing ist die Verteidigungsschicht, die gefälschte oder wiedergegebene Stimmen erkennt, die versuchen, Sprachauthentifizierungssysteme zu täuschen.

2 Min. gelesenLesen
Audio-KI

Sprachentrauschung mit RNNoise

RNNoise ist ein kleines, schnelles neuronales Netzwerk, das Hintergrundgeräusche in Echtzeit aus Sprache entfernt.

2 Min. gelesenLesen
Audio-KI

Audioeinbettungen und Repräsentationslernen

Audio-Einbettungen wandeln Schall in kompakte numerische Vektoren um, die Bedeutung erfassen, sodass Maschinen Audio so vergleichen, suchen und klassifizieren können, wie Menschen es erkennen.

2 Min. gelesenLesen
Audio-KI

Akustische Echounterdrückung

Akustische Echounterdrückung (AEC) ist die Technologie, die verhindert, dass Ihre eigene Stimme während eines Anrufs zurückgeworfen wird.

2 Min. gelesenLesen
Audio-KI

Sprachtrennung und das Cocktailparty-Problem

Unter Sprachtrennung versteht man die Aufgabe, einzelne Stimmen aus einer Aufnahme herauszutrennen, in der mehrere Personen gleichzeitig sprechen.

2 Min. gelesenLesen
Audio-KI

Permutationsinvariantes Training

Permutationsinvariantes Training (PIT) ist ein cleverer Trainingstrick, der es einem Modell ermöglicht, mehrere Stimmen zu trennen, ohne sich darum zu kümmern, in welchem ​​Ausgabeslot jede Stimme landet …

2 Min. gelesenLesen
Audio-KI

Abrufen von Musikinformationen

Music Information Retrieval (MIR) ist der Bereich, der Computern beibringt, Musik anhand von Audiosignalen und Partituren zu analysieren, zu verstehen und zu durchsuchen.

2 Min. gelesenLesen
Audio-KI

Demucs und HT-Demucs Musikquellentrennung

Erfahren Sie, wie Demucs und HT-Demucs Musik mithilfe von Wellenform-, Spektrogramm- und Transformatormodellierung in Gesang und Instrumentenstämme aufteilen.

2 Min. gelesenLesen
Audio-KI

Erkennung von Audioakkorden

Bei der Audio-Akkorderkennung handelt es sich um die Aufgabe, die in einem Song gespielten Akkorde automatisch direkt aus dem Audio zu kennzeichnen.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.

Audio AI AI Guides — Page 3 of 10 | AI Understanding