Kostenlose KI-Bibliothek

Audio-KI FührerFür immer kostenlos.

117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

117Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Audio-KI

Audiountertitel

Bei der Audiountertitelung wird ein Satz in natürlicher Sprache generiert, der den Inhalt eines Audioclips beschreibt, z. B. „Ein Zug ertönt, während er an einem Bahnübergang vorbeifährt.“

2 Min. gelesenLesen
Audio-KI

Flüsterspracherkennung

Whisper ist das Open-Source-System zur automatischen Spracherkennung von OpenAI, das Audio in über 90 Sprachen in Text umwandelt.

2 Min. gelesenLesen
Audio-KI

Wav2Vec 2.0

Wav2Vec 2.0 ist Meta AIs selbstüberwachtes Sprachmodell, das leistungsstarke Audiodarstellungen aus unbeschrifteten Rohaufnahmen lernt.

2 Min. gelesenLesen
Audio-KI

HuBERT Selbstüberwachte Rede

HuBERT (Hidden-Unit BERT) ist Meta AIs selbstüberwachtes Sprachmodell, das lernt, indem es gruppierte Audioeinheiten für maskierte Segmente im BERT-Stil vorhersagt.

2 Min. gelesenLesen
Audio-KI

Neuronale Vocoder

Ein neuronaler Vocoder ist ein Modell, das eine kompakte akustische Darstellung, normalerweise ein Mel-Spektrogramm, in eine tatsächliche hörbare Wellenform umwandelt.

2 Min. gelesenLesen
Audio-KI

Neuronale Audio-Codecs

Neuronale Audio-Codecs nutzen Deep Learning, um den Ton in winzige Ströme diskreter Token zu komprimieren und ihn mit hoher Wiedergabetreue zu rekonstruieren.

2 Min. gelesenLesen
Audio-KI

VALL-E- und Codec-Sprachmodelle

VALL-E hat Text-to-Speech als Sprachmodellierungsproblem über Audio-Codec-Tokens umgestaltet und das Klonen von Stimmen aus nur drei Sekunden eines Samples ermöglicht.

2 Min. gelesenLesen
Audio-KI

OpenAI Flüstern

Whisper ist das Open-Source-System zur automatischen Spracherkennung von OpenAI, das gesprochene Audiodaten in Dutzenden von Sprachen transkribiert und übersetzt.

2 Min. gelesenLesen
Audio-KI

Automatische Musiktranskription

Automatische Musiktranskription (AMT) wandelt eine rohe Audioaufnahme von Musik in eine symbolische Notation wie Noten, MIDI oder eine Klavierrolle um.

2 Min. gelesenLesen
Audio-KI

Beat- und Tempo-Tracking

Beim Beat- und Tempo-Tracking geht es darum, den gleichmäßigen Puls in der Musik zu finden: Wo jeder Beat fällt und wie schnell sich der Song in Beats pro Minute (BPM) bewegt.

2 Min. gelesenLesen
Audio-KI

Audio-Fingerprinting

Audio-Fingerprinting erstellt eine kompakte, rauschresistente digitale Signatur eines Tons, sodass dieser später auch durch Hintergrundgeräusche erkannt werden kann …

2 Min. gelesenLesen
Audio-KI

Jukebox

Jukebox ist das neuronale Netzwerk 2020 von OpenAI, das rohes Musikaudio generiert – komplett mit Gesangsstimmen, Instrumenten und sogar Texten im Stil bestimmter…

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.