Kostenlose KI-Bibliothek

Audio-KI FührerFür immer kostenlos.

117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

117Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Audio-KI

Beamforming und Mikrofonarrays

Beim Beamforming werden mehrere Mikrofone verwendet, um in eine bestimmte Richtung zu lauschen, wodurch der Schall eines Ziels verstärkt und alles andere unterdrückt wird.

2 Min. gelesenLesen
Audio-KI

Riffusionsspektrogramm-Diffusion

Riffusion ist ein cleverer Hack, der Musik erzeugt, indem er Ton als Bild behandelt: Er optimiert das Stable Diffusion-Bildmodell, um Spektrogramme zu zeichnen, und ...

2 Min. gelesenLesen
Audio-KI

MusicLM: Hierarchische semantische und akustische Token

Erfahren Sie, wie Google MusicLM hierarchische semantische und akustische Token, SoundStream und MuLan verwendet, um Textansagen in kohärente Musik umzuwandeln.

2 Min. gelesenLesen
Audio-KI

Noise2Noise-Sprachverbesserung

Noise2Noise ist ein Trainingstrick, mit dem ein Modell lernen kann, Rauschen zu entfernen, ohne jemals eine saubere Referenz zu sehen, indem es aus Paaren unterschiedlich lauter… lernt.

2 Min. gelesenLesen
Audio-KI

Conv-TasNet Zeitbereichstrennung

Conv-TasNet ist ein neuronales Netzwerk, das gemischte Audiosignale (z. B. zwei Personen, die gleichzeitig sprechen) trennt, indem es stattdessen direkt an der Rohtonwellenform arbeitet …

2 Min. gelesenLesen
Audio-KI

Dual-Path-RNN-Trennung

Dual-Path RNN (DPRNN) ist eine Audio-Trennarchitektur, die eine sehr lange Sequenz von Audio-Features in kurze überlappende Abschnitte aufteilt und diese verarbeitet…

2 Min. gelesenLesen
Audio-KI

Open-Unmix-Musiktrennung

Open-Unmix (UMX) ist ein Open-Source-Deep-Learning-System, das einen Song in seine Teile aufteilt: Gesang, Schlagzeug, Bass und andere Instrumente.

2 Min. gelesenLesen
Audio-KI

Flüsterzeitgestempelte Wortausrichtung

Durch die Flüsterwortausrichtung wird jedes transkribierte Wort an eine genaue Start- und Endzeit im Audio gebunden.

2 Min. gelesenLesen
Audio-KI

Musik-Tagging mit Transformers

Beim Markieren von Musik werden Transformatormodelle verwendet, um ein Lied anzuhören und beschreibende Bezeichnungen wie Genre, Stimmung, Instrumente und Tempo vorherzusagen.

2 Min. gelesenLesen
Audio-KI

Onset-Erkennung im Audio

Die Onset-Erkennung findet die genauen Momente, in denen Noten, Schläge oder Töne in einem Audiosignal beginnen.

2 Min. gelesenLesen
Audio-KI

Generativer Vocoder von MelGAN

MelGAN ist ein vollständig faltender GAN-basierter Vocoder, der Mel-Spektrogramme in einem einzigen Schnellvorlaufdurchgang in rohe Audiowellenformen umwandelt.

2 Min. gelesenLesen
Audio-KI

UnivNet Multi-Resolution Vocoder

UnivNet ist ein GAN-Vocoder, der generierte Audiodaten mithilfe mehrerer Spektrogramme beurteilt, die mit unterschiedlichen STFT-Auflösungen berechnet wurden, und so hochfrequente Details schärft.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.