Kostenlose KI-Bibliothek

Audio-KI FührerFür immer kostenlos.

117 Leitfäden in einfachem Englisch, strukturierte Lernpfade und eine offene Bibliothek – erstellt von einer unabhängigen gemeinnützigen Organisation 501(c)(3), damit jeder moderne KI verstehen kann.

117Kostenlose Reiseführer
1Themenspuren
~2 minPro Reiseführer
~4hLesezeit

Beginnen Sie hier

Fünf ergebnisorientierte Kurse

Jeder Kurs umfasst explizite Ergebnisse, abgebildete Kompetenzen, Übungsaktivitäten und einen angewandten Schlussstein.

Themenspuren

Nach Titel durchsuchen

Springen Sie in den Bereich, der Ihnen am Herzen liegt. Zu jedem Titel gibt es mehrere leicht verständliche Anleitungen.

Vollständige Bibliothek

Alle Führer

117 von 1019 Anleitungen angezeigt. Filtern Sie nach Titel oder suchen Sie oben.

Audio-KI

Mimi Streaming Audio Codec

Mimi ist ein neuronaler Audio-Codec, der Sprache in Echtzeit in einen winzigen Strom diskreter Token komprimiert, sodass KI-Modelle mit sehr geringer Lautstärke zuhören und sprechen können.

2 Min. gelesenLesen
Audio-KI

Zuhören, teilnehmen und buchstabieren

Listen, Attend and Spell (LAS) ist ein bahnbrechendes neuronales Netzwerk aus dem Jahr 2015, das Sprache direkt in Zeichen umwandelt, ohne dass eine manuelle Aussprache erforderlich ist.

2 Min. gelesenLesen
Audio-KI

SpecAugment für Spracherkennung

SpecAugment ist eine einfache, aber leistungsstarke Datenerweiterungsmethode, die das Sprachspektrogramm maskiert und verzerrt, um Erkennungsmodelle robuster zu machen.

2 Min. gelesenLesen
Audio-KI

Automatisches Tagging von Musik

Das automatische Tagging von Musik nutzt maschinelles Lernen, um einen Song anzuhören und automatisch beschreibende Labels wie Genre, Stimmung, Instrumente und Tempo hinzuzufügen.

2 Min. gelesenLesen
Audio-KI

Musikalische Klangfarbenübertragung

Die Klangfarbenübertragung formt die „Klangfarbe“ von Audio um, sodass ein Instrument wie ein anderes klingt, und verwandelt eine gesummte Melodie in eine Geigen- oder Trompetenlinie …

2 Min. gelesenLesen
Audio-KI

Akustische Szenenklassifizierung

Die akustische Szenenklassifizierung (ASC) trainiert Maschinen, die Umgebung zu erkennen, in der eine Aufnahme gemacht wurde, eine belebte Straße, einen ruhigen Park, einen Zug, ein Café …

2 Min. gelesenLesen
Audio-KI

NVIDIA Riva und NeMo Speech

NVIDIA Riva ist ein GPU-beschleunigtes SDK für Sprach-KI in der Produktion (ASR, TTS und Übersetzung), während NeMo das Open-Source-Toolkit für Training und Feinabstimmung ist …

2 Min. gelesenLesen
Audio-KI

DeepSpeech-Architektur

DeepSpeech ist ein von Baidu im Jahr 2014 eingeführtes End-to-End-Spracherkennungsmodell, das Rohaudiomerkmale mithilfe eines wiederkehrenden neuronalen Verfahrens direkt dem Text zuordnet.

2 Min. gelesenLesen
Audio-KI

Einbettungen von X-Vector-Lautsprechern

X-Vektoren sind numerische Fingerabdrücke fester Länge der Stimme eines Sprechers, die von einem neuronalen Netzwerk erzeugt werden und dazu dienen, zu erkennen, wer spricht, unabhängig davon, was er sagt.

2 Min. gelesenLesen
Audio-KI

Monotone Glow-TTS-Ausrichtung

Glow-TTS ist ein Text-to-Speech-Modell, das mithilfe eines cleveren Suchtricks lernt, Text und Sprache selbstständig auszurichten, sodass kein separater Aligner erforderlich ist.

2 Min. gelesenLesen
Audio-KI

Paralleler WaveGAN Vocoder

Parallel WaveGAN ist ein schneller neuronaler Vocoder, der ein Mel-Spektrogramm mithilfe eines kleinen GAN in eine rohe Audiowellenform umwandelt und dabei alle Samples auf einmal generiert.

2 Min. gelesenLesen
Audio-KI

WaveGlow Flow-basierter Vocoder

WaveGlow ist ein flussbasierter neuronaler Vocoder von NVIDIA, der Sprachwellenformen aus Mel-Spektrogrammen in einem einzigen Durchgang ohne Autoregression synthetisiert.

2 Min. gelesenLesen

Mit dem Lesen fertig? Beweisen Sie es.

Überprüfen Sie anhand von Themenquiz, was Sie gelernt haben, und erkunden Sie anschließend unsere strukturierten Kurse und aktuellen Zertifizierungsanforderungen. Die wichtigsten Leitfäden bleiben weiterhin frei lesbar.