Audio-KI-GUIDE

Herausforderung zur Tiefengeräuschunterdrückung

Die Deep Noise Suppression (DNS) Challenge ist ein von Microsoft durchgeführter Wettbewerb, der Forscher dazu drängt, neuronale Netze aufzubauen, die Hintergrundgeräusche in Echtzeit aus Sprache entfernen.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

Es setzte die modernen Maßstäbe, die Funktionen wie Teams und Zoom-Geräuschentfernung ermöglichen.

Tiefer Einblick

Die DNS Challenge wurde 2020 von Microsoft ins Leben gerufen und mehrere Jahre lang wiederholt (häufig bei INTERSPEECH und ICASSP). Sie stellte den Teams einen großen, standardisierten Datensatz aus sauberer Sprache, Rauschclips und synthetisch gemischten Rauschaufnahmen zur Verfügung. Entscheidend ist, dass sich die Bewertung von älteren Signalmathematiken wie PESQ hin zu menschlichen Hörbewertungen und erlernten Prädiktoren für die wahrgenommene Qualität verlagerte. Außerdem wurden harte reale Bedingungen hinzugefügt: hallende Räume, instationäre Geräusche (Tippen, Hunde, Sirenen), tonale Geräusche und personalisierte Szenarien, in denen ein Modell alle außer einem registrierten Zielsprecher unterdrücken muss. Durch die Veröffentlichung von Daten, Basislinien und einem gemeinsamen Testsatz konnten Labore Äpfel mit Äpfeln vergleichen und den Übergang von Filtertricks zu durchgängigem Deep Learning zur Sprachverbesserung beschleunigen.

Technischer Einblick

Einträge speisen typischerweise die Kurzzeit-Fourier-Transformation der verrauschten Wellenform in ein wiederkehrendes oder Faltungsnetzwerk ein, das eine Zeit-Frequenz-Maske vorhersagt. Durch Multiplizieren der Maske mit dem Rauschspektrum werden rauschdominierte Bins gedämpft, während sprachdominierte Bins erhalten bleiben. Anschließend wird die Wellenform durch eine inverse STFT neu aufgebaut. Echtzeitregeln begrenzen die algorithmische Latenz (ca. 40 ms) und erfordern eine kausale Verarbeitung, sodass Modelle beim Bereinigen des aktuellen Frames keinen Blick auf zukünftige Audiodaten werfen können.

Strategische Auswirkungen

Zugang und Erreichbarkeit

Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.

Kosten und Budget

Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.

Geschwindigkeit und Umfang

Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.

Die Zukunft der Deep Noise Suppression Challenge

Erwarten Sie, dass sich der Rahmen in Richtung personalisierter und multimodaler Unterdrückung erweitert, wobei die Lippenbewegung oder der Stimmabdruck eines Sprechers bestimmen, was beibehalten werden soll. Die Modelle werden immer kleiner, um in Ohrhörern und Hörgeräten auf dem Gerät laufen zu können, und die 48-kHz-Vollbandverarbeitung wird zum Standard, damit Musik und hohe Frequenzen überleben können. Generative Ansätze, die saubere Sprache neu synthetisieren, anstatt nur Geräusche zu maskieren, sind ein aktives und manchmal umstrittenes Grenzgebiet.

Reale Umsetzung

Hintergrundgeräuschentfernung in Echtzeit in Microsoft Teams und anderen Videoanruf-Apps

Sauberere Spracherfassung in Ohrhörern und Headsets beim Pendeln oder in belebten Cafés

Vorverarbeitung verrauschter Feldaufnahmen vor der automatischen Transkription oder Untertitelung

Verbesserung der Verständlichkeit bei Hörgeräten und Hörhilfen

Risiken und Leitplanken

Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.

Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.

Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.

Implementierungs-Roadmap

1

Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.

2

Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.

3

Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.

4

Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Häufig gestellte Fragen

Was ist die Deep Noise Suppression Challenge?

Die Deep Noise Suppression (DNS) Challenge ist ein von Microsoft durchgeführter Wettbewerb, der Forscher dazu drängt, neuronale Netze aufzubauen, die Hintergrundgeräusche in Echtzeit aus Sprache entfernen. Es setzt die modernen Maßstäbe für Funktionen wie die Rauschunterdrückung von Teams und Zoom.

Welche Organisation hat die Deep Noise Suppression (DNS) Challenge ins Leben gerufen?

Microsoft startete die DNS Challenge im Jahr 2020 und führte sie an Veranstaltungsorten wie INTERSPEECH und ICASSP durch.

Was ist das Hauptziel der für die DNS Challenge entwickelten Systeme?

Die Herausforderung zielt auf die Sprachverbesserung in Echtzeit ab, indem Geräusche unterdrückt und gleichzeitig die Stimme des Sprechers erhalten bleibt.

Warum verbietet die Echtzeit-DNS-Verarbeitung Modellen die Verwendung zukünftiger Audio-Frames?

Live-Konversationen erfordern eine kausale Verarbeitung mit geringer Latenz, sodass das Modell nur vergangene und aktuelle Audiodaten verwenden kann.

Eine gängige Technik bei DNS-Einträgen besteht darin, eine „Maske“ vorherzusagen. Was macht die Maske?

Eine Zeit-Frequenz-Maske wird mit dem Rauschspektrum multipliziert, um rauschdominierte Bins zu unterdrücken und Sprache beizubehalten.

Wie hat die DNS Challenge die Bewertung der Sprachverbesserung verändert?

Die Herausforderung verlagerte sich auf menschliche Hörtests und erlernte Prädiktoren für die Wahrnehmungsqualität statt nur auf Signalmathematik.