Défi de suppression du bruit profond
Le défi Deep Noise Suppression (DNS) est un concours organisé par Microsoft qui pousse les chercheurs à construire des réseaux neuronaux qui suppriment le bruit de fond de la parole en temps réel.
Aperçu
It set the modern benchmarks that power features like Teams and Zoom noise removal.
Plongée profonde
Lancé par Microsoft en 2020 et répété pendant plusieurs années (souvent chez INTERSPEECH et ICASSP), le DNS Challenge a fourni aux équipes un vaste ensemble de données standardisées de paroles claires, d'extraits de bruit et d'enregistrements bruités synthétiquement mélangés. Fondamentalement, il a déplacé l’évaluation des anciens calculs de signaux comme le PESQ vers les scores d’écoute humaine et les prédicteurs appris de la qualité perçue. Il a également ajouté des conditions difficiles du monde réel : des pièces réverbérantes, des bruits non stationnaires (frappe au clavier, chiens, sirènes), des bruits tonals et des scénarios personnalisés dans lesquels un modèle doit supprimer tout le monde, à l'exception d'un locuteur cible inscrit. En publiant des données, des références et un ensemble de tests communs, il a permis aux laboratoires de comparer des pommes avec des pommes et a accéléré le passage des astuces de filtrage à l'apprentissage profond de bout en bout pour l'amélioration de la parole.
Aperçu technique
Les entrées alimentent généralement la transformée de Fourier à court terme de la forme d'onde bruyante en un réseau récurrent ou convolutif qui prédit un masque temps-fréquence. La multiplication du masque par le spectre bruyant atténue les cases dominées par le bruit tout en préservant celles dominées par la parole, puis une STFT inverse reconstruit la forme d'onde. Les règles en temps réel limitent la latence algorithmique (environ 40 ms) et nécessitent un traitement causal, de sorte que les modèles ne peuvent pas jeter un œil à l'audio futur lors du nettoyage de l'image actuelle.
Impact stratégique
Accès et portée
Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.
Coût et budget
Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.
Vitesse et échelle
Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.
Le défi de l’avenir de la suppression du bruit profond
Attendez-vous à ce que le cadre s'étende vers une suppression personnalisée et multimodale, où le mouvement des lèvres ou l'empreinte vocale d'un locuteur guide ce qu'il faut conserver. Les modèles diminuent pour fonctionner sur des appareils destinés aux écouteurs et aux aides auditives, et le traitement pleine bande de 48 kHz devient la norme pour que la musique et les hautes fréquences survivent. Les approches génératives qui resynthétisent la parole claire, plutôt que de simplement masquer le bruit, constituent une frontière active et parfois controversée.
Mise en œuvre dans le monde réel
Suppression du bruit de fond en temps réel dans Microsoft Teams et autres applications d'appel vidéo
Capture vocale plus nette dans les écouteurs et les casques pendant les trajets domicile-travail ou dans les cafés occupés
Prétraitement des enregistrements de terrain bruyants avant transcription ou sous-titrage automatique
Améliorer l’intelligibilité des aides auditives et des aides auditives
Risques et garde-fous
Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.
La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.
L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.
Feuille de route de mise en œuvre
Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.
Testez la qualité sur divers locuteurs et conditions d’arrière-plan.
Définissez quand un humain doit examiner ou approuver les résultats.
Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Deep Noise Suppression Challenge quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Apprentissage profond
Questions fréquemment posées
What is Deep Noise Suppression Challenge?
Le défi Deep Noise Suppression (DNS) est un concours organisé par Microsoft qui pousse les chercheurs à construire des réseaux neuronaux qui suppriment le bruit de fond de la parole en temps réel. Il a établi les références modernes qui alimentent des fonctionnalités telles que Teams et la suppression du bruit Zoom.
Quelle organisation a lancé le Deep Noise Suppression (DNS) Challenge ?
Microsoft a lancé le DNS Challenge en 2020 et l'a organisé dans des lieux comme INTERSPEECH et ICASSP.
Quel est l’objectif principal des systèmes construits pour le DNS Challenge ?
Le défi vise l'amélioration de la parole en temps réel, en supprimant le bruit tout en préservant la voix de l'orateur.
Pourquoi le traitement DNS en temps réel interdit-il aux modèles d'utiliser les futures trames audio ?
La conversation en direct nécessite un traitement causal à faible latence, de sorte que le modèle ne peut utiliser que l'audio passé et actuel.
Une technique courante dans les entrées DNS consiste à prédire un « masque ». A quoi sert le masque ?
Un masque temps-fréquence est multiplié par le spectre bruyant pour supprimer les groupes dominés par le bruit et conserver la parole.
Comment le DNS Challenge a-t-il changé la façon dont l’amélioration de la parole est évaluée ?
Le défi s'est déplacé vers des tests d'écoute humaine et vers l'apprentissage de prédicteurs de qualité perceptuelle au lieu des seuls calculs mathématiques du signal.