Аудио РУКОВОДСТВО ПО ИИ

Задача глубокого подавления шума

Конкурс Deep Noise Suppression (DNS) Challenge — это конкурс, проводимый Microsoft, который побуждает исследователей создавать нейронные сети, которые удаляют фоновый шум из речи в режиме реального времени.

2 минуты чтенияПоследнее обновление

Обзор

It set the modern benchmarks that power features like Teams and Zoom noise removal.

Глубокое погружение

Конкурс DNS Challenge, запущенный Microsoft в 2020 году и повторявшийся в течение нескольких лет (часто в INTERSPEECH и ICASSP), предоставил командам большой стандартизированный набор данных, состоящий из чистой речи, шумовых клипов и синтетически смешанных шумовых записей. Что особенно важно, это сместило оценку от старой математики сигналов, такой как PESQ, к оценкам человеческого слушания и изученным предикторам воспринимаемого качества. Также были добавлены жесткие условия реального мира: реверберирующие помещения, нестационарные шумы (печать, собаки, сирены), тональные шумы и персонализированные сценарии, в которых модель должна подавлять всех, кроме зарегистрированного целевого говорящего. Публикуя данные, базовые показатели и общий набор тестов, он позволил лабораториям сравнивать яблоки с яблоками и ускорил переход от трюков с фильтрацией к сквозному глубокому обучению для улучшения речи.

Техническая информация

Записи обычно подают кратковременное преобразование Фурье зашумленной формы сигнала в рекуррентную или сверточную сеть, которая прогнозирует частотно-временную маску. Умножение маски на зашумленный спектр ослабляет элементы разрешения с преобладанием шума, сохраняя при этом элементы с преобладанием речи, а затем обратное STFT восстанавливает форму сигнала. Правила реального времени ограничивают алгоритмическую задержку (около 40 мс) и требуют причинной обработки, поэтому модели не могут просмотреть будущий звук при очистке текущего кадра.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее проблемы глубокого шумоподавления

Ожидайте, что система будет расширяться в сторону персонализированного и мультимодального подавления, когда движение губ или отпечаток голоса говорящего подскажут, что следует сохранить. Модели уменьшаются, чтобы работать на устройствах для наушников-вкладышей и слуховых аппаратов, а полнодиапазонная обработка 48 кГц становится стандартом, поэтому музыка и высокие частоты выживают. Генеративные подходы, которые повторно синтезируют чистую речь, а не просто маскируют шум, являются активным, а иногда и противоречивым направлением.

Реальная реализация

Удаление фонового шума в реальном времени в Microsoft Teams и других приложениях для видеозвонков

Более четкий захват речи в наушниках и гарнитурах во время поездок на работу или в оживленном кафе.

Предварительная обработка шумных полевых записей перед автоматической транскрипцией или субтитрами

Улучшение разборчивости в слуховых аппаратах и вспомогательных устройствах для прослушивания

Риски и ограничения

Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

1

Получите явное согласие на захват, клонирование и повторное использование голоса.

2

Проверьте качество звука при использовании различных динамиков и фоновых условий.

3

Определите, когда человек должен проверять или утверждать результаты.

4

Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Глубокое обучение

Часто задаваемые вопросы

What is Deep Noise Suppression Challenge?

Конкурс Deep Noise Suppression (DNS) Challenge — это конкурс, проводимый Microsoft, который побуждает исследователей создавать нейронные сети, которые удаляют фоновый шум из речи в режиме реального времени. Он установил современные стандарты для таких функций, как Teams и удаление шума Zoom.

Какая организация запустила конкурс Deep Noise Suppression (DNS) Challenge?

Microsoft запустил DNS Challenge в 2020 году и проводил его на таких площадках, как INTERSPEECH и ICASSP.

Какова основная цель систем, созданных для DNS Challenge?

Задача направлена ​​на улучшение речи в реальном времени, подавление шума при сохранении голоса говорящего.

Почему обработка DNS в реальном времени запрещает моделям использовать будущие аудиокадры?

Живой разговор требует причинной обработки с малой задержкой, поэтому модель может использовать только прошлый и текущий звук.

Распространенным методом работы с записями DNS является предсказание «маски». Что делает маска?

Частотно-временная маска умножается на шумовой спектр, чтобы подавить элементы разрешения с преобладанием шума и сохранить речь.

Как DNS Challenge изменил способ оценки улучшения речи?

Задача заключалась в тестах на прослушивание человека и изучении предсказателей качества восприятия, а не только в математике сигналов.