Предизвикателство за дълбоко потискане на шума
Предизвикателството за дълбоко потискане на шума (DNS) е състезание, организирано от Microsoft, което тласка изследователите да изграждат невронни мрежи, които премахват фоновия шум от речта в реално време.
Преглед
It set the modern benchmarks that power features like Teams and Zoom noise removal.
Дълбоко гмуркане
Стартирано от Microsoft през 2020 г. и повтаряно в продължение на няколко години (често в INTERSPEECH и ICASSP), DNS Challenge даде на екипите голям, стандартизиран набор от данни за чиста реч, клипове с шум и синтетично смесени записи с шум. Най-важното е, че измести оценката от по-старата математика на сигнала като PESQ към резултатите от слушане от хора и научените предиктори на възприеманото качество. Той също така добави трудни условия в реалния свят: ревербериращи стаи, нестационарни шумове (писане, кучета, сирени), тонални шумове и персонализирани сценарии, при които моделът трябва да потисне всички, с изключение на записан целеви говорител. Чрез публикуване на данни, базови линии и общ набор от тестове, той позволи на лабораториите да сравняват ябълки с ябълки и ускори преминаването от филтриращи трикове към задълбочено обучение от край до край за подобряване на речта.
Техническа информация
Записите обикновено захранват кратковременната трансформация на Фурие на шумната форма на вълната в повтаряща се или конволюционна мрежа, която предсказва времево-честотна маска. Умножаването на маската по спектъра на шума отслабва доминираните от шум контейнери, като същевременно запазва тези, доминирани от речта, след което обратният STFT възстановява формата на вълната. Правилата в реално време ограничават латентността на алгоритмите (около 40 ms) и изискват причинно-следствена обработка, така че моделите не могат да надникнат в бъдещо аудио, когато почистват текущия кадър.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на предизвикателството за дълбоко потискане на шума
Очаквайте рамката да се разшири към персонализирано и мултимодално потискане, където движението на устните или гласовият отпечатък на говорещия насочва какво да запазите. Моделите се свиват, за да работят на устройството за слушалки и слухови апарати, а пълночестотната обработка от 48 kHz става стандарт, така че музиката и високите честоти да оцеляват. Генеративните подходи, които ресинтезират чиста реч, вместо само маскиране на шума, са активна и понякога противоречива граница.
Внедряване в реалния свят
Премахване на фонов шум в реално време в Microsoft Teams и други приложения за видеоразговори
По-чисто улавяне на реч в наушници и слушалки по време на пътуване до работното място или натоварени кафенета
Предварителна обработка на полеви записи с шум преди автоматична транскрипция или надписи
Подобряване на разбираемостта на слуховите апарати и помощните устройства за слушане
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Deep Noise Suppression Challenge quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Дълбоко обучение
Frequently asked questions
What is Deep Noise Suppression Challenge?
Предизвикателството за дълбоко потискане на шума (DNS) е състезание, организирано от Microsoft, което тласка изследователите да изграждат невронни мрежи, които премахват фоновия шум от речта в реално време. Той постави съвременните стандарти, които захранват функции като Teams и премахване на шума от Zoom.
Коя организация стартира предизвикателството за дълбоко потискане на шума (DNS)?
Microsoft стартира DNS Challenge през 2020 г. и го проведе на места като INTERSPEECH и ICASSP.
Каква е основната цел на системите, изградени за DNS Challenge?
Предизвикателството е насочено към подобряване на речта в реално време, потискайки шума, като същевременно запазва гласа на говорещия.
Защо DNS обработката в реално време забранява на моделите да използват бъдещи аудио рамки?
Разговорът на живо изисква причинно-следствена обработка с ниска латентност, така че моделът може да използва само минало и текущо аудио.
Често срещана техника в DNS записите е да се предвиди „маска“. Какво прави маската?
Времево-честотната маска се умножава със спектъра на шума, за да се потиснат доминираните от шума интервали и да се запази речта.
Как DNS Challenge промени начина, по който се оценява подобряването на речта?
Предизвикателството се насочи към тестове за слушане на хора и научени предиктори за качество на възприятието, вместо само математика на сигнала.