Шумоподавление речи с помощью RNNoise
RNNoise — это крошечная, быстрая нейронная сеть, которая удаляет фоновый шум из речи в режиме реального времени.
Обзор
Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.
Глубокое погружение
RNNoise, выпущенный в 2017 году, был разработан для подавления шума с малой задержкой при голосовых вызовах. Вместо того, чтобы изучать все подряд, он разбивает речь примерно на 22 частотных диапазона, смоделированных на человеческом ухе (шкала Барка), и использует рекуррентную нейронную сеть с Gated Recurrent Units для оценки усиления (от 0 до 1) для каждого диапазона за кадр. Эти преимущества ослабляют шумные полосы, сохраняя при этом полосы с преобладанием речи. Дополнительный фильтр высоты тона очищает остаточный шум между гармониками вокализованной речи. Вся модель имеет примерно 85 000 весов, работает быстрее, чем в реальном времени, на одном ядре ЦП и имеет открытый исходный код под лицензией BSD, поэтому она была интегрирована в такие проекты, как экосистема кодеков Opus, Mumble и OBS Studio.
Техническая информация
Ключевым выбором конструкции является работа с усилением воспринимаемой полосы вместо необработанных спектральных элементов. Прогнозируя только ~22 значения усиления на кадр, сеть GRU остается крошечной и позволяет избежать артефактов музыкального шума, характерных для старых методов спектрального вычитания. Созданные вручную функции (энергия полосы, период основного тона, корреляция основного тона) используются в сети, сочетая знания DSP с обучением. Отдельный выход голосовой активности помогает усилить усиление во время кадров с чистым шумом.
Стратегическое воздействие
Доступ и охват
Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.
Стоимость и бюджет
Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.
Скорость и масштаб
Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.
Будущее шумоподавления речи с помощью RNNoise
RNNoise вдохновил на волну легких улучшений в реальном времени; его последующие исследования (PercepNet, DeepFilterNet) повышают качество при сохранении небольшого бюджета ЦП. Ожидайте, что шумоподавители будут встраиваться непосредственно в гарнитуры, слуховые аппараты и чипы для конференц-связи, в сочетании с эхоподавлением и дереверберацией, а также использовать перцептивные и даже генеративные цели. Гибридный рецепт DSP плюс малая сеть остается влиятельным везде, где низкая задержка, низкое энергопотребление и лицензирование с открытым исходным кодом имеют большее значение, чем размер исходной модели.
Реальная реализация
Подавление стука клавиатуры и шума вентилятора во время видеовызовов в приложениях, поддерживающих RNNoise.
Очистка микрофона стримера в OBS Studio через встроенный фильтр шумоподавления RNNoise.
Улучшение разборчивости голосового чата в играх и инструментах VoIP, таких как Mumble, на маломощном оборудовании.
Предварительная обработка зашумленных полевых записей, чтобы последующее распознавание речи получало более чистый сигнал.
Риски и ограничения
Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.
Точность может снижаться из-за акцентов, диалектов или шумной обстановки.
Синтетический звук можно принять за аутентичную речь без четкой маркировки.
Дорожная карта реализации
Получите явное согласие на захват, клонирование и повторное использование голоса.
Проверьте качество звука при использовании различных динамиков и фоновых условий.
Определите, когда человек должен проверять или утверждать результаты.
Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speech Denoising with RNNoise quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Разделение речи и проблема коктейльной вечеринки
Часто задаваемые вопросы
What is Speech Denoising with RNNoise?
RNNoise — это крошечная, быстрая нейронная сеть, которая удаляет фоновый шум из речи в режиме реального времени. Созданный Жан-Марком Валином из Xiph.Org, он сочетает в себе классическую обработку сигналов с небольшой рекуррентной сетью, поэтому работает на обычных процессорах и даже встроенных устройствах.
Что в первую очередь прогнозирует RNNoise для каждого короткого кадра звука?
RNNoise оценивает усиление для каждого диапазона, которое ослабляет полосы с преобладанием шума, сохраняя при этом полосы с преобладанием речи, а не работает над каждым спектральным элементом.
Какой тип нейронной сети лежит в основе RNNoise?
RNNoise использует компактную рекуррентную нейронную сеть, построенную на основе Gated Recurrent Units, что обеспечивает временную память, оставаясь при этом крошечной.
Почему RNNoise использует воспринимаемые частотные диапазоны вместо необработанных спектральных элементов?
Прогнозирование усиления всего лишь ~22 полос делает сеть небольшой, быстрой и менее подверженной артефактам музыкального шума, которые мешают методам каждого бина.
Насколько велика примерно модель RNNoise?
RNNoise имеет порядка 85 000 весов, что достаточно мало, чтобы работать быстрее, чем в реальном времени, на одном ядре ЦП.
Какова роль фильтра высоты тона в RNNoise?
Гребенчатый/питч-фильтр использует гармоническую структуру вокализованной речи для подавления шума, находящегося между гармониками, дополняя усиление полосы.