Аудіо AI GUIDE

Приглушення мовлення за допомогою RNNoise

RNNoise — це крихітна швидка нейронна мережа, яка видаляє фоновий шум із мови в реальному часі.

2 хвилини читанняОстаннє оновлення

Огляд

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

Глибоке занурення

RNNoise, випущений у 2017 році, був розроблений для придушення шуму з низькою затримкою під час голосових викликів. Замість того, щоб вивчати все наскрізне, він розбиває мовлення приблизно на 22 діапазони частот, змодельовані за людським вухом (шкала, подібна до Барка), і використовує рекурентну нейронну мережу з Gated Recurrent Units для оцінки посилення (від 0 до 1) для кожної смуги на кадр. Ці переваги послаблюють зашумлені смуги, зберігаючи смуги з домінуванням мови недоторканими. Додатковий фільтр висоти тону усуває залишковий шум між гармоніками озвученої мови. Вся модель має приблизно 85 000 вагових коефіцієнтів, працює швидше, ніж у реальному часі на одному ядрі ЦП, і є відкритим вихідним кодом за ліцензією BSD, тому її було інтегровано в такі проекти, як екосистема кодеків Opus, Mumble і OBS Studio.

Технічне розуміння

Ключовим вибором дизайну є використання сприйнятливих смуг сприйняття замість необроблених спектральних розділів. Прогнозуючи лише ~22 значення посилення на кадр, мережа GRU залишається крихітною та уникає музичних шумових артефактів, поширених у старих методах спектрального віднімання. Створені вручну функції (енергії смуги, період висоти, кореляція висоти) живлять мережу, поєднуючи знання DSP із навчанням. Окремий вихід голосової активності допомагає підвищити рівень гейту під час кадрів із чистим шумом.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє знешумлення мовлення за допомогою RNNoise

RNNoise надихнув хвилю легкої роботи з покращення в реальному часі; його наступні дослідження (PercepNet, DeepFilterNet) підвищують якість, зберігаючи при цьому невеликі бюджети ЦП. Очікуйте, що шумозаглушувачі вбудовуватимуться безпосередньо в гарнітури, слухові апарати та мікросхеми для конференц-зв’язку, поєднуватимуть із придушенням луни та деверберацією, а також використовуватимуть перцептивні та навіть генеративні цілі. Гібридний рецепт DSP плюс мала мережа залишається впливовим скрізь, де низька затримка, низьке енергоспоживання та ліцензування з відкритим вихідним кодом важливіші, ніж розмір сирої моделі.

Реалізація в реальному світі

Придушення стукоту клавіатури та дзижчання вентилятора під час відеодзвінків у програмах, які об’єднують RNNoise.

Очищення мікрофона стримера в OBS Studio за допомогою вбудованого шумозаглушувального фільтра RNNoise.

Покращення розбірливості голосового чату в іграх і таких інструментів VoIP, як Mumble, на малопотужному обладнанні.

Попередня обробка записів із зашумленим полем для отримання чистішого сигналу розпізнавання мовлення.

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Поділ мовлення та проблема коктейльної вечірки

Часті запитання

What is Speech Denoising with RNNoise?

RNNoise — це крихітна швидка нейронна мережа, яка видаляє фоновий шум із мови в реальному часі. Створений Жаном-Марком Валіном з Xiph.Org, він поєднує класичну обробку сигналу з невеликою рекурентною мережею, тому працює на звичайних процесорах і навіть вбудованих пристроях.

Що в першу чергу передбачає RNNoise для кожного короткого кадру аудіо?

RNNoise оцінює приріст для кожної смуги, що послаблює смуги з домінуванням шуму, зберігаючи смуги з домінуванням мови, а не працює з кожним спектральним блоком.

Який тип нейронної мережі лежить в основі RNNoise?

RNNoise використовує компактну рекурентну нейронну мережу, створену з Gated Recurrent Units, надаючи їй тимчасову пам’ять, залишаючись крихітною.

Чому RNNoise використовує перцептивні смуги частот замість необроблених спектральних блоків?

Прогнозування лише ~22 посилень смуги зберігає мережу невеликою, швидкою та менш схильною до артефактів музичного шуму, які заважають методам на бін.

Наскільки приблизно розміром є модель RNNoise?

RNNoise має порядку 85 000 ваг, достатньо малих, щоб працювати швидше, ніж у реальному часі на одному ядрі ЦП.

Яка роль фільтра висоти тону в RNNoise?

Комбінований/висотний фільтр використовує гармонічну структуру озвученої мови для придушення шуму, що знаходиться між гармоніками, доповнюючи посилення смуги.