Аудио AI РЪКОВОДСТВО

Noise2Noise Подобряване на речта

Noise2Noise е тренировъчен трик, който позволява на модела да се научи да премахва шума, без изобщо да вижда чиста препратка, като се учи от двойки различно шумни версии на един и същи сигнал.

2 min readПоследна актуализация

Преглед

For speech enhancement it matters because clean recordings are expensive or impossible to obtain, yet noisy ones are everywhere.

Дълбоко гмуркане

Въведено от изследователи на NVIDIA през 2018 г., Noise2Noise направи изненадващо твърдение: можете да обучите шумозаглушител, като използвате само повредени примери. Прозрението е статистическо. Ако дадете на мрежа две шумни версии на един и същ основен сигнал и я помолите да картографира една към друга, използвайки загуба като средна квадратна грешка, мрежата не може да предвиди произволния шум в целта, така че най-доброто, което може да направи, е да изведе очакваната стойност, която е чистият сигнал. Шумът се усреднява. Приложено към речта, вие вземате чисто изказване, добавяте две независими проби от шум и обучавате модела да предсказва един шумен клип от другия. При извод моделът премахва шума от реални записи. Това заобикаля основното тясно място на контролираното премахване на шума: необходимостта от идеално чисто наземно истинско аудио.

Техническа информация

Математиката се основава на свойството, че L2 (средна квадратна грешка) загуба е сведена до минимум при условната средна стойност. Ако шумът, добавен към целта, е нулева средна стойност и не зависи от шума на входа, непредсказуемият шум допринася само за постоянна вариация към загубата, така че градиентното спускане кара мрежата към основния чист сигнал. Същата идея работи с други оценители: загуба на L1 възстановява медианата, полезна за импулсивен шум.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на подобряването на речта Noise2Noise

Noise2Noise създаде семейство от самоконтролирани методи за премахване на шума, включително Noise2Void и Noise2Self, които облекчават още повече изискванията към обучение от единични шумни проби. За говор очаквайте тези идеи да активират подобрение на устройството за слухови апарати, разговори и полеви записи, където събирането на чисти препратки е непрактично. Комбинирани с генеративни вокодери, бъдещите системи може не само да изваждат шума, но правдоподобно да реконструират маскирано или унищожено съдържание на речта, като същевременно остават верни на говорещия.

Внедряване в реалния свят

Почистване на полеви или архивни записи, където не съществува чиста препратка към оригиналната реч

Подобряване на яснотата на гласовото повикване на телефони и лаптопи чрез обучение на демонизатори на заснемане на шум в реалния свят

Подобряване на речта за слухови апарати с помощта на сдвоени шумни записи вместо недостижим чист звук

Възстановяване на шумен стар подкаст или касети с интервюта, където оцеляват само деградирали версии

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Noise2Noise Speech Enhancement quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Инструментариум за разпознаване на реч Kaldi

Frequently asked questions

What is Noise2Noise Speech Enhancement?

Noise2Noise е тренировъчен трик, който позволява на модела да се научи да премахва шума, без изобщо да вижда чиста препратка, като се учи от двойки различно шумни версии на един и същи сигнал. За подобряването на речта това има значение, защото чистите записи са скъпи или невъзможни за получаване, но шумните са навсякъде.

Какво е изненадващото основно твърдение на Noise2Noise?

Noise2Noise показа, че можете да тренирате ефективен обезшумител, като използвате само двойки повредени примери, без чисти цели.

Защо мрежата просто не може да запомни шума в целевия клип?

Тъй като шумът на целта е случаен и независим от входа, мрежата не може да го предвиди и вместо това се сближава с чистата очаквана стойност.

При L2 (средна квадратна грешка) загуба, към какво се сближава мрежата?

Загубата на L2 е сведена до минимум при условната средна стойност, така че с независим целеви шум с нулева средна стойност мрежата извежда основния чист сигнал.

Какво трябва да е вярно за шума, добавен към целта, за да проработи трикът?

Целевият шум трябва да бъде нулева средна стойност и статистически независим от входния шум, така че да се усреднява по време на обучение.

Превключването от загуба на L2 към загуба на L1 кара мрежата да възстанови коя статистика?

Загубата на L1 (абсолютна грешка) е сведена до минимум при медианата, която е по-устойчива на импулсивен шум.