PRZEWODNIK AI audio

Wzmocnienie mowy Noise2Noise

Noise2Noise to sztuczka szkoleniowa, która pozwala modelowi nauczyć się usuwać szum bez zobaczenia czystego odniesienia, poprzez uczenie się na podstawie par wersji tego samego sygnału o różnym poziomie szumu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

For speech enhancement it matters because clean recordings are expensive or impossible to obtain, yet noisy ones are everywhere.

Głębokie nurkowanie

Wprowadzony przez badaczy firmy NVIDIA w 2018 roku program Noise2Noise przedstawił zaskakujące stwierdzenie: można wytrenować denoiser, korzystając wyłącznie z uszkodzonych przykładów. Wgląd ma charakter statystyczny. Jeśli dasz sieci dwie zaszumione wersje tego samego sygnału podstawowego i poprosisz ją o odwzorowanie jednej na drugą przy użyciu błędu średniokwadratowego przypominającego stratę, sieć nie będzie w stanie przewidzieć losowego szumu w obiekcie docelowym, więc najlepsze, co może zrobić, to wyprowadzić oczekiwaną wartość, czyli czysty sygnał. Hałas jest średni. W odniesieniu do mowy bierzesz czystą wypowiedź, dodajesz dwie niezależne próbki szumu i szkolisz model, aby przewidywał jeden hałaśliwy klip od drugiego. Podsumowując, model usuwa szum z rzeczywistych nagrań. Pozwala to ominąć główne wąskie gardło nadzorowanego odszumiania: potrzebę idealnie czystego, prawdziwego dźwięku.

Wgląd techniczny

Obliczenia opierają się na własności, że strata L2 (średni błąd kwadratowy) jest minimalizowana przy średniej warunkowej. Jeśli szum dodany do celu jest zerowy i niezależny od szumu wejściowego, nieprzewidywalny szum przyczynia się jedynie do stałej wariancji strat, więc opadanie gradientu kieruje sieć w stronę bazowego czystego sygnału. Ten sam pomysł działa z innymi estymatorami: strata L1 przywraca medianę, przydatną w przypadku szumu impulsowego.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość poprawy mowy Noise2Noise

Noise2Noise otworzyło rodzinę samonadzorowanych metod odszumiania, w tym Noise2Void i Noise2Self, które jeszcze bardziej rozluźniają wymagania w kierunku uczenia się na podstawie pojedynczych zaszumionych próbek. W przypadku mowy możesz spodziewać się, że te pomysły pozwolą na usprawnienie działania aparatu słuchowego, rozmów telefonicznych i nagrań w terenie, gdzie zbieranie czystych referencji jest niepraktyczne. W połączeniu z wokoderami generatywnymi przyszłe systemy będą mogły nie tylko odejmować szum, ale także wiarygodnie rekonstruować zamaskowaną lub zniszczoną treść mowy, zachowując jednocześnie wierność mówiącemu.

Implementacja w świecie rzeczywistym

Czyszczenie nagrań terenowych lub archiwalnych, w których nie ma czystego odniesienia do oryginalnego przemówienia

Poprawa przejrzystości połączeń głosowych na telefonach i laptopach poprzez szkolenie urządzeń usuwających szumy na przechwytywaniu szumów w świecie rzeczywistym

Ulepszanie mowy w aparatach słuchowych za pomocą sparowanych, hałaśliwych nagrań zamiast nieosiągalnego, czystego dźwięku

Przywracanie starych, zaszumionych nagrań z podcastami lub wywiadami, na których przetrwały jedynie zdegradowane wersje

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Noise2Noise Speech Enhancement quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Zestaw narzędzi do rozpoznawania mowy Kaldi

Często zadawane pytania

What is Noise2Noise Speech Enhancement?

Noise2Noise to sztuczka szkoleniowa, która pozwala modelowi nauczyć się usuwać szum bez zobaczenia czystego odniesienia, poprzez uczenie się na podstawie par wersji tego samego sygnału o różnym poziomie szumu. W przypadku poprawy mowy ma to znaczenie, ponieważ czyste nagrania są drogie lub niemożliwe do uzyskania, a mimo to wszędzie są zaszumione nagrania.

Jakie jest zaskakujące główne twierdzenie Noise2Noise?

Projekt Noise2Noise pokazał, że można wytrenować skuteczny środek odszumiający, używając tylko par uszkodzonych przykładów, bez czystych celów.

Dlaczego sieć nie może po prostu zapamiętać szumu w docelowym klipie?

Ponieważ szum obiektu docelowego jest losowy i niezależny od sygnału wejściowego, sieć nie jest w stanie go przewidzieć i zamiast tego osiąga czystą wartość oczekiwaną.

W jakim kierunku zmierza sieć, przy stracie L2 (średniego kwadratu błędu)?

Strata L2 jest minimalizowana przy średniej warunkowej, więc przy niezależnym szumie docelowym o zerowej średniej, sieć wyprowadza podstawowy czysty sygnał.

Co musi być prawdą w odniesieniu do hałasu dodanego do celu, aby sztuczka zadziałała?

Docelowy szum musi mieć średnią zerową i być statystycznie niezależny od szumu wejściowego, aby uśredniał się podczas treningu.

Jakie statystyki powoduje przejście z utraty L2 na utratę L1?

Strata L1 (błąd bezwzględny) jest minimalizowana na medianie, która jest bardziej odporna na szum impulsowy.