PRZEWODNIK AI audio

Wokoder UnivNet o wielu rozdzielczościach

UnivNet to wokoder GAN, który ocenia wygenerowany dźwięk na podstawie wielu spektrogramów obliczonych w różnych rozdzielczościach STFT, wyostrzając szczegóły wysokich częstotliwości.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It aims to be a universal vocoder that generalizes well to unseen speakers and recording conditions.

Głębokie nurkowanie

UnivNet, zaproponowany przez Janga i in. w 2021 r. rozwiązuje problem wspólnej słabości wokoderów GAN: stłumionych lub obciążonych artefaktami wysokich częstotliwości. Jego generator opiera się na pełnopasmowych spektrogramach mel i wykorzystuje sploty o zmiennej lokalizacji (LVC), w których jądra splotu są przewidywane na bieżąco na podstawie cech wejściowych, dzięki czemu filtr dostosowuje się do zawartości lokalnej. Główną ideą jest wielorozdzielczy dyskryminator spektrogramu (MRSD): zamiast oceniać tylko surowy kształt fali, UnivNet oblicza kilka STFT z różnymi rozmiarami okien i przeskoków i uruchamia dyskryminatory na tych wielkościach spektrogramu. To zmusza generator do prawidłowego uzyskania zarówno drobnych szczegółów widmowych, jak i szerokiej struktury czasowej. Wyszkolony na wielu głośnikach, UnivNet wytwarza naturalną mowę dla głosów, których nigdy nie widział podczas szkolenia, zyskując swoją uniwersalną etykietę.

Wgląd techniczny

Splot zmiennych lokalizacyjnych UnivNet dynamicznie generuje wagi jądra na podstawie funkcji kondycjonowania mel za pośrednictwem małej sieci predyktorów jądra, więc w każdym kroku skutecznie wykorzystuje się filtr dostosowujący się do zawartości, a nie stałe współdzielone jądro. W połączeniu z wielorozdzielczym dyskryminatorem spektrogramu, który obejmuje jednocześnie kilka kompromisów czasowo-częstotliwościowych, umożliwia to bezpośrednie namierzenie pasma wysokich częstotliwości, w którym prostsze wokodery GAN mają tendencję do rozmycia lub buczenia.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość wielorozdzielczego wokodera UnivNet

Dyskryminacja spektrogramów o wielu rozdzielczościach UnivNet stała się standardowym składnikiem nowoczesnych stosów TTS i wpływa na systemy, takie jak BigVGAN i neuronowe kodeki audio. Spodziewaj się, że uniwersalne, niezależne od głośnika ramy będą się nadal rozwijać w kierunku śpiewu, wielojęzycznej syntezy i pełnopasmowego dźwięku 48 kHz, podczas gdy koncepcja jądra adaptacyjnego zapewnia wydajne modele na urządzeniach, które muszą obsługiwać różnorodne głosy bez dostrajania poszczególnych głośników.

Implementacja w świecie rzeczywistym

Usługi TTS z wieloma głośnikami, które muszą brzmieć naturalnie w przypadku głosów, których nie ma w danych treningowych

Potoki klonowania głosu, w których jeden uniwersalny wokoder obsługuje wiele głośników docelowych

Wysokiej jakości narracja audiobooków i podcastów wymagająca wyraźnego sybilansu i wysokich częstotliwości

Wokoder zaplecza do kompleksowych systemów TTS, który łączy predyktor spektrogramu z solidnym generatorem przebiegów

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the UnivNet Multi-Resolution Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is UnivNet Multi-Resolution Vocoder?

UnivNet to wokoder GAN, który ocenia wygenerowany dźwięk na podstawie wielu spektrogramów obliczonych w różnych rozdzielczościach STFT, wyostrzając szczegóły wysokich częstotliwości. Ma być uniwersalnym wokoderem, który dobrze uogólnia niewidzialne głośniki i warunki nagrywania.

Jaka jest charakterystyczna cecha dyskryminatora UnivNet?

Wielorozdzielczy dyskryminator spektrogramu UnivNet analizuje kilka STFT z różnymi rozmiarami okien i przeskoków, aby uchwycić różne kompromisy czas-częstotliwość.

Na jaki problem we wcześniejszych wokoderach GAN szczególnie celuje UnivNet?

Rozróżniając wiele rozdzielczości spektrogramu, UnivNet poprawia szczegóły w wysokich częstotliwościach, które często zacierają prostsze wokodery GAN.

Co to są sploty zmiennych lokalizacji (LVC) w UnivNet?

LVC wykorzystuje sieć predyktorów jądra, zatem w każdej lokalizacji stosowane są filtry dostosowujące się do zawartości, pochodzące z kondycjonującego spektrogramu mel.

Dlaczego UnivNet jest opisywany jako uniwersalny wokoder?

Wyszkolony na wielu mówcach, UnivNet syntetyzuje mowę naturalną nawet dla głosów, których nigdy nie spotkał podczas szkolenia, a zatem jest uniwersalny.

W jaki sposób wielorozdzielczy dyskryminator spektrogramu pomaga generatorowi?

Różne rozdzielczości STFT podkreślają różne kompromisy czasowo-częstotliwościowe, więc dopasowanie ich wszystkich popycha generator w stronę dokładnych szczegółów i struktury.