PRZEWODNIK AI audio

NaturalSpeech i dyfuzja utajona TTS

NaturalSpeech to linia badań Microsoft TTS, których celem jest jakość mowy na poziomie ludzkim, przy czym późniejsze wersje wykorzystują utajoną dyfuzję do generowania bogatych, naturalnych głosów.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It shows how diffusion models, famous for images, can produce expressive, controllable audio.

Głębokie nurkowanie

Oryginalny NaturalSpeech (2022) był pierwszym systemem, który według doniesień osiągnął jakość na poziomie ludzkim w teście porównawczym LJSpeech, ocenianą przez słuchaczy, którzy nie byli w stanie wiarygodnie odróżnić tego od prawdziwych nagrań. Wykorzystano w nim wariacyjny autokoder ze starannie dobranymi priorytetami, aby zamknąć lukę między uczeniem a wnioskowaniem. Następnie w NaturalSpeech 2 zastosowano podejście polegające na utajonym dyfuzji: mowa jest kodowana przez neuronowy kodek audio w ciągłe utajone wektory, a model dyfuzji uczy się generować te utajone wektory z tekstu, umożliwiając silne, zerowe klonowanie głosu na podstawie krótkiego komunikatu. W NaturalSpeech 3 wprowadzono dyfuzję faktoryczną, dzielącą mowę na rozwikłane atrybuty, takie jak treść, prozodia, barwa i szczegóły akustyczne, dzięki czemu każdy z nich można modelować i kontrolować niezależnie, co zapewnia wyższą wierność i elastyczność.

Wgląd techniczny

Utajona dyfuzja polega na dodawaniu szumu do zwartej utajonej reprezentacji mowy i szkoleniu sieci, aby krok po kroku odwracała ten szum. Zamiast odszumiać surowe przebiegi lub pełne spektrogramy, NaturalSpeech 2 odszumi ukryte kodeki, które są mniej wymiarowe i łatwiejsze do modelowania. Uwarunkowanie na podstawie tekstu i referencyjnego komunikatu głosowego steruje odwrotną dyfuzją, tak aby ostatecznie pobrane próbki utajone dekodowały na mowę, która odpowiada żądanej treści i tożsamości mówiącego.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość naturalnej mowy i dyfuzji utajonej TTS

Oparte na dyfuzji i faktoryzowane TTS wskazują na głosy, które są nie tylko naturalne, ale także doskonale sterowalne, umożliwiając użytkownikom dostosowanie barwy, emocji i prozodii za pomocą niezależnych pokręteł. Oczekuj szybszego próbkowania poprzez destylację i kilkuetapową dyfuzję, silniejszego klonowania typu zero-shot na podstawie sekund dźwięku i ściślejszej integracji z modelami dużych języków w celu dostarczania uwzględniającego kontekst. Postępy te zwiększają również potrzebę stosowania zabezpieczeń dotyczących znaków wodnych i zgody, ponieważ klonowanie o wysokiej wierności stwarza wyraźne ryzyko nadużyć.

Implementacja w świecie rzeczywistym

Studia dubbingowe klonują głos aktora na podstawie krótkiej próbki w celu lokalizacji filmów za pomocą klonowania typu zero-shot w stylu NaturalSpeech 2.

Platformy audiobooków generują narrację na poziomie ludzkim, którą słuchacze mają trudności z odróżnieniem od prawdziwego talentu głosowego.

Narzędzia ułatwień dostępu odtwarzają głos danej osoby na podstawie starych nagrań w przypadku osób, które utraciły mowę.

Pakiety do tworzenia treści pozwalają redaktorom niezależnie dostosowywać barwę i prozodię, wykorzystując faktoryzowane atrybuty NaturalSpeech 3.

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NaturalSpeech and Latent Diffusion TTS quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Stabilna dyfuzja utajona dźwięku

Często zadawane pytania

What is NaturalSpeech and Latent Diffusion TTS?

NaturalSpeech to linia badań Microsoft TTS, których celem jest jakość mowy na poziomie ludzkim, przy czym późniejsze wersje wykorzystują utajoną dyfuzję do generowania bogatych, naturalnych głosów. Pokazuje, jak modele dyfuzyjne, znane z obrazów, mogą wytwarzać wyrazisty, kontrolowany dźwięk.

Jaki kamień milowy osiągnięto w oryginalnym projekcie NaturalSpeech (2022)?

NaturalSpeech został zgłoszony jako pierwszy system, który osiągnął w LJSpeech jakość na poziomie ludzkim, a słuchacze nie byli w stanie wiarygodnie odróżnić go od prawdziwej mowy.

Co tak naprawdę generuje model dyfuzji ukrytej NaturalSpeech 2?

NaturalSpeech 2 rozprasza ukryte kodeki, które są zwarte i łatwiejsze do modelowania niż surowe przebiegi, a następnie dekoduje je na dźwięk.

W jaki sposób model dyfuzji generuje dane na wysokim poziomie?

Dyfuzja dodaje szum podczas treningu i uczy się go odwracać, generując próbki poprzez stopniowe usuwanie szumu z losowego szumu.

Jakie kluczowe możliwości zapewnia ukryta dyfuzja NaturalSpeech 2?

Opierając się na krótkich podpowiedziach głosowych, NaturalSpeech 2 może sklonować głos mówiącego, na którym nigdy nie był specjalnie szkolony.

Jaka jest główna idea „rozproszenia faktoryzowanego” w NaturalSpeech 3?

Rozproszenie na czynniki rozplątuje treść, prozodię, barwę i szczegóły akustyczne, dzięki czemu każdy atrybut można modelować i kontrolować oddzielnie.