NaturalSpeech i dyfuzja utajona TTS
NaturalSpeech to linia badań Microsoft TTS, których celem jest jakość mowy na poziomie ludzkim, przy czym późniejsze wersje wykorzystują utajoną dyfuzję do generowania bogatych, naturalnych głosów.
Przegląd
It shows how diffusion models, famous for images, can produce expressive, controllable audio.
Głębokie nurkowanie
Oryginalny NaturalSpeech (2022) był pierwszym systemem, który według doniesień osiągnął jakość na poziomie ludzkim w teście porównawczym LJSpeech, ocenianą przez słuchaczy, którzy nie byli w stanie wiarygodnie odróżnić tego od prawdziwych nagrań. Wykorzystano w nim wariacyjny autokoder ze starannie dobranymi priorytetami, aby zamknąć lukę między uczeniem a wnioskowaniem. Następnie w NaturalSpeech 2 zastosowano podejście polegające na utajonym dyfuzji: mowa jest kodowana przez neuronowy kodek audio w ciągłe utajone wektory, a model dyfuzji uczy się generować te utajone wektory z tekstu, umożliwiając silne, zerowe klonowanie głosu na podstawie krótkiego komunikatu. W NaturalSpeech 3 wprowadzono dyfuzję faktoryczną, dzielącą mowę na rozwikłane atrybuty, takie jak treść, prozodia, barwa i szczegóły akustyczne, dzięki czemu każdy z nich można modelować i kontrolować niezależnie, co zapewnia wyższą wierność i elastyczność.
Wgląd techniczny
Utajona dyfuzja polega na dodawaniu szumu do zwartej utajonej reprezentacji mowy i szkoleniu sieci, aby krok po kroku odwracała ten szum. Zamiast odszumiać surowe przebiegi lub pełne spektrogramy, NaturalSpeech 2 odszumi ukryte kodeki, które są mniej wymiarowe i łatwiejsze do modelowania. Uwarunkowanie na podstawie tekstu i referencyjnego komunikatu głosowego steruje odwrotną dyfuzją, tak aby ostatecznie pobrane próbki utajone dekodowały na mowę, która odpowiada żądanej treści i tożsamości mówiącego.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość naturalnej mowy i dyfuzji utajonej TTS
Oparte na dyfuzji i faktoryzowane TTS wskazują na głosy, które są nie tylko naturalne, ale także doskonale sterowalne, umożliwiając użytkownikom dostosowanie barwy, emocji i prozodii za pomocą niezależnych pokręteł. Oczekuj szybszego próbkowania poprzez destylację i kilkuetapową dyfuzję, silniejszego klonowania typu zero-shot na podstawie sekund dźwięku i ściślejszej integracji z modelami dużych języków w celu dostarczania uwzględniającego kontekst. Postępy te zwiększają również potrzebę stosowania zabezpieczeń dotyczących znaków wodnych i zgody, ponieważ klonowanie o wysokiej wierności stwarza wyraźne ryzyko nadużyć.
Implementacja w świecie rzeczywistym
Studia dubbingowe klonują głos aktora na podstawie krótkiej próbki w celu lokalizacji filmów za pomocą klonowania typu zero-shot w stylu NaturalSpeech 2.
Platformy audiobooków generują narrację na poziomie ludzkim, którą słuchacze mają trudności z odróżnieniem od prawdziwego talentu głosowego.
Narzędzia ułatwień dostępu odtwarzają głos danej osoby na podstawie starych nagrań w przypadku osób, które utraciły mowę.
Pakiety do tworzenia treści pozwalają redaktorom niezależnie dostosowywać barwę i prozodię, wykorzystując faktoryzowane atrybuty NaturalSpeech 3.
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the NaturalSpeech and Latent Diffusion TTS quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Stabilna dyfuzja utajona dźwięku
Często zadawane pytania
What is NaturalSpeech and Latent Diffusion TTS?
NaturalSpeech to linia badań Microsoft TTS, których celem jest jakość mowy na poziomie ludzkim, przy czym późniejsze wersje wykorzystują utajoną dyfuzję do generowania bogatych, naturalnych głosów. Pokazuje, jak modele dyfuzyjne, znane z obrazów, mogą wytwarzać wyrazisty, kontrolowany dźwięk.
Jaki kamień milowy osiągnięto w oryginalnym projekcie NaturalSpeech (2022)?
NaturalSpeech został zgłoszony jako pierwszy system, który osiągnął w LJSpeech jakość na poziomie ludzkim, a słuchacze nie byli w stanie wiarygodnie odróżnić go od prawdziwej mowy.
Co tak naprawdę generuje model dyfuzji ukrytej NaturalSpeech 2?
NaturalSpeech 2 rozprasza ukryte kodeki, które są zwarte i łatwiejsze do modelowania niż surowe przebiegi, a następnie dekoduje je na dźwięk.
W jaki sposób model dyfuzji generuje dane na wysokim poziomie?
Dyfuzja dodaje szum podczas treningu i uczy się go odwracać, generując próbki poprzez stopniowe usuwanie szumu z losowego szumu.
Jakie kluczowe możliwości zapewnia ukryta dyfuzja NaturalSpeech 2?
Opierając się na krótkich podpowiedziach głosowych, NaturalSpeech 2 może sklonować głos mówiącego, na którym nigdy nie był specjalnie szkolony.
Jaka jest główna idea „rozproszenia faktoryzowanego” w NaturalSpeech 3?
Rozproszenie na czynniki rozplątuje treść, prozodię, barwę i szczegóły akustyczne, dzięki czemu każdy atrybut można modelować i kontrolować oddzielnie.