PRZEWODNIK AI audio

Styl Dyfuzja stylu TTS 2

StyleTTS 2 to model zamiany tekstu na mowę, który traktuje „styl” głosu – prozodię, emocje i barwę głośnika – jako zmienną losową próbkowaną za pomocą modelu dyfuzji, a następnie syntetyzuje dźwięk za pomocą treningu kontradyktoryjnego z dużym modelem języka mowy.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it reached human-level naturalness on single-speaker benchmarks without needing a reference clip at inference time.

Głębokie nurkowanie

StyleTTS 2, wydany w 2023 r. przez naukowców z Uniwersytetu Columbia, generuje mowę, najpierw próbkując ukryty „wektor stylu” przy użyciu procesu dyfuzji uwarunkowanego wyłącznie tekstem wejściowym, a następnie dekodując ten styl wraz z fonemami w kształt fali. Wektor stylu kontroluje wszystko, co nie jest zapisane w tekście: tempo mówienia, kontur intonacji, pauzy i koloryt emocjonalny. Co najważniejsze, dodaje trening kontradyktoryjny z dużymi, wstępnie wytrenowanymi modelami języka mowy (WavLM) jako dyskryminatorami, przesuwając sygnał wyjściowy w stronę dźwięku o prawdziwie ludzkim brzmieniu. W teście porównawczym LJSpeech przekroczył on nagrania ludzkie pod względem ocen słuchaczy, a w zestawie LibriTTS z wieloma głośnikami osiągnął poziom podstawowy — kamień milowy w zakresie kompleksowej jakości neuronowego TTS.

Wgląd techniczny

Kluczową sztuczką jest dyfuzja stylu: zamiast przewidywać jedną ustaloną prozodię, StyleTTS 2 modeluje styl jako rozkład prawdopodobieństwa i pobiera z niego próbki za pomocą modelu dyfuzji działającego w niskowymiarowej przestrzeni ukrytej, dzięki czemu to samo zdanie można wypowiedzieć na wiele naturalnych sposobów. Kompleksowo, predyktor czasu trwania, koder stylu, dekoder i dyskryminator kontradyktoryjny oparty na WavLM są trenowane wspólnie, umożliwiając przepływ gradientów od jakości kształtu fali z powrotem przez cały potok.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość dyfuzji stylu StyleTTS 2

Spodziewaj się, że dyfuzja stylu połączy się z klonowaniem głosu o zerowym zasięgu, tak aby kilka sekund referencyjnego dźwięku sterowało próbkowanym stylem, a sterowane uchwyty pozwalają twórcom wyraźnie wybierać emocje, nacisk lub tempo. Lżejsze wersje destylowane mają na celu ograniczenie wieloetapowego próbkowania dyfuzyjnego w celu wykorzystania na urządzeniach w czasie rzeczywistym. Gdy modele te osiągną jakość transmisji, znak wodny i weryfikacja zgody staną się standardem, aby rozwiązać problemy związane z fałszowaniem głosu i nadużyciami typu deepfake.

Implementacja w świecie rzeczywistym

Generowanie narracji w formie audiobooka, w której ten sam mówca w naturalny sposób zmienia prozodię w poszczególnych rozdziałach, zamiast brzmieć monotonnie

Tworzenie wyrazistych głosów postaci do gier niezależnych i animacji bez zatrudniania wielu aktorów głosowych

Zasilanie czytników ekranu ułatwień dostępu, które brzmią na tyle ludzko, że można ich słuchać przez dłuższy czas

Tworzenie zlokalizowanych lektorów e-learningowych z naturalnym naciskiem i tempem na podstawie zwykłego tekstu

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the StyleTTS 2 Style Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Spektrogram dyfuzyjny Dyfuzja

Często zadawane pytania

What is StyleTTS 2 Style Diffusion?

StyleTTS 2 to model zamiany tekstu na mowę, który traktuje „styl” głosu – prozodię, emocje i barwę głośnika – jako zmienną losową próbkowaną za pomocą modelu dyfuzji, a następnie syntetyzuje dźwięk za pomocą treningu kontradyktoryjnego z dużym modelem języka mowy. Ma to znaczenie, ponieważ w testach porównawczych z jednym głośnikiem osiągnął naturalność na poziomie ludzkim, bez potrzeby stosowania klipu referencyjnego w momencie wnioskowania.

Co modeluje StyleTTS 2 przy użyciu procesu dyfuzji?

StyleTTS 2 próbkuje niskowymiarowy wektor stylu z modelem dyfuzji, przechwytując prozodię, emocje i charakterystykę mówcy nieokreśloną w tekście.

Który wstępnie wytrenowany model mowy jest używany jako dyskryminator kontradyktoryjny w StyleTTS 2?

StyleTTS 2 wykorzystuje duże modele języka mowy, takie jak WavLM, jako dyskryminatory w treningu kontradyktoryjnym, aby skierować sygnały wyjściowe w stronę dźwięku brzmiącego jak człowiek.

Dlaczego StyleTTS 2 może powiedzieć to samo zdanie na wiele naturalnych sposobów?

Ponieważ styl jest traktowany jako zmienna losowa i próbkowany w drodze dyfuzji, każde pokolenie może stworzyć inną, ale naturalną prozodię dla identycznego tekstu.

W którym teście porównawczym dotyczącym jednego głośnika StyleTTS 2 podobno przewyższył nagrania wykonane przez ludzi pod względem ocen słuchaczy?

W teście LJSpeech urządzenie StyleTTS 2 uzyskało oceny naturalności słuchacza przewyższające nagrania oparte na faktach od ludzi.

Co daje kompleksowe szkolenie StyleTTS 2?

Wspólne, kompleksowe szkolenie pozwala, aby utrata końcowej jakości dźwięku aktualizowała razem predyktor czasu trwania, koder stylu i dekoder, a nie w izolowanych etapach.