PRZEWODNIK AI audio

Generowanie mowy dopasowane do przepływu głosowego

Voicebox to model generowania mowy sterowany tekstem firmy Meta, przeszkolony w celu dopasowywania przepływu, aby „wypełniać” zamaskowany dźwięk, umożliwiając jednemu modelowi klonowanie głosu z zerowym strzałem, usuwanie szumów, edycję treści i syntezę wielojęzyczną.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because, like a language model for speech, it generalizes across many tasks it was never explicitly trained for.

Głębokie nurkowanie

Voicebox, ogłoszony przez Meta AI w 2023 roku, jest szkolony w zakresie jednego zadania: biorąc pod uwagę otaczający kontekst audio i odpowiadający mu tekst, przewiduj zamaskowaną część mowy. To sformułowanie „w kontekście” lub wypełniające, zapożyczone koncepcyjnie z dużych modeli językowych, oznacza, że ​​ten sam model obsługuje różne zadania przy wnioskowaniu, wybierając, co ma maskować. Usuń źle wypowiedziane słowo, a Voicebox odtworzy je tym samym głosem; podaj dwie sekundy czyjejś wypowiedzi jako kontekst, a ona zsyntetyzuje nowe zdania naśladując ich barwę i styl; maskuje hałaśliwe segmenty i zapewnia czyste zamienniki. Zgłoszone wyniki wykazały doskonałą, natychmiastową jakość zamiany tekstu na mowę i znacznie szybsze generowanie w porównaniu z porównywalnymi systemami autoregresyjnymi opartymi na dyfuzji, przy jednoczesnej obsłudze kilku języków w ramach jednego modelu.

Wgląd techniczny

Voicebox wykorzystuje warunkowe dopasowywanie przepływu, trenując model w czasie ciągłym, aby nauczyć się płynnego pola prędkości, które przenosi losowy szum do rzeczywistych funkcji mowy, uwarunkowanych tekstem i niemaskowanym dźwiękiem. W porównaniu z dyfuzją, dopasowywanie przepływu można rozwiązać za pomocą zwykłego narzędzia do rozwiązywania równań różniczkowych w stosunkowo kilku krokach, co pozwala obniżyć koszty wnioskowania. Określając każdą funkcję jako „przewidywanie zamaskowanego dźwięku w danym kontekście”, pojedyncza sieć nieautoregresyjna uczy się edycji, klonowania i odszumiania bez konieczności skupiania się na konkretnych zadaniach lub oddzielnych przebiegów szkoleniowych.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość generowania mowy dopasowanej do przepływu głosowego

Generowanie mowy dopasowane do przepływu ma stanowić podstawę uniwersalnych modeli mowy, które edytują, tłumaczą i zmieniają styl dźwięku tak płynnie, jak edytory tekstu obsługują słowa. Oczekuj agentów konwersacyjnych działających w czasie rzeczywistym, wielojęzycznego zachowania głosu w tłumaczeniu i przywracania wysokiej jakości uszkodzonych nagrań. Ponieważ ta sama technologia umożliwia przekonujące klonowanie głosu, Meta początkowo wstrzymał się z wprowadzeniem modelu i forsował badania nad wykrywaniem mowy syntetycznej — a kluczowe znaczenie dla odpowiedzialnego wdrożenia będą miały znaki wodne pochodzenia, ramy wyrażania zgody i narzędzia do wykrywania.

Implementacja w świecie rzeczywistym

Edytowanie podcastu poprzez wpisanie poprawionego słowa i ponowne wypowiedzenie go głosem oryginalnego mówcy

Klonowanie głosu o zerowym zasięgu z zaledwie kilku sekund referencyjnego dźwięku

Usuwanie przejściowego szumu poprzez maskowanie i regenerację czystych segmentów mowy

Syntetyzowanie głosu tego samego mówcy w wielu językach w ramach jednego modelu

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Voicebox Flow-Matching Speech Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Dopasowanie przepływu

Często zadawane pytania

What is Voicebox Flow-Matching Speech Generation?

Voicebox to model generowania mowy sterowany tekstem firmy Meta, przeszkolony w celu dopasowywania przepływu, aby „wypełniać” zamaskowany dźwięk, umożliwiając jednemu modelowi klonowanie głosu z zerowym strzałem, usuwanie szumów, edycję treści i syntezę wielojęzyczną. Ma to znaczenie, ponieważ podobnie jak model językowy mowy, uogólnia wiele zadań, do których nigdy nie był wyraźnie przeszkolony.

Do jakiego pojedynczego zadania szkoleniowego zoptymalizowano Voicebox?

Voicebox jest przeszkolony do wypełniania zamaskowanych fragmentów mowy otaczającym dźwiękiem i tekstem, co jest sformułowaniem kontekstowym inspirowanym modelami językowymi.

Jakiej techniki generatywnej używa Voicebox zamiast dyfuzji?

Voicebox wykorzystuje warunkowe dopasowywanie przepływu, ucząc się pola prędkości, które przenosi szum na mowę i które można skutecznie rozwiązać za pomocą solwera ODE.

W jaki sposób Voicebox wykonuje klonowanie głosu typu zero-shot?

Biorąc pod uwagę krótki klip referencyjny jako zdemaskowany kontekst, Voicebox syntetyzuje nowe zdania pasujące do barwy i stylu mówiącego, bez konieczności ponownego szkolenia.

Dlaczego Meta początkowo wstrzymał się z pełnym modelem Voiceboxa?

Ponieważ model może w przekonujący sposób klonować głosy, projekt Meta wstrzymał się z tym i położył nacisk na badania nad wykrywaniem mowy syntetycznej.

Jak jeden model radzi sobie z edycją, klonowaniem i odszumianiem w Voiceboxie?

Wszystkie możliwości sprowadzają się do tego samego celu; zmiana tego, co jest maskowane podczas wnioskowania, powoduje edycję, klonowanie lub usuwanie szumu z jednego modelu.