Synteza tekstu na audio w AudioGen
AudioGen to model Meta, który zamienia opisy tekstowe w realistyczne dźwięki otoczenia i efekty dźwiękowe, takie jak „szczekanie psa podczas ćwierkania ptaków”. Ma to znaczenie, ponieważ pozwala twórcom generować dźwięk inny niż mowa ze zwykłego języka, a jest to funkcja, której od dawna brakuje generatywnej sztucznej inteligencji.
Głębokie nurkowanie
AudioGen, wydany przez Meta AI w 2022 r., to model języka autoregresyjnego, który generuje ogólny dźwięk (efekty dźwiękowe, sceny otoczenia, dźwięki zwierząt i obiektów) bezpośrednio z podpowiedzi tekstowych. W przeciwieństwie do systemów zamiany tekstu na mowę, jest ukierunkowany na bałagan w świecie codziennych dźwięków. Najpierw kompresuje surowy dźwięk do sekwencji dyskretnych tokenów przy użyciu kodeka neuronowego (autoenkoder w stylu EnCodec z kwantyzacją wektora resztkowego). Model języka Transformera uczy się następnie przewidywać te tokeny audio na podstawie opisu tekstowego zakodowanego przez oddzielny koder tekstu. Aby poprawić zrozumienie kompozycji, autorzy zmiksowali i połączyli próbki audio podczas szkolenia, aby model mógł nauczyć się kombinacji, takich jak nakładające się dźwięki. AudioGen stał się później częścią biblioteki AudioCraft Meta wraz z modelem muzycznym MusicGen.
Wgląd techniczny
AudioGen ma dwa etapy. Po pierwsze, autoenkoder audio uczy się mapować przebiegi na zwarty strumień dyskretnych tokenów i odwrotnie. Po drugie, Transformer jest szkolony w celu modelowania języka, aby przewidzieć następny token audio na podstawie poprzedzających tokenów i warunkowania tekstu. Naprowadzanie bez klasyfikatorów i wielostrumieniowe modelowanie książki kodowej poprawiają wierność i wyrównanie tekstu. Generowanie dźwięku oznacza autoregresywne próbkowanie tokenów, a następnie dekodowanie ich z powrotem do postaci fali za pomocą kodeka.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość syntezy tekstu na audio firmy AudioGen
Przetwarzanie tekstu na dźwięk zmierza w kierunku wyższych częstotliwości próbkowania, dłuższych spójnych scen i ściślejszej kontroli nad synchronizacją i rozmieszczeniem przestrzennym dźwięków. Spodziewaj się integracji z narzędziami wideo, które automatycznie dodają dopasowane efekty dźwiękowe, narzędziami ułatwień dostępu, które opisują sceny w formie dźwiękowej, oraz silnikami gier, które na żądanie syntetyzują dźwięk otoczenia. Łączenie modeli tokenów w stylu AudioGen z metodami rozpowszechniania i silniejszymi koderami tekstu powinno poprawić realizm, a narzędzia do znakowania wodnego i pochodzenia pomogą odróżnić dźwięk syntetyczny od nagranego.
Implementacja w świecie rzeczywistym
Generowanie efektów Foley i dźwiękowych do filmów i gier z podpowiedzi tekstowych
Tworzenie otoczenia dźwiękowego (deszcz, ruch uliczny, lasy) dla aplikacji i narzędzi do medytacji
Prototypowanie dźwięku do projektów wideo bez licencjonowania bibliotek stockowych
Tworzenie niestandardowych dźwięków alertów i powiadomień opisanych prostym językiem
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioGen Text-to-Audio Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Różnicowa synteza audio DDSP
Często zadawane pytania
What is AudioGen Text-to-Audio Synthesis?
AudioGen to model Meta, który zamienia opisy tekstowe w realistyczne dźwięki otoczenia i efekty dźwiękowe, takie jak „szczekanie psa podczas ćwierkania ptaków”. Ma to znaczenie, ponieważ pozwala twórcom generować dźwięk inny niż mowa ze zwykłego języka, a jest to funkcja, której od dawna brakuje generatywnej sztucznej inteligencji.
Co przede wszystkim generuje AudioGen?
AudioGen specjalizuje się w dźwięku innym niż mowa, ogólnym, takim jak dźwięki otoczenia i efekty generowane na podstawie komunikatów tekstowych.
Jaki jest pierwszy etap prac AudioGen?
Autokoder kodeka neuronowego kompresuje surowy dźwięk w dyskretne tokeny, które następnie można przewidzieć za pomocą modelu języka.
Jaki typ modelu przewiduje tokeny audio?
AudioGen korzysta z autoregresyjnego Transformatora, który przewiduje tokeny audio jeden po drugim, warunkowane tekstem.
Dlaczego autorzy miksowali i łączyli dźwięk podczas szkolenia?
Wzbogacanie zmiksowanymi i połączonymi klipami poprawiło zdolność AudioGen do komponowania wielu dźwięków opisanych razem w podpowiedzi.
Która większa biblioteka Meta zawiera AudioGen?
AudioGen jest częścią biblioteki AudioCraft Meta, która zawiera również model MusicGen.