PRZEWODNIK AI audio

Synteza tekstu na audio w AudioGen

AudioGen to model Meta, który zamienia opisy tekstowe w realistyczne dźwięki otoczenia i efekty dźwiękowe, takie jak „szczekanie psa podczas ćwierkania ptaków”. Ma to znaczenie, ponieważ pozwala twórcom generować dźwięk inny niż mowa ze zwykłego języka, a jest to funkcja, której od dawna brakuje generatywnej sztucznej inteligencji.

2 minuty czytaniaOstatnia aktualizacja

Głębokie nurkowanie

AudioGen, wydany przez Meta AI w 2022 r., to model języka autoregresyjnego, który generuje ogólny dźwięk (efekty dźwiękowe, sceny otoczenia, dźwięki zwierząt i obiektów) bezpośrednio z podpowiedzi tekstowych. W przeciwieństwie do systemów zamiany tekstu na mowę, jest ukierunkowany na bałagan w świecie codziennych dźwięków. Najpierw kompresuje surowy dźwięk do sekwencji dyskretnych tokenów przy użyciu kodeka neuronowego (autoenkoder w stylu EnCodec z kwantyzacją wektora resztkowego). Model języka Transformera uczy się następnie przewidywać te tokeny audio na podstawie opisu tekstowego zakodowanego przez oddzielny koder tekstu. Aby poprawić zrozumienie kompozycji, autorzy zmiksowali i połączyli próbki audio podczas szkolenia, aby model mógł nauczyć się kombinacji, takich jak nakładające się dźwięki. AudioGen stał się później częścią biblioteki AudioCraft Meta wraz z modelem muzycznym MusicGen.

Wgląd techniczny

AudioGen ma dwa etapy. Po pierwsze, autoenkoder audio uczy się mapować przebiegi na zwarty strumień dyskretnych tokenów i odwrotnie. Po drugie, Transformer jest szkolony w celu modelowania języka, aby przewidzieć następny token audio na podstawie poprzedzających tokenów i warunkowania tekstu. Naprowadzanie bez klasyfikatorów i wielostrumieniowe modelowanie książki kodowej poprawiają wierność i wyrównanie tekstu. Generowanie dźwięku oznacza autoregresywne próbkowanie tokenów, a następnie dekodowanie ich z powrotem do postaci fali za pomocą kodeka.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość syntezy tekstu na audio firmy AudioGen

Przetwarzanie tekstu na dźwięk zmierza w kierunku wyższych częstotliwości próbkowania, dłuższych spójnych scen i ściślejszej kontroli nad synchronizacją i rozmieszczeniem przestrzennym dźwięków. Spodziewaj się integracji z narzędziami wideo, które automatycznie dodają dopasowane efekty dźwiękowe, narzędziami ułatwień dostępu, które opisują sceny w formie dźwiękowej, oraz silnikami gier, które na żądanie syntetyzują dźwięk otoczenia. Łączenie modeli tokenów w stylu AudioGen z metodami rozpowszechniania i silniejszymi koderami tekstu powinno poprawić realizm, a narzędzia do znakowania wodnego i pochodzenia pomogą odróżnić dźwięk syntetyczny od nagranego.

Implementacja w świecie rzeczywistym

Generowanie efektów Foley i dźwiękowych do filmów i gier z podpowiedzi tekstowych

Tworzenie otoczenia dźwiękowego (deszcz, ruch uliczny, lasy) dla aplikacji i narzędzi do medytacji

Prototypowanie dźwięku do projektów wideo bez licencjonowania bibliotek stockowych

Tworzenie niestandardowych dźwięków alertów i powiadomień opisanych prostym językiem

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioGen Text-to-Audio Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Różnicowa synteza audio DDSP

Często zadawane pytania

What is AudioGen Text-to-Audio Synthesis?

AudioGen to model Meta, który zamienia opisy tekstowe w realistyczne dźwięki otoczenia i efekty dźwiękowe, takie jak „szczekanie psa podczas ćwierkania ptaków”. Ma to znaczenie, ponieważ pozwala twórcom generować dźwięk inny niż mowa ze zwykłego języka, a jest to funkcja, której od dawna brakuje generatywnej sztucznej inteligencji.

Co przede wszystkim generuje AudioGen?

AudioGen specjalizuje się w dźwięku innym niż mowa, ogólnym, takim jak dźwięki otoczenia i efekty generowane na podstawie komunikatów tekstowych.

Jaki jest pierwszy etap prac AudioGen?

Autokoder kodeka neuronowego kompresuje surowy dźwięk w dyskretne tokeny, które następnie można przewidzieć za pomocą modelu języka.

Jaki typ modelu przewiduje tokeny audio?

AudioGen korzysta z autoregresyjnego Transformatora, który przewiduje tokeny audio jeden po drugim, warunkowane tekstem.

Dlaczego autorzy miksowali i łączyli dźwięk podczas szkolenia?

Wzbogacanie zmiksowanymi i połączonymi klipami poprawiło zdolność AudioGen do komponowania wielu dźwięków opisanych razem w podpowiedzi.

Która większa biblioteka Meta zawiera AudioGen?

AudioGen jest częścią biblioteki AudioCraft Meta, która zawiera również model MusicGen.