PRZEWODNIK AI audio

AudioLM

AudioLM to platforma badawcza Google, która generuje realistyczny dźwięk — mowę lub muzykę fortepianową — traktując dźwięk jak język i przewidując go znacznik po znaku.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

Głębokie nurkowanie

Wprowadzony przez Google w 2022 roku, AudioLM przekształca generowanie dźwięku w problem modelowania języka: konwertuje surowe przebiegi na dyskretne tokeny, a następnie przewiduje następny token, tak jak model tekstowy przewiduje następne słowo. Jego kluczową sztuczką jest hierarchia typów tokenów. Tokeny „semantyczne” (z modelu takiego jak w2v-BERT) przechwytują długoterminową strukturę – fonetykę, składnię, melodię – podczas gdy tokeny „akustyczne” (z kodeka neuronowego SoundStream) przechwytują drobne szczegóły, takie jak tożsamość mówiącego, barwa i warunki nagrywania. Najpierw przewidując tokeny semantyczne, a następnie warunkowując je tokenami akustycznymi, AudioLM tworzy kontynuacje, które pozostają spójne przez wiele sekund, zachowując jednocześnie oryginalny głos lub instrument. Po kilku sekundach mówi dalej tym samym głosem; biorąc pod uwagę fortepian, improwizuje w tym samym stylu.

Wgląd techniczny

AudioLM jest szkolony wyłącznie w oparciu o dźwięk — bez transkrypcji. SoundStream kompresuje dźwięk do tokenów akustycznych poprzez kwantyzację wektora resztkowego, podczas gdy w2v-BERT dostarcza zgrubne tokeny semantyczne. Stos modeli języka Transformer przewiduje tokeny etapami: najpierw semantycznie dla struktury, a następnie zgrubne i dokładne tokeny akustyczne dla rekonstrukcji o wysokiej wierności. Dekoder SoundStream w końcu zamienia przewidywane tokeny z powrotem w kształt fali, tworząc dźwięk, który utrzymuje spójność głosu i prozodii mówiącego.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość AudioLM

Receptura AudioLM oparta na tokenach stała się podstawą późniejszych systemów: pomysły Google AudioLM zostały wprowadzone do MusicLM w celu zamiany tekstu na muzykę i SoundStorm w celu szybszego generowania, podczas gdy szersze pole łączy teraz tokeny semantyczne i akustyczne w mowie, muzyce i efektach dźwiękowych. Oczekuj szybszej generacji w czasie rzeczywistym, dłuższych spójnych wyjść i kontroli multimodalnej, w której tekst lub inne sygnały sterują modelami wyłącznie audio. Te same techniki zwiększają również obawy dotyczące klonowania głosu i deepfake’ów audio.

Implementacja w świecie rzeczywistym

Kontynuowanie krótkiego klipu przemówienia z głosem i intonacją tego samego mówcy bez transkrypcji

Improwizowanie nowej muzyki fortepianowej, która pasuje do stylu krótkiego nagranego monitu

Służy jako szkielet generowania dźwięku dla systemów zamiany tekstu na muzykę, takich jak MusicLM

Badania nad syntezą mowy zachowującą prozodię i nagrywanie akustyki z próbki

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Wyszukiwanie słów kluczowych i słowa budzące

Często zadawane pytania

What is AudioLM?

AudioLM to platforma badawcza Google, która generuje realistyczny dźwięk — mowę lub muzykę fortepianową — traktując dźwięk jak język i przewidując go znacznik po znaku. To ma znaczenie, ponieważ pokazało, że można stworzyć spójne, naturalnie brzmiące kontynuacje audio bez transkrypcji tekstu lub partytury.

Jakiej podstawowej idei używa AudioLM do generowania dźwięku?

AudioLM konwertuje przebiegi na dyskretne tokeny i przewiduje je sekwencyjnie, stosując podejście oparte na modelach językowych następnego tokena do surowego dźwięku.

Jaka jest rola tokenów „semantycznych” w AudioLM?

Tokeny semantyczne (z w2v-BERT) kodują strukturę i spójność wysokiego poziomu, podczas gdy tokeny akustyczne obsługują drobne szczegóły audio.

Który kodek neuronowy generuje tokeny akustyczne AudioLM?

SoundStream wykorzystuje kwantyzację wektora resztkowego do kompresji dźwięku do tokenów akustycznych, a później dekodowania przewidywanych tokenów z powrotem do postaci fali.

Czego AudioLM wymaga jako danych treningowych?

Godną uwagi cechą jest to, że AudioLM trenuje wyłącznie na dźwięku, bez żadnych etykiet tekstowych, ucząc się struktury bezpośrednio z dźwięku.

Dlaczego AudioLM przewiduje tokeny semantyczne przed tokenami akustycznymi?

Generowanie najpierw zgrubnej struktury zapewnia spójność wyników w czasie; żetony akustyczne są następnie kondycjonowane na tej strukturze, aby dodać szczegóły o wysokiej wierności.