PRZEWODNIK AI audio

Kodek neuronowy SoundStream

SoundStream to kompleksowy neuronowy kodek audio firmy Google, który kompresuje mowę i muzykę do wyjątkowo niskiej przepływności, zachowując jednocześnie jakość.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

Głębokie nurkowanie

Wprowadzony przez Google w 2021 r. SoundStream to w pełni neuronowy kodek zbudowany z trzech wyszkolonych razem elementów: kodera splotowego, który przekształca surowy przebieg w zwartą sekwencję wektorów, kwantyzatora wektorów resztkowych (RVQ), który dyskretyzuje te wektory, oraz dekodera splotowego, który rekonstruuje kształt fali. Jest szkolony zarówno ze stratami rekonstrukcji, jak i dyskryminatorem kontradyktoryjnym w stylu GAN, więc sygnał wyjściowy brzmi naturalnie, a nie tylko blisko liczbowo. Wyróżniającą się cechą jest „skalowalność” lub uczenie z porzucaniem kwantyzatora: pojedynczy model może działać przy przepływnościach od około 3 do 18 kb/s, po prostu używając większej lub mniejszej liczby warstw kwantyzatora przy wnioskowaniu, bez ponownego uczenia. Przy 3 kb/s podobno przewyższa Opus przy 12 kb/s w testach odsłuchowych, obsłudze mowy, muzyki i ogólnego dźwięku w jednym modelu, który może działać w czasie rzeczywistym na procesorze smartfona.

Wgląd techniczny

Kształt fali przechodzi przez sploty krokowe, które znacznie zmniejszają próbkowanie, tworząc jedno osadzenie na klatkę (np. 75 klatek na sekundę). Następnie RVQ koduje każde osadzenie jako stos indeksów książki kodowej. Szybkość transmisji jest równa szybkości klatek razy liczba aktywnych kwantyzatorów razy bity na książkę kodową. Rezygnacja z kwantyzatora losowo obcina stos RVQ podczas uczenia, zmuszając wcześniejsze książki kodowe do przenoszenia najważniejszych informacji, dzięki czemu kodek ulega płynnej degradacji przy niższych szybkościach.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość kodeka neuronowego SoundStream

SoundStream ustanowił szablon, który później udoskonalono w kodekach, takich jak EnCodec i DAC, a jego dyskretne tokeny stały się podłożem dla systemów generatywnych, takich jak AudioLM i MusicLM. Spodziewaj się, że potomkowie będą dążyć do jeszcze niższych przepływności, tokenów o strukturze semantycznej, które pełnią także funkcję danych wejściowych do generatorów dźwięku w stylu modelu językowego, oraz ściślejszego wdrażania na urządzeniu w przypadku połączeń na żywo, aparatów słuchowych i przesyłania strumieniowego, gdzie przepustowość i opóźnienia są ściśle ograniczone.

Implementacja w świecie rzeczywistym

Kompresja połączeń głosowych do ~3 kb/s przy jednoczesnym brzmieniu wyraźniejszym niż w przypadku starszych kodeków przy wyższych przepływnościach

Generowanie dyskretnych tokenów audio, które zasilają modele generatywne AudioLM i MusicLM Google

Przesyłanie strumieniowe dźwięku o niskiej przepustowości w czasie rzeczywistym na urządzenia mobilne z kodowaniem i dekodowaniem na procesorze

Efektywne przechowywanie lub przesyłanie muzyki i dźwięków otoczenia w jednym modelu, który obsługuje wszystkie typy treści

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Neuronowe kodeki audio

Często zadawane pytania

What is SoundStream Neural Codec?

SoundStream to kompleksowy neuronowy kodek audio firmy Google, który kompresuje mowę i muzykę do wyjątkowo niskiej przepływności, zachowując jednocześnie jakość. Ma to znaczenie, ponieważ pokonuje tradycyjne kodeki, takie jak Opus, przy tej samej przepływności i obsługuje nowoczesne generatywne modele audio.

Które trzy komponenty składają się na architekturę SoundStream?

SoundStream składa się z kodera splotowego, kwantyzatora wektorów resztkowych, który dyskretyzuje osadzania, oraz dekodera splotowego, a wszystko to jest przeszkolone od początku do końca.

Jaka technika pozwala pojedynczemu modelowi SoundStream obsługiwać wiele różnych przepływności bez konieczności ponownego uczenia?

Podczas uczenia SoundStream losowo upuszcza warstwy kwantyzatora, dzięki czemu podczas wnioskowania można użyć większej lub mniejszej liczby poziomów RVQ, aby uzyskać różne szybkości transmisji bitów z jednego modelu.

W testach odsłuchowych Google stwierdzono, że SoundStream przy 3 kb/s jest lepszy od jakiego kodeka przy 12 kb/s?

W subiektywnych ocenach jakości SoundStream przy zaledwie 3 kb/s dorównywał lub przewyższał powszechnie używany kodek Opus działający z szybkością 12 kb/s.

Jakiego rodzaju dodatkowego sygnału treningowego używa SoundStream, aby dźwięk wyjściowy był naturalny?

Oprócz strat związanych z rekonstrukcją, SoundStream wykorzystuje dyskryminatory kontradyktoryjne (GAN), dzięki czemu rekonstrukcje brzmią percepcyjnie realistycznie, a nie tylko blisko liczbowo.

Jak szybkość transmisji SoundStream ma się do jego kwantyzatorów?

Szybkość transmisji skaluje się wraz z liczbą aktywnych warstw RVQ (razy liczba klatek na sekundę razy liczba bitów na książkę kodów), więc dodanie kwantyzatorów podnosi szybkość transmisji i jakość.