Kodek neuronowy SoundStream
SoundStream to kompleksowy neuronowy kodek audio firmy Google, który kompresuje mowę i muzykę do wyjątkowo niskiej przepływności, zachowując jednocześnie jakość.
Przegląd
It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.
Głębokie nurkowanie
Wprowadzony przez Google w 2021 r. SoundStream to w pełni neuronowy kodek zbudowany z trzech wyszkolonych razem elementów: kodera splotowego, który przekształca surowy przebieg w zwartą sekwencję wektorów, kwantyzatora wektorów resztkowych (RVQ), który dyskretyzuje te wektory, oraz dekodera splotowego, który rekonstruuje kształt fali. Jest szkolony zarówno ze stratami rekonstrukcji, jak i dyskryminatorem kontradyktoryjnym w stylu GAN, więc sygnał wyjściowy brzmi naturalnie, a nie tylko blisko liczbowo. Wyróżniającą się cechą jest „skalowalność” lub uczenie z porzucaniem kwantyzatora: pojedynczy model może działać przy przepływnościach od około 3 do 18 kb/s, po prostu używając większej lub mniejszej liczby warstw kwantyzatora przy wnioskowaniu, bez ponownego uczenia. Przy 3 kb/s podobno przewyższa Opus przy 12 kb/s w testach odsłuchowych, obsłudze mowy, muzyki i ogólnego dźwięku w jednym modelu, który może działać w czasie rzeczywistym na procesorze smartfona.
Wgląd techniczny
Kształt fali przechodzi przez sploty krokowe, które znacznie zmniejszają próbkowanie, tworząc jedno osadzenie na klatkę (np. 75 klatek na sekundę). Następnie RVQ koduje każde osadzenie jako stos indeksów książki kodowej. Szybkość transmisji jest równa szybkości klatek razy liczba aktywnych kwantyzatorów razy bity na książkę kodową. Rezygnacja z kwantyzatora losowo obcina stos RVQ podczas uczenia, zmuszając wcześniejsze książki kodowe do przenoszenia najważniejszych informacji, dzięki czemu kodek ulega płynnej degradacji przy niższych szybkościach.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość kodeka neuronowego SoundStream
SoundStream ustanowił szablon, który później udoskonalono w kodekach, takich jak EnCodec i DAC, a jego dyskretne tokeny stały się podłożem dla systemów generatywnych, takich jak AudioLM i MusicLM. Spodziewaj się, że potomkowie będą dążyć do jeszcze niższych przepływności, tokenów o strukturze semantycznej, które pełnią także funkcję danych wejściowych do generatorów dźwięku w stylu modelu językowego, oraz ściślejszego wdrażania na urządzeniu w przypadku połączeń na żywo, aparatów słuchowych i przesyłania strumieniowego, gdzie przepustowość i opóźnienia są ściśle ograniczone.
Implementacja w świecie rzeczywistym
Kompresja połączeń głosowych do ~3 kb/s przy jednoczesnym brzmieniu wyraźniejszym niż w przypadku starszych kodeków przy wyższych przepływnościach
Generowanie dyskretnych tokenów audio, które zasilają modele generatywne AudioLM i MusicLM Google
Przesyłanie strumieniowe dźwięku o niskiej przepustowości w czasie rzeczywistym na urządzenia mobilne z kodowaniem i dekodowaniem na procesorze
Efektywne przechowywanie lub przesyłanie muzyki i dźwięków otoczenia w jednym modelu, który obsługuje wszystkie typy treści
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SoundStream Neural Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Neuronowe kodeki audio
Często zadawane pytania
What is SoundStream Neural Codec?
SoundStream to kompleksowy neuronowy kodek audio firmy Google, który kompresuje mowę i muzykę do wyjątkowo niskiej przepływności, zachowując jednocześnie jakość. Ma to znaczenie, ponieważ pokonuje tradycyjne kodeki, takie jak Opus, przy tej samej przepływności i obsługuje nowoczesne generatywne modele audio.
Które trzy komponenty składają się na architekturę SoundStream?
SoundStream składa się z kodera splotowego, kwantyzatora wektorów resztkowych, który dyskretyzuje osadzania, oraz dekodera splotowego, a wszystko to jest przeszkolone od początku do końca.
Jaka technika pozwala pojedynczemu modelowi SoundStream obsługiwać wiele różnych przepływności bez konieczności ponownego uczenia?
Podczas uczenia SoundStream losowo upuszcza warstwy kwantyzatora, dzięki czemu podczas wnioskowania można użyć większej lub mniejszej liczby poziomów RVQ, aby uzyskać różne szybkości transmisji bitów z jednego modelu.
W testach odsłuchowych Google stwierdzono, że SoundStream przy 3 kb/s jest lepszy od jakiego kodeka przy 12 kb/s?
W subiektywnych ocenach jakości SoundStream przy zaledwie 3 kb/s dorównywał lub przewyższał powszechnie używany kodek Opus działający z szybkością 12 kb/s.
Jakiego rodzaju dodatkowego sygnału treningowego używa SoundStream, aby dźwięk wyjściowy był naturalny?
Oprócz strat związanych z rekonstrukcją, SoundStream wykorzystuje dyskryminatory kontradyktoryjne (GAN), dzięki czemu rekonstrukcje brzmią percepcyjnie realistycznie, a nie tylko blisko liczbowo.
Jak szybkość transmisji SoundStream ma się do jego kwantyzatorów?
Szybkość transmisji skaluje się wraz z liczbą aktywnych warstw RVQ (razy liczba klatek na sekundę razy liczba bitów na książkę kodów), więc dodanie kwantyzatorów podnosi szybkość transmisji i jakość.