Аудио AI РЪКОВОДСТВО

Невронен кодек SoundStream

SoundStream е невронният аудио кодек от край до край на Google, който компресира реч и музика до изключително ниски битрейтове, като същевременно запазва качеството.

2 min readПоследна актуализация

Преглед

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

Дълбоко гмуркане

Представен от Google през 2021 г., SoundStream е напълно невронен кодек, изграден от три части, обучени заедно: конволюционен енкодер, който превръща необработената вълнова форма в компактна последователност от вектори, остатъчен векторен квантизатор (RVQ), който дискретизира тези вектори, и конволюционен декодер, който реконструира вълновата форма. Той е обучен както със загуби при реконструкция, така и със състезателен дискриминатор в стил GAN, така че изходът звучи естествено, а не просто числено близо. Отличителна характеристика е „мащабируемото“ или обучението за отпадане на квантователя: единичен модел може да работи с побитови скорости от приблизително 3 до 18 kbps просто чрез използване на повече или по-малко слоеве на квантизатор при извод, без повторно обучение. Съобщава се, че при 3 kbps превъзхожда Opus при 12 kbps при тестове за слушане, обработка на реч, музика и общо аудио в един модел, който може да работи в реално време на процесор на смартфон.

Техническа информация

Формата на вълната преминава през стъпаловидни извивки, които намаляват семплирането силно, създавайки едно вграждане на кадър (напр. 75 кадъра/секунда). След това RVQ кодира всяко вграждане като стек от индекси на кодова книга. Скоростта на предаване е равна на скоростта на кадрите, умножена по броя на активните квантизери, умножени по битовете на кодова книга. Отпадането на квантователя произволно съкращава RVQ стека по време на обучение, принуждавайки по-ранните кодови книги да носят най-важната информация, така че кодекът да се влошава елегантно при по-ниски скорости.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на невронния кодек SoundStream

SoundStream създаде шаблона, който по-късно кодеци като EnCodec и DAC усъвършенстваха, и неговите дискретни токени станаха субстрат за генеративни системи като AudioLM и MusicLM. Очаквайте наследници, които се стремят към още по-ниски битрейтове, семантично структурирани токени, които се удвояват като входове за аудио генератори в стил езиков модел, и по-стриктно внедряване на устройството за разговори на живо, слухови апарати и стрийминг, където честотната лента и латентността са строго ограничени.

Внедряване в реалния свят

Компресиране на гласови повиквания до ~3 kbps, като същевременно звучат по-ясно от старите кодеци при по-високи битрейтове

Генериране на отделни аудио токени, които захранват генериращите модели AudioLM и MusicLM на Google

Аудио стрийминг с ниска честотна лента в реално време на мобилни устройства с кодиране и декодиране на процесора

Ефективно съхраняване или предаване на музика и околен звук в един модел, който обработва всички видове съдържание

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Невронни аудио кодеци

Frequently asked questions

What is SoundStream Neural Codec?

SoundStream е невронният аудио кодек от край до край на Google, който компресира реч и музика до изключително ниски битрейтове, като същевременно запазва качеството. Има значение, защото побеждава традиционните кодеци като Opus със същия битрейт и захранва съвременните генеративни аудио модели.

Кои три компонента изграждат архитектурата на SoundStream?

SoundStream е изграден от конволюционен енкодер, остатъчен векторен квантизатор, който дискретизира вгражданията, и конволюционен декодер, всички обучени от край до край.

Каква техника позволява на един модел SoundStream да обслужва много различни битрейтове без повторно обучение?

По време на обучението SoundStream произволно изпуска слоевете на квантователя, така че при извод можете да използвате повече или по-малко нива на RVQ, за да постигнете различни битрейтове от един модел.

В тестовете за слушане на Google се съобщава, че SoundStream при 3 kbps превъзхожда кой кодек при 12 kbps?

SoundStream при скорост от само 3 kbps съвпадна или победи широко използвания кодек Opus, работещ при 12 kbps при субективни оценки на качеството.

Какъв вид допълнителен сигнал за обучение използва SoundStream, за да направи изходния звук естествен?

Отвъд загубите при реконструкция, SoundStream използва противопоставящи се (GAN) дискриминатори, така че реконструкциите звучат перцептуално реалистично, а не просто числено близки.

Как битрейтът на SoundStream е свързан с неговите квантизатори?

Скоростта на предаване се мащабира с броя на активните RVQ слоеве (умножена скоростта на кадрите, умножена по битовете на кодова книга), така че добавянето на квантизатори повишава скоростта на предаване и качеството.