GUIA de IA de áudio

Codec neural SoundStream

SoundStream é o codec de áudio neural ponta a ponta do Google que compacta fala e música em taxas de bits extremamente baixas, preservando a qualidade.

2 minutos de leituraÚltima atualização

Visão geral

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

Mergulho profundo

Introduzido por Google em 2021, SoundStream é um codec totalmente neural construído a partir de três peças treinadas juntas: um codificador convolucional que transforma a forma de onda bruta em uma sequência compacta de vetores, um quantizador de vetor residual (RVQ) que discretiza esses vetores e um decodificador convolucional que reconstrói a forma de onda. Ele é treinado com perdas de reconstrução e um discriminador adversário estilo GAN, de modo que a saída parece natural, em vez de apenas numericamente próxima. Um recurso de destaque é o treinamento 'escalável' ou de abandono de quantizador: um único modelo pode operar em taxas de bits de aproximadamente 3 a 18 kbps simplesmente usando mais ou menos camadas de quantizador na inferência, sem nenhum retreinamento. A 3 kbps, ele supostamente supera o Opus a 12 kbps em testes de audição, manipulação de fala, música e áudio geral em um modelo que pode ser executado em tempo real na CPU de um smartphone.

Visão Técnica

A forma de onda passa por convoluções que reduzem fortemente a resolução, produzindo uma incorporação por quadro (por exemplo, 75 quadros/segundo). O RVQ então codifica cada incorporação como uma pilha de índices do livro de códigos. A taxa de bits é igual à taxa de quadros vezes o número de quantizadores ativos vezes os bits por livro de código. O abandono do quantizador trunca aleatoriamente a pilha RVQ durante o treinamento, forçando os livros de código anteriores a transportar as informações mais importantes para que o codec se degrade normalmente em taxas mais baixas.

Impacto Estratégico

Acesso e alcance

Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.

Custo e orçamento

As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.

Velocidade e escala

Os sistemas voltados para o cliente podem processar interações faladas em maior escala.

O futuro do codec neural SoundStream

SoundStream estabeleceu o modelo que codecs posteriores como EnCodec e DAC refinaram, e seus tokens discretos se tornaram o substrato para sistemas generativos como AudioLM e MusicLM. Espere que os descendentes busquem taxas de bits ainda mais baixas, tokens semanticamente estruturados que funcionam como entradas para geradores de áudio no estilo de modelo de linguagem e implantação mais rígida no dispositivo para chamadas ao vivo, aparelhos auditivos e streaming onde a largura de banda e a latência são fortemente restritas.

Implementação no mundo real

Compactação de chamadas de voz para aproximadamente 3 kbps e som mais nítido do que codecs legados em taxas de bits mais altas

Gerando tokens de áudio discretos que alimentam os modelos generativos AudioLM e MusicLM de Google

Streaming de áudio de baixa largura de banda em tempo real em dispositivos móveis com codificação e decodificação na CPU

Armazenar ou transmitir música e som ambiente de forma eficiente em um único modelo que lida com todos os tipos de conteúdo

Riscos e guarda-corpos

Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.

A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.

O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.

Roteiro de implementação

1

Obtenha consentimento explícito para captura, clonagem e reutilização de voz.

2

Teste a qualidade em diversos alto-falantes e condições de fundo.

3

Defina quando um ser humano deve revisar ou aprovar os resultados.

4

Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is SoundStream Neural Codec?

SoundStream é o codec de áudio neural ponta a ponta do Google que compacta fala e música em taxas de bits extremamente baixas, preservando a qualidade. É importante porque supera codecs tradicionais como Opus na mesma taxa de bits e potencializa modelos de áudio generativos modernos.

Quais são os três componentes que compõem a arquitetura SoundStream?

SoundStream é construído a partir de um codificador convolucional, um quantizador vetorial residual que discretiza os embeddings e um decodificador convolucional, todos treinados de ponta a ponta.

Que técnica permite que um único modelo SoundStream atenda a muitas taxas de bits diferentes sem retreinamento?

Durante o treinamento, o SoundStream elimina aleatoriamente as camadas do quantizador para que, na inferência, você possa usar mais ou menos níveis de RVQ para atingir diferentes taxas de bits de um modelo.

Nos testes de escuta de Google, foi relatado que SoundStream a 3 kbps supera qual codec a 12 kbps?

SoundStream com apenas 3 kbps igualou ou superou o amplamente utilizado codec Opus rodando a 12 kbps em avaliações subjetivas de qualidade.

Que tipo de sinal de treinamento adicional o SoundStream usa para tornar o som de saída natural?

Além das perdas de reconstrução, o SoundStream usa discriminadores adversários (GAN) para que as reconstruções pareçam perceptualmente realistas, em vez de meramente numericamente próximas.

Como a taxa de bits do SoundStream se relaciona com seus quantizadores?

A taxa de bits é dimensionada com o número de camadas RVQ ativas (vezes a taxa de quadros vezes bits por livro de código), portanto, adicionar quantizadores aumenta a taxa de bits e a qualidade.