GUIDE de l'IA audio

Codec neuronal SoundStream

SoundStream est le codec audio neuronal de bout en bout de Google qui compresse la parole et la musique à des débits extrêmement faibles tout en préservant la qualité.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

Plongée profonde

Introduit par Google en 2021, SoundStream est un codec entièrement neuronal construit à partir de trois éléments entraînés ensemble : un codeur convolutif qui transforme la forme d'onde brute en une séquence compacte de vecteurs, un quantificateur vectoriel résiduel (RVQ) qui discrétise ces vecteurs et un décodeur convolutionnel qui reconstruit la forme d'onde. Il est entraîné à la fois avec des pertes de reconstruction et un discriminateur contradictoire de type GAN, de sorte que la sortie semble naturelle plutôt que simplement numériquement proche. Une fonctionnalité remarquable est la formation « évolutive » ou sans abandon de quantificateur : un seul modèle peut fonctionner sur des débits binaires d'environ 3 à 18 kbps simplement en utilisant plus ou moins de couches de quantificateur lors de l'inférence, sans recyclage. À 3 kbps, il surpasserait Opus à 12 kbps dans les tests d'écoute, la gestion de la parole, de la musique et de l'audio général dans un modèle pouvant fonctionner en temps réel sur le processeur d'un smartphone.

Aperçu technique

La forme d'onde passe par des convolutions striées qui sous-échantillonnent fortement, produisant une intégration par image (par exemple 75 images/seconde). RVQ code ensuite chaque intégration sous la forme d'une pile d'index de livres de codes. Le débit binaire est égal à la fréquence d'images multipliée par le nombre de quantificateurs actifs multiplié par les bits par livre de codes. L'abandon du quantificateur tronque de manière aléatoire la pile RVQ pendant la formation, obligeant les livres de codes antérieurs à contenir les informations les plus importantes afin que le codec se dégrade progressivement à des taux inférieurs.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir du codec neuronal SoundStream

SoundStream a établi le modèle que les codecs ultérieurs comme EnCodec et DAC ont affiné, et ses jetons discrets sont devenus le substrat pour les systèmes génératifs tels que AudioLM et MusicLM. Attendez-vous à ce que les descendants poussent vers des débits binaires encore plus bas, des jetons sémantiquement structurés qui servent également d'entrées aux générateurs audio de type modèle de langage et un déploiement plus strict sur l'appareil pour les appels en direct, les aides auditives et le streaming où la bande passante et la latence sont étroitement limitées.

Mise en œuvre dans le monde réel

Compresser les appels vocaux à ~ 3 kbps tout en sonnant plus clairement que les codecs existants à des débits binaires plus élevés

Génération de jetons audio discrets qui alimentent les modèles génératifs AudioLM et MusicLM de Google

Streaming audio en temps réel à faible bande passante sur les appareils mobiles avec encodage et décodage sur le processeur

Stocker ou transmettre efficacement de la musique et du son ambiant dans un seul modèle qui gère tous les types de contenu

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Codecs audio neuronaux

Questions fréquemment posées

What is SoundStream Neural Codec?

SoundStream est le codec audio neuronal de bout en bout de Google qui compresse la parole et la musique à des débits extrêmement faibles tout en préservant la qualité. C’est important car il bat les codecs traditionnels comme Opus au même débit binaire et alimente les modèles audio génératifs modernes.

Quels sont les trois composants qui composent l’architecture SoundStream ?

SoundStream est construit à partir d'un codeur convolutif, d'un quantificateur vectoriel résiduel qui discrétise les intégrations et d'un décodeur convolutif, tous formés de bout en bout.

Quelle technique permet à un seul modèle SoundStream de servir de nombreux débits différents sans recyclage ?

Pendant l'entraînement, SoundStream supprime de manière aléatoire les couches de quantification afin que, lors de l'inférence, vous puissiez utiliser plus ou moins de niveaux RVQ pour atteindre différents débits binaires à partir d'un modèle.

Lors des tests d'écoute de Google, SoundStream à 3 Kbit/s a surpassé quel codec à 12 Kbit/s ?

SoundStream à seulement 3 kbps correspondait ou battait le codec Opus largement utilisé fonctionnant à 12 kbps dans les évaluations de qualité subjectives.

Quel type de signal d'entraînement supplémentaire SoundStream utilise-t-il pour rendre le son de sortie naturel ?

Au-delà des pertes de reconstruction, SoundStream utilise des discriminateurs contradictoires (GAN) afin que les reconstructions semblent réalistes au niveau de la perception plutôt que simplement proches numériquement.

Quel est le rapport entre le débit binaire de SoundStream et ses quantificateurs ?

Le débit binaire évolue avec le nombre de couches RVQ actives (fois la fréquence d'images multipliée par les bits par livre de codes), donc l'ajout de quantificateurs augmente le débit binaire et la qualité.