SoundStream Neural Codec
SoundStream ist der durchgängige neuronale Audio-Codec von Google, der Sprache und Musik auf extrem niedrige Bitraten komprimiert und dabei die Qualität beibehält.
Übersicht
It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.
Tiefer Einblick
SoundStream wurde 2021 von Google eingeführt und ist ein vollständig neuronaler Codec, der aus drei gemeinsam trainierten Teilen besteht: einem Faltungsencoder, der die Rohwellenform in eine kompakte Folge von Vektoren umwandelt, einem Restvektorquantisierer (RVQ), der diese Vektoren diskretisiert, und einem Faltungsdecoder, der die Wellenform rekonstruiert. Es wird sowohl mit Rekonstruktionsverlusten als auch mit einem gegnerischen Diskriminator im GAN-Stil trainiert, sodass die Ausgabe natürlich klingt und nicht nur numerisch nahe kommt. Eine herausragende Funktion ist das „skalierbare“ oder Quantisierer-Dropout-Training: Ein einzelnes Modell kann mit Bitraten von etwa 3 bis 18 Kbit/s arbeiten, indem einfach mehr oder weniger Quantisiererschichten bei der Inferenz verwendet werden, ohne dass ein erneutes Training erforderlich ist. Berichten zufolge übertrifft es Opus mit 3 Kbit/s bei Hörtests mit 12 Kbit/s und verarbeitet Sprache, Musik und allgemeines Audio in einem Modell, das in Echtzeit auf einer Smartphone-CPU laufen kann.
Technischer Einblick
Die Wellenform durchläuft schrittweise Faltungen, die stark heruntergerechnet werden, wodurch eine Einbettung pro Bild entsteht (z. B. 75 Bilder/Sekunde). RVQ kodiert dann jede Einbettung als Stapel von Codebuch-Indizes. Die Bitrate entspricht der Bildrate mal der Anzahl der aktiven Quantisierer mal den Bits pro Codebuch. Durch den Ausfall des Quantisierers wird der RVQ-Stapel während des Trainings nach dem Zufallsprinzip gekürzt, wodurch frühere Codebücher gezwungen werden, die wichtigsten Informationen zu übertragen, sodass der Codec bei niedrigeren Raten ordnungsgemäß abnimmt.
Strategische Auswirkungen
Zugang und Erreichbarkeit
Es verbessert die Zugänglichkeit durch Transkription, Erzählung und Sprachschnittstellen.
Kosten und Budget
Medienteams können mit kleineren Budgets schneller ausgefeilte Audioinhalte liefern.
Geschwindigkeit und Umfang
Kundenorientierte Systeme können gesprochene Interaktionen in größerem Maßstab verarbeiten.
Die Zukunft des SoundStream Neural Codec
SoundStream erstellte die Vorlage, die später von Codecs wie EnCodec und DAC verfeinert wurde, und seine diskreten Token wurden zum Substrat für generative Systeme wie AudioLM und MusicLM. Erwarten Sie Nachkommen, die auf noch niedrigere Bitraten drängen, semantisch strukturierte Token, die gleichzeitig als Eingaben für Audiogeneratoren im Sprachmodellstil dienen, und eine engere Bereitstellung auf dem Gerät für Live-Anrufe, Hörgeräte und Streaming, bei denen Bandbreite und Latenz stark eingeschränkt sind.
Reale Umsetzung
Sprachanrufe werden auf ca. 3 kbit/s komprimiert und klingen bei höheren Bitraten klarer als herkömmliche Codecs
Generieren diskreter Audio-Tokens, die die generativen Modelle AudioLM und MusicLM von Google versorgen
Echtzeit-Audio-Streaming mit geringer Bandbreite auf Mobilgeräten mit On-CPU-Kodierung und -Dekodierung
Effizientes Speichern oder Übertragen von Musik und Umgebungsgeräuschen in einem einzigen Modell, das alle Inhaltstypen verarbeitet
Risiken und Leitplanken
Das Risiko von Stimmmissbrauch und Identitätsdiebstahl steigt, wenn die Einwilligung fehlt.
Die Genauigkeit kann je nach Akzent, Dialekt oder lauter Umgebung abnehmen.
Synthetisches Audio kann ohne klare Kennzeichnung mit authentischer Sprache verwechselt werden.
Implementierungs-Roadmap
Holen Sie die ausdrückliche Zustimmung zur Spracherfassung, zum Klonen und zur Wiederverwendung ein.
Testen Sie die Qualität über verschiedene Lautsprecher und Hintergrundbedingungen hinweg.
Definieren Sie, wann ein Mensch Ausgaben überprüfen oder genehmigen muss.
Kennzeichnen Sie synthetisches Audio und bewahren Sie Aufzeichnungen über die Herkunft auf, um die Verantwortlichkeit zu gewährleisten.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SoundStream Neural Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Neuronale Audio-Codecs
Häufig gestellte Fragen
What is SoundStream Neural Codec?
SoundStream ist der durchgängige neuronale Audio-Codec von Google, der Sprache und Musik auf extrem niedrige Bitraten komprimiert und dabei die Qualität beibehält. Das ist wichtig, weil es traditionelle Codecs wie Opus bei gleicher Bitrate übertrifft und moderne generative Audiomodelle unterstützt.
Aus welchen drei Komponenten besteht die SoundStream-Architektur?
SoundStream besteht aus einem Faltungsencoder, einem Restvektorquantisierer, der die Einbettungen diskretisiert, und einem Faltungsdecoder, die alle durchgängig trainiert werden.
Mit welcher Technik kann ein einzelnes SoundStream-Modell viele verschiedene Bitraten ohne Umschulung bedienen?
Während des Trainings löscht SoundStream nach dem Zufallsprinzip Quantisierungsebenen, sodass Sie bei der Inferenz mehr oder weniger RVQ-Ebenen verwenden können, um unterschiedliche Bitraten eines Modells zu erreichen.
In den Hörtests von Google wurde berichtet, dass SoundStream mit 3 Kbit/s welchen Codec mit 12 Kbit/s übertrifft?
In subjektiven Qualitätsbewertungen erreichte SoundStream mit nur 3 KBit/s den weit verbreiteten Opus-Codec mit 12 KBit/s oder übertraf ihn sogar.
Welche Art von zusätzlichem Trainingssignal verwendet SoundStream, um die Ausgabe natürlich klingen zu lassen?
Über die Rekonstruktionsverluste hinaus verwendet SoundStream Adversarial (GAN)-Diskriminatoren, sodass Rekonstruktionen wahrnehmungsrealistisch und nicht nur numerisch ähnlich klingen.
In welcher Beziehung steht die Bitrate von SoundStream zu seinen Quantisierern?
Die Bitrate skaliert mit der Anzahl der aktiven RVQ-Schichten (mal Bildrate mal Bits pro Codebuch), sodass das Hinzufügen von Quantisierern die Bitrate und Qualität erhöht.