SoundStream Sinir Kodlayıcısı
SoundStream, Google'in kaliteyi korurken konuşma ve müziği son derece düşük bit hızlarına sıkıştıran uçtan uca sinirsel ses codec bileşenidir.
Genel Bakış
It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.
Derin Dalış
Google tarafından 2021'de tanıtılan SoundStream, birlikte eğitilmiş üç parçadan oluşturulmuş tamamen sinirsel bir codec bileşenidir: ham dalga biçimini kompakt bir vektör dizisine dönüştüren evrişimli bir kodlayıcı, bu vektörleri ayrıştıran bir artık vektör niceleyici (RVQ) ve dalga biçimini yeniden oluşturan evrişimli bir kod çözücü. Hem yeniden yapılanma kayıpları hem de GAN tarzı rakip ayrımcı ile eğitilmiştir, bu nedenle çıktı sadece sayısal olarak yakın olmaktan ziyade doğal görünmektedir. Öne çıkan bir özellik, 'ölçeklenebilir' veya niceleyici bırakma eğitimidir: tek bir model, çıkarımda daha fazla veya daha az niceleyici katman kullanarak, yeniden eğitim gerektirmeden, kabaca 3 ila 18 kbps arasındaki bit hızlarında çalışabilir. Bir akıllı telefon CPU'sunda gerçek zamanlı olarak çalışabilen tek bir modelde dinleme testlerinde, konuşma, müzik ve genel ses işlemede 3 kbps hızıyla Opus'tan 12 kbps hızında daha iyi performans gösterdiği bildiriliyor.
Teknik Bilgi
Dalga formu, yoğun şekilde alt örnekleme yapan adımlı evrişimlerden geçerek kare başına bir yerleştirme (örneğin 75 kare/saniye) üretir. RVQ daha sonra her yerleştirmeyi bir kod kitabı indeksleri yığını olarak kodlar. Bit hızı, kare hızı çarpı aktif kuantizör sayısı çarpı kod kitabı başına bitlere eşittir. Quantizer'ın bırakılması, eğitim sırasında RVQ yığınını rastgele keserek önceki kod kitaplarını en önemli bilgileri taşımaya zorlar, böylece codec bileşeni daha düşük hızlarda sorunsuz bir şekilde bozulur.
Stratejik Etki
Access and reach
Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.
Maliyet ve bütçe
Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.
Speed and scale
Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.
SoundStream Nöral Codec'in Geleceği
SoundStream, daha sonra EnCodec ve DAC gibi codec'lerin iyileştirdiği şablonu oluşturdu ve ayrık belirteçleri, AudioLM ve MusicLM gibi üretken sistemler için alt tabaka haline geldi. Torunların daha da düşük bit hızlarına, dil modeli tarzı ses oluşturuculara giriş işlevi gören semantik olarak yapılandırılmış belirteçlere ve bant genişliği ve gecikmenin sıkı bir şekilde kısıtlandığı canlı çağrılar, işitme cihazları ve akış için daha sıkı cihaz içi dağıtıma doğru ilerlemesini bekleyin.
Gerçek Dünya Uygulaması
Yüksek bit hızlarında eski codec bileşenlerinden daha net ses verirken, sesli çağrıları ~3 kbps'ye sıkıştırıyoruz
Google'in AudioLM ve MusicLM üretken modellerini besleyen ayrı ses belirteçleri oluşturma
CPU üzerinde kodlama ve kod çözme ile mobil cihazlarda gerçek zamanlı düşük bant genişlikli ses akışı
Müziği ve ortam sesini, tüm içerik türlerini işleyen tek bir modelde verimli bir şekilde depolamak veya iletmek
Riskler ve Korkuluklar
Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.
Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.
Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.
Uygulama Yol Haritası
Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.
Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.
Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.
Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SoundStream Neural Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Sinirsel Ses Codec'leri
Sık sorulan sorular
What is SoundStream Neural Codec?
SoundStream, Google'in kaliteyi korurken konuşma ve müziği son derece düşük bit hızlarına sıkıştıran uçtan uca sinirsel ses codec bileşenidir. Bu önemlidir çünkü Opus gibi geleneksel codec bileşenlerini aynı bit hızında yener ve modern üretken ses modellerine güç verir.
SoundStream mimarisini hangi üç bileşen oluşturur?
SoundStream, tümü uçtan uca eğitilmiş bir evrişimli kodlayıcıdan, yerleştirmeleri ayrıklaştıran bir artık vektör niceleyiciden ve bir evrişimli kod çözücüden oluşturulmuştur.
Hangi teknik, tek bir SoundStream modelinin yeniden eğitim gerektirmeden birçok farklı bit hızına hizmet etmesini sağlar?
Eğitim sırasında SoundStream, niceleyici katmanları rastgele bırakır, böylece çıkarımda bir modelden farklı bit hızlarına ulaşmak için daha fazla veya daha az RVQ seviyesi kullanabilirsiniz.
Google'in dinleme testlerinde, 3 kbps'deki SoundStream'in 12 kbps'de hangi codec'ten daha iyi performans gösterdiği rapor edildi?
Yalnızca 3 kbps hızındaki SoundStream, subjektif kalite değerlendirmelerinde yaygın olarak kullanılan 12 kbps hızında çalışan Opus codec bileşeniyle eşleşti veya onu geçti.
SoundStream, çıktı sesinin doğal olmasını sağlamak için ne tür ek eğitim sinyali kullanır?
Yeniden yapılandırma kayıplarının ötesinde SoundStream, rakip (GAN) ayırıcıları kullanır, böylece yeniden yapılandırmalar yalnızca sayısal olarak yakın olmaktan ziyade algısal olarak gerçekçi görünür.
SoundStream'in bit hızının niceleyicileriyle ilişkisi nedir?
Bit hızı, aktif RVQ katmanlarının sayısına (kare hızı çarpı kod kitabı başına bit sayısı) göre ölçeklenir, böylece niceleyicilerin eklenmesi bit hızını ve kaliteyi artırır.