Ses AI KILAVUZU

SoundStream Sinir Kodlayıcısı

SoundStream, Google'in kaliteyi korurken konuşma ve müziği son derece düşük bit hızlarına sıkıştıran uçtan uca sinirsel ses codec bileşenidir.

2 min readSon güncelleme

Genel Bakış

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

Derin Dalış

Google tarafından 2021'de tanıtılan SoundStream, birlikte eğitilmiş üç parçadan oluşturulmuş tamamen sinirsel bir codec bileşenidir: ham dalga biçimini kompakt bir vektör dizisine dönüştüren evrişimli bir kodlayıcı, bu vektörleri ayrıştıran bir artık vektör niceleyici (RVQ) ve dalga biçimini yeniden oluşturan evrişimli bir kod çözücü. Hem yeniden yapılanma kayıpları hem de GAN tarzı rakip ayrımcı ile eğitilmiştir, bu nedenle çıktı sadece sayısal olarak yakın olmaktan ziyade doğal görünmektedir. Öne çıkan bir özellik, 'ölçeklenebilir' veya niceleyici bırakma eğitimidir: tek bir model, çıkarımda daha fazla veya daha az niceleyici katman kullanarak, yeniden eğitim gerektirmeden, kabaca 3 ila 18 kbps arasındaki bit hızlarında çalışabilir. Bir akıllı telefon CPU'sunda gerçek zamanlı olarak çalışabilen tek bir modelde dinleme testlerinde, konuşma, müzik ve genel ses işlemede 3 kbps hızıyla Opus'tan 12 kbps hızında daha iyi performans gösterdiği bildiriliyor.

Teknik Bilgi

Dalga formu, yoğun şekilde alt örnekleme yapan adımlı evrişimlerden geçerek kare başına bir yerleştirme (örneğin 75 kare/saniye) üretir. RVQ daha sonra her yerleştirmeyi bir kod kitabı indeksleri yığını olarak kodlar. Bit hızı, kare hızı çarpı aktif kuantizör sayısı çarpı kod kitabı başına bitlere eşittir. Quantizer'ın bırakılması, eğitim sırasında RVQ yığınını rastgele keserek önceki kod kitaplarını en önemli bilgileri taşımaya zorlar, böylece codec bileşeni daha düşük hızlarda sorunsuz bir şekilde bozulur.

Stratejik Etki

Access and reach

Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.

Maliyet ve bütçe

Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.

Speed and scale

Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.

SoundStream Nöral Codec'in Geleceği

SoundStream, daha sonra EnCodec ve DAC gibi codec'lerin iyileştirdiği şablonu oluşturdu ve ayrık belirteçleri, AudioLM ve MusicLM gibi üretken sistemler için alt tabaka haline geldi. Torunların daha da düşük bit hızlarına, dil modeli tarzı ses oluşturuculara giriş işlevi gören semantik olarak yapılandırılmış belirteçlere ve bant genişliği ve gecikmenin sıkı bir şekilde kısıtlandığı canlı çağrılar, işitme cihazları ve akış için daha sıkı cihaz içi dağıtıma doğru ilerlemesini bekleyin.

Gerçek Dünya Uygulaması

Yüksek bit hızlarında eski codec bileşenlerinden daha net ses verirken, sesli çağrıları ~3 kbps'ye sıkıştırıyoruz

Google'in AudioLM ve MusicLM üretken modellerini besleyen ayrı ses belirteçleri oluşturma

CPU üzerinde kodlama ve kod çözme ile mobil cihazlarda gerçek zamanlı düşük bant genişlikli ses akışı

Müziği ve ortam sesini, tüm içerik türlerini işleyen tek bir modelde verimli bir şekilde depolamak veya iletmek

Riskler ve Korkuluklar

Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.

Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.

Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.

Uygulama Yol Haritası

1

Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.

2

Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.

3

Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.

4

Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Sinirsel Ses Codec'leri

Sık sorulan sorular

What is SoundStream Neural Codec?

SoundStream, Google'in kaliteyi korurken konuşma ve müziği son derece düşük bit hızlarına sıkıştıran uçtan uca sinirsel ses codec bileşenidir. Bu önemlidir çünkü Opus gibi geleneksel codec bileşenlerini aynı bit hızında yener ve modern üretken ses modellerine güç verir.

SoundStream mimarisini hangi üç bileşen oluşturur?

SoundStream, tümü uçtan uca eğitilmiş bir evrişimli kodlayıcıdan, yerleştirmeleri ayrıklaştıran bir artık vektör niceleyiciden ve bir evrişimli kod çözücüden oluşturulmuştur.

Hangi teknik, tek bir SoundStream modelinin yeniden eğitim gerektirmeden birçok farklı bit hızına hizmet etmesini sağlar?

Eğitim sırasında SoundStream, niceleyici katmanları rastgele bırakır, böylece çıkarımda bir modelden farklı bit hızlarına ulaşmak için daha fazla veya daha az RVQ seviyesi kullanabilirsiniz.

Google'in dinleme testlerinde, 3 kbps'deki SoundStream'in 12 kbps'de hangi codec'ten daha iyi performans gösterdiği rapor edildi?

Yalnızca 3 kbps hızındaki SoundStream, subjektif kalite değerlendirmelerinde yaygın olarak kullanılan 12 kbps hızında çalışan Opus codec bileşeniyle eşleşti veya onu geçti.

SoundStream, çıktı sesinin doğal olmasını sağlamak için ne tür ek eğitim sinyali kullanır?

Yeniden yapılandırma kayıplarının ötesinde SoundStream, rakip (GAN) ayırıcıları kullanır, böylece yeniden yapılandırmalar yalnızca sayısal olarak yakın olmaktan ziyade algısal olarak gerçekçi görünür.

SoundStream'in bit hızının niceleyicileriyle ilişkisi nedir?

Bit hızı, aktif RVQ katmanlarının sayısına (kare hızı çarpı kod kitabı başına bit sayısı) göre ölçeklenir, böylece niceleyicilerin eklenmesi bit hızını ve kaliteyi artırır.