WaveNet
DeepMind tarafından 2016 yılında tanıtılan WaveNet, her seferinde bir örnek ham ses üreten, çarpıcı derecede doğal konuşma ve müzik üreten çığır açıcı bir sinir ağıydı.
Genel Bakış
It set the modern standard for high-fidelity text-to-speech.
Derin Dalış
WaveNet, otoregresif üretken bir modeldir: her ses örneğini, kendisinden önceki tüm örneklere göre, genellikle saniyede 16.000 veya 24.000 örnekle koşullandırarak tahmin eder. Temel yeniliği, genişlemiş nedensel kıvrımların bir yığınıdır. Nedensellik, modelin üretim sırasını koruyarak yalnızca zamanda geriye baktığı anlamına gelir; genişleme, her katmanın katlanarak artan sayıda örneği atlaması anlamına gelir; böylece mütevazı bir yığın, büyük bir maliyet olmadan binlerce örneği (geniş bir alıcı alan) kapsar. Dilsel özelliklere veya mel-spektrograma bağlı olarak WaveNet, kendisinden önceki birleştirmeli ve parametrik ses kodlayıcılardan çok daha doğal konuşma üretir, insan kayıtlarıyla aradaki boşluğun çoğunu kapatır ve Google Assistant'ın ilk sürümlerini güçlendirir.
Teknik Bilgi
Genişletilmiş evrişimler anahtar püf noktasıdır: 1, 2, 4, 8 vb. genişleme oranlarıyla, yalnızca onlarca katman derinliğindeki bir ağ, hem ince dalga biçimi ayrıntılarını hem de daha uzun prozodik yapıyı yakalayarak binlerce geçmiş örneğe katılabilir. Çıktı, her numunenin değerini kategorik bir dağılım olarak modeller (başlangıçta mu-law sıkıştırma yoluyla 256 seviye) ve geçitli aktivasyon birimleri artı artık ve atlama bağlantıları, bu çok derin yığının eğitimini stabilize eder.
Stratejik Etki
Access and reach
Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.
Maliyet ve bütçe
Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.
Speed and scale
Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.
WaveNet'in Geleceği
Orijinal WaveNet yavaştı çünkü örnekleme ardışıktı. Ardılları bunu düzeltti: Paralel WaveNet ve WaveRNN, gerçek zamanlı sentezi mümkün kıldı ve daha sonra WaveGlow ve HiFi-GAN gibi akış ve GAN tabanlı ses kodlayıcıların yanı sıra difüzyon ses kodlayıcıları, kaliteyi ve hızı daha da ileriye taşıdı. WaveNet'in otoregresif, genişlemiş evrişim fikirleri bu sistemlerde varlığını sürdürüyor ve sesin çok ötesindeki mimarileri etkileyerek üretken modellemedeki mirasını güçlendiriyor.
Gerçek Dünya Uygulaması
Google Assistant ve Google Cloud Text-to-Speech için doğal görünen sesler üretiliyor
Tacotron 2 gibi TTS boru hatlarında mel-spektrogramları dalga formlarına dönüştüren sinirsel bir ses kodlayıcı görevi görüyor
Ham sesten gerçekçi piyano ve enstrümantal müzik sentezleme
Erişilebilirlik araçları ve sesli kitap anlatımı için ses sentezi
Riskler ve Korkuluklar
Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.
Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.
Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.
Uygulama Yol Haritası
Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.
Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.
Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.
Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveNet quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Ses Deepfake Tespiti
Sık sorulan sorular
What is WaveNet?
DeepMind tarafından 2016 yılında tanıtılan WaveNet, her seferinde bir örnek ham ses üreten, çarpıcı derecede doğal konuşma ve müzik üreten çığır açıcı bir sinir ağıydı. Yüksek kaliteli metin-konuşma için modern standardı belirledi.
WaveNet nasıl ses üretir?
WaveNet otoregresiftir: her ses örneğini kendisinden önce gelen örneklere göre tahmin eder.
WaveNet'teki temel evrişimsel yenilik nedir?
Genişletilmiş nedensel evrişimler, ağın yalnızca zamanda geriye bakarken binlerce geçmiş örneği verimli bir şekilde kapsamasına olanak tanır.
Genişleme neden WaveNet'e yardımcı oluyor?
Üstel olarak artan genişleme oranları, nispeten az katmana sahip binlerce örnek üzerinde geniş bir alıcı alan sağlar.
Orijinal WaveNet'in en büyük pratik dezavantajı neydi?
Her örnek bir öncekine bağlı olduğundan, üretim sıralı ve dolayısıyla yavaştı; bu da Parallel WaveNet'i ve diğer ardılları motive ediyordu.
Metin-konuşma hattında WaveNet çoğunlukla ne görevi görür?
WaveNet bir mel-spektrogramı (örneğin Tacotron 2'den) alabilir ve doğal ses veren son dalga formunu üretebilir.