Ses AI KILAVUZU

NaturalSpeech ve Gizli Difüzyon TTS

NaturalSpeech, insan düzeyinde konuşma kalitesini hedefleyen bir Microsoft TTS araştırma serisidir; sonraki sürümleri, zengin, doğal sesler oluşturmak için gizli difüzyonu kullanır.

2 min readSon güncelleme

Genel Bakış

It shows how diffusion models, famous for images, can produce expressive, controllable audio.

Derin Dalış

Orijinal NaturalSpeech (2022), gerçek kayıtlardan güvenilir bir şekilde ayırt edemeyen dinleyiciler tarafından değerlendirilen LJSpeech karşılaştırmasında insan düzeyinde kaliteye ulaştığı bildirilen ilk sistemdi. Eğitim ve çıkarım arasındaki boşluğu kapatmak için dikkatlice eşleşen önceliklere sahip değişken bir otomatik kodlayıcı kullandı. NaturalSpeech 2 daha sonra gizli bir yayılma yaklaşımını benimsedi: konuşma, bir sinirsel ses codec'i tarafından sürekli gizli vektörler halinde kodlanır ve bir yayılma modeli, bu gizli öğeleri metinden üretmeyi öğrenerek, kısa bir komuttan güçlü sıfır atışlı ses klonlamasına olanak tanır. NaturalSpeech 3, konuşmayı içerik, prozodi, tını ve akustik ayrıntı gibi ayrıştırılmış niteliklere ayırarak faktörize edilmiş yayılmayı tanıttı; böylece her biri daha yüksek aslına uygunluk ve esneklik için bağımsız olarak modellenebilir ve kontrol edilebilir.

Teknik Bilgi

Gizli yayılma, konuşmanın kompakt bir gizli temsiline gürültü ekleyerek ve bu gürültüyü adım adım tersine çevirmek için bir ağı eğiterek çalışır. NaturalSpeech 2, ham dalga formlarının veya tam spektrogramların gürültüsünü gidermek yerine, daha düşük boyutlu ve modellenmesi daha kolay olan codec latentlerinin gürültüsünü giderir. Metne ve bir referans sesli uyarıya koşullandırma, ters yayılımı yönlendirir, böylece son örneklenen gizli öğeler, istenen içerik ve konuşmacı kimliğiyle eşleşen konuşmaya dönüştürülür.

Stratejik Etki

Access and reach

Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.

Maliyet ve bütçe

Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.

Speed and scale

Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.

Doğal Konuşma ve Gizli Difüzyon TTS'nin Geleceği

Difüzyon tabanlı ve faktörize edilmiş TTS, yalnızca doğal değil aynı zamanda hassas bir şekilde yönlendirilebilir olan seslere işaret ederek kullanıcıların tınıyı, duyguyu ve prozodiyi bağımsız kadranlar olarak ayarlamasına olanak tanır. Damıtma ve birkaç adımlı dağıtım yoluyla daha hızlı örnekleme, saniyelerce sesten daha güçlü sıfır atış klonlama ve bağlama duyarlı dağıtım için büyük dil modelleriyle daha sıkı entegrasyon bekleyebilirsiniz. Bu ilerlemeler aynı zamanda filigranlama ve izin korumalarına olan ihtiyacı da artırıyor çünkü yüksek kaliteli klonlama açık kötüye kullanım risklerini artırıyor.

Gerçek Dünya Uygulaması

Dublaj stüdyoları, NaturalSpeech 2 tarzı sıfır çekim klonlamayı kullanarak filmleri yerelleştirmek için kısa bir örnekten bir oyuncunun sesini klonlar.

Sesli kitap platformları, dinleyicilerin gerçek seslendirme yeteneğinden ayırt etmekte zorlandığı, insan düzeyinde anlatımlar üretir.

Erişilebilirlik araçları, konuşmasını kaybetmiş kişiler için eski kayıtlardan kişinin kendi sesini yeniden oluşturur.

İçerik oluşturma paketleri, editörlerin NaturalSpeech 3'ün faktörize edilmiş niteliklerinden yararlanarak tınıyı ve prozodiyi bağımsız olarak ayarlamasına olanak tanır.

Riskler ve Korkuluklar

Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.

Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.

Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.

Uygulama Yol Haritası

1

Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.

2

Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.

3

Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.

4

Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NaturalSpeech and Latent Diffusion TTS quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Kararlı Ses Gizli Yayılımı

Sık sorulan sorular

What is NaturalSpeech and Latent Diffusion TTS?

NaturalSpeech, insan düzeyinde konuşma kalitesini hedefleyen bir Microsoft TTS araştırma serisidir; sonraki sürümleri, zengin, doğal sesler oluşturmak için gizli difüzyonu kullanır. Görüntüleriyle ünlü difüzyon modellerinin nasıl etkileyici, kontrol edilebilir ses üretebildiğini gösteriyor.

Orijinal NaturalSpeech'in (2022) hangi dönüm noktasına ulaştığı bildirildi?

NaturalSpeech'in LJSpeech'te insan düzeyinde kaliteye ulaşan ilk sistem olduğu ve dinleyicilerin onu gerçek konuşmadan güvenilir bir şekilde ayırt edemediği bildirildi.

NaturalSpeech 2'nin gizli yayılma modeli aslında ne üretiyor?

NaturalSpeech 2, kompakt ve modellenmesi ham dalga formlarına göre daha kolay olan codec latent'leri üzerinden yayılır ve ardından bunların kodunu sese dönüştürür.

Bir yayılma modeli nasıl yüksek düzeyde veri üretir?

Difüzyon, eğitim sırasında gürültü ekler ve bunu tersine çevirmeyi öğrenir, rastgele gürültüden aşamalı olarak arındırarak örnekler üretir.

Gizli difüzyon NaturalSpeech 2'ye hangi temel yeteneği kazandırır?

NaturalSpeech 2, kısa bir sesli uyarıyı koşullandırarak, daha önce açıkça eğitim almadığı bir konuşmacının sesini kopyalayabilir.

NaturalSpeech 3'ün 'faktörleştirilmiş yayılımının' ana fikri nedir?

Faktörlere ayrılmış yayılma içeriği, prozodiyi, tınıyı ve akustik ayrıntıları çözer, böylece her bir özellik ayrı ayrı modellenebilir ve kontrol edilebilir.