VALL-E ve Codec Dil Modelleri
VALL-E, metinden konuşmaya, ses codec belirteçleri üzerinden bir dil modelleme sorunu olarak yeniden çerçevelendi ve bir örneğin yalnızca üç saniyesinden ses klonlanmasına olanak sağladı.
Genel Bakış
It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.
Derin Dalış
Microsoft tarafından 2023'ün başlarında duyurulan VALL-E, konuşma sentezini dil modelleme gibi ele alıyor. Bir spektrogramı tahmin etmek yerine, bir sinir codec bileşeninin (EnCodec) ayrı akustik belirteçlerini tahmin eder, böylece nesil, sesli bir kelime dağarcığı üzerinden sonraki belirteç tahmini haline gelir. Görünmeyen bir konuşmacının ve hedef metnin 3 saniyelik kaydı verildiğinde, VALL-E o konuşmacının sesinde devam ederek tınıyı ve hatta akustik ortamı korur. Yaklaşık 60.000 saatlik konuşmayla eğitildi; bu, tipik TTS veri kümelerinden çok daha fazlaydı ve bu da ona güçlü sıfır atışlı klonlama sağlıyordu. Codec belirteçleri katmanlı olduğundan (RVQ aracılığıyla), VALL-E iki aşama kullanır: otoregresif bir model, istemde koşullandırılan ilk kaba belirteç akışını tahmin eder ve otoregresif olmayan bir model, kalan ayrıntı belirteçlerini doldurur. Bu codec-LM tarifi, VALL-E 2 gibi ardıllara ve birçok konuşma temeli modeline ilham verdi.
Teknik Bilgi
İşin püf noktası, hiyerarşik codec belirteçleri üzerinden hibrit kod çözmedir. Otoregresif aşama, prozodi ve içeriği yakalayarak en önemli ilk kod kitabı belirteçlerini teker teker tahmin eder. İnce akustik ayrıntılar ekleyen geri kalan kod kitapları, ilk akışa ve hoparlör istemine göre koşullandırılan, otoregresif olmayan bir model tarafından paralel olarak tahmin edilir. Bu bölünme, kaliteyi yüksek tutarken her jetonun sırayla oluşturulmasının maliyetini ortadan kaldırır ve bir codec bileşeni kullanmak, konuşma ve metnin aynı transformatör makinesiyle modellenebileceği anlamına gelir.
Stratejik Etki
Access and reach
Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.
Maliyet ve bütçe
Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.
Speed and scale
Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.
VALL-E ve Codec Dil Modellerinin Geleceği
Codec dil modelleri, konuşmayı büyük dil modelleriyle birleştiriyor; tek bir modelde dinleyen, akıl yürüten ve konuşan birleşik sistemlere işaret ediyor. Daha iyi stabilite ve daha az yapaylık, gerçek zamanlı akış oluşturma ve duygu ile stil üzerinde daha sıkı kontrol bekleyebilirsiniz. VALL-E'yi erişilebilirlik ve dublaj açısından faydalı kılan aynı güçlü klonlama aynı zamanda deepfake ve izin endişelerini de artırıyor; dolayısıyla filigranlama, ses doğrulama korumaları ve politika korkulukları bu sistemlerin konuşlandırılma şeklinin merkezi bir parçası haline geliyor.
Gerçek Dünya Uygulaması
Kayıp bir sesi geri getiren kişiselleştirilmiş asistanlar veya erişilebilirlik araçları için birkaç saniyelik sesten bir ses klonlama
Orijinal konuşmacının tınısını korurken videoyu yerelleştirme ve diğer dillere kopyalama
Bir kaydın akustik ortamını koruyan etkileyici, bağlama uygun anlatım oluşturma
Konuşma sesini hem anlayan hem de üreten multimodal asistanlarda konuşma omurgası görevi görüyor
Riskler ve Korkuluklar
Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.
Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.
Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.
Uygulama Yol Haritası
Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.
Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.
Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.
Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VALL-E and Codec Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Büyük Dil Modellerinin Ortaya Çıkan Yetenekleri
Sık sorulan sorular
What is VALL-E and Codec Language Models?
VALL-E, metinden konuşmaya, ses codec belirteçleri üzerinden bir dil modelleme sorunu olarak yeniden çerçevelendi ve bir örneğin yalnızca üç saniyesinden ses klonlanmasına olanak sağladı. Bu, yüksek lisanslı metinlere güç veren aynı sonraki belirteç tahmininin son derece doğal ve etkileyici bir konuşma üretebildiğini gösterdi.
VALL-E'yi daha önceki metin-konuşma sistemlerinden ayıran temel fikir nedir?
VALL-E, konuşma üretimini bir dil modeli gibi ele alarak, TTS'yi ayrı ses kodlayıcı belirteçleri üzerinden sonraki belirteç tahmini olarak yeniden çerçevelendirir.
VALL-E'nin yeni bir konuşmacının sesini kopyalamak için ne kadar referans sese ihtiyacı var?
VALL-E, görünmeyen bir konuşmacının yaklaşık 3 saniyelik örneğinden sıfır atışlı ses klonlama gerçekleştirebilir.
VALL-E, ses belirteçlerini üretmek için hangi sinir kodeğini kullanıyor?
VALL-E, Meta'nin EnCodec'ini temel alarak konuşmayı sentezlemek için ayrı akustik belirteçlerini tahmin eder.
VALL-E neden hem otoregresif hem de otoregresif olmayan aşamayı kullanıyor?
Codec belirteçleri RVQ aracılığıyla hiyerarşiktir; VALL-E, verimlilik için ilk kaba akışı otoregresif olarak ve kalan ayrıntı belirteçlerini paralel olarak tahmin eder.
VALL-E kabaca ne kadar konuşma verisi üzerinde eğitildi ve bu da güçlü sıfır atışlı klonlamayı mümkün kıldı?
VALL-E, tipik TTS veri kümelerinden çok daha fazla olan yaklaşık 60.000 saatlik konuşma eğitimi aldı ve bu da sıfır atışlı genellemeyi güçlendirdi.