SesLM
AudioLM, sesi bir dil gibi ele alarak ve simge bazında tahmin ederek gerçekçi ses (konuşma veya piyano müziği) üreten bir Google araştırma çerçevesidir.
Genel Bakış
It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.
Derin Dalış
Google tarafından 2022'de tanıtılan AudioLM, ses üretimini bir dil modelleme sorunu olarak yeniden çerçeveliyor: ham dalga biçimlerini ayrı belirteçlere dönüştürür ve ardından tıpkı bir metin modelinin bir sonraki kelimeyi tahmin etmesi gibi bir sonraki belirteci tahmin eder. Anahtar noktası, token türlerinin hiyerarşisidir. 'Anlamsal' belirteçler (w2v-BERT gibi bir modelden) uzun vadeli yapıyı (fonetik, sözdizimi, melodi) yakalarken, 'akustik' belirteçler (SoundStream sinir kodlayıcısından) konuşmacı kimliği, tını ve kayıt koşulları gibi ince ayrıntıları yakalar. AudioLM, önce anlamsal belirteçleri tahmin ederek, ardından akustik belirteçleri bunlara koşullandırarak, orijinal sesi veya enstrümanı korurken birçok saniye boyunca tutarlı kalan devamlar üretir. Birkaç saniye konuştuktan sonra aynı sesle konuşmaya devam eder; piyano verildiğinde aynı tarzda doğaçlama yapar.
Teknik Bilgi
AudioLM tamamen ses üzerine eğitilmiştir; transkript yoktur. SoundStream, artık vektör nicemleme yoluyla sesi akustik belirteçlere sıkıştırırken, w2v-BERT kaba anlamsal belirteçler sağlar. Bir dizi Transformer dil modeli, belirteçleri aşamalar halinde tahmin eder: önce yapı için anlamsal, ardından yüksek doğrulukta yeniden yapılandırma için kaba ve ince akustik belirteçler. SoundStream'in kod çözücüsü sonunda tahmin edilen jetonları tekrar dalga biçimine dönüştürerek konuşmacının sesini ve prozodisini tutarlı tutan ses üretir.
Stratejik Etki
Access and reach
Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.
Maliyet ve bütçe
Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.
Speed and scale
Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.
AudioLM'in Geleceği
AudioLM'nin belirteç tabanlı tarifi daha sonraki sistemlerin temeli oldu: Google'in AudioLM fikirleri, metinden müziğe geçiş için MusicLM'ye ve daha hızlı nesil için SoundStorm'a beslenirken, daha geniş alan artık konuşma, müzik ve ses efektleri genelinde anlamsal ve akustik belirteçleri harmanlıyor. Metin veya diğer sinyallerin tamamen ses eğitimli modelleri yönlendirdiği daha hızlı, gerçek zamanlı üretim, daha uzun tutarlı çıkışlar ve çok modlu kontrol bekleyebilirsiniz. Aynı teknikler, ses klonlama ve ses derin sahtekarlıkları hakkındaki endişeleri de artırıyor.
Gerçek Dünya Uygulaması
Kısa bir konuşma klibinin aynı konuşmacının ses tonu ve tonlamasıyla transkript olmadan devam etmesi
Kaydedilmiş kısa bir istemin tarzına uyan yeni piyano müziğini doğaçlama yapmak
MusicLM gibi metinden müziğe sistemler için ses oluşturma omurgası görevi görüyor
Bir örnekten prozodiyi ve kayıt akustiğini koruyan konuşma sentezi üzerine araştırma
Riskler ve Korkuluklar
Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.
Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.
Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.
Uygulama Yol Haritası
Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.
Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.
Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.
Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Anahtar Kelime Tespiti ve Uyandırma Kelimeleri
Sık sorulan sorular
What is AudioLM?
AudioLM, sesi bir dil gibi ele alarak ve simge bazında tahmin ederek gerçekçi ses (konuşma veya piyano müziği) üreten bir Google araştırma çerçevesidir. Bu önemli çünkü herhangi bir metin metni veya müzik notası olmadan tutarlı, doğal ses veren ses devamları üretebileceğinizi gösterdi.
AudioLM ses üretmek için hangi temel fikri kullanıyor?
AudioLM, dalga biçimlerini ayrı belirteçlere dönüştürür ve bunları sıralı olarak tahmin ederek, dil modellerinin sonraki belirteç yaklaşımını ham sese uygular.
AudioLM'de 'anlamsal' belirteçlerin rolü nedir?
Anlamsal belirteçler (w2v-BERT'ten) üst düzey yapıyı ve tutarlılığı kodlarken, akustik belirteçler ince ses ayrıntılarını işler.
AudioLM'nin akustik belirteçlerini hangi sinir kodlayıcı üretir?
SoundStream, sesi akustik belirteçler halinde sıkıştırmak için artık vektör nicelemesini kullanır ve daha sonra tahmin edilen belirteçlerin kodunu tekrar bir dalga biçimine dönüştürür.
AudioLM eğitim verileri olarak neye ihtiyaç duyar?
Dikkate değer bir özellik, AudioLM'nin herhangi bir metin etiketi olmadan yalnızca ses üzerinde eğitim alması ve yapıyı doğrudan sesten öğrenmesidir.
AudioLM neden anlamsal belirteçleri akustik belirteçlerden önce tahmin ediyor?
İlk önce kaba yapı oluşturmak, çıktının zaman içinde tutarlı olmasını sağlar; Akustik belirteçler daha sonra yüksek kaliteli ayrıntılar eklemek için bu yapıya göre koşullandırılır.