Ses AI KILAVUZU

SesLM

AudioLM, sesi bir dil gibi ele alarak ve simge bazında tahmin ederek gerçekçi ses (konuşma veya piyano müziği) üreten bir Google araştırma çerçevesidir.

2 min readSon güncelleme

Genel Bakış

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

Derin Dalış

Google tarafından 2022'de tanıtılan AudioLM, ses üretimini bir dil modelleme sorunu olarak yeniden çerçeveliyor: ham dalga biçimlerini ayrı belirteçlere dönüştürür ve ardından tıpkı bir metin modelinin bir sonraki kelimeyi tahmin etmesi gibi bir sonraki belirteci tahmin eder. Anahtar noktası, token türlerinin hiyerarşisidir. 'Anlamsal' belirteçler (w2v-BERT gibi bir modelden) uzun vadeli yapıyı (fonetik, sözdizimi, melodi) yakalarken, 'akustik' belirteçler (SoundStream sinir kodlayıcısından) konuşmacı kimliği, tını ve kayıt koşulları gibi ince ayrıntıları yakalar. AudioLM, önce anlamsal belirteçleri tahmin ederek, ardından akustik belirteçleri bunlara koşullandırarak, orijinal sesi veya enstrümanı korurken birçok saniye boyunca tutarlı kalan devamlar üretir. Birkaç saniye konuştuktan sonra aynı sesle konuşmaya devam eder; piyano verildiğinde aynı tarzda doğaçlama yapar.

Teknik Bilgi

AudioLM tamamen ses üzerine eğitilmiştir; transkript yoktur. SoundStream, artık vektör nicemleme yoluyla sesi akustik belirteçlere sıkıştırırken, w2v-BERT kaba anlamsal belirteçler sağlar. Bir dizi Transformer dil modeli, belirteçleri aşamalar halinde tahmin eder: önce yapı için anlamsal, ardından yüksek doğrulukta yeniden yapılandırma için kaba ve ince akustik belirteçler. SoundStream'in kod çözücüsü sonunda tahmin edilen jetonları tekrar dalga biçimine dönüştürerek konuşmacının sesini ve prozodisini tutarlı tutan ses üretir.

Stratejik Etki

Access and reach

Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.

Maliyet ve bütçe

Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.

Speed and scale

Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.

AudioLM'in Geleceği

AudioLM'nin belirteç tabanlı tarifi daha sonraki sistemlerin temeli oldu: Google'in AudioLM fikirleri, metinden müziğe geçiş için MusicLM'ye ve daha hızlı nesil için SoundStorm'a beslenirken, daha geniş alan artık konuşma, müzik ve ses efektleri genelinde anlamsal ve akustik belirteçleri harmanlıyor. Metin veya diğer sinyallerin tamamen ses eğitimli modelleri yönlendirdiği daha hızlı, gerçek zamanlı üretim, daha uzun tutarlı çıkışlar ve çok modlu kontrol bekleyebilirsiniz. Aynı teknikler, ses klonlama ve ses derin sahtekarlıkları hakkındaki endişeleri de artırıyor.

Gerçek Dünya Uygulaması

Kısa bir konuşma klibinin aynı konuşmacının ses tonu ve tonlamasıyla transkript olmadan devam etmesi

Kaydedilmiş kısa bir istemin tarzına uyan yeni piyano müziğini doğaçlama yapmak

MusicLM gibi metinden müziğe sistemler için ses oluşturma omurgası görevi görüyor

Bir örnekten prozodiyi ve kayıt akustiğini koruyan konuşma sentezi üzerine araştırma

Riskler ve Korkuluklar

Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.

Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.

Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.

Uygulama Yol Haritası

1

Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.

2

Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.

3

Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.

4

Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Anahtar Kelime Tespiti ve Uyandırma Kelimeleri

Sık sorulan sorular

What is AudioLM?

AudioLM, sesi bir dil gibi ele alarak ve simge bazında tahmin ederek gerçekçi ses (konuşma veya piyano müziği) üreten bir Google araştırma çerçevesidir. Bu önemli çünkü herhangi bir metin metni veya müzik notası olmadan tutarlı, doğal ses veren ses devamları üretebileceğinizi gösterdi.

AudioLM ses üretmek için hangi temel fikri kullanıyor?

AudioLM, dalga biçimlerini ayrı belirteçlere dönüştürür ve bunları sıralı olarak tahmin ederek, dil modellerinin sonraki belirteç yaklaşımını ham sese uygular.

AudioLM'de 'anlamsal' belirteçlerin rolü nedir?

Anlamsal belirteçler (w2v-BERT'ten) üst düzey yapıyı ve tutarlılığı kodlarken, akustik belirteçler ince ses ayrıntılarını işler.

AudioLM'nin akustik belirteçlerini hangi sinir kodlayıcı üretir?

SoundStream, sesi akustik belirteçler halinde sıkıştırmak için artık vektör nicelemesini kullanır ve daha sonra tahmin edilen belirteçlerin kodunu tekrar bir dalga biçimine dönüştürür.

AudioLM eğitim verileri olarak neye ihtiyaç duyar?

Dikkate değer bir özellik, AudioLM'nin herhangi bir metin etiketi olmadan yalnızca ses üzerinde eğitim alması ve yapıyı doğrudan sesten öğrenmesidir.

AudioLM neden anlamsal belirteçleri akustik belirteçlerden önce tahmin ediyor?

İlk önce kaba yapı oluşturmak, çıktının zaman içinde tutarlı olmasını sağlar; Akustik belirteçler daha sonra yüksek kaliteli ayrıntılar eklemek için bu yapıya göre koşullandırılır.