Ses AI KILAVUZU

Müzik kutusu

Jukebox, OpenAI'nin şarkı sesleri, enstrümanlar ve hatta belirli sanatçıların tarzında şarkı sözleriyle tamamlanan ham müzik sesi üreten 2020 sinir ağıdır.

2 min readSon güncelleme

Genel Bakış

It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.

Derin Dalış

OpenAI tarafından Nisan 2020'de piyasaya sürülen Jukebox, müziği sembolik notalar yerine ham ses olarak üretir; bu, vokaller de dahil olmak üzere gerçek sesi ürettiği anlamına gelir. Web'den alınan yaklaşık 1,2 milyon şarkı (yaklaşık yarısı İngilizce) ve LyricWiki'den şarkı sözleri ve meta verilerle eşleştirilerek eğitildi. Bunu bir türe, sanatçı tarzına ve şarkı sözlerine göre koşullandırabilirsiniz ve o da o sanatçı gibi (bulanık da olsa) tanınabilir bir şekilde şarkı söyleyecektir. Çıkışlar birkaç dakika uzunluğunda çalışır. İşin püf noktası hız ve doğruluktur: Üretim son derece yavaştı, tek bir dakikalık sesin işlenmesi yaklaşık dokuz saat sürüyordu ve sonuçlar boğuk, gürültülü bir kaliteye sahipti. Jukebox gösterişli bir ürün değil, bir araştırmaydı ancak mümkün olana dair beklentileri yeniden şekillendirdi.

Teknik Bilgi

Jukebox, ham sesi üç zamanlı çözünürlükte VQ-VAE otomatik kodlayıcıları kullanarak sıkıştırarak uzun bir dalga biçimini çok daha kısa ayrık kod dizisine dönüştürür. Otoregresif Transformatörler daha sonra bu kodları sanatçıya, türe ve şarkı sözlerine göre teker teker tahmin eder ve üst örnekleyiciler yüksek frekanslı ayrıntılar ekler. Alt düzey kodların 44,1 kHz dalga biçimine geri çözülmesi, üretimi bu kadar yavaş yapan şeydir, çünkü milyonlarca ses örneğinin sırayla üretilmesi gerekir.

Stratejik Etki

Access and reach

Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.

Maliyet ve bütçe

Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.

Speed and scale

Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.

Jukebox'ın Geleceği

Jukebox'ın kendisi artık büyük ölçüde tarihi bir dönüm noktasıdır; yerini Suno ve Udio'nun arkasındaki gibi saniyeler içinde CD kalitesine yakın şarkılar üreten daha hızlı yayılma ve gizli ses modellerine bırakmıştır. Temel fikirleri (ayrı ses belirteçleri ve şarkı sözlerinin koşullandırılması) modern sistemlerde varlığını sürdürüyor. Gelecekteki ham ses modellerinin üretim süresini kısaltmaya devam etmesini, ses netliğini keskinleştirmesini ve ince kontroller eklemesini beklerken, Jukebox'un telif hakkıyla korunan kayıtlarla ilgili eğitim hakkında ilk kez gündeme getirdiği telif hakkı soruları yalnızca daha yüksek sesle büyüyor.

Gerçek Dünya Uygulaması

Jukebox'ı referans mimarisi olarak kullanarak sinir ağlarının uzun biçimli ham ses ve şarkı söyleme seslerini nasıl modelleyebileceğini inceleyen araştırmacılar.

Müzisyenler ve amatörler, seçilmiş bir sanatçının kaba üslubuyla yeni şarkı sözleri söyleyen ürkütücü, lo-fi "AI cover'ları" üretiyor.

MIDI tarzı nota üretiminden vokallerle tam ham ses sentezine geçişi gösteren eğitimciler.

Ses tasarımcıları ve deneysel sanatçılar, Jukebox'ın puslu, rüya gibi dokularını remix ve kolaj için hammadde olarak kullanıyor.

Riskler ve Korkuluklar

Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.

Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.

Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.

Uygulama Yol Haritası

1

Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.

2

Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.

3

Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.

4

Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Sembolik Müzik Üretimi

Sık sorulan sorular

What is Jukebox?

Jukebox, OpenAI'nin şarkı sesleri, enstrümanlar ve hatta belirli sanatçıların tarzında şarkı sözleriyle tamamlanan ham müzik sesi üreten 2020 sinir ağıdır. Bu, yapay zekanın yalnızca notaları değil, şarkı uzunluğundaki müziğin gerçek dalga biçimini de modelleyebildiğinin dönüm noktası niteliğindeki bir kanıtıydı.

Jukebox'ı daha önceki sembolik müzik yapay zekası benzeri, MIDI çıkışı sağlayan sistemlerden farklı kılan şey nedir?

Jukebox, müziğin gerçek sesini ham ses olarak modelliyor, böylece yalnızca nota verileri çıkaran sembolik sistemlerin aksine, vokal ve enstrüman tınıları üretebiliyor.

Jukebox'ı kim ve yaklaşık olarak ne zaman piyasaya sürdü?

OpenAI, vokallerle müzik oluşturmaya yönelik bir araştırma modeli olarak Nisan 2020'de Jukebox'ı piyasaya sürdü.

Jukebox'ın önemli bir pratik sınırlaması neydi?

Ham ses örneklerinin kodunu örnek bazında çözdüğü için Jukebox'ın tek bir dakikalık müzik üretmesi yaklaşık dokuz saat sürdü ve bu da onu gerçek zamanlı kullanım için kullanışsız hale getiriyordu.

Jukebox, uzun ham sesi Transformers'ları için yönetilebilir hale getirmek için hangi temel tekniği kullanıyor?

Jukebox, dalga biçimini ayrı belirteçler halinde sıkıştırmak için VQ-VAE otomatik kodlayıcıları kullanır; Transformers daha sonra bunları sese geri örneklemeden önce otomatik regresif olarak modeller.

Jukebox'ın çıktısını neye göre koşullandırabilirsiniz?

Jukebox bir türü, taklit edilecek bir sanatçıyı ve şarkı sözlerini kabul eder ve bu sözleri o tarzda söylemeye çalışacaktır.