Müzik kutusu
Jukebox, OpenAI'nin şarkı sesleri, enstrümanlar ve hatta belirli sanatçıların tarzında şarkı sözleriyle tamamlanan ham müzik sesi üreten 2020 sinir ağıdır.
Genel Bakış
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
Derin Dalış
OpenAI tarafından Nisan 2020'de piyasaya sürülen Jukebox, müziği sembolik notalar yerine ham ses olarak üretir; bu, vokaller de dahil olmak üzere gerçek sesi ürettiği anlamına gelir. Web'den alınan yaklaşık 1,2 milyon şarkı (yaklaşık yarısı İngilizce) ve LyricWiki'den şarkı sözleri ve meta verilerle eşleştirilerek eğitildi. Bunu bir türe, sanatçı tarzına ve şarkı sözlerine göre koşullandırabilirsiniz ve o da o sanatçı gibi (bulanık da olsa) tanınabilir bir şekilde şarkı söyleyecektir. Çıkışlar birkaç dakika uzunluğunda çalışır. İşin püf noktası hız ve doğruluktur: Üretim son derece yavaştı, tek bir dakikalık sesin işlenmesi yaklaşık dokuz saat sürüyordu ve sonuçlar boğuk, gürültülü bir kaliteye sahipti. Jukebox gösterişli bir ürün değil, bir araştırmaydı ancak mümkün olana dair beklentileri yeniden şekillendirdi.
Teknik Bilgi
Jukebox, ham sesi üç zamanlı çözünürlükte VQ-VAE otomatik kodlayıcıları kullanarak sıkıştırarak uzun bir dalga biçimini çok daha kısa ayrık kod dizisine dönüştürür. Otoregresif Transformatörler daha sonra bu kodları sanatçıya, türe ve şarkı sözlerine göre teker teker tahmin eder ve üst örnekleyiciler yüksek frekanslı ayrıntılar ekler. Alt düzey kodların 44,1 kHz dalga biçimine geri çözülmesi, üretimi bu kadar yavaş yapan şeydir, çünkü milyonlarca ses örneğinin sırayla üretilmesi gerekir.
Stratejik Etki
Access and reach
Transkripsiyon, anlatım ve ses arayüzleri aracılığıyla erişilebilirliği artırır.
Maliyet ve bütçe
Medya ekipleri daha küçük bütçelerle daha iyi ses kalitesi sunabilir.
Speed and scale
Müşteriyle yüz yüze olan sistemler, sözlü etkileşimleri daha büyük ölçekte işleyebilir.
Jukebox'ın Geleceği
Jukebox'ın kendisi artık büyük ölçüde tarihi bir dönüm noktasıdır; yerini Suno ve Udio'nun arkasındaki gibi saniyeler içinde CD kalitesine yakın şarkılar üreten daha hızlı yayılma ve gizli ses modellerine bırakmıştır. Temel fikirleri (ayrı ses belirteçleri ve şarkı sözlerinin koşullandırılması) modern sistemlerde varlığını sürdürüyor. Gelecekteki ham ses modellerinin üretim süresini kısaltmaya devam etmesini, ses netliğini keskinleştirmesini ve ince kontroller eklemesini beklerken, Jukebox'un telif hakkıyla korunan kayıtlarla ilgili eğitim hakkında ilk kez gündeme getirdiği telif hakkı soruları yalnızca daha yüksek sesle büyüyor.
Gerçek Dünya Uygulaması
Jukebox'ı referans mimarisi olarak kullanarak sinir ağlarının uzun biçimli ham ses ve şarkı söyleme seslerini nasıl modelleyebileceğini inceleyen araştırmacılar.
Müzisyenler ve amatörler, seçilmiş bir sanatçının kaba üslubuyla yeni şarkı sözleri söyleyen ürkütücü, lo-fi "AI cover'ları" üretiyor.
MIDI tarzı nota üretiminden vokallerle tam ham ses sentezine geçişi gösteren eğitimciler.
Ses tasarımcıları ve deneysel sanatçılar, Jukebox'ın puslu, rüya gibi dokularını remix ve kolaj için hammadde olarak kullanıyor.
Riskler ve Korkuluklar
Onay eksik olduğunda sesin kötüye kullanılması ve kimliğe bürünme riskleri artar.
Aksanlar, lehçeler veya gürültülü ortamlarda doğruluk düşebilir.
Sentetik ses, net bir etiketleme olmadan, orijinal konuşmayla karıştırılabilir.
Uygulama Yol Haritası
Sesin yakalanması, klonlanması ve yeniden kullanılması için açık izin alın.
Kaliteyi farklı hoparlörler ve arka plan koşullarında test edin.
Bir insanın çıktıları ne zaman incelemesi veya onaylaması gerektiğini tanımlayın.
Sentetik sesi etiketleyin ve sorumluluk için kaynak kayıtlarını saklayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Sembolik Müzik Üretimi
Sık sorulan sorular
What is Jukebox?
Jukebox, OpenAI'nin şarkı sesleri, enstrümanlar ve hatta belirli sanatçıların tarzında şarkı sözleriyle tamamlanan ham müzik sesi üreten 2020 sinir ağıdır. Bu, yapay zekanın yalnızca notaları değil, şarkı uzunluğundaki müziğin gerçek dalga biçimini de modelleyebildiğinin dönüm noktası niteliğindeki bir kanıtıydı.
Jukebox'ı daha önceki sembolik müzik yapay zekası benzeri, MIDI çıkışı sağlayan sistemlerden farklı kılan şey nedir?
Jukebox, müziğin gerçek sesini ham ses olarak modelliyor, böylece yalnızca nota verileri çıkaran sembolik sistemlerin aksine, vokal ve enstrüman tınıları üretebiliyor.
Jukebox'ı kim ve yaklaşık olarak ne zaman piyasaya sürdü?
OpenAI, vokallerle müzik oluşturmaya yönelik bir araştırma modeli olarak Nisan 2020'de Jukebox'ı piyasaya sürdü.
Jukebox'ın önemli bir pratik sınırlaması neydi?
Ham ses örneklerinin kodunu örnek bazında çözdüğü için Jukebox'ın tek bir dakikalık müzik üretmesi yaklaşık dokuz saat sürdü ve bu da onu gerçek zamanlı kullanım için kullanışsız hale getiriyordu.
Jukebox, uzun ham sesi Transformers'ları için yönetilebilir hale getirmek için hangi temel tekniği kullanıyor?
Jukebox, dalga biçimini ayrı belirteçler halinde sıkıştırmak için VQ-VAE otomatik kodlayıcıları kullanır; Transformers daha sonra bunları sese geri örneklemeden önce otomatik regresif olarak modeller.
Jukebox'ın çıktısını neye göre koşullandırabilirsiniz?
Jukebox bir türü, taklit edilecek bir sanatçıyı ve şarkı sözlerini kabul eder ve bu sözleri o tarzda söylemeye çalışacaktır.