kotak juke
Jukebox adalah jaringan saraf OpenAI tahun 2020 yang menghasilkan audio musik mentah — lengkap dengan suara nyanyian, instrumen, dan bahkan lirik dengan gaya artis tertentu.
Ikhtisar
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
Menyelam Lebih Dalam
Dirilis oleh OpenAI pada bulan April 2020, Jukebox menghasilkan musik sebagai audio mentah, bukan not simbolis, artinya menghasilkan suara sebenarnya termasuk vokal. Itu dilatih pada sekitar 1,2 juta lagu (sekitar setengah berbahasa Inggris) yang diambil dari web, dipasangkan dengan lirik dan metadata dari LyricWiki. Anda dapat mengkondisikannya berdasarkan genre, gaya artis, dan lirik, dan lagu tersebut akan bernyanyi dengan mudah dikenali (meskipun samar-samar) seperti artis tersebut. Output berjalan selama beberapa menit. Kuncinya adalah kecepatan dan ketepatan: pembuatannya sangat lambat, memerlukan waktu sekitar sembilan jam untuk merender satu menit audio, dan hasilnya memiliki kualitas yang teredam dan berisik. Jukebox adalah penelitian, bukan produk yang sempurna, namun ia membentuk kembali harapan akan apa yang mungkin terjadi.
Wawasan Teknis
Jukebox mengompresi audio mentah menggunakan autoencoder VQ-VAE pada tiga resolusi waktu, mengubah bentuk gelombang panjang menjadi rangkaian kode diskrit yang jauh lebih pendek. Transformer Autoregressive kemudian memprediksi kode-kode ini satu per satu, berdasarkan artis, genre, dan lirik, dan upsampler menambahkan detail frekuensi tinggi. Mendekode kode tingkat bawah kembali ke bentuk gelombang 44,1 kHz membuat pembangkitan menjadi sangat lambat, karena jutaan sampel audio harus diproduksi secara berurutan.
Dampak Strategis
Access and reach
Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.
Cost and budget
Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.
Kecepatan dan skala
Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.
Masa Depan Jukebox
Jukebox sendiri merupakan tonggak sejarah saat ini, digantikan oleh difusi yang lebih cepat dan model audio laten seperti yang ada di belakang Suno dan Udio yang menghasilkan lagu-lagu berkualitas mendekati CD dalam hitungan detik. Ide intinya — token audio terpisah dan pengondisian lirik — tetap hidup dalam sistem modern. Harapkan model audio mentah di masa depan akan terus mempersingkat waktu pembuatan, mempertajam kejernihan vokal, dan menambahkan kontrol yang baik, sementara pertanyaan hak cipta yang pertama kali diajukan Jukebox tentang pelatihan rekaman berhak cipta semakin keras.
Implementasi Dunia Nyata
Para peneliti mempelajari bagaimana jaringan saraf dapat memodelkan audio mentah dan suara nyanyian dalam bentuk panjang, menggunakan Jukebox sebagai arsitektur referensi.
Musisi dan penghobi membuat 'cover AI' lo-fi yang menakutkan dan menyanyikan lirik baru dengan gaya kasar artis terpilih.
Pendidik mendemonstrasikan lompatan dari pembuatan nada bergaya MIDI ke sintesis audio mentah penuh dengan vokal.
Desainer suara dan seniman eksperimental memanfaatkan tekstur Jukebox yang kabur dan seperti mimpi sebagai bahan mentah untuk remix dan kolase.
Risiko & Pagar Pembatas
Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.
Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.
Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.
Peta Jalan Implementasi
Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.
Uji kualitas di beragam speaker dan kondisi latar belakang.
Tentukan kapan manusia harus meninjau atau menyetujui keluaran.
Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Generasi Musik Simbolik
Pertanyaan yang sering diajukan
What is Jukebox?
Jukebox adalah jaringan saraf OpenAI tahun 2020 yang menghasilkan audio musik mentah — lengkap dengan suara nyanyian, instrumen, dan bahkan lirik dengan gaya artis tertentu. Ini adalah bukti penting bahwa AI dapat memodelkan bentuk gelombang sebenarnya dari musik sepanjang lagu, bukan hanya not.
Apa yang membuat Jukebox berbeda dari sistem seperti AI musik simbolik sebelumnya yang menghasilkan MIDI?
Jukebox memodelkan suara musik yang sebenarnya sebagai audio mentah, sehingga dapat menghasilkan vokal dan warna nada instrumen, tidak seperti sistem simbolik yang hanya mengeluarkan data nada.
Siapa yang merilis Jukebox dan kira-kira kapan?
OpenAI merilis Jukebox pada bulan April 2020 sebagai model penelitian untuk menghasilkan musik dengan vokal.
Apa batasan praktis utama dari Jukebox?
Karena menerjemahkan sampel audio mentah demi sampel, Jukebox membutuhkan waktu sembilan jam untuk menghasilkan satu menit musik, sehingga tidak praktis untuk penggunaan waktu nyata.
Teknik inti apa yang digunakan Jukebox agar audio mentah panjang dapat dikelola untuk Transformers-nya?
Jukebox menggunakan autoencoder VQ-VAE untuk mengompresi bentuk gelombang menjadi token diskrit, yang kemudian dimodelkan oleh Transformers secara otomatis sebelum ditingkatkan sampelnya kembali ke audio.
Pada apa Anda dapat mengkondisikan keluaran Jukebox?
Jukebox menerima genre, artis untuk ditiru, dan lirik, dan akan mencoba menyanyikan kata-kata tersebut dengan gaya tersebut.