Kotak Juke
Jukebox ialah rangkaian neural OpenAI 2020 yang menjana audio muzik mentah — lengkap dengan suara nyanyian, instrumen dan juga lirik dalam gaya artis tertentu.
Gambaran keseluruhan
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
Menyelam dalam
Dikeluarkan oleh OpenAI pada April 2020, Jukebox menjana muzik sebagai audio mentah dan bukannya nota simbolik, bermakna ia menghasilkan bunyi sebenar termasuk vokal. Ia dilatih mengenai kira-kira 1.2 juta lagu (kira-kira separuh bahasa Inggeris) yang dikikis daripada web, dipasangkan dengan lirik dan metadata daripada LyricWiki. Anda boleh menetapkannya pada genre, gaya artis dan lirik, dan ia akan menyanyi dengan jelas (jika samar-samar) seperti artis itu. Output berjalan selama beberapa minit. Tangkapan adalah kepantasan dan kesetiaan: penjanaan adalah sangat perlahan, mengambil masa kira-kira sembilan jam untuk menghasilkan satu minit audio, dan hasilnya mempunyai kualiti yang bising dan bising. Jukebox adalah penyelidikan, bukan produk yang digilap, tetapi ia membentuk semula jangkaan untuk apa yang mungkin.
Wawasan Teknikal
Jukebox memampatkan audio mentah menggunakan pengekod automatik VQ-VAE pada resolusi tiga kali, menukar bentuk gelombang panjang kepada urutan kod diskret yang lebih pendek. Autoregressive Transformers kemudian meramalkan kod ini satu demi satu, berkondisi pada artis, genre dan lirik, dan upsampler menambah perincian frekuensi tinggi. Penyahkodan kod peringkat bawah kembali kepada bentuk gelombang 44.1 kHz adalah yang menjadikan penjanaan begitu perlahan, kerana berjuta-juta sampel audio mesti dihasilkan secara berurutan.
Kesan Strategik
Akses dan capai
Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.
Kos dan bajet
Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.
Kelajuan dan skala
Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.
Masa Depan Jukebox
Jukebox itu sendiri sebahagian besarnya merupakan peristiwa penting sekarang, digantikan oleh model resapan dan audio terpendam yang lebih pantas seperti yang terdapat di belakang Suno dan Udio yang menjana lagu berkualiti hampir CD dalam beberapa saat. Idea terasnya — token audio diskret dan penyesuaian pada lirik — hidup dalam sistem moden. Jangkakan model audio mentah masa hadapan untuk terus mengecilkan masa penjanaan, mempertajam kejelasan vokal dan menambah kawalan yang halus, manakala soalan hak cipta yang pertama kali dibangkitkan Jukebox tentang latihan mengenai rakaman berhak cipta semakin kuat.
Pelaksanaan Dunia Sebenar
Penyelidik mengkaji bagaimana rangkaian saraf boleh memodelkan audio mentah dan suara nyanyian dalam bentuk panjang, menggunakan Jukebox sebagai seni bina rujukan.
Pemuzik dan penghobi menghasilkan 'liputan AI' yang menakutkan dan lo-fi yang menyanyikan lirik baharu dalam gaya kasar artis pilihan.
Pendidik menunjukkan lonjakan daripada penjanaan nota gaya MIDI kepada sintesis audio mentah penuh dengan vokal.
Pereka bentuk bunyi dan artis eksperimen menuai tekstur kabur Jukebox, seperti mimpi sebagai bahan mentah untuk pengadunan semula dan kolaj.
Risiko & Pengawal
Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.
Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.
Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.
Hala Tuju Pelaksanaan
Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.
Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.
Tentukan bila manusia mesti menyemak atau meluluskan output.
Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Penjanaan Muzik Simbolik
Soalan lazim
What is Jukebox?
Jukebox ialah rangkaian neural OpenAI 2020 yang menjana audio muzik mentah — lengkap dengan suara nyanyian, instrumen dan juga lirik dalam gaya artis tertentu. Ia adalah bukti penting bahawa AI boleh memodelkan bentuk gelombang sebenar muzik panjang lagu, bukan hanya nota.
Apakah yang membuatkan Jukebox berbeza daripada muzik simbolik terdahulu AI seperti sistem yang mengeluarkan MIDI?
Jukebox memodelkan bunyi sebenar muzik sebagai audio mentah, jadi ia boleh menghasilkan vokal dan timbre instrumen, tidak seperti sistem simbolik yang hanya mengeluarkan data nota.
Siapa yang mengeluarkan Jukebox dan kira-kira bila?
OpenAI mengeluarkan Jukebox pada April 2020 sebagai model penyelidikan untuk menjana muzik dengan vokal.
Apakah had praktikal utama Jukebox?
Kerana ia menyahkod sampel audio mentah mengikut sampel, Jukebox mengambil urutan sembilan jam untuk menghasilkan satu minit muzik, menjadikannya tidak praktikal untuk penggunaan masa nyata.
Apakah teknik teras yang digunakan Jukebox untuk menjadikan audio mentah yang panjang boleh diurus untuk Transformersnya?
Jukebox menggunakan pengekod auto VQ-VAE untuk memampatkan bentuk gelombang menjadi token diskret, yang kemudiannya dimodelkan oleh Transformers secara autoregresif sebelum menaikkan pensampelan semula kepada audio.
Apakah yang boleh anda syaratkan pada output Jukebox?
Jukebox menerima genre, artis untuk ditiru, dan lirik, dan akan cuba menyanyikan perkataan itu dalam gaya itu.