Jenderal Musik
MusicGen adalah model AI Meta yang menghasilkan musik dari deskripsi teks, dan secara opsional melodi yang Anda senandungkan atau unggah.
Ikhtisar
It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.
Menyelam Lebih Dalam
Dirilis oleh Meta AI pada tahun 2023 sebagai bagian dari proyek AudioCraft, MusicGen mengubah perintah seperti 'lagu synth-pop tahun 80-an yang ceria dengan garis bass yang menggetarkan' menjadi klip musik berdurasi sekitar 12 detik (dapat diperpanjang). Tidak seperti sistem multi-tahap, MusicGen menggunakan model bahasa Transformer tunggal yang memprediksi token audio yang dihasilkan oleh codec saraf EnCodec Meta. Kontribusi cerdasnya adalah pola interleaving token (disebut interleaving penundaan) yang memungkinkan satu model menangani beberapa aliran token paralel EnCodec secara efisien, menghindari rangkaian model terpisah yang memerlukan pendekatan sebelumnya. MusicGen dapat dikendalikan dengan dua cara sekaligus: dengan deskripsi teks dan melodi referensi, sehingga Anda dapat meminta 'versi jazz' dari lagu yang Anda senandungkan. Meta merilis kode dan bobot secara terbuka, sehingga memicu gelombang alat dan eksperimen komunitas.
Wawasan Teknis
MusicGen mewakili audio sebagai aliran paralel token diskrit dari codec EnCodec, setiap aliran menangkap detail berbeda. Daripada memodelkan streaming dengan model terpisah, MusicGen menyisipkannya dengan penundaan terkontrol sehingga satu Transformer autoregresif memprediksinya dalam satu lintasan. Pengkondisian teks berasal dari encoder teks T5, sedangkan pengkondisian melodi opsional menggunakan kromagram (profil kelas nada audio) sehingga model mengikuti nada tanpa menyalin rekaman persisnya.
Dampak Strategis
Access and reach
Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.
Cost and budget
Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.
Kecepatan dan skala
Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.
Masa Depan MusikGen
Rilisan terbuka MusicGen menetapkan dasar yang ingin dicapai oleh penerusnya dengan output stereo yang lebih panjang, fidelitas lebih tinggi, dan kontrol yang lebih baik terhadap struktur, instrumentasi, dan bagian lagu. Harapkan integrasi yang lebih erat ke dalam perangkat lunak produksi musik, pembuatan interaktif waktu nyata, dan alat yang lebih baik untuk mengedit atau memperluas trek yang ada. Seperti halnya musik generatif lainnya, hal ini mempertajam pertanyaan tentang hak cipta data pelatihan, kompensasi artis, dan cara memberi label pada lagu yang dihasilkan AI di pasar yang kebanjiran.
Implementasi Dunia Nyata
Menghasilkan musik latar bebas royalti untuk video YouTube dari perintah teks
Menyenandungkan melodi dan meminta MusicGen untuk mengaransemen orkestra lengkapnya
Pengembang game membuat prototipe soundtrack level dalam genre berbeda dengan cepat
Peneliti dan penghobi menjalankan bobot sumber terbuka untuk bereksperimen dengan teks-ke-musik
Risiko & Pagar Pembatas
Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.
Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.
Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.
Peta Jalan Implementasi
Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.
Uji kualitas di beragam speaker dan kondisi latar belakang.
Tentukan kapan manusia harus meninjau atau menyetujui keluaran.
Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MusicGen quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Penyelarasan yang Dipaksa
Pertanyaan yang sering diajukan
What is MusicGen?
MusicGen adalah model AI Meta yang menghasilkan musik dari deskripsi teks, dan secara opsional melodi yang Anda senandungkan atau unggah. Hal ini penting karena hal ini menempatkan kreasi musik yang berkualitas tinggi dan dapat dikontrol ke dalam satu model yang dirilis secara terbuka sehingga dapat dijalankan oleh para penghobi dan peneliti.
Dua jenis masukan apa yang dapat mengarahkan MusicGen secara bersamaan?
MusicGen menerima perintah teks dan, opsional, melodi, sehingga Anda dapat meminta versi gaya lagu yang Anda berikan.
Codec saraf manakah yang menghasilkan token audio yang diprediksi oleh MusicGen?
MusicGen memodelkan token terpisah yang dihasilkan oleh codec EnCodec Meta, yang juga menerjemahkan token yang diprediksi kembali menjadi audio.
Apa penyederhanaan arsitektur utama MusicGen dibandingkan pendekatan sebelumnya?
Dengan menyisipkan aliran token paralel EnCodec dengan penundaan terkontrol, satu Transformer autoregresif dapat memodelkannya dalam satu lintasan, menghindari rangkaian model.
Bagaimana cara MusicGen mengikuti melodi yang disediakan tanpa menyalin rekaman persisnya?
Kromagram menangkap kelas nada mana yang muncul dari waktu ke waktu, sehingga MusicGen dapat mencocokkan harmoni dan kontur lagu tanpa mereproduksi timbre aslinya.
Proyek dan perusahaan mana yang merilis MusicGen?
MusicGen dirilis pada tahun 2023 sebagai bagian dari proyek AudioCraft Meta AI, dengan kode terbuka dan bobot model.