PANDUAN AI Audio

MusicGen

MusicGen ialah model AI Meta yang menjana muzik daripada perihalan teks, dan secara pilihan melodi yang anda dendangkan atau muat naik.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Menyelam dalam

Dikeluarkan oleh Meta AI pada tahun 2023 sebagai sebahagian daripada projek AudioCraft, MusicGen menukar gesaan seperti 'lagu synth-pop 80-an yang ceria dengan garis bass yang memacu' menjadi klip muzik selama kira-kira 12 saat (boleh dilanjutkan). Tidak seperti sistem berbilang peringkat, MusicGen menggunakan model bahasa Transformer tunggal yang meramalkan token audio yang dihasilkan oleh codec neural EnCodec Meta. Sumbangan bijaknya ialah corak selang token (dipanggil selang kelewatan) yang membolehkan satu model mengendalikan berbilang aliran token selari EnCodec dengan cekap, mengelakkan rangkaian model berasingan yang memerlukan pendekatan lebih awal. MusicGen boleh dipandu dua cara sekali gus: dengan penerangan teks dan melodi rujukan, jadi anda boleh meminta 'versi jazz' lagu yang anda dendangkan. Meta mengeluarkan kod dan pemberat secara terbuka, menyemarakkan gelombang alat komuniti dan eksperimen.

Wawasan Teknikal

MusicGen mewakili audio sebagai aliran selari token diskret daripada codec EnCodec, setiap aliran menangkap butiran berbeza. Daripada memodelkan strim dengan model yang berasingan, MusicGen menyelitkannya dengan kelewatan terkawal supaya Transformer autoregresif tunggal meramalkannya dalam satu laluan. Pelaziman teks berasal daripada pengekod teks T5, manakala pelaziman melodi pilihan menggunakan krogram (profil kelas nada audio) supaya model mengikuti lagu tanpa menyalin rakaman tepatnya.

Kesan Strategik

Akses dan capai

Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.

Kos dan bajet

Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.

Kelajuan dan skala

Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.

Masa Depan MusicGen

Keluaran terbuka MusicGen menetapkan garis dasar yang disasarkan oleh pengganti dengan output stereo yang lebih panjang, ketepatan yang lebih tinggi, serta kawalan yang lebih halus ke atas bahagian struktur, instrumentasi dan lagu. Jangkakan penyepaduan yang lebih ketat ke dalam perisian pengeluaran muzik, penjanaan interaktif masa nyata dan alatan yang lebih baik untuk mengedit atau melanjutkan trek sedia ada. Seperti semua muzik generatif, ia mempertajam soalan tentang hak cipta data latihan, pampasan artis dan cara melabelkan lagu yang dijana AI dalam pasaran yang dibanjiri.

Pelaksanaan Dunia Sebenar

Menjana muzik latar belakang tanpa royalti untuk video YouTube daripada gesaan teks

Menyenandungkan melodi dan meminta MusicGen untuk susunan orkestra penuh

Pembangun permainan membuat prototaip runut bunyi peringkat dalam genre yang berbeza dengan cepat

Penyelidik dan penggemar menjalankan pemberat sumber terbuka untuk bereksperimen dengan teks-ke-muzik

Risiko & Pengawal

Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.

Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.

Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.

Hala Tuju Pelaksanaan

1

Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.

2

Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.

3

Tentukan bila manusia mesti menyemak atau meluluskan output.

4

Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Penjajaran Paksa

Soalan lazim

What is MusicGen?

MusicGen ialah model AI Meta yang menjana muzik daripada perihalan teks, dan secara pilihan melodi yang anda dendangkan atau muat naik. Ia penting kerana ia meletakkan ciptaan muzik yang berkualiti tinggi dan boleh dikawal ke dalam model tunggal yang dikeluarkan secara terbuka yang sebenarnya boleh dijalankan oleh penggemar dan penyelidik.

Apakah dua jenis input yang boleh mengemudi MusicGen pada masa yang sama?

MusicGen menerima gesaan teks dan, secara pilihan, melodi, supaya anda boleh meminta versi gaya bagi lagu yang anda sediakan.

Codec saraf manakah yang menghasilkan token audio yang diramalkan MusicGen?

MusicGen model token diskret yang dijana oleh codec EnCodec Meta, yang juga menyahkod token yang diramalkan kembali ke dalam audio.

Apakah penyederhanaan seni bina utama MusicGen berbanding pendekatan terdahulu?

Dengan mencampurkan aliran token selari EnCodec dengan kelewatan terkawal, satu Transformer autoregresif boleh memodelkannya dalam satu laluan, mengelakkan rangkaian model.

Bagaimanakah MusicGen mengikut melodi yang disediakan tanpa menyalin rakaman yang tepat?

Kromagram menangkap kelas nada yang hadir dari semasa ke semasa, membenarkan MusicGen memadankan harmoni dan kontur lagu tanpa menghasilkan semula timbre asal.

Projek dan syarikat manakah yang mengeluarkan MusicGen?

MusicGen telah dikeluarkan pada tahun 2023 sebagai sebahagian daripada projek AudioCraft AI Meta, dengan kod terbuka dan berat model.