PANDUAN Audio AI

MusicLM: Token Semantik dan Akustik Hierarki

MusicLM adalah model teks-ke-musik Google yang menghasilkan audio bentuk panjang melalui hierarki token semantik untuk struktur musik dan token akustik untuk detail suara.

2 min readTerakhir diperbarui

Menyelam Lebih Dalam

Diumumkan oleh Google Penelitian pada awal tahun 2023, MusicLM membingkai generasi musik sebagai prediksi rangkaian token audio terpisah, seperti model bahasa yang memprediksi kata-kata. Ia menggunakan hierarki representasi: token semantik (dari model yang disebut w2v-BERT) menangkap struktur tingkat tinggi seperti melodi dan ritme dalam rentang waktu yang lama, sementara token akustik (dari codec saraf SoundStream) menangkap detail halus seperti timbre dan tekstur. Tahap pertama menghasilkan token semantik dari perintah teks, kemudian tahap selanjutnya mengisi detail akustik yang dikondisikan pada semantik tersebut. Pengkondisian teks berasal dari MuLM/MuLan, penyematan teks-musik gabungan yang dilatih sehingga deskripsi dan audio mendarat di ruang yang sama. Pendekatan bertahap ini memungkinkan MusicLM tetap konsisten secara musikal selama beberapa menit, bukannya melayang setelah beberapa detik.

Wawasan Teknis

Ide utamanya adalah memisahkan struktur dari tekstur di seluruh hierarki token. Token semantik kasar jarang dan lambat berubah, sehingga Transformer dapat memodelkan bentuk jangka panjang tanpa panjang urutan yang besar. Token akustik padat dan berkecepatan tinggi, tetapi token tersebut hanya perlu diprediksi berdasarkan semantik yang sudah tetap, sehingga setiap tahapan dapat dilakukan. Kuantisasi vektor sisa SoundStream menghasilkan kode akustik berlapis yang diubah kembali oleh dekoder akhir menjadi bentuk gelombang 24 kHz.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan MusicLM: Token Semantik dan Akustik Hierarki

Pendekatan token hierarki MusicLM menjadi templat untuk sistem selanjutnya seperti MusicGen dan alat musik komersial. Harapkan pengondisian melodi yang lebih ketat (senandungkan sebuah lagu, dapatkan aransemen lengkap), lagu yang lebih panjang dan terstruktur penuh dengan bait dan chorus, serta kemampuan kontrol yang lebih baik terhadap instrumen dan kunci. Masalah peliknya adalah masalah hukum dan etika: perizinan data pelatihan, persetujuan artis, dan pemberian tanda air pada audio yang dihasilkan sehingga dapat dibedakan dari musik buatan manusia kini menjadi hal yang penting dalam penerapannya.

Implementasi Dunia Nyata

Mengubah deskripsi adegan tertulis menjadi skor film atau trailer, misalnya. 'pembangunan orkestra epik dengan paduan suara'

Menghasilkan musik latar yang dikondisikan pada keterangan gambar atau bahkan deskripsi lukisan untuk instalasi seni

Memperluas melodi pendek yang bersenandung atau bersiul menjadi aransemen yang berinstrumen lengkap

Memproduksi beragam trek musik stok dengan tempo dan suasana berbeda untuk periklanan dan pembuat konten

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Generasi Musik Simbolik

Pertanyaan yang sering diajukan

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM adalah model teks-ke-musik Google yang menghasilkan audio bentuk panjang melalui hierarki token semantik untuk struktur musik dan token akustik untuk detail suara.

Bagaimana MusicLM secara mendasar menangani tugas menghasilkan musik?

MusicLM membingkai pembuatan musik sebagai prediksi autoregresif atas token audio terpisah, mirip dengan cara model bahasa memprediksi kata.

Apa peran token semantik di MusicLM?

Token semantik (dari w2v-BERT) menangkap struktur kasar yang berubah secara perlahan seperti melodi dan ritme dalam rentang waktu yang lama.

Komponen manakah yang memberikan detail akustik halus seperti timbre dan tekstur?

Token akustik berasal dari codec saraf SoundStream dan mengkodekan detail halus seperti timbre dan tekstur.

Bagaimana MusicLM menghubungkan prompt teks ke audio musik?

MuLan dilatih agar deskripsi teks dan pencocokan peta audio ke titik terdekat di ruang penyematan bersama, memungkinkan pengondisian teks.

Mengapa desain yang hierarkis dan bertahap membantu struktur jangka panjang?

Token semantik yang jarang berubah secara perlahan, sehingga Transformer dapat memodelkan bentuk jangka panjang secara efisien sebelum detail akustik yang padat terisi.