AudioLM
AudioLM adalah kerangka penelitian Google yang menghasilkan audio realistis — ucapan atau musik piano — dengan memperlakukan suara seperti bahasa dan memprediksinya sedikit demi sedikit.
Ikhtisar
It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.
Menyelam Lebih Dalam
Diperkenalkan oleh Google pada tahun 2022, AudioLM mengubah pembuatan audio sebagai masalah pemodelan bahasa: AudioLM mengubah bentuk gelombang mentah menjadi token terpisah dan kemudian memprediksi token berikutnya, seperti model teks yang memprediksi kata berikutnya. Trik utamanya adalah hierarki tipe token. Token 'Semantik' (dari model seperti w2v-BERT) menangkap struktur jangka panjang — fonetik, sintaksis, melodi — sedangkan token 'akustik' (dari codec saraf SoundStream) menangkap detail halus seperti identitas pembicara, timbre, dan kondisi perekaman. Dengan terlebih dahulu memprediksi token semantik, lalu mengkondisikan token akustik pada token tersebut, AudioLM menghasilkan kelanjutan yang tetap koheren selama beberapa detik sambil mempertahankan suara atau instrumen aslinya. Mengingat beberapa detik pidatonya, ia terus berbicara dengan suara yang sama; diberikan piano, ia berimprovisasi dengan gaya yang sama.
Wawasan Teknis
AudioLM dilatih murni pada audio — tanpa transkrip. SoundStream memampatkan audio menjadi token akustik melalui kuantisasi vektor sisa, sementara w2v-BERT memasok token semantik kasar. Tumpukan model bahasa Transformer memprediksi token secara bertahap: semantik terlebih dahulu untuk struktur, kemudian token akustik kasar dan halus untuk rekonstruksi fidelitas tinggi. Dekoder SoundStream akhirnya mengubah token yang diprediksi kembali menjadi bentuk gelombang, menghasilkan audio yang menjaga konsistensi suara dan prosodi pembicara.
Dampak Strategis
Access and reach
Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.
Cost and budget
Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.
Kecepatan dan skala
Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.
Masa Depan AudioLM
Resep berbasis token AudioLM menjadi fondasi untuk sistem selanjutnya: ide AudioLM Google dimasukkan ke dalam MusicLM untuk teks-ke-musik dan SoundStorm untuk pembuatan yang lebih cepat, sementara bidang yang lebih luas kini memadukan token semantik dan akustik di seluruh ucapan, musik, dan efek suara. Harapkan pembangkitan yang lebih cepat dan real-time, keluaran koheren yang lebih panjang, dan kontrol multimodal di mana teks atau sinyal lainnya mengarahkan model yang dilatih secara audio. Teknik yang sama juga mempertajam kekhawatiran tentang kloning suara dan audio deepfake.
Implementasi Dunia Nyata
Melanjutkan klip pidato pendek dengan suara dan intonasi pembicara yang sama tanpa transkrip
Improvisasi musik piano baru yang sesuai dengan gaya rekaman singkat
Berfungsi sebagai tulang punggung pembuatan audio untuk sistem teks-ke-musik seperti MusicLM
Penelitian sintesis ucapan yang mempertahankan prosodi dan rekaman akustik dari sampel
Risiko & Pagar Pembatas
Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.
Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.
Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.
Peta Jalan Implementasi
Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.
Uji kualitas di beragam speaker dan kondisi latar belakang.
Tentukan kapan manusia harus meninjau atau menyetujui keluaran.
Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pencarian Kata Kunci dan Kata Bangun
Pertanyaan yang sering diajukan
What is AudioLM?
AudioLM adalah kerangka penelitian Google yang menghasilkan audio realistis — ucapan atau musik piano — dengan memperlakukan suara seperti bahasa dan memprediksinya sedikit demi sedikit. Hal ini penting karena hal ini menunjukkan bahwa Anda dapat menghasilkan kelanjutan audio yang koheren dan terdengar alami tanpa transkrip teks atau partitur musik apa pun.
Ide inti apa yang digunakan AudioLM untuk menghasilkan audio?
AudioLM mengubah bentuk gelombang menjadi token diskrit dan memprediksinya secara berurutan, menerapkan pendekatan model bahasa token berikutnya ke suara mentah.
Apa peran token 'semantik' di AudioLM?
Token semantik (dari w2v-BERT) mengkodekan struktur dan koherensi tingkat tinggi, sedangkan token akustik menangani detail audio yang halus.
Codec saraf manakah yang menghasilkan token akustik AudioLM?
SoundStream menggunakan kuantisasi vektor sisa untuk mengompresi audio menjadi token akustik dan kemudian menerjemahkan token yang diprediksi kembali menjadi bentuk gelombang.
Apa yang dibutuhkan AudioLM sebagai data pelatihan?
Fitur penting adalah AudioLM berlatih murni pada audio tanpa label teks apa pun, mempelajari struktur langsung dari suara.
Mengapa AudioLM memprediksi token semantik sebelum token akustik?
Menghasilkan struktur kasar terlebih dahulu menjaga keluaran tetap koheren seiring waktu; token akustik kemudian dikondisikan pada struktur tersebut untuk menambahkan detail dengan ketelitian tinggi.