PANDUAN Audio AI

AudioLM

AudioLM adalah kerangka penelitian Google yang menghasilkan audio realistis — ucapan atau musik piano — dengan memperlakukan suara seperti bahasa dan memprediksinya sedikit demi sedikit.

2 min readTerakhir diperbarui

Ikhtisar

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

Menyelam Lebih Dalam

Diperkenalkan oleh Google pada tahun 2022, AudioLM mengubah pembuatan audio sebagai masalah pemodelan bahasa: AudioLM mengubah bentuk gelombang mentah menjadi token terpisah dan kemudian memprediksi token berikutnya, seperti model teks yang memprediksi kata berikutnya. Trik utamanya adalah hierarki tipe token. Token 'Semantik' (dari model seperti w2v-BERT) menangkap struktur jangka panjang — fonetik, sintaksis, melodi — sedangkan token 'akustik' (dari codec saraf SoundStream) menangkap detail halus seperti identitas pembicara, timbre, dan kondisi perekaman. Dengan terlebih dahulu memprediksi token semantik, lalu mengkondisikan token akustik pada token tersebut, AudioLM menghasilkan kelanjutan yang tetap koheren selama beberapa detik sambil mempertahankan suara atau instrumen aslinya. Mengingat beberapa detik pidatonya, ia terus berbicara dengan suara yang sama; diberikan piano, ia berimprovisasi dengan gaya yang sama.

Wawasan Teknis

AudioLM dilatih murni pada audio — tanpa transkrip. SoundStream memampatkan audio menjadi token akustik melalui kuantisasi vektor sisa, sementara w2v-BERT memasok token semantik kasar. Tumpukan model bahasa Transformer memprediksi token secara bertahap: semantik terlebih dahulu untuk struktur, kemudian token akustik kasar dan halus untuk rekonstruksi fidelitas tinggi. Dekoder SoundStream akhirnya mengubah token yang diprediksi kembali menjadi bentuk gelombang, menghasilkan audio yang menjaga konsistensi suara dan prosodi pembicara.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan AudioLM

Resep berbasis token AudioLM menjadi fondasi untuk sistem selanjutnya: ide AudioLM Google dimasukkan ke dalam MusicLM untuk teks-ke-musik dan SoundStorm untuk pembuatan yang lebih cepat, sementara bidang yang lebih luas kini memadukan token semantik dan akustik di seluruh ucapan, musik, dan efek suara. Harapkan pembangkitan yang lebih cepat dan real-time, keluaran koheren yang lebih panjang, dan kontrol multimodal di mana teks atau sinyal lainnya mengarahkan model yang dilatih secara audio. Teknik yang sama juga mempertajam kekhawatiran tentang kloning suara dan audio deepfake.

Implementasi Dunia Nyata

Melanjutkan klip pidato pendek dengan suara dan intonasi pembicara yang sama tanpa transkrip

Improvisasi musik piano baru yang sesuai dengan gaya rekaman singkat

Berfungsi sebagai tulang punggung pembuatan audio untuk sistem teks-ke-musik seperti MusicLM

Penelitian sintesis ucapan yang mempertahankan prosodi dan rekaman akustik dari sampel

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pencarian Kata Kunci dan Kata Bangun

Pertanyaan yang sering diajukan

What is AudioLM?

AudioLM adalah kerangka penelitian Google yang menghasilkan audio realistis — ucapan atau musik piano — dengan memperlakukan suara seperti bahasa dan memprediksinya sedikit demi sedikit. Hal ini penting karena hal ini menunjukkan bahwa Anda dapat menghasilkan kelanjutan audio yang koheren dan terdengar alami tanpa transkrip teks atau partitur musik apa pun.

Ide inti apa yang digunakan AudioLM untuk menghasilkan audio?

AudioLM mengubah bentuk gelombang menjadi token diskrit dan memprediksinya secara berurutan, menerapkan pendekatan model bahasa token berikutnya ke suara mentah.

Apa peran token 'semantik' di AudioLM?

Token semantik (dari w2v-BERT) mengkodekan struktur dan koherensi tingkat tinggi, sedangkan token akustik menangani detail audio yang halus.

Codec saraf manakah yang menghasilkan token akustik AudioLM?

SoundStream menggunakan kuantisasi vektor sisa untuk mengompresi audio menjadi token akustik dan kemudian menerjemahkan token yang diprediksi kembali menjadi bentuk gelombang.

Apa yang dibutuhkan AudioLM sebagai data pelatihan?

Fitur penting adalah AudioLM berlatih murni pada audio tanpa label teks apa pun, mempelajari struktur langsung dari suara.

Mengapa AudioLM memprediksi token semantik sebelum token akustik?

Menghasilkan struktur kasar terlebih dahulu menjaga keluaran tetap koheren seiring waktu; token akustik kemudian dikondisikan pada struktur tersebut untuk menambahkan detail dengan ketelitian tinggi.