PANDUAN Audio AI

GelombangNet

WaveNet, yang diperkenalkan oleh DeepMind pada tahun 2016, merupakan terobosan jaringan saraf yang menghasilkan audio mentah satu sampel dalam satu waktu, menghasilkan ucapan dan musik yang sangat alami.

2 min readTerakhir diperbarui

Ikhtisar

It set the modern standard for high-fidelity text-to-speech.

Menyelam Lebih Dalam

WaveNet adalah model generatif autoregresif: model ini memprediksi setiap sampel audio yang dikondisikan pada semua sampel sebelumnya, biasanya pada 16.000 atau 24.000 sampel per detik. Inovasi intinya adalah tumpukan konvolusi sebab akibat yang melebar. Kausal berarti model hanya melihat ke belakang dalam waktu, menjaga urutan generasi; pelebaran berarti setiap lapisan melewatkan jumlah sampel yang bertambah secara eksponensial, sehingga tumpukan sederhana mencakup ribuan sampel (bidang reseptif yang luas) tanpa biaya yang besar. Dikondisikan pada fitur linguistik atau mel-spektogram, WaveNet menghasilkan ucapan yang jauh lebih alami dibandingkan vocoder konkatenatif dan parametrik yang mendahuluinya, sehingga menutup banyak kesenjangan terhadap rekaman manusia dan mendukung versi awal Google Assistant.

Wawasan Teknis

Konvolusi yang melebar adalah trik utama: dengan tingkat dilatasi 1, 2, 4, 8, dan seterusnya, jaringan yang kedalamannya hanya puluhan lapisan dapat menangani ribuan sampel masa lalu, menangkap detail bentuk gelombang yang halus dan struktur prosodik yang lebih panjang. Output memodelkan nilai setiap sampel sebagai distribusi kategorikal (awalnya 256 level melalui mu-law companding), dan unit aktivasi yang terjaga keamanannya ditambah koneksi sisa dan lewati menstabilkan pelatihan tumpukan yang sangat dalam ini.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan WaveNet

WaveNet asli lambat karena pengambilan sampelnya berurutan. Penerusnya memperbaikinya: Parallel WaveNet dan WaveRNN mengaktifkan sintesis real-time, dan kemudian vocoder berbasis aliran dan GAN seperti WaveGlow dan HiFi-GAN, ditambah vocoder difusi, mendorong kualitas dan kecepatan lebih jauh. Ide-ide autoregresif dan konvolusi dilatasi WaveNet hidup dalam sistem ini dan memengaruhi arsitektur jauh di luar audio, memperkuat warisannya dalam pemodelan generatif.

Implementasi Dunia Nyata

Menghasilkan suara yang terdengar alami untuk Google Asisten dan Google Cloud Text-to-Speech

Bertindak sebagai vocoder saraf yang mengubah spektogram mel menjadi bentuk gelombang di saluran pipa TTS seperti Tacotron 2

Mensintesis piano realistis dan musik instrumental dari audio mentah

Sintesis suara untuk alat aksesibilitas dan narasi buku audio

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Deteksi Audio Deepfake

Pertanyaan yang sering diajukan

What is WaveNet?

WaveNet, yang diperkenalkan oleh DeepMind pada tahun 2016, merupakan terobosan jaringan saraf yang menghasilkan audio mentah satu sampel dalam satu waktu, menghasilkan ucapan dan musik yang sangat alami. Ini menetapkan standar modern untuk text-to-speech dengan ketelitian tinggi.

Bagaimana WaveNet menghasilkan audio?

WaveNet bersifat autoregresif: ia memprediksi setiap sampel audio berdasarkan sampel sebelumnya.

Apa inovasi konvolusional utama di WaveNet?

Konvolusi kausal yang melebar memungkinkan jaringan mencakup ribuan sampel masa lalu secara efisien sambil hanya melihat ke belakang dalam waktu.

Mengapa pelebaran membantu WaveNet?

Laju dilatasi yang meningkat secara eksponensial memberikan bidang reseptif yang luas pada ribuan sampel dengan lapisan yang relatif sedikit.

Apa kelemahan praktis utama dari WaveNet yang asli?

Karena setiap sampel bergantung pada sampel sebelumnya, pembangkitan dilakukan secara berurutan dan oleh karena itu lambat, memotivasi Parallel WaveNet dan penerus lainnya.

Dalam saluran text-to-speech, WaveNet sering berfungsi sebagai apa?

WaveNet dapat mengambil spektogram mel (misalnya, dari Tacotron 2) dan menghasilkan bentuk gelombang akhir yang terdengar alami.