PANDUAN Audio AI

Tacotron 2

Tacotron 2 adalah sistem text-to-speech ujung ke ujung dari Google (2017) yang mengubah teks tertulis langsung menjadi mel-spektogram, yang diubah oleh vocoder saraf menjadi ucapan seperti aslinya.

2 min readTerakhir diperbarui

Ikhtisar

It produced audio rivaling human recordings on key benchmarks.

Menyelam Lebih Dalam

Tacotron 2 memiliki dua bagian utama. Pertama, jaringan urutan-ke-urutan dengan perhatian membaca karakter teks dan memprediksi mel-spektogram bingkai demi bingkai. Pembuat enkode mengubah karakter menjadi representasi tersembunyi, mekanisme perhatian peka lokasi menyelaraskan teks ke bingkai audio, dan dekoder autoregresif memancarkan spektogram sementara 'token berhenti' mempelajari kapan ucapan berakhir. Kedua, vocoder WaveNet yang dimodifikasi mengubah spektogram mel menjadi bentuk gelombang mentah. Dengan membagi masalah seperti ini, Tacotron 2 mempelajari prosodi, pengucapan, dan tempo dari data dengan rekayasa tangan minimal. Ini mencapai skor opini rata-rata yang mendekati rekaman profesional, menjadikannya tonggak penting dalam sintesis yang terdengar alami dan templat untuk TTS saraf selanjutnya.

Wawasan Teknis

Spektogram mel adalah antarmuka cerdas antara dua jaringan: ringkas dan mudah diprediksi oleh model perhatian, namun cukup kaya bagi vocoder untuk merekonstruksi audio dengan fidelitas tinggi. Perhatian yang peka terhadap lokasi mencegah kegagalan umum seperti kata yang diulang atau dilewati dengan mempertimbangkan penyelarasan sebelumnya, dan dekoder autoregresif dengan token berhenti yang dipelajari memungkinkan model menangani kalimat dengan panjang variabel dengan baik.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan Tacotron 2

Desain dua tahap Tacotron 2 menginspirasi gelombang TTS saraf. Penerus non-autoregresif yang lebih cepat seperti FastSpeech 2 menghapus decoder sekuensial untuk kecepatan dan stabilitas, dan vocoder WaveNet sekarang sering ditukar dengan HiFi-GAN atau model difusi. Bidang ini bergerak menuju sistem kloning suara yang sepenuhnya end-to-end dan multi-speaker, ekspresif, dan zero-shot, namun Tacotron 2 tetap menjadi referensi dasar untuk saluran pipa berbasis spektogram.

Implementasi Dunia Nyata

Mendukung suara yang terdengar alami di produk dan asisten text-to-speech Google

Menghasilkan narasi ekspresif untuk buku audio dan podcast

Memberikan suara untuk pembaca layar dan perangkat lunak aksesibilitas

Berfungsi sebagai dasar penelitian dan contoh pengajaran untuk saluran TTS saraf

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tacotron 2 quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pemodelan Prosodi

Pertanyaan yang sering diajukan

What is Tacotron 2?

Tacotron 2 adalah sistem text-to-speech ujung ke ujung dari Google (2017) yang mengubah teks tertulis langsung menjadi mel-spektogram, yang diubah oleh vocoder saraf menjadi ucapan seperti aslinya. Ini menghasilkan audio yang menyaingi rekaman manusia pada tolok ukur utama.

Representasi perantara apa yang diprediksi Tacotron 2 dari teks?

Jaringan urutan-ke-urutan Tacotron 2 memprediksi mel-spektogram, yang kemudian diubah oleh vocoder menjadi audio.

Apa yang mengubah spektogram Tacotron 2 menjadi bentuk gelombang sebenarnya?

Tacotron 2 memasangkan prediktor spektogramnya dengan vocoder WaveNet yang dimodifikasi untuk menghasilkan audio mentah akhir.

Masalah apa yang dapat dicegah oleh perhatian peka lokasi?

Dengan mempertimbangkan penyelarasan sebelumnya, perhatian peka lokasi mengurangi kegagalan seperti kata-kata yang diulang atau dihilangkan.

Bagaimana Tacotron 2 mengetahui kapan harus berhenti mengeluarkan ucapan?

Dekoder autoregresif memprediksi token berhenti, membiarkan model menangani kalimat dengan panjang yang bervariasi.

Gaya arsitektur keseluruhan apa yang digunakan bagian teks-ke-spektogram?

Tacotron 2 menggunakan model sequence-to-sequence encoder-decoder dengan memperhatikan karakter peta ke frame spektogram.