PANDUAN Audio AI

Dengarkan Hadiri dan Eja

Listen, Attend and Spell (LAS) adalah jaringan saraf penting tahun 2015 yang mentranskripsi ucapan langsung menjadi karakter, tanpa kamus pengucapan buatan tangan atau model bahasa terpisah.

2 min readTerakhir diperbarui

Ikhtisar

It showed that a single end-to-end model could do speech recognition.

Menyelam Lebih Dalam

Dengar, Hadiri, dan Eja, yang diperkenalkan oleh peneliti Google Chan, Jaitly, Le, dan Vinyals pada tahun 2015, adalah salah satu pengenal ucapan ujung ke ujung yang pertama. Ini memiliki dua bagian: 'Listener', LSTM dua arah piramidal yang mengkodekan audio sambil memperkecil dimensi waktu, dan 'Speller', decoder LSTM berbasis perhatian yang memancarkan karakter satu per satu. Mekanisme perhatian memungkinkan Pengeja fokus pada potongan audio yang relevan untuk setiap huruf keluaran. Tidak seperti pipeline HMM-DNN lama, LAS tidak memerlukan kamus fonem, tidak ada penyelarasan paksa, dan tidak ada model bahasa yang dilatih secara terpisah; ia mempelajari ejaan, batasan kata, dan akustik secara bersama-sama dari audio yang ditranskripsi. Ini secara langsung mengilhami sistem ASR modern yang berurutan dan berbasis perhatian.

Wawasan Teknis

LAS menggabungkan encoder-decoder dengan perhatian. Encoder LSTM piramidal membagi dua resolusi waktu pada masing-masing tiga lapisan, memotong rangkaian akustik panjang menjadi panjang yang dapat diatur sehingga perhatian dapat diatur. Pada setiap langkah decoding, Speller menghitung bobot perhatian pada semua status encoder, memadukannya ke dalam vektor konteks, dan memprediksi karakter berikutnya. Pelatihan memaksimalkan kemungkinan urutan karakter yang benar; trik pengambilan sampel terjadwal mengurangi ketidakcocokan pelatihan/pengujian.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan Dengar, Hadiri dan Eja

LAS kini menjadi sejarah, namun DNA-nya tersebar di setiap sistem ASR modern. Ide encoder-decoder berbasis perhatiannya berkembang menjadi pengenal Transformer dan Conformer, sementara pendekatan terkait seperti RNN-Transduser mendukung dikte pada perangkat. Sistem masa depan melanjutkan jalur end-to-end ini, menggabungkan pengenalan dengan terjemahan dan pemahaman dalam model multibahasa tunggal, dan mendorong ke arah streaming, transkripsi latensi rendah yang pada awalnya tidak dapat disediakan oleh LAS, karena non-streaming.

Implementasi Dunia Nyata

Mentranskripsikan bahasa Inggris lisan langsung menjadi huruf tanpa kamus pengucapan

Berfungsi sebagai dasar konseptual untuk dikte suara dan sistem teks berbasis perhatian

Mendemonstrasikan pelatihan menyeluruh untuk kursus dan tolok ukur pengenalan ucapan akademik

Model urutan-ke-urutan yang menginspirasi kemudian digunakan dalam saluran terjemahan ucapan

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pemberian Tag Otomatis Musik

Pertanyaan yang sering diajukan

What is Listen Attend and Spell?

Listen, Attend and Spell (LAS) adalah jaringan saraf penting tahun 2015 yang mentranskripsi ucapan langsung menjadi karakter, tanpa kamus pengucapan buatan tangan atau model bahasa terpisah. Hal ini menunjukkan bahwa satu model end-to-end dapat melakukan pengenalan suara.

Apa dua komponen utama model LAS?

LAS terdiri dari encoder 'Listener' yang memproses audio dan decoder berbasis perhatian 'Speller' yang memancarkan karakter.

Apa yang dihasilkan oleh Speller di LAS?

Speller adalah decoder yang menghasilkan transkripsi karakter demi karakter, mempelajari ejaan secara langsung.

Mengapa pembuat enkode LAS disebut 'piramida'?

Setiap lapisan BLSTM piramidal membagi dua panjang urutan, memperpendek urutan audio yang panjang sehingga perhatian dapat dilakukan secara komputasi.

Komponen lama apa yang TIDAK diperlukan oleh LAS?

Tidak seperti pipeline HMM-DNN klasik, LAS belajar langsung dari pasangan audio-ke-teks tanpa kamus fonem atau penyelarasan paksa.

Mekanisme manakah yang memungkinkan Pengeja fokus pada bagian audio yang relevan untuk setiap karakter?

Mekanisme perhatian menghitung bobot pada status encoder, membentuk vektor konteks yang digunakan decoder pada setiap langkah.