PANDUAN AI Audio

Dengar Hadir dan Eja

Dengar, Hadiri dan Eja (LAS) ialah rangkaian neural mercu tanda 2015 yang menyalin pertuturan terus ke dalam aksara, tanpa kamus sebutan binaan tangan atau model bahasa yang berasingan.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It showed that a single end-to-end model could do speech recognition.

Menyelam dalam

Dengar, Hadiri dan Eja, yang diperkenalkan oleh penyelidik Google Chan, Jaitly, Le, dan Vinyals pada tahun 2015, merupakan salah satu pengecam pertuturan hujung ke hujung yang pertama. Ia mempunyai dua bahagian: 'Pendengar,' LSTM dwiarah piramid yang mengekod audio sambil mengecilkan dimensi masa dan 'Speller,' penyahkod LSTM berasaskan perhatian yang mengeluarkan aksara satu demi satu. Mekanisme perhatian membolehkan Eja memfokus pada kepingan audio yang berkaitan untuk setiap huruf keluaran. Tidak seperti saluran paip HMM-DNN yang lebih lama, LAS tidak memerlukan kamus fonem, tiada penjajaran paksa dan tiada model bahasa terlatih secara berasingan; ia mempelajari ejaan, sempadan perkataan dan akustik secara bersama daripada audio yang ditranskripsi. Ia secara langsung mengilhamkan urutan-ke-jujukan moden dan sistem ASR berasaskan perhatian.

Wawasan Teknikal

LAS menggabungkan penyahkod pengekod dengan perhatian. Pengekod LSTM piramid mengurangkan separuh resolusi masa pada setiap satu daripada tiga lapisan, memotong jujukan akustik yang panjang kepada panjang yang boleh diurus supaya perhatian dapat dikendalikan. Pada setiap langkah penyahkodan, Speller mengira berat perhatian ke atas semua keadaan pengekod, menggabungkannya ke dalam vektor konteks dan meramalkan aksara seterusnya. Latihan memaksimumkan kebarangkalian urutan aksara yang betul; helah pensampelan berjadual mengurangkan ketidakpadanan kereta/ujian.

Kesan Strategik

Akses dan capai

Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.

Kos dan bajet

Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.

Kelajuan dan skala

Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.

Masa Depan Dengar Hadir dan Eja

LAS kini bersejarah, tetapi DNAnya berjalan melalui setiap sistem ASR moden. Idea pengekod-penyahkod berasaskan perhatiannya berkembang menjadi pengecam Transformer dan Conformer, manakala pendekatan berkaitan seperti imlak kuasa pada peranti RNN-Transducer. Sistem masa hadapan meneruskan trajektori hujung ke hujung ini, menggabungkan pengiktirafan dengan terjemahan dan pemahaman dalam model berbilang bahasa tunggal, dan mendorong ke arah penstriman, transkripsi kependaman rendah yang LAS, sebagai bukan penstriman, tidak dapat sediakan pada asalnya.

Pelaksanaan Dunia Sebenar

Mentranskripsi bahasa Inggeris pertuturan terus ke dalam huruf tanpa kamus sebutan

Berkhidmat sebagai asas konsep untuk sistem imlak suara dan kapsyen berasaskan perhatian

Menunjukkan latihan hujung ke hujung untuk kerja kursus dan tanda aras pengecaman pertuturan akademik

Model urutan-ke-jujukan yang memberi inspirasi kemudian digunakan dalam saluran paip terjemahan pertuturan

Risiko & Pengawal

Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.

Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.

Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.

Hala Tuju Pelaksanaan

1

Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.

2

Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.

3

Tentukan bila manusia mesti menyemak atau meluluskan output.

4

Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Pengetegan Auto Muzik

Soalan lazim

What is Listen Attend and Spell?

Dengar, Hadiri dan Eja (LAS) ialah rangkaian neural mercu tanda 2015 yang menyalin pertuturan terus ke dalam aksara, tanpa kamus sebutan binaan tangan atau model bahasa yang berasingan. Ia menunjukkan bahawa model hujung ke hujung tunggal boleh melakukan pengecaman pertuturan.

Apakah dua komponen utama model LAS?

LAS terdiri daripada pengekod 'Pendengar' yang memproses audio dan penyahkod berasaskan perhatian 'Speller' yang mengeluarkan aksara.

Apakah keluaran Speller dalam LAS?

Ejaan ialah penyahkod yang menghasilkan aksara transkripsi mengikut aksara, mempelajari ejaan secara langsung.

Mengapa pengekod LAS dipanggil 'piramidal'?

Setiap lapisan BLSTM piramid mengurangkan separuh panjang jujukan, memendekkan jujukan audio yang panjang supaya perhatian boleh dilaksanakan secara pengiraan.

Apakah komponen lama yang TIDAK diperlukan oleh LAS?

Tidak seperti saluran paip HMM-DNN klasik, LAS belajar terus daripada pasangan audio-ke-teks tanpa kamus fonem atau penjajaran paksa.

Mekanisme manakah yang membolehkan Eja memfokus pada bahagian audio yang berkaitan untuk setiap aksara?

Mekanisme perhatian mengira berat berbanding keadaan pengekod, membentuk vektor konteks yang digunakan oleh penyahkod pada setiap langkah.