聞いて出席して綴る
Listen, Attend and Spell (LAS) は、手作りの発音辞書や個別の言語モデルを使用せずに、音声を直接文字に転写する、2015 年の画期的なニューラル ネットワークです。
概要
It showed that a single end-to-end model could do speech recognition.
ディープダイブ
Google 研究者の Chan、Jaitly、Le、Vinyals によって 2015 年に導入された Listen、Attend、Spell は、最初の真のエンドツーエンド音声認識装置の 1 つです。これは、時間次元を縮小しながらオーディオをエンコードするピラミッド型の双方向 LSTM である「Listener」と、一度に 1 つずつ文字を出力するアテンションベースの LSTM デコーダである「Speller」の 2 つの部分で構成されています。アテンション メカニズムにより、Speller は各出力文字に関連するオーディオのスライスに焦点を当てることができます。古い HMM-DNN パイプラインとは異なり、LAS は音素辞書、強制的な位置合わせ、個別にトレーニングされた言語モデルを必要としません。文字起こしされた音声からスペル、単語の境界、音響を共同で学習します。これは、現代のシーケンスツーシーケンスおよびアテンションベースの ASR システムに直接影響を与えました。
技術的な洞察
LAS は、エンコーダ/デコーダとアテンションを組み合わせます。ピラミッド型 LSTM エンコーダーは、3 つのレイヤーのそれぞれで時間分解能を半分にし、長い音響シーケンスを扱いやすい長さにカットするので、注意を払いやすくなります。すべてのデコード ステップで、Speller はすべてのエンコーダ状態に対してアテンション ウェイトを計算し、それらをコンテキスト ベクトルにブレンドして、次の文字を予測します。トレーニングにより、正しい文字シーケンスの確率が最大化されます。スケジュールされたサンプリングのトリックにより、トレーニングとテストの不一致が軽減されます。
戦略的影響
アクセスと到達範囲
文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。
費用と予算
メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。
速度とスケール
顧客対応システムは、音声対話を大規模に処理できます。
Listen Attend と Spell の未来
LAS は今や歴史的なものですが、その DNA は最新のすべての ASR システムに受け継がれています。そのアテンションベースのエンコーダ/デコーダのアイデアは、Transformer および Conformer レコグナイザに発展し、RNN-Transducer のパワーオンデバイスディクテーションなどの関連アプローチも生まれました。将来のシステムはこのエンドツーエンドの軌道を継続し、単一の多言語モデルで認識と翻訳および理解を融合し、非ストリーミングである LAS が当初提供できなかったストリーミングの低遅延文字起こしを推進します。
現実世界の実装
発音辞書を使わずに、話された英語を直接文字に書き写す
アテンションベースの音声ディクテーションおよびキャプションシステムの概念的基礎として機能します
学術的な音声認識コースワークとベンチマークのためのエンドツーエンドのトレーニングをデモンストレーションする
後に音声翻訳パイプラインで使用される、インスピレーションを与えるシーケンスツーシーケンス モデル
リスクとガードレール
同意がない場合、音声の悪用やなりすましのリスクが高まります。
アクセント、方言、または騒がしい環境では精度が低下する可能性があります。
合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。
実装ロードマップ
音声のキャプチャ、複製、再利用については明示的な同意を取得してください。
さまざまな話者や背景条件で品質をテストします。
人間がいつ出力をレビューまたは承認する必要があるかを定義します。
合成音声にラベルを付け、出所記録を保管して説明責任を果たします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Listen Attend and Spell quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
音楽の自動タグ付け
よくある質問
What is Listen Attend and Spell?
Listen, Attend and Spell (LAS) は、手作りの発音辞書や個別の言語モデルを使用せずに、音声を直接文字に転写する、2015 年の画期的なニューラル ネットワークです。これは、単一のエンドツーエンド モデルで音声認識を実行できることを示しました。
LAS モデルの 2 つの主要コンポーネントは何ですか?
LAS は、音声を処理する「Listener」エンコーダと、文字を出力する「Speller」アテンションベースのデコーダで構成されます。
LAS の Speller は何を出力しますか?
Speller は、スペルを直接学習して文字ごとに転写を生成するデコーダーです。
LAS エンコーダが「ピラミッド」と呼ばれるのはなぜですか?
ピラミッド型 BLSTM の各層はシーケンスの長さを半分にし、長いオーディオ シーケンスを短縮するので、計算上実現可能です。
LAS が特に必要としない古いコンポーネントは何ですか?
従来の HMM-DNN パイプラインとは異なり、LAS は音素辞書や強制的な位置合わせを行わずに、オーディオとテキストのペアから直接学習します。
Speller が各キャラクターの音声の関連部分に集中できるようにするメカニズムはどれですか?
アテンション メカニズムはエンコーダの状態に対する重みを計算し、デコーダが各ステップで使用するコンテキスト ベクトルを形成します。