ささやき音声認識
Whisper は、OpenAI のオープンソース自動音声認識システムで、90 以上の言語で音声をテキストに変換します。
概要
It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.
ディープダイブ
2022 年 9 月に OpenAI によってリリースされた Whisper は、Web から収集した 680,000 時間の多言語、マルチタスクのオーディオでトレーニングされた、Transformer ベースのエンコーダー/デコーダー モデルです。クリーンなラベル付きデータを必要とした以前のシステムとは異なり、Whisper は乱雑な現実世界の録音から学習し、アクセント、ノイズ、クロストークに対する驚くほどの耐性を備えています。単一のモデルが、文字起こし、英語への翻訳、言語識別、タイムスタンプを処理します。 「小型」 (3,900 万パラメータ) から「大型」 (1.55B) までのサイズで出荷されるため、ユーザーは速度と精度を引き換えることができます。ウェイトは MIT の下でオープンにライセンスされているため、Whisper はほぼ一夜にして無数のポッドキャスト文字起こし、キャプション ツール、音声アプリのデフォルト バックボーンになりました。
技術的な洞察
Whisper はオーディオを 30 秒のチャンクに分割し、それぞれを log-Mel スペクトログラム (80 周波数チャネル) に変換し、それを Transformer エンコーダーに供給します。次に、デコーダーは、タスク (文字起こしか翻訳)、言語、およびタイムスタンプを発行するかどうかを指定する特別なトークンに基づいて、テキスト トークンを自己回帰的に予測します。このマルチタスクのトークン コンディショニングは巧妙なトリックです。デコードの開始時に指定されたプロンプト トークンに応じて、1 つの重みセットが多くのジョブを実行します。
戦略的影響
アクセスと到達範囲
文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。
費用と予算
メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。
速度とスケール
顧客対応システムは、音声対話を大規模に処理できます。
ささやき音声認識の未来
Whisper は、Whisper.cpp、より高速なウィスパー、携帯電話やラップトップでリアルタイムに実行される蒸留バージョンなど、より高速な派生バージョンの波を引き起こしました。より緊密なストリーミング (低遅延) バリアント、より優れた話者ダイアライゼーションとそれとの組み合わせ、および低リソース言語でのより強力なパフォーマンスが期待されます。オンデバイスのオーディオ AI が成長するにつれて、軽量の Whisper スタイル モデルは、ライブ キャプション、会議メモ、アクセシビリティ ツールを完全にオフラインで強化し、クラウド グレードの精度に匹敵しながらプライバシーを保護することになるでしょう。
現実世界の実装
ポッドキャストや YouTube ビデオの検索可能なトランスクリプトとキャプションを自動生成
Zoom または Teams の音声から概要を生成するライブ会議メモ アプリを強化する
外国語のインタビューをジャーナリスト向けに英語のテキストに直接翻訳
入力できないユーザー向けに音声制御のアクセシビリティ ツールとディクテーションを構築する
リスクとガードレール
同意がない場合、音声の悪用やなりすましのリスクが高まります。
アクセント、方言、または騒がしい環境では精度が低下する可能性があります。
合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。
実装ロードマップ
音声のキャプチャ、複製、再利用については明示的な同意を取得してください。
さまざまな話者や背景条件で品質をテストします。
人間がいつ出力をレビューまたは承認する必要があるかを定義します。
合成音声にラベルを付け、出所記録を保管して説明責任を果たします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
音声感情認識
よくある質問
What is Whisper Speech Recognition?
Whisper は、OpenAI のオープンソース自動音声認識システムで、90 以上の言語で音声をテキストに変換します。これが重要なのは、アクセント、背景雑音、専門用語に確実に対処し、人間に近い文字起こし品質を無料で誰にでも提供できるからです。
Whisper のトレーニングはおよそ何時間の音声で行われましたか?
Whisper は、Web から収集された約 680,000 時間の多言語でマルチタスクの音声、つまり異常に大規模で多様なデータセットを使用してトレーニングされました。
Whisper はエンコーダーの前に生のオーディオからどのような中間表現を計算しますか?
Whisper は、30 秒の各オーディオ チャンクを 80 チャネルの log-Mel スペクトログラムに変換し、Transformer エンコーダーが処理します。
単一の Whisper モデルは、転写や翻訳などの複数のタスクをどのように実行するのでしょうか?
デコードの開始時に、言語、タスク、タイムスタンプを発行するかどうかを伝える特別なトークンのウィスパー条件。
Whisper は全体的にどのようなニューラル アーキテクチャを使用していますか?
Whisper はエンコーダ/デコーダ トランスフォーマです。エンコーダはスペクトログラムを読み取り、デコーダは自己回帰的にテキスト トークンを生成します。
Whisper が以前の ASR システムと比べて特に堅牢であると考えられるのはなぜですか?
膨大な量のさまざまな現実世界のオーディオ (アクセント、ノイズ、クロストーク) でのトレーニングにより、Whisper はドメインごとの調整を行わずに、すぐに使用できる強力な堅牢性を実現しました。