無料のAIライブラリ

オーディオAI ガイド永久無料。

117 平易な英語のガイド、構造化された学習パス、オープン ライブラリ - 独立した 501(c)(3) 非営利団体によって構築され、誰でも最新の AI を理解できるようになります。

117無料ガイド
1トピックトラック
~2 minガイドごと
~4h読書時間

ここから始めましょう

5 成果ベースのコース

各コースには、明示的な成果、マッピングされたコンピテンシー、練習アクティビティ、および適用されたキャップストーンが含まれています。

トピックトラック

トラックごとに閲覧する

気になるエリアに飛び込んでみましょう。すべてのトラックには複数のわかりやすい英語のガイドが付いています。

フルライブラリ

すべてのガイド

117 1019 ガイドが表示されます。トラックでフィルタリングするか、上で検索してください。

オーディオAI

Mimi ストリーミング オーディオ コーデック

Mimi は、音声をリアルタイムで離散トークンの小さなストリームに圧縮するニューラル オーディオ コーデックです。そのため、AI モデルは非常に低い音声で聞き、話すことができます。

2 最小読み取り読む
オーディオAI

聞いて出席して綴る

Listen, Attend and Spell (LAS) は、手作業で発音を構築することなく、音声を直接文字に転写する、2015 年の画期的なニューラル ネットワークです。

2 最小読み取り読む
オーディオAI

音声認識のための SpecAugment

SpecAugment は、音声のスペクトログラムをマスクおよびワープして認識モデルをより堅牢にする、シンプルだが強力なデータ拡張手法です。

2 最小読み取り読む
オーディオAI

音楽の自動タグ付け

音楽の自動タグ付けでは、機械学習を使用して曲を聴き、ジャンル、ムード、楽器、テンポなどの説明的なラベルを自動的に付けます。

2 最小読み取り読む
オーディオAI

音楽的な音色の転送

音色転送はオーディオの「音色」を再形成し、ある楽器が別の楽器のように聞こえるようにし、鼻歌のようなメロディーをヴァイオリンやトランペットの音色に変えます…

2 最小読み取り読む
オーディオAI

音響シーンの分類

音響シーン分類 (ASC) は、混雑した通り、静かな公園、電車、カフェなど、録音が行われた環境を認識するようにマシンを訓練します。

2 最小読み取り読む
オーディオAI

NVIDIA Riva と NeMo のスピーチ

NVIDIA Riva は、プロダクション音声 AI (ASR、TTS、翻訳) 用の GPU アクセラレーション SDK であり、NeMo はトレーニングと微調整のためのオープンソース ツールキットです…

2 最小読み取り読む
オーディオAI

DeepSpeech アーキテクチャ

DeepSpeech は、Baidu が 2014 年に導入したエンドツーエンドの音声認識モデルで、リカレント ニューラル…

2 最小読み取り読む
オーディオAI

X-Vector スピーカーの埋め込み

X ベクトルは、ニューラル ネットワークによって生成される話者の声の固定長の数値指紋であり、話している内容に関係なく、誰が話しているのかを伝えるために使用されます。

2 最小読み取り読む
オーディオAI

Glow-TTS モノトニック アライメント

Glow-TTS は、賢い検索トリックを使用して独自にテキストを音声に調整することを学習するテキスト読み上げモデルであり、別のアライナーの必要性を排除します。

2 最小読み取り読む
オーディオAI

パラレル WaveGAN ボコーダー

Parallel WaveGAN は、小型 GAN を使用してメル スペクトログラムを生のオーディオ波形に変換し、すべてのサンプルを一度に生成する高速ニューラル ボコーダーです。

2 最小読み取り読む
オーディオAI

WaveGlow フローベースのボコーダー

WaveGlow は、NVIDIA のフローベースのニューラル ボコーダーで、自己回帰なしでシングル パスでメル スペクトログラムから音声波形を合成します。

2 最小読み取り読む

読み終わりましたか?証明してみろ。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.