無料のAIライブラリ

オーディオAI ガイド永久無料。

117 平易な英語のガイド、構造化された学習パス、オープン ライブラリ - 独立した 501(c)(3) 非営利団体によって構築され、誰でも最新の AI を理解できるようになります。

117無料ガイド
1トピックトラック
~2 minガイドごと
~4h読書時間

ここから始めましょう

5 成果ベースのコース

各コースには、明示的な成果、マッピングされたコンピテンシー、練習アクティビティ、および適用されたキャップストーンが含まれています。

トピックトラック

トラックごとに閲覧する

気になるエリアに飛び込んでみましょう。すべてのトラックには複数のわかりやすい英語のガイドが付いています。

フルライブラリ

すべてのガイド

117 1019 ガイドが表示されます。トラックでフィルタリングするか、上で検索してください。

オーディオAI

音声キャプション

音声キャプションは、「踏切を通過する電車の警笛が鳴り響く」など、音声クリップの内容を説明する自然言語文を生成します。

2 最小読み取り読む
オーディオAI

ささやき音声認識

Whisper は、OpenAI のオープンソース自動音声認識システムで、90 以上の言語で音声をテキストに変換します。

2 最小読み取り読む
オーディオAI

Wav2Vec 2.0

Wav2Vec 2.0 は、Meta AI の自己教師型音声モデルであり、ラベルのない生の録音から強力な音声表現を学習します。

2 最小読み取り読む
オーディオAI

HuBERT 自己監修スピーチ

HuBERT (Hidden-Unit BERT) は Meta AI の自己教師あり音声モデルで、マスクされたセグメントのクラスター化されたオーディオ ユニットを BERT スタイルで予測することで学習します。

2 最小読み取り読む
オーディオAI

ニューラルボコーダー

ニューラル ボコーダーは、コンパクトな音響表現 (通常はメル スペクトログラム) を実際の可聴波形に変換するモデルです。

2 最小読み取り読む
オーディオAI

ニューラルオーディオコーデック

ニューラル オーディオ コーデックは、ディープラーニングを使用してサウンドを離散トークンの小さなストリームに圧縮し、それを高い忠実度で再構築します。

2 最小読み取り読む
オーディオAI

VALL-E およびコーデック言語モデル

VALL-E は、テキスト読み上げをオーディオ コーデック トークン上の言語モデリングの問題として再構成し、わずか 3 秒のサンプルからの音声クローン作成を可能にしました。

2 最小読み取り読む
オーディオAI

OpenAI ささやき

Whisper は、OpenAI のオープンソース自動音声認識システムで、数十の言語にわたって話された音声を文字に起こし、翻訳します。

2 最小読み取り読む
オーディオAI

自動音楽採譜

自動音楽転写 (AMT) は、音楽の生のオーディオ録音を楽譜、MIDI、ピアノ ロールなどの記号表記に変換します。

2 最小読み取り読む
オーディオAI

ビートとテンポの追跡

ビートとテンポの追跡は、音楽の安定したパルス、つまり各ビートがどこに位置するか、曲が毎分ビート (BPM) でどのくらい速く進むかを見つけるタスクです。

2 最小読み取り読む
オーディオAI

オーディオフィンガープリンティング

オーディオ フィンガープリンティングにより、コンパクトでノイズ耐性のあるサウンドのデジタル署名が作成されるため、後から背景ノイズがあっても認識できるようになります。

2 最小読み取り読む
オーディオAI

ジュークボックス

ジュークボックスは、生の音楽オーディオを生成する OpenAI の 2020 ニューラル ネットワークです。歌声、楽器、さらには特定の形式の歌詞も含まれています。

2 最小読み取り読む

読み終わりましたか?証明してみろ。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 8 of 10 | AI Understanding