無料のAIライブラリ

オーディオAI ガイド永久無料。

117 平易な英語のガイド、構造化された学習パス、オープン ライブラリ - 独立した 501(c)(3) 非営利団体によって構築され、誰でも最新の AI を理解できるようになります。

117無料ガイド
1トピックトラック
~2 minガイドごと
~4h読書時間

ここから始めましょう

5 成果ベースのコース

各コースには、明示的な成果、マッピングされたコンピテンシー、練習アクティビティ、および適用されたキャップストーンが含まれています。

トピックトラック

トラックごとに閲覧する

気になるエリアに飛び込んでみましょう。すべてのトラックには複数のわかりやすい英語のガイドが付いています。

フルライブラリ

すべてのガイド

117 1019 ガイドが表示されます。トラックでフィルタリングするか、上で検索してください。

オーディオAI

歌声合成

歌声合成(SVS)は、書かれたメロディーと歌詞を完全に歌ったボーカルパフォーマンスに変換するAIです。

2 最小読み取り読む
オーディオAI

AudioLM

AudioLM は、音声を言語のように扱い、トークンを予測することで、リアルなオーディオ (スピーチやピアノ音楽) を生成する Google 研究フレームワークです。

2 最小読み取り読む
オーディオAI

ミュージックジェネ

MusicGen は Meta の AI モデルで、テキストの説明から音楽を生成し、オプションで鼻歌やアップロードしたメロディーも生成します。

2 最小読み取り読む
オーディオAI

キーワードスポッティングとウェイクワード

キーワード スポッティングは、デバイスが「Hey Siri」や「Alexa」などの 1 つのトリガー フレーズを待ってから起動する常時リッスン テクノロジーです。

2 最小読み取り読む
オーディオAI

強制位置合わせ

強制位置合わせでは、既知のトランスクリプトとその音声を自動的に並べて、各単語や音声の開始と終了を正確にマークします。

2 最小読み取り読む
オーディオAI

メルスペクトログラム

メル スペクトログラムは、時間の経過に伴う音の画像であり、人間の耳がピッチを知覚する方法と同じ周波数間隔で表示されます。

2 最小読み取り読む
オーディオAI

コネクショニストの時間分類

コネクショニスト時間分類 (CTC) は、ニューラル ネットワークが長いオーディオ シーケンスをテキストに変換できるようにする損失関数およびデコード手法です。

2 最小読み取り読む
オーディオAI

RNN トランスデューサー モデル

RNN トランスデューサー (RNN-T) は、CTC の最大の弱点、つまり依存関係をモデル化できないことを修正するストリーミング対応の音声認識アーキテクチャです。

2 最小読み取り読む
オーディオAI

コンフォーマーアーキテクチャ

Conformer は、畳み込みと自己注意を融合するニューラル ネットワーク ブロックで、きめの細かい局所的なサウンド パターンと長距離のコンテキストの両方をキャプチャします。

2 最小読み取り読む

読み終わりましたか?証明してみろ。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.