無料のAIライブラリ

オーディオAI ガイド永久無料。

117 平易な英語のガイド、構造化された学習パス、オープン ライブラリ - 独立した 501(c)(3) 非営利団体によって構築され、誰でも最新の AI を理解できるようになります。

117無料ガイド
1トピックトラック
~2 minガイドごと
~4h読書時間

ここから始めましょう

5 成果ベースのコース

各コースには、明示的な成果、マッピングされたコンピテンシー、練習アクティビティ、および適用されたキャップストーンが含まれています。

トピックトラック

トラックごとに閲覧する

気になるエリアに飛び込んでみましょう。すべてのトラックには複数のわかりやすい英語のガイドが付いています。

フルライブラリ

すべてのガイド

117 1019 ガイドが表示されます。トラックでフィルタリングするか、上で検索してください。

オーディオAI

DiffWave 拡散ボコーダー

DiffWave は、メル スペクトログラムに基づいてランダム ノイズを波形に繰り返しノイズ除去することでオーディオを合成する拡散ベースのボコーダーです。

2 最小読み取り読む
オーディオAI

Bark 生成オーディオ モデル

Bark は、Suno のオープンソースのテキスト音声変換モデルで、音声だけでなく、笑い声、ため息、音楽、効果音をテキスト プロンプトから直接生成します。

2 最小読み取り読む
オーディオAI

Tortoise TTS 自己回帰合成

Tortoise TTS は、オープンソースのテキスト読み上げシステムで、非常に自然で感情豊かな音声と、わずか数本の短い音声からの強力な音声クローンで高く評価されています。

2 最小読み取り読む
オーディオAI

XTTS 言語を超えた音声クローン作成

XTTS は Coqui の多言語テキスト読み上げモデルで、短いクリップから音声を複製し、音声を保存しながらさまざまな言語で話すことができます。

2 最小読み取り読む
オーディオAI

SoundStorm 並列オーディオ生成

SoundStorm は、一度に 1 つのトークンではなく音声とサウンドを並行して生成する Google オーディオ生成モデルであり、高品質のオーディオ合成を実現します。

2 最小読み取り読む
オーディオAI

AudioGen テキストからオーディオへの合成

AudioGen は、テキストの説明を「鳥のさえずり中に犬が吠える」などの現実的な環境音や音響効果に変換する Meta モデルです。

2 最小読み取り読む
オーディオAI

安定したオーディオの潜在拡散

Stable Audio は、潜在拡散を使用して音楽とサウンド効果を生成し、クリップの長さを明示的に制御する、Stability AI のテキスト音声変換システムです。

2 最小読み取り読む
オーディオAI

Kaldi 音声認識ツールキット

Kaldi は、音声認識システムを構築するための主要な研究プラットフォームとなった無料のオープンソース ツールキットです。

2 最小読み取り読む
オーディオAI

Wav2Letter畳み込みASR

Wav2Letter は Facebook AI のエンドツーエンドの音声認識システムで、再帰性のない畳み込みニューラル ネットワークのみを使用します。

2 最小読み取り読む
オーディオAI

Jasper および QuartzNet ASR

Jasper と QuartzNet は、NVIDIA のエンドツーエンドの畳み込み音声認識モデルであり、QuartzNet は劇的に小型で効率的な再設計です…

2 最小読み取り読む
オーディオAI

オーディオの普及モデル

拡散モデルは、段階的なノイズ処理を逆転することを学習することでオーディオを生成し、ランダムなノイズを一貫した音声、音楽、効果音に変換します。

2 最小読み取り読む
オーディオAI

サウンドイベントの検出

サウンド イベント検出 (SED) は、オーディオ ストリーム内で発生するサウンドと、その開始と終了を正確に識別します。

2 最小読み取り読む

読み終わりましたか?証明してみろ。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 7 of 10 | AI Understanding