無料のAIライブラリ

オーディオAI ガイド永久無料。

117 平易な英語のガイド、構造化された学習パス、オープン ライブラリ - 独立した 501(c)(3) 非営利団体によって構築され、誰でも最新の AI を理解できるようになります。

117無料ガイド
1トピックトラック
~2 minガイドごと
~4h読書時間

ここから始めましょう

5 成果ベースのコース

各コースには、明示的な成果、マッピングされたコンピテンシー、練習アクティビティ、および適用されたキャップストーンが含まれています。

トピックトラック

トラックごとに閲覧する

気になるエリアに飛び込んでみましょう。すべてのトラックには複数のわかりやすい英語のガイドが付いています。

フルライブラリ

すべてのガイド

117 1019 ガイドが表示されます。トラックでフィルタリングするか、上で検索してください。

オーディオAI

カバー曲の識別

カバー曲の識別は、2 つの非常に異なるサウンドの録音が実際には同じ基礎曲であることを検出します (ライブのアコースティック バージョン、リミックスなど)。

2 最小読み取り読む
オーディオAI

DDSP 微分可能オーディオ合成

DDSP (Differentiable Digital Signal Processing) は、古典的なシンセサイザーのビルディング ブロックとニューラル ネットワークを融合するため、ディープ ラーニングで発振器を制御できるようになります…

2 最小読み取り読む
オーディオAI

VITS エンドツーエンド音声合成

VITS は、通常の 2 段階のパイプラインをスキップし、単一のトレーニング済みシステム内でテキストを直接生のオーディオ波形に変換するテキスト読み上げモデルです。

2 最小読み取り読む
オーディオAI

FastSpeech と非自己回帰 TTS

FastSpeech は、一度に 1 フレームずつではなく、音声スペクトログラム全体を並行して生成するため、合成が劇的に高速かつ安定します。

2 最小読み取り読む
オーディオAI

NaturalSpeech と潜在拡散 TTS

NaturalSpeech は、人間レベルの音声品質を目的とした Microsoft TTS 研究の一環であり、後のバージョンでは潜在拡散を使用して豊かで自然な音声を生成します。

2 最小読み取り読む
オーディオAI

音声感情認識

音声感情認識 (SER) は、話者の感情状態 (怒り、喜び、悲しみ、フラストレーション) を声の音から検出する AI です。

2 最小読み取り読む
オーディオAI

Moshi 全二重スピーチ

Moshi は、Kyutai が開発したオープンソースのリアルタイム音声 AI で、厳密に順番を変えるのではなく、話したり聞いたりを同時に (全二重) 行います。

2 最小読み取り読む
オーディオAI

音声から音声への翻訳

Speech-to-Speech Translation (S2ST) は、ある言語で話された言葉を受け取り、別の言語で話された言葉を生成します。理想的には話者の声、トーンを維持します。

2 最小読み取り読む
オーディオAI

HiFi-GAN および GAN​​ ボコーダー

HiFi-GAN は、メル スペクトログラムをほぼ瞬時に生のオーディオ波形に変換し、スタジオ品質の音声を瞬時に生成する敵対的生成ボコーダーです。

2 最小読み取り読む
オーディオAI

書記素から音素への変換

書記素から音素への (G2P) 変換は、書かれた文字を音声システムが実際に発音すべき音に変換します。

2 最小読み取り読む
オーディオAI

音声のテキスト正規化

テキストの正規化は、音声システムが発話する前に、生の書かれたテキストを完全に話された言葉に書き換えるフロントエンドのステップです。

2 最小読み取り読む
オーディオAI

SoundStream ニューラル コーデック

SoundStream は、品質を維持しながら音声と音楽を非常に低いビットレートに圧縮する Google のエンドツーエンドのニューラル オーディオ コーデックです。

2 最小読み取り読む

読み終わりましたか?証明してみろ。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.