無料のAIライブラリ

オーディオAI ガイド永久無料。

117 平易な英語のガイド、構造化された学習パス、オープン ライブラリ - 独立した 501(c)(3) 非営利団体によって構築され、誰でも最新の AI を理解できるようになります。

117無料ガイド
1トピックトラック
~2 minガイドごと
~4h読書時間

ここから始めましょう

5 成果ベースのコース

各コースには、明示的な成果、マッピングされたコンピテンシー、練習アクティビティ、および適用されたキャップストーンが含まれています。

トピックトラック

トラックごとに閲覧する

気になるエリアに飛び込んでみましょう。すべてのトラックには複数のわかりやすい英語のガイドが付いています。

フルライブラリ

すべてのガイド

117 1019 ガイドが表示されます。トラックでフィルタリングするか、上で検索してください。

オーディオAI

ビームフォーミングとマイクアレイ

ビームフォーミングでは、複数のマイクを使用して選択した方向を聞き、ターゲットからの音を増幅し、他のすべてを抑制します。

2 最小読み取り読む
オーディオAI

拡散スペクトログラムの拡散

Riffusion は、音を画像として扱うことで音楽を生成する賢いハックです。安定拡散画像モデルを微調整してスペクトログラムをペイントし、その後…

2 最小読み取り読む
オーディオAI

MusicLM: 階層的なセマンティックおよび音響トークン

Google MusicLM が階層的なセマンティック トークンと音響トークン、SoundStream、および MuLan を使用して、テキスト プロンプトを一貫した音楽に変える方法を学びましょう。

2 最小読み取り読む
オーディオAI

Noise2Noise音声強調

Noise2Noise は、異なるノイズを含むペアから学習することで、クリーンな参照を見ることなくモデルがノイズを除去できるようにするトレーニング トリックです。

2 最小読み取り読む
オーディオAI

Conv-TasNet 時間領域分離

Conv-TasNet は、生の音声波形を直接処理することで、混合オーディオ (2 人が同時に話しているような) を分離するニューラル ネットワークです。

2 最小読み取り読む
オーディオAI

デュアルパス RNN 分離

デュアルパス RNN (DPRNN) は、非常に長いオーディオ特徴のシーケンスを短く重複するチャンクに分割し、それらを処理するオーディオ分離アーキテクチャです。

2 最小読み取り読む
オーディオAI

オープンアンミックス音楽の分離

Open-Unmix (UMX) は、曲をボーカル、ドラム、ベース、その他の楽器のパートに分割するオープンソースの深層学習システムです。

2 最小読み取り読む
オーディオAI

ウィスパーのタイムスタンプ付き単語のアライメント

ウィスパー ワード アライメントは、書き起こされた各ワードを音声内の正確な開始時間と終了時間に固定します。

2 最小読み取り読む
オーディオAI

トランスフォーマーによる音楽のタグ付け

音楽のタグ付けでは、トランスフォーマー モデルを使用して曲を聴き、ジャンル、ムード、楽器、テンポなどの説明的なラベルを予測します。

2 最小読み取り読む
オーディオAI

オーディオのオンセット検出

オンセット検出は、オーディオ信号内で音符、ビート、サウンドが始まる正確な瞬間を検出します。

2 最小読み取り読む
オーディオAI

MelGAN ジェネレーティブ ボコーダー

MelGAN は、単一の早送りパスでメル スペクトログラムを生のオーディオ波形に変換する完全畳み込み GAN ベースのボコーダーです。

2 最小読み取り読む
オーディオAI

UnivNet マルチ解像度ボコーダー

UnivNet は、異なる STFT 解像度で計算された複数のスペクトログラムを使用して生成されたオーディオを判断し、高周波のディテールを鮮明にする GAN ボコーダーです。

2 最小読み取り読む

読み終わりましたか?証明してみろ。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 6 of 10 | AI Understanding