免費人工智慧庫

音訊人工智慧 指南永遠免費。

117 簡明英語指南、結構化學習路徑和開放圖書館——由獨立的 501(c)(3) 非營利組織構建,以便任何人都可以理解現代人工智慧。

117免費指南
1主題曲目
~2 min根據指南
~4h閱讀時間

從這裡開始

基於結果的課程

每門課程都包括明確的成果、映射的能力、實踐活動和應用的頂點。

主題曲目

按曲目瀏覽

跳入您關心的領域。每條賽道都有多個簡單的英文指南。

全庫

所有指南

117 1019 顯示指南。按曲目過濾或上方搜尋。

音訊人工智慧

波束形成和麥克風陣列

波束成形使用多個麥克風在選定的方向上監聽,放大來自目標的聲音,同時抑制其他聲音。

2 最小閱讀量閱讀
音訊人工智慧

擴散頻譜圖擴散

Riffusion 是一種巧妙的技巧,透過將聲音視為圖片來產生音樂:它微調穩定擴散影像模型來繪製頻譜圖,然後…

2 最小閱讀量閱讀
音訊人工智慧

MusicLM:分層語意和聲學標記

了解 Google MusicLM 如何使用分層語意和聲學標記、SoundStream 和 MuLan 將文字提示轉換為連貫的音樂。

2 最小閱讀量閱讀
音訊人工智慧

Noise2Noise 語音增強

Noise2Noise 是一種訓練技巧,透過從成對的不同噪音中學習,模型可以在沒有看到乾淨參考的情況下學習消除噪音…

2 最小閱讀量閱讀
音訊人工智慧

Conv-TasNet 時域分離

Conv-TasNet 是一種神經網絡,它透過直接處理原始聲音波形來分離混音音訊(就像兩個人同時說話)...

2 最小閱讀量閱讀
音訊人工智慧

雙路徑 RNN 分離

雙路徑 RNN (DPRNN) 是一種音訊分離架構,它將很長的音訊特徵序列分割成短的重疊區塊並處理它們...

2 最小閱讀量閱讀
音訊人工智慧

打開-分離音樂分離

Open-Unmix (UMX) 是一種開源深度學習系統,它將歌曲分成幾個部分:人聲、鼓、貝斯和其他樂器。

2 最小閱讀量閱讀
音訊人工智慧

Whisper 帶時間戳的字對齊

Whisper 單字對齊將每個轉錄單字固定到音訊中的準確開始和結束時間。

2 最小閱讀量閱讀
音訊人工智慧

使用變形金剛進行音樂標記

音樂標籤使用 Transformer 模型來聆聽歌曲並預測描述性標籤,例如流派、情緒、樂器和節奏。

2 最小閱讀量閱讀
音訊人工智慧

音訊中的起始檢測

起始點偵測可找到音訊訊號中音符、節拍或聲音開始的精確時刻。

2 最小閱讀量閱讀
音訊人工智慧

MelGAN 產生聲碼器

MelGAN 是一種基於 GAN 的全卷積聲碼器,可在單次快速前向傳遞中將梅爾聲譜圖轉換為原始音訊波形。

2 最小閱讀量閱讀
音訊人工智慧

UnivNet 多重解析度聲碼器

UnivNet 是一種 GAN 聲碼器,它使用在不同 STFT 解析度下計算的多個頻譜圖來判斷產生的音頻,從而銳化高頻細節。

2 最小閱讀量閱讀

讀完了嗎?證明一下。

透過主題測驗檢查您學到了什麼,然後探索我們的結構化課程或努力獲得證書。每本指南都可以免費閱讀。