免費人工智慧庫

音訊人工智慧 指南永遠免費。

117 簡明英語指南、結構化學習路徑和開放圖書館——由獨立的 501(c)(3) 非營利組織構建,以便任何人都可以理解現代人工智慧。

117免費指南
1主題曲目
~2 min根據指南
~4h閱讀時間

從這裡開始

基於結果的課程

每門課程都包括明確的成果、映射的能力、實踐活動和應用的頂點。

主題曲目

按曲目瀏覽

跳入您關心的領域。每條賽道都有多個簡單的英文指南。

全庫

所有指南

117 1019 顯示指南。按曲目過濾或上方搜尋。

音訊人工智慧

分裂莖分離

Spleeter 是 Deezer 的開源工具,它使用深度學習將完成的歌曲分割成單獨的曲目(人聲、鼓、貝斯等)。

2 最小閱讀量閱讀
音訊人工智慧

CREPE 間距估計

CREPE 是一種深度學習模型,可直接從原始波形估計單聲道音訊訊號的基頻(音調)。

2 最小閱讀量閱讀
音訊人工智慧

PESQ 和 STOI 語音品質指標

PESQ 和 STOI 是標準的客觀指標,可以對處理後的語音聲音的好壞程度以及語音的可理解性進行評分,而無需人類聽眾。

2 最小閱讀量閱讀
音訊人工智慧

來源過濾器聲碼和 WORLD

聲碼器是一種將語音分解為構建塊並重建它的工具。

2 最小閱讀量閱讀
音訊人工智慧

平均意見得分評估

平均意見分數 (MOS) 是人類聽眾的 1 到 5 平均評分,用於衡量合成或傳輸的音訊聲音的好壞程度。

2 最小閱讀量閱讀
音訊人工智慧

音頻的恆定 Q 變換

恆定 Q 變換 (CQT) 是一種頻率分析,它使用與音高匹配的對數間隔的 bin,而不是均勻間隔的 bin…

2 最小閱讀量閱讀
音訊人工智慧

濾波器組和 PLP 功能

濾波器組和感知線性預測 (PLP) 功能是將語音訊號匯總為緊湊的、感知上有意義的數字的方法,這些數字可以加工…

2 最小閱讀量閱讀
音訊人工智慧

StyleTTS 2 風格擴散

StyleTTS 2 是一種文字轉語音模型,它將語音「風格」(韻律、情緒和說話者音色)視為使用擴散模型取樣的隨機變數…

2 最小閱讀量閱讀
音訊人工智慧

FastPitch 音調可控制 TTS

FastPitch 是一種快速、非自回歸的文字轉語音模型,可明確預測每個輸入標記的音調(基本頻率),讓您…

2 最小閱讀量閱讀
音訊人工智慧

Voicebox 流程匹配語音生成

Voicebox 是 Meta 的文字引導語音生成模型,透過流匹配目標進行訓練,以「填充」屏蔽音頻,讓一個模型執行零樣本語音…

2 最小閱讀量閱讀
音訊人工智慧

深度噪音抑制挑戰

深度噪音抑制 (DNS) 挑戰賽是一項 Microsoft 舉辦的競賽,旨在推動研究人員建構去除背景噪音的神經網路…

2 最小閱讀量閱讀
音訊人工智慧

譜減法和維納濾波

譜減法和維納濾波是經典的、預深度學習的降噪主力。

2 最小閱讀量閱讀

讀完了嗎?證明一下。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.