免費人工智慧庫

音訊人工智慧 指南永遠免費。

117 簡明英語指南、結構化學習路徑和開放圖書館——由獨立的 501(c)(3) 非營利組織構建,以便任何人都可以理解現代人工智慧。

117免費指南
1主題曲目
~2 min根據指南
~4h閱讀時間

從這裡開始

基於結果的課程

每門課程都包括明確的成果、映射的能力、實踐活動和應用的頂點。

主題曲目

按曲目瀏覽

跳入您關心的領域。每條賽道都有多個簡單的英文指南。

全庫

所有指南

117 1019 顯示指南。按曲目過濾或上方搜尋。

音訊人工智慧

DiffWave 擴散聲碼器

DiffWave 是一種基於擴散的聲碼器,透過迭代地將隨機雜訊去噪為以梅爾頻譜圖為條件的波形來合成音訊。

2 最小閱讀量閱讀
音訊人工智慧

樹皮生成音訊模型

Bark 是 Suno 的開源文字到音訊模型,它不僅可以產生語音,還可以直接從文字提示產生笑聲、嘆息、音樂和聲音效果。

2 最小閱讀量閱讀
音訊人工智慧

Tortoise TTS 自回歸合成

Tortoise TTS 是一種開源文字轉語音系統,因其異常自然、情感豐富的聲音以及從幾個簡短的聲音克隆而來的強大聲音而備受讚譽。

2 最小閱讀量閱讀
音訊人工智慧

XTTS 跨語言語音克隆

XTTS 是 Coqui 的多語言文字轉語音模型,可以從短片中複製聲音,然後用多種不同的語言說話,同時保留...

2 最小閱讀量閱讀
音訊人工智慧

SoundStorm 並行音訊生成

SoundStorm 是一種 Google 音訊生成模型,它並行生成語音和聲音,而不是一次生成一個令牌,從而實現高品質的音訊合成…

2 最小閱讀量閱讀
音訊人工智慧

AudioGen 文字到音訊合成

AudioGen 是 Meta 模型,可將文字描述轉換為逼真的環境聲音和音效,例如「狗叫,鳥鳴」。

2 最小閱讀量閱讀
音訊人工智慧

穩定的音頻潛在擴散

Stable Audio 是 Stability AI 的文字轉音訊系統,它使用潛在擴散來產生音樂和聲音效果,並明確控制剪輯長度。

2 最小閱讀量閱讀
音訊人工智慧

Kaldi 語音辨識工具包

Kaldi 是一個免費的開源工具包,已成為建立語音辨識系統的主要研究平台。

2 最小閱讀量閱讀
音訊人工智慧

Wav2Letter 卷積 ASR

Wav2Letter 是 Facebook AI 的端對端語音辨識系統,僅使用卷積神經網絡,無遞歸。

2 最小閱讀量閱讀
音訊人工智慧

Jasper 和 QuartzNet ASR

Jasper 和 QuartzNet 是 NVIDIA 的端對端卷積語音辨識模型,QuartzNet 是一個更小、更有效率的重新設計…

2 最小閱讀量閱讀
音訊人工智慧

音頻擴散模型

擴散模型透過學習逆轉逐步的噪音過程來產生音頻,將隨機噪音轉化為連貫的語音、音樂或聲音效果。

2 最小閱讀量閱讀
音訊人工智慧

聲音事件偵測

聲音事件偵測 (SED) 可以辨識音訊串流中出現的聲音以及聲音的確切開始和停止時間。

2 最小閱讀量閱讀

讀完了嗎?證明一下。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.