免費人工智慧庫

音訊人工智慧 指南永遠免費。

117 簡明英語指南、結構化學習路徑和開放圖書館——由獨立的 501(c)(3) 非營利組織構建,以便任何人都可以理解現代人工智慧。

117免費指南
1主題曲目
~2 min根據指南
~4h閱讀時間

從這裡開始

基於結果的課程

每門課程都包括明確的成果、映射的能力、實踐活動和應用的頂點。

主題曲目

按曲目瀏覽

跳入您關心的領域。每條賽道都有多個簡單的英文指南。

全庫

所有指南

117 1019 顯示指南。按曲目過濾或上方搜尋。

音訊人工智慧

Mimi 串流音訊編解碼器

Mimi 是一種神經音頻編解碼器,可將語音即時壓縮為微小的離散標記流,因此 AI 模型可以以非常低的速度聽和說…

2 最小閱讀量閱讀
音訊人工智慧

聽、聽、拼寫

Listen、Attend and Spell (LAS) 是 2015 年具有里程碑意義的神經網絡,它可以將語音直接轉錄成字符,無需手工構建發音…

2 最小閱讀量閱讀
音訊人工智慧

用於語音辨識的 SpecAugment

SpecAugment 是一種簡單但功能強大的資料增強方法,可屏蔽和扭曲語音頻譜圖,使辨識模型更加穩健。

2 最小閱讀量閱讀
音訊人工智慧

音樂自動標記

音樂自動標記使用機器學習來聽歌曲並自動附加描述性標籤,例如流派、情緒、樂器和節奏。

2 最小閱讀量閱讀
音訊人工智慧

音樂音色轉移

音色轉換重塑了音頻的“音色”,使一種樂器聽起來像另一種樂器,將哼唱的旋律變成小提琴或小號線......

2 最小閱讀量閱讀
音訊人工智慧

聲學場景分類

聲學場景分類 (ASC) 訓練機器識別錄音的環境,繁忙的街道、安靜的公園、火車、咖啡館…

2 最小閱讀量閱讀
音訊人工智慧

NVIDIA Riva 和 NeMo 語音

NVIDIA Riva 是一款用於生產語音 AI(ASR、TTS 和翻譯)的 GPU 加速 SDK,而 NeMo 是用於訓練和微調的開源工具包…

2 最小閱讀量閱讀
音訊人工智慧

深度語音架構

DeepSpeech 是百度於 2014 年推出的端對端語音辨識模型,它使用循環神經網路將原始音訊特徵直接映射到文字...

2 最小閱讀量閱讀
音訊人工智慧

X 向量揚聲器嵌入

X 向量是由神經網路產生的說話者聲音的固定長度數位指紋,用於判斷誰在說話,無論他們說什麼。

2 最小閱讀量閱讀
音訊人工智慧

Glow-TTS 單調對齊

Glow-TTS 是一種文字轉語音模型,它可以使用巧妙的搜尋技巧自行學習將文字與語音對齊,從而無需單獨的對齊器。

2 最小閱讀量閱讀
音訊人工智慧

並行 WaveGAN 聲碼器

Parallel WaveGAN 是一種快速神經聲碼器,它使用小型 GAN 將梅爾頻譜圖轉換為原始音訊波形,同時產生所有樣本。

2 最小閱讀量閱讀
音訊人工智慧

WaveGlow 基於流的聲碼器

WaveGlow 是 NVIDIA 的一款基於串流的神經聲碼器,可一次從梅爾頻譜圖合成語音波形,無需自回歸。

2 最小閱讀量閱讀

讀完了嗎?證明一下。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.