免費人工智慧庫

音訊人工智慧 指南永遠免費。

117 簡明英語指南、結構化學習路徑和開放圖書館——由獨立的 501(c)(3) 非營利組織構建,以便任何人都可以理解現代人工智慧。

117免費指南
1主題曲目
~2 min根據指南
~4h閱讀時間

從這裡開始

基於結果的課程

每門課程都包括明確的成果、映射的能力、實踐活動和應用的頂點。

主題曲目

按曲目瀏覽

跳入您關心的領域。每條賽道都有多個簡單的英文指南。

全庫

所有指南

117 1019 顯示指南。按曲目過濾或上方搜尋。

音訊人工智慧

音訊字幕

音訊字幕產生描述音訊剪輯內容的自然語言句子,例如「火車通過平交道時喇叭鳴響」。

2 最小閱讀量閱讀
音訊人工智慧

耳語語音識別

Whisper 是 OpenAI 的開源自動語音辨識系統,可將音訊轉換為跨 90 多種語言的文字。

2 最小閱讀量閱讀
音訊人工智慧

Wav2Vec 2.0

Wav2Vec 2.0 是 Meta AI 的自我監督語音模型,可從原始、未標記的錄音中學習強大的音訊表示。

2 最小閱讀量閱讀
音訊人工智慧

HuBERT 自監督演講

HuBERT(隱藏單元 BERT)是 Meta AI 的自我監督語音模型,透過預測 BERT 風格的屏蔽片段的聚類音訊單元來學習。

2 最小閱讀量閱讀
音訊人工智慧

神經聲碼器

神經聲碼器是一種將緊湊的聲學表示(通常是梅爾頻譜圖)轉換為實際可聽波形的模型。

2 最小閱讀量閱讀
音訊人工智慧

神經音頻編解碼器

神經音頻編解碼器使用深度學習將聲音壓縮為離散標記的微小流,並以高保真度重建它。

2 最小閱讀量閱讀
音訊人工智慧

VALL-E 和編解碼器語言模型

VALL-E 將文字轉語音重新定義為音訊編解碼器令牌上的語言建模問題,從而可以從僅三秒的樣本中克隆語音。

2 最小閱讀量閱讀
音訊人工智慧

OpenAI 耳語

Whisper 是 OpenAI 的開源自動語音辨識系統,可轉錄和翻譯多種語言的口語音訊。

2 最小閱讀量閱讀
音訊人工智慧

自動音樂轉錄

自動音樂轉錄 (AMT) 將原始音樂錄音轉換為符號符號,例如樂譜、MIDI 或鋼琴捲軸。

2 最小閱讀量閱讀
音訊人工智慧

節拍和節奏跟踪

節拍和節奏追蹤的任務是找到音樂中的穩定脈動:每個節拍落在哪裡以及歌曲每分鐘節拍 (BPM) 的移動速度。

2 最小閱讀量閱讀
音訊人工智慧

音頻指紋識別

音頻指紋辨識可以創建一個緊湊、抗噪音的聲音數位簽名,以便以後即使在背景噪音的情況下也可以識別它...

2 最小閱讀量閱讀
音訊人工智慧

點唱機

Jukebox 是 OpenAI 的 2020 年神經網絡,可產生原始音樂音訊 - 包括歌聲、樂器,甚至特定風格的歌詞…

2 最小閱讀量閱讀

讀完了嗎?證明一下。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 8 of 10 | AI Understanding