免費人工智慧庫

音訊人工智慧 指南永遠免費。

117 簡明英語指南、結構化學習路徑和開放圖書館——由獨立的 501(c)(3) 非營利組織構建,以便任何人都可以理解現代人工智慧。

117免費指南
1主題曲目
~2 min根據指南
~4h閱讀時間

從這裡開始

基於結果的課程

每門課程都包括明確的成果、映射的能力、實踐活動和應用的頂點。

主題曲目

按曲目瀏覽

跳入您關心的領域。每條賽道都有多個簡單的英文指南。

全庫

所有指南

117 1019 顯示指南。按曲目過濾或上方搜尋。

音訊人工智慧

翻唱歌曲識別

翻唱歌曲識別可以檢測兩個聽起來截然不同的錄音實際上是同一首歌曲——現場原聲版本、混音版…

2 最小閱讀量閱讀
音訊人工智慧

DDSP 可微分音訊合成

DDSP(可微分數位訊號處理)將經典合成器建構塊與神經網路融合在一起,因此深度學習可以控制振盪器…

2 最小閱讀量閱讀
音訊人工智慧

VITS 端對端語音合成

VITS 是一種文字轉語音模型,可在單一經過訓練的系統中將文字直接轉換為原始音訊波形,跳過通常的兩級管道。

2 最小閱讀量閱讀
音訊人工智慧

FastSpeech 和非自回歸 TTS

FastSpeech 並行產生整個語頻譜圖,而不是一次產生一幀,從而使合成速度顯著更快、更穩定。

2 最小閱讀量閱讀
音訊人工智慧

自然語音與潛在擴散 TTS

NaturalSpeech 是 Microsoft TTS 研究的一個系列,旨在實現人類水平的語音質量,後續版本使用潛在擴散來生成豐富、自然的…

2 最小閱讀量閱讀
音訊人工智慧

語音情緒識別

語音情緒辨識 (SER) 是一種人工智慧,可以從說話者的聲音中偵測他們的情緒狀態——憤怒、快樂、悲傷、沮喪,而不僅僅是…

2 最小閱讀量閱讀
音訊人工智慧

Moshi 全雙工語音

Moshi 是 Kyutai 的開源即時語音 AI,它可以同時說話和聆聽(全雙工),而不是嚴格輪流。

2 最小閱讀量閱讀
音訊人工智慧

語音轉語音翻譯

語音轉語音翻譯 (S2ST) 獲取一種語言的口語單字並產生另一種語言的口語單字 - 理想地保留說話者的聲音、語氣…

2 最小閱讀量閱讀
音訊人工智慧

HiFi-GAN 和 GAN 聲碼器

HiFi-GAN 是一種生成對抗式聲碼器,幾乎可以立即將梅爾頻譜圖轉換為原始音訊波形,從而產生錄音室品質的語音...

2 最小閱讀量閱讀
音訊人工智慧

字素到音素的轉換

字素到音素 (G2P) 轉換將書面字母轉換為語音系統實際應發音的聲音。

2 最小閱讀量閱讀
音訊人工智慧

語音文字規範化

文字規範化是在語音系統說出原始書面文字之前將其重寫為完全說出的單字的前端步驟。

2 最小閱讀量閱讀
音訊人工智慧

SoundStream 神經編解碼器

SoundStream 是 Google 的端對端神經音訊編解碼器,可將語音和音樂壓縮到極低的位元率,同時保持品質。

2 最小閱讀量閱讀

讀完了嗎?證明一下。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding