免费人工智能库

音频人工智能 指南永远免费。

117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

117免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

117 1019 显示指南。按曲目过滤或在上方搜索。

音频人工智能

DiffWave 扩散声码器

DiffWave 是一种基于扩散的声码器,通过迭代地将随机噪声去噪为以梅尔频谱图为条件的波形来合成音频。

2 最小阅读量阅读
音频人工智能

树皮生成音频模型

Bark 是 Suno 的开源文本到音频模型,它不仅可以生成语音,还可以直接从文本提示生成笑声、叹息、音乐和声音效果。

2 最小阅读量阅读
音频人工智能

Tortoise TTS 自回归合成

Tortoise TTS 是一种开源文本转语音系统,因其异常自然、情感丰富的声音以及从几个简短的声音克隆而来的强大声音而备受赞誉。

2 最小阅读量阅读
音频人工智能

XTTS 跨语言语音克隆

XTTS 是 Coqui 的多语言文本转语音模型,可以从短片中克隆声音,然后用多种不同的语言说话,同时保留...

2 最小阅读量阅读
音频人工智能

SoundStorm 并行音频生成

SoundStorm 是一种 Google 音频生成模型,它并行生成语音和声音,而不是一次生成一个令牌,从而实现高质量的音频合成……

2 最小阅读量阅读
音频人工智能

AudioGen 文本到音频合成

AudioGen 是一个 Meta 模型,可将文本描述转换为逼真的环境声音和音效,例如“狗叫,鸟鸣”。

2 最小阅读量阅读
音频人工智能

稳定的音频潜在扩散

Stable Audio 是 Stability AI 的文本转音频系统,它使用潜在扩散来生成音乐和声音效果,并明确控制剪辑长度。

2 最小阅读量阅读
音频人工智能

Kaldi 语音识别工具包

Kaldi 是一个免费的开源工具包,已成为构建语音识别系统的主要研究平台。

2 最小阅读量阅读
音频人工智能

Wav2Letter 卷积 ASR

Wav2Letter 是 Facebook AI 的端到端语音识别系统,仅使用卷积神经网络,无递归。

2 最小阅读量阅读
音频人工智能

Jasper 和 QuartzNet ASR

Jasper 和 QuartzNet 是 NVIDIA 的端到端卷积语音识别模型,QuartzNet 是一个更小、更高效的重新设计......

2 最小阅读量阅读
音频人工智能

音频扩散模型

扩散模型通过学习逆转逐步的噪声过程来生成音频,将随机噪声转化为连贯的语音、音乐或声音效果。

2 最小阅读量阅读
音频人工智能

声音事件检测

声音事件检测 (SED) 可以识别音频流中出现的声音以及声音的确切开始和停止时间。

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.