免费人工智能库

音频人工智能 指南永远免费。

117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

117免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

117 1019 显示指南。按曲目过滤或在上方搜索。

音频人工智能

翻唱歌曲识别

翻唱歌曲识别可以检测两个听起来截然不同的录音实际上是同一首歌曲——现场原声版本、混音版……

2 最小阅读量阅读
音频人工智能

DDSP 可微分音频合成

DDSP(可微分数字信号处理)将经典合成器构建块与神经网络融合在一起,因此深度学习可以控制振荡器……

2 最小阅读量阅读
音频人工智能

VITS 端到端语音合成

VITS 是一种文本转语音模型,可在单个经过训练的系统中将文本直接转换为原始音频波形,跳过通常的两级管道。

2 最小阅读量阅读
音频人工智能

FastSpeech 和非自回归 TTS

FastSpeech 并行生成整个语音频谱图,而不是一次生成一帧,从而使合成速度显着更快、更稳定。

2 最小阅读量阅读
音频人工智能

自然语音和潜在扩散 TTS

NaturalSpeech 是 Microsoft TTS 研究的一个系列,旨在实现人类水平的语音质量,后续版本使用潜在扩散来生成丰富、自然的……

2 最小阅读量阅读
音频人工智能

语音情感识别

语音情绪识别 (SER) 是一种人工智能,可以从说话者的声音中检测他们的情绪状态——愤怒、快乐、悲伤、沮丧,而不仅仅是……

2 最小阅读量阅读
音频人工智能

Moshi 全双工语音

Moshi 是 Kyutai 的一款开源实时语音 AI,它可以同时说话和聆听(全双工),而不是严格轮流。

2 最小阅读量阅读
音频人工智能

语音到语音翻译

语音转语音翻译 (S2ST) 获取一种语言的口语单词并生成另一种语言的口语单词 - 理想地保留说话者的声音、语气……

2 最小阅读量阅读
音频人工智能

HiFi-GAN 和 GAN 声码器

HiFi-GAN 是一种生成对抗式声码器,几乎可以立即将梅尔频谱图转换为原始音频波形,从而产生录音室质量的语音......

2 最小阅读量阅读
音频人工智能

字素到音素的转换

字素到音素 (G2P) 转换将书面字母转换为语音系统实际应发音的声音。

2 最小阅读量阅读
音频人工智能

语音文本规范化

文本规范化是在语音系统说出原始书面文本之前将其重写为完全说出的单词的前端步骤。

2 最小阅读量阅读
音频人工智能

SoundStream 神经编解码器

SoundStream 是 Google 的端到端神经音频编解码器,可将语音和音乐压缩到极低的比特率,同时保持质量。

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.