免费人工智能库

音频人工智能 指南永远免费。

117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

117免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

117 1019 显示指南。按曲目过滤或在上方搜索。

音频人工智能

分裂茎分离

Spleeter 是 Deezer 的一款开源工具,它使用深度学习将完成的歌曲分割成单独的曲目(人声、鼓、贝斯等)。

2 最小阅读量阅读
音频人工智能

CREPE 间距估计

CREPE 是一种深度学习模型,可直接从原始波形估计单声道音频信号的基频(音调)。

2 最小阅读量阅读
音频人工智能

PESQ 和 STOI 语音质量指标

PESQ 和 STOI 是标准的客观指标,可以对处理后的语音声音的好坏程度以及语音的可理解性进行评分,而无需人类听众。

2 最小阅读量阅读
音频人工智能

源过滤器声码和 WORLD

声码器是一种将语音分解为构建块并重建它的工具。

2 最小阅读量阅读
音频人工智能

平均意见得分评估

平均意见分数 (MOS) 是人类听众的 1 到 5 平均评分,用于衡量合成或传输的音频声音的好坏程度。

2 最小阅读量阅读
音频人工智能

音频的恒定 Q 变换

恒定 Q 变换 (CQT) 是一种频率分析,它使用与音高匹配的对数间隔的 bin,而不是均匀间隔的 bin……

2 最小阅读量阅读
音频人工智能

滤波器组和 PLP 功能

滤波器组和感知线性预测 (PLP) 功能是将语音信号汇总为紧凑的、感知上有意义的数字的方法,这些数字可以加工……

2 最小阅读量阅读
音频人工智能

StyleTTS 2 风格扩散

StyleTTS 2 是一种文本转语音模型,它将语音“风格”(韵律、情感和说话者音色)视为使用扩散模型采样的随机变量……

2 最小阅读量阅读
音频人工智能

FastPitch 音调可控 TTS

FastPitch 是一种快速、非自回归的文本转语音模型,可显式预测每个输入标记的音调(基本频率),让您……

2 最小阅读量阅读
音频人工智能

Voicebox 流程匹配语音生成

Voicebox 是 Meta 的文本引导语音生成模型,通过流匹配目标进行训练,以“填充”屏蔽音频,让一个模型执行零样本语音……

2 最小阅读量阅读
音频人工智能

深度噪声抑制挑战

深度噪声抑制 (DNS) 挑战赛是一项 Microsoft 举办的竞赛,旨在推动研究人员构建去除背景噪声的神经网络……

2 最小阅读量阅读
音频人工智能

谱减法和维纳滤波

谱减法和维纳滤波是经典的、预深度学习的降噪主力。

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.