免费人工智能库

音频人工智能 指南永远免费。

117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

117免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

117 1019 显示指南。按曲目过滤或在上方搜索。

音频人工智能

Mimi 流媒体音频编解码器

Mimi 是一种神经音频编解码器,可将语音实时压缩为微小的离散标记流,因此 AI 模型可以以非常低的速度听和说……

2 最小阅读量阅读
音频人工智能

听、听、拼写

Listen、Attend and Spell (LAS) 是 2015 年具有里程碑意义的神经网络,它可以将语音直接转录成字符,无需手工构建发音……

2 最小阅读量阅读
音频人工智能

用于语音识别的 SpecAugment

SpecAugment 是一种简单但功能强大的数据增强方法,可以屏蔽和扭曲语音频谱图,使识别模型更加稳健。

2 最小阅读量阅读
音频人工智能

音乐自动标记

音乐自动标记使用机器学习来听歌曲并自动附加描述性标签,例如流派、情绪、乐器和节奏。

2 最小阅读量阅读
音频人工智能

音乐音色转移

音色转换重塑了音频的“音色”,使一种乐器听起来像另一种乐器,将哼唱的旋律变成小提琴或小号线......

2 最小阅读量阅读
音频人工智能

声学场景分类

声学场景分类 (ASC) 训练机器识别录音的环境,繁忙的街道、安静的公园、火车、咖啡馆……

2 最小阅读量阅读
音频人工智能

NVIDIA Riva 和 NeMo 语音

NVIDIA Riva 是一款用于生产语音 AI(ASR、TTS 和翻译)的 GPU 加速 SDK,而 NeMo 是用于训练和微调的开源工具包……

2 最小阅读量阅读
音频人工智能

深度语音架构

DeepSpeech 是百度于 2014 年推出的一种端到端语音识别模型,它使用循环神经网络将原始音频特征直接映射到文本......

2 最小阅读量阅读
音频人工智能

X 向量扬声器嵌入

X 向量是由神经网络生成的说话者声音的固定长度数字指纹,用于判断谁在说话,无论他们说什么。

2 最小阅读量阅读
音频人工智能

Glow-TTS 单调对齐

Glow-TTS 是一种文本转语音模型,它可以使用巧妙的搜索技巧自行学习将文本与语音对齐,从而无需单独的对齐器。

2 最小阅读量阅读
音频人工智能

并行 WaveGAN 声码器

Parallel WaveGAN 是一种快速神经声码器,它使用小型 GAN 将梅尔频谱图转换为原始音频波形,同时生成所有样本。

2 最小阅读量阅读
音频人工智能

WaveGlow 基于流的声码器

WaveGlow 是 NVIDIA 的一款基于流的神经声码器,可一次性从梅尔频谱图合成语音波形,无需自回归。

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.