免费人工智能库

音频人工智能 指南永远免费。

117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

117免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

117 1019 显示指南。按曲目过滤或在上方搜索。

音频人工智能

歌声合成

歌声合成(SVS)是一种人工智能,可将书面旋律和歌词转化为完整的演唱声乐表演。

2 最小阅读量阅读
音频人工智能

音频LM

AudioLM 是一个 Google 研究框架,通过将声音视为语言并预测它的标记来生成逼真的音频(语音或钢琴音乐)......

2 最小阅读量阅读
音频人工智能

音乐生成器

MusicGen 是 Meta 的 AI 模型,它根据文本描述生成音乐,还可以选择您哼唱或上传的旋律。

2 最小阅读量阅读
音频人工智能

关键词识别和唤醒词

关键字识别是一种始终监听的技术,让设备在弹出之前等待单个触发短语,例如“Hey Siri”或“Alexa”……

2 最小阅读量阅读
音频人工智能

强制对齐

强制对齐会自动将已知的文字记录与其音频对齐,准确标记每个单词或声音的开始和结束时间。

2 最小阅读量阅读
音频人工智能

梅尔谱图

梅尔声谱图是声音随时间变化的图像,其频率间隔与人耳感知音调的方式相同。

2 最小阅读量阅读
音频人工智能

联结主义时间分类

连接主义时间分类 (CTC) 是一种损失函数和解码方法,可让神经网络将长音频序列转换为文本,而无需……

2 最小阅读量阅读
音频人工智能

RNN-传感器模型

RNN-Transducer (RNN-T) 是一种流友好的语音识别架构,它修复了 CTC 的最大弱点——无法对依赖关系进行建模……

2 最小阅读量阅读
音频人工智能

符合者架构

Conformer 是一个神经网络模块,它将卷积与自注意力融合在一起,捕获细粒度的局部声音模式和远程上下文……

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.