免费人工智能库

音频人工智能 指南永远免费。

117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

117免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

117 1019 显示指南。按曲目过滤或在上方搜索。

音频人工智能

苏诺和乌迪奥

Suno 和 Udio 是两个领先的消费者 AI 音乐生成器,它们可以将简短的文本提示转换为完整的、接近录音室质量的歌曲 - 配有人声......

2 最小阅读量阅读
音频人工智能

象征性音乐的产生

符号音乐生成将音乐创建为结构化记谱——音符、音调、持续时间和时间(通常为 MIDI)——而不是原始音频。

2 最小阅读量阅读
音频人工智能

梅尔频率倒谱系数

梅尔倒谱系数 (MFCC) 是一组紧凑的数字,概括了人耳感知声音频谱的形状……

2 最小阅读量阅读
音频人工智能

波网

WaveNet 由 DeepMind 于 2016 年推出,是一种突破性的神经网络,它一次生成一个原始音频样本,产生极其自然的语音……

2 最小阅读量阅读
音频人工智能

塔克特隆 2

Tacotron 2 是来自 Google (2017) 的端到端文本转语音系统,可将书面文本直接转换为梅尔频谱图,然后由神经声码器将其转换...

2 最小阅读量阅读
音频人工智能

音频 Deepfake 检测

音频深度伪造检测是一组用于判断语音录音是由真人说出还是由人工智能合成/克隆的技术。

2 最小阅读量阅读
音频人工智能

韵律建模

韵律建模教机器语音的旋律、节奏、音调、重音和基于单词的节奏。

2 最小阅读量阅读
音频人工智能

情感语音合成

情感语音合成生成的声音听起来像是快乐、悲伤、愤怒或平静,不仅易于理解,而且让人感觉可信。

2 最小阅读量阅读
音频人工智能

语音转换

语音转换可以转换一个人录制的语音,使其听起来像是其他人所说的,同时保留原来的单词和时间。

2 最小阅读量阅读
音频人工智能

说话人分类

说话者分类回答了“谁在何时说话?”的问题。通过将录音分割成按说话者身份标记的片段。

2 最小阅读量阅读
音频人工智能

发言者验证

说话人验证可确认语音是否与特定的声称身份匹配,充当基于语音的密码。

2 最小阅读量阅读
音频人工智能

语音活动检测

语音活动检测 (VAD) 会时刻判断音频信号是包含人类语音还是仅包含静音和噪音。

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.