免费人工智能库

音频人工智能 指南永远免费。

117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

117免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

117 1019 显示指南。按曲目过滤或在上方搜索。

音频人工智能

音频字幕

音频字幕生成描述音频剪辑内容的自然语言句子,例如“火车通过平交路口时喇叭鸣响”。

2 最小阅读量阅读
音频人工智能

耳语语音识别

Whisper 是 OpenAI 的开源自动语音识别系统,可将音频转换为跨 90 多种语言的文本。

2 最小阅读量阅读
音频人工智能

Wav2Vec 2.0

Wav2Vec 2.0 是 Meta AI 的自我监督语音模型,可从原始、未标记的录音中学习强大的音频表示。

2 最小阅读量阅读
音频人工智能

HuBERT 自监督演讲

HuBERT(隐藏单元 BERT)是 Meta AI 的自监督语音模型,通过预测 BERT 风格的屏蔽片段的聚类音频单元来进行学习。

2 最小阅读量阅读
音频人工智能

神经声码器

神经声码器是一种将紧凑的声学表示(通常是梅尔频谱图)转换为实际可听波形的模型。

2 最小阅读量阅读
音频人工智能

神经音频编解码器

神经音频编解码器使用深度学习将声音压缩为离散标记的微小流,并以高保真度重建它。

2 最小阅读量阅读
音频人工智能

VALL-E 和编解码器语言模型

VALL-E 将文本到语音重新定义为音频编解码器令牌上的语言建模问题,从而可以从仅三秒的样本中克隆语音。

2 最小阅读量阅读
音频人工智能

OpenAI 耳语

Whisper 是 OpenAI 的开源自动语音识别系统,可转录和翻译多种语言的口语音频。

2 最小阅读量阅读
音频人工智能

自动音乐转录

自动音乐转录 (AMT) 将原始音乐录音转换为符号符号,例如乐谱、MIDI 或钢琴卷轴。

2 最小阅读量阅读
音频人工智能

节拍和节奏跟踪

节拍和节奏跟踪的任务是找到音乐中的稳定脉搏:每个节拍落在哪里以及歌曲每分钟节拍 (BPM) 的移动速度。

2 最小阅读量阅读
音频人工智能

音频指纹识别

音频指纹识别可以创建一个紧凑、抗噪声的声音数字签名,以便以后即使在背景噪声的情况下也可以识别它......

2 最小阅读量阅读
音频人工智能

点唱机

Jukebox 是 OpenAI 的 2020 年神经网络,可生成原始音乐音频 - 包括歌声、乐器,甚至特定风格的歌词……

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 8 of 10 | AI Understanding