免费人工智能库

音频人工智能 指南永远免费。

117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

117免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

117 1019 显示指南。按曲目过滤或在上方搜索。

音频人工智能

波束形成和麦克风阵列

波束成形使用多个麦克风在选定的方向上监听,放大来自目标的声音,同时抑制其他声音。

2 最小阅读量阅读
音频人工智能

扩散频谱图扩散

Riffusion 是一种巧妙的技巧,通过将声音视为图片来生成音乐:它微调稳定扩散图像模型来绘制频谱图,然后……

2 最小阅读量阅读
音频人工智能

MusicLM:分层语义和声学标记

了解 Google MusicLM 如何使用分层语义和声学标记、SoundStream 和 MuLan 将文本提示转换为连贯的音乐。

2 最小阅读量阅读
音频人工智能

Noise2Noise 语音增强

Noise2Noise 是一种训练技巧,通过从成对的不同噪声中学习,模型可以在没有看到干净参考的情况下学习消除噪声......

2 最小阅读量阅读
音频人工智能

Conv-TasNet 时域分离

Conv-TasNet 是一种神经网络,它通过直接处理原始声音波形来分离混合音频(就像两个人同时说话)......

2 最小阅读量阅读
音频人工智能

双路径 RNN 分离

双路径 RNN (DPRNN) 是一种音频分离架构,它将很长的音频特征序列分割成短的重叠块并处理它们......

2 最小阅读量阅读
音频人工智能

打开-分离音乐分离

Open-Unmix (UMX) 是一种开源深度学习系统,它将歌曲分成几个部分:人声、鼓、贝斯和其他乐器。

2 最小阅读量阅读
音频人工智能

Whisper 带时间戳的字对齐

Whisper 单词对齐将每个转录单词固定到音频中的准确开始和结束时间。

2 最小阅读量阅读
音频人工智能

使用变形金刚进行音乐标记

音乐标签使用 Transformer 模型来聆听歌曲并预测描述性标签,例如流派、情绪、乐器和节奏。

2 最小阅读量阅读
音频人工智能

音频中的起始检测

起始点检测可找到音频信号中音符、节拍或声音开始的精确时刻。

2 最小阅读量阅读
音频人工智能

MelGAN 生成声码器

MelGAN 是一种基于 GAN 的全卷积声码器,可在单次快速前向传递中将梅尔声谱图转换为原始音频波形。

2 最小阅读量阅读
音频人工智能

UnivNet 多分辨率声码器

UnivNet 是一种 GAN 声码器,它使用在不同 STFT 分辨率下计算的多个频谱图来判断生成的音频,从而锐化高频细节。

2 最小阅读量阅读

读完了吗?证明给我看。

通过主题测验检查您学到了什么,然后探索我们的结构化课程或努力获得证书。每本指南都可以免费阅读。

音频 AI AI 指南 — 第 6 页(共 10 页) | AI Understanding