CREPE 间距估计
CREPE 是一种深度学习模型,可直接从原始波形估计单声道音频信号的基频(音调)。
概述
It set a new accuracy standard for pitch tracking, especially on noisy or difficult recordings.
深入探讨
CREPE(音高估计的卷积表示)由 Kim、Salamon、Li 和 Bello 于 2018 年提出,可预测单音(单音)音频(例如演唱的声音或独奏乐器)的音高。与 YIN 或 pYIN 等依赖于信号自相关的经典算法不同,CREPE 是直接在时域音频帧上训练的深度卷积神经网络。它将音高估计构建为一个分类问题:它输出 360 个音高区间的概率分布,跨越大约 6 个八度音阶,每个区间间隔 20 音分。具有最高激活值的箱,通过局部加权平均值进行细化,给出了估计频率加上置信度分数。事实证明,CREPE 明显比信号处理方法更稳健,尤其是在噪声条件下,并且现在已成为许多音乐和语音分析流程中的标准组件。
技术洞察
CREPE 采用 1024 个样本的音频帧,并将其传递给六个堆叠的卷积层,最终形成具有 sigmoid 激活的 360 个单元的输出层。每个单元对应于大约六个八度音阶间隔 20 音分的音高仓。该网络针对以真实音高为中心的高斯模糊目标,使用二元交叉熵进行训练。推断时,预测频率是峰箱周围激活的局部加权平均值,峰高作为置信值。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
CREPE 间距估计的未来
音高估计正在朝着处理复调(多个同时音符)的联合模型、实时调音和自动和声的更低延迟以及在手机和嵌入式设备上运行的更小的蒸馏网络的方向发展。 CREPE 的置信度输出越来越多地反馈到自动转录、声音校正和表达性能分析等下游任务中。学习音高以及音色和发音的自我监督和多任务方法可能会将 CREPE 式的准确性扩展到干净的单声道音频之外。
现实世界的实施
跟踪歌手的音高以在声乐训练应用程序中提供实时调音反馈
使用精确的基频曲线驱动自动调谐和音调校正工具
将独奏乐器旋律转录成 MIDI 或乐谱
音乐教育和表演研究中的语调和颤音分析
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CREPE Pitch Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is CREPE Pitch Estimation?
CREPE 是一种深度学习模型,可直接从原始波形估计单声道音频信号的基频(音高)。它为音高跟踪设定了新的准确度标准,尤其是在嘈杂或困难的录音中。
CREPE 从音频信号中估计出什么?
CREPE 预测单声道音频的基频,即感知的音调。
CREPE主要是为什么样的音频而设计的?
CREPE 估计单声道信号的音高,例如单个声音或独奏乐器。
CREPE 内部如何构建音调估计任务?
CREPE 输出超过 360 个音调箱的概率分布,将估计视为分类。
CREPE 将什么作为其直接输入?
与基于频谱图的方法不同,CREPE 通过卷积层对原始波形帧进行操作。
CREPE 的沥青箱之间的距离大约是多少?
CREPE 使用 360 个间隔 20 美分的箱,在大约六个八度音程内提供亚半音分辨率。