Estimación del tono CREPE
CREPE es un modelo de aprendizaje profundo que estima la frecuencia fundamental (tono) de una señal de audio monofónica directamente a partir de su forma de onda sin procesar.
Descripción general
It set a new accuracy standard for pitch tracking, especially on noisy or difficult recordings.
Buceo profundo
CREPE (Representación convolucional para la estimación del tono), introducido en 2018 por Kim, Salamon, Li y Bello, predice el tono de un audio de una sola nota (monofónico), como una voz cantada o un instrumento solista. A diferencia de los algoritmos clásicos como YIN o pYIN que se basan en la autocorrelación de la señal, CREPE es una red neuronal convolucional profunda entrenada directamente en fotogramas de audio en el dominio del tiempo. Enmarca la estimación del tono como un problema de clasificación: genera una distribución de probabilidad en 360 contenedores de tono que abarcan aproximadamente seis octavas, cada uno con una separación de 20 centavos. El contenedor con la mayor activación, refinado con un promedio ponderado local, proporciona la frecuencia estimada más una puntuación de confianza. CREPE demostró ser notablemente más robusto que los métodos de procesamiento de señales, particularmente bajo ruido, y ahora es un componente estándar en muchos procesos de análisis de música y voz.
Información técnica
CREPE toma un cuadro de audio de 1024 muestras y lo pasa a través de seis capas convolucionales apiladas, terminando en una capa de salida de 360 unidades con activaciones sigmoideas. Cada unidad corresponde a un contenedor de tono con una separación de 20 centavos a lo largo de aproximadamente seis octavas. La red se entrena con entropía cruzada binaria contra un objetivo borroso gaussiano centrado en el tono real. Por inferencia, la frecuencia predicha es el promedio ponderado local de activaciones alrededor del contenedor de picos, y la altura del pico sirve como valor de confianza.
Impacto Estratégico
Access and reach
Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.
Costo y presupuesto
Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.
Speed and scale
Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.
El futuro de la estimación del tono CREPE
La estimación del tono se está moviendo hacia modelos conjuntos que manejan la polifonía (múltiples notas simultáneas), una latencia más baja para la afinación y la armonía automática en tiempo real, y redes destiladas más pequeñas que se ejecutan en teléfonos y dispositivos integrados. Los resultados de confianza de CREPE se incorporan cada vez más a tareas posteriores como la transcripción automática, la corrección vocal y el análisis de la interpretación expresiva. Es probable que los enfoques autosupervisados y multitarea que aprenden el tono junto con el timbre y la articulación extiendan la precisión del estilo CREPE más allá del audio monofónico limpio.
Implementación en el mundo real
Seguimiento del tono de un cantante para obtener comentarios de afinación en tiempo real en aplicaciones de entrenamiento vocal
Manejo de herramientas de corrección de tono y sintonización automática con curvas de frecuencia fundamental precisas
Transcribir melodías de instrumentos solistas a MIDI o partituras
Análisis de la entonación y el vibrato en la educación musical y la investigación escénica.
Riesgos y barandillas
Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.
La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.
El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.
Hoja de ruta de implementación
Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.
Pruebe la calidad en diversos oradores y condiciones de fondo.
Defina cuándo un humano debe revisar o aprobar los resultados.
Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CREPE Pitch Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
TTS con control de tono FastPitch
Preguntas frecuentes
What is CREPE Pitch Estimation?
CREPE es un modelo de aprendizaje profundo que estima la frecuencia fundamental (tono) de una señal de audio monofónica directamente a partir de su forma de onda sin procesar. Estableció un nuevo estándar de precisión para el seguimiento del tono, especialmente en grabaciones ruidosas o difíciles.
¿Qué estima CREPE a partir de una señal de audio?
CREPE predice la frecuencia fundamental, es decir, el tono percibido, del audio monofónico.
¿CREPE está diseñado principalmente para qué tipo de audio?
CREPE estima el tono de señales monofónicas, como una sola voz o un instrumento solista.
¿Cómo encuadra CREPE internamente la tarea de estimación del tono?
CREPE genera una distribución de probabilidad en 360 contenedores de tono, tratando la estimación como clasificación.
¿Qué toma CREPE como insumo directo?
A diferencia de los métodos basados en espectrogramas, CREPE opera en marcos de formas de onda sin procesar a través de capas convolucionales.
¿Aproximadamente a qué distancia están los contenedores de brea de CREPE?
CREPE utiliza 360 contenedores espaciados 20 centavos, lo que proporciona una resolución de subsemitono en aproximadamente seis octavas.