Biblioteca de IA gratuita

IA de audio guíasGratis para siempre.

117 Guías en inglés sencillo, rutas de aprendizaje estructuradas y una biblioteca abierta, creada por una organización sin fines de lucro independiente 501(c)(3) para que cualquiera pueda comprender la IA moderna.

117Guías gratuitas
1Pistas temáticas
~2 minPor guía
~4hReading time

Empieza aquí

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Pistas temáticas

Navegar por pista

Salta al área que te interesa. Cada pista tiene varias guías en inglés sencillo.

biblioteca completa

Todas las guías

117 de 1019 guías mostradas. Filtrar por pista o buscar arriba.

IA de audio

Separación del tallo del bazo

Spleeter es una herramienta de código abierto de Deezer que divide una canción terminada en pistas separadas (voz, batería, bajo y más) mediante el aprendizaje profundo.

2 lectura mínimaleer
IA de audio

Estimación del tono CREPE

CREPE es un modelo de aprendizaje profundo que estima la frecuencia fundamental (tono) de una señal de audio monofónica directamente a partir de su forma de onda sin procesar.

2 lectura mínimaleer
IA de audio

Métricas de calidad del habla PESQ y STOI

PESQ y STOI son métricas objetivas estándar que califican qué tan bien suena el habla procesada y qué tan comprensible es, sin necesidad de oyentes humanos.

2 lectura mínimaleer
IA de audio

Vocodificación con filtro de fuente y MUNDO

Un vocoder es una herramienta que descompone el habla en sus componentes básicos y los reconstruye.

2 lectura mínimaleer
IA de audio

Evaluación de la puntuación media de opinión

La puntuación media de opinión (MOS) es una calificación promedio de 1 a 5 de oyentes humanos que mide qué tan bien suena el audio sintetizado o transmitido.

2 lectura mínimaleer
IA de audio

Transformación de Q constante para audio

La Transformada Q Constante (CQT) es un análisis de frecuencia que utiliza contenedores espaciados logarítmicamente adaptados al tono musical, en lugar de contenedores espaciados uniformemente...

2 lectura mínimaleer
IA de audio

Funciones del banco de filtros y PLP

Las funciones de banco de filtros y predicción lineal perceptual (PLP) son formas de resumir una señal de voz en números compactos y perceptivamente significativos que maquinan...

2 lectura mínimaleer
IA de audio

Difusión de estilos StyleTTS 2

StyleTTS 2 es un modelo de conversión de texto a voz que trata el "estilo" de la voz (prosodia, emoción y timbre del hablante) como una variable aleatoria muestreada con un modelo de difusión...

2 lectura mínimaleer
IA de audio

TTS con control de tono FastPitch

FastPitch es un modelo de conversión de texto a voz rápido y no autorregresivo que predice explícitamente el tono (frecuencia fundamental) de cada token de entrada, lo que le permite...

2 lectura mínimaleer
IA de audio

Generación de voz que coincide con el flujo de Voicebox

Voicebox es el modelo de generación de voz guiada por texto de Meta entrenado con un objetivo de coincidencia de flujo para "rellenar" audio enmascarado, permitiendo que un modelo haga voz de disparo cero...

2 lectura mínimaleer
IA de audio

Desafío de supresión profunda del ruido

El Desafío de Supresión Profunda de Ruido (DNS) es una competencia organizada por Microsoft que empuja a los investigadores a construir redes neuronales que eliminen el ruido de fondo...

2 lectura mínimaleer
IA de audio

Sustracción espectral y filtrado de Wiener

La resta espectral y el filtrado de Wiener son los caballos de batalla clásicos de reducción de ruido previos al aprendizaje profundo.

2 lectura mínimaleer

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.