Biblioteca de IA gratuita

IA de audio guíasGratis para siempre.

117 Guías en inglés sencillo, rutas de aprendizaje estructuradas y una biblioteca abierta, creada por una organización sin fines de lucro independiente 501(c)(3) para que cualquiera pueda comprender la IA moderna.

117Guías gratuitas
1Pistas temáticas
~2 minPor guía
~4hReading time

Empieza aquí

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Pistas temáticas

Navegar por pista

Salta al área que te interesa. Cada pista tiene varias guías en inglés sencillo.

biblioteca completa

Todas las guías

117 de 1019 guías mostradas. Filtrar por pista o buscar arriba.

IA de audio

Suno y Udio

Suno y Udio son los dos principales generadores de música de IA para el consumidor que convierten un breve mensaje de texto en una canción completa, casi con calidad de estudio, completa con voces...

2 lectura mínimaleer
IA de audio

Generación de música simbólica

La generación de música simbólica crea música como notación estructurada (notas, tonos, duraciones y tiempos (a menudo como MIDI)) en lugar de audio en bruto.

2 lectura mínimaleer
IA de audio

Coeficientes cepstrales de frecuencia Mel

Los coeficientes cepstrales de frecuencia de fusión (MFCC) son un conjunto compacto de números que resumen la forma del espectro de frecuencia de un sonido de la forma en que los oídos humanos perciben...

2 lectura mínimaleer
IA de audio

OndaNet

WaveNet, presentada por DeepMind en 2016, fue una innovadora red neuronal que genera audio sin procesar, una muestra a la vez, produciendo un habla sorprendentemente natural...

2 lectura mínimaleer
IA de audio

Tacotrón 2

Tacotron 2 es un sistema de texto a voz de un extremo a otro de Google (2017) que convierte el texto escrito directamente en un espectrograma mel, que un codificador de voz neuronal convierte...

2 lectura mínimaleer
IA de audio

Detección de audio falso

La detección de audio deepfake es el conjunto de técnicas utilizadas para determinar si una grabación de voz fue pronunciada por un humano real o sintetizada/clonada por IA.

2 lectura mínimaleer
IA de audio

Modelado de prosodia

El modelado de prosodia enseña a las máquinas la melodía del habla, el ritmo, el tono, el acento y el ritmo que se encuentran encima de las palabras.

2 lectura mínimaleer
IA de audio

Síntesis del habla emocional

La síntesis del habla emocional genera voces que suenan felices, tristes, enojadas o tranquilas, no sólo inteligibles sino también creíbles.

2 lectura mínimaleer
IA de audio

Conversión de voz

La conversión de voz transforma el discurso grabado de una persona para que suene como si lo hubiera pronunciado otra persona, manteniendo las palabras y el tiempo originales.

2 lectura mínimaleer
IA de audio

Diarización del orador

La diarioización de los oradores responde a la pregunta "¿quién habló y cuándo?" dividiendo una grabación de audio en segmentos etiquetados por identidad del hablante.

2 lectura mínimaleer
IA de audio

Verificación del orador

La verificación del hablante confirma si una voz coincide con una identidad reclamada específica, actuando como una contraseña basada en voz.

2 lectura mínimaleer
IA de audio

Detección de actividad de voz

La Detección de Actividad de Voz (VAD) decide, momento a momento, si una señal de audio contiene habla humana o simplemente silencio y ruido.

2 lectura mínimaleer

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 9 of 10 | AI Understanding