Biblioteca de IA gratuita

IA de audio guíasGratis para siempre.

117 Guías en inglés sencillo, rutas de aprendizaje estructuradas y una biblioteca abierta, creada por una organización sin fines de lucro independiente 501(c)(3) para que cualquiera pueda comprender la IA moderna.

117Guías gratuitas
1Pistas temáticas
~2 minPor guía
~4hReading time

Empieza aquí

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Pistas temáticas

Navegar por pista

Salta al área que te interesa. Cada pista tiene varias guías en inglés sencillo.

biblioteca completa

Todas las guías

117 de 1019 guías mostradas. Filtrar por pista o buscar arriba.

IA de audio

Formación de haces y matrices de micrófonos

Beamforming utiliza varios micrófonos para escuchar en una dirección elegida, amplificando el sonido de un objetivo y suprimiendo todo lo demás.

2 lectura mínimaleer
IA de audio

Difusión del espectrograma de riffusión

Riffusion es un truco inteligente que genera música tratando el sonido como una imagen: ajusta el modelo de imagen de Difusión Estable para pintar espectrogramas, luego...

2 lectura mínimaleer
IA de audio

MusicLM: Tokens acústicos y semánticos jerárquicos

Descubra cómo Google MusicLM utiliza tokens acústicos y semánticos jerárquicos, SoundStream y MuLan para convertir indicaciones de texto en música coherente.

2 lectura mínimaleer
IA de audio

Mejora del habla Noise2Noise

Noise2Noise es un truco de entrenamiento que permite a un modelo aprender a eliminar el ruido sin siquiera ver una referencia limpia, aprendiendo de pares de ruidos diferentes...

2 lectura mínimaleer
IA de audio

Separación de dominio de tiempo Conv-TasNet

Conv-TasNet es una red neuronal que separa el audio mixto (como dos personas hablando a la vez) trabajando directamente en la forma de onda del sonido sin procesar...

2 lectura mínimaleer
IA de audio

Separación RNN de doble ruta

Dual-Path RNN (DPRNN) es una arquitectura de separación de audio que divide una secuencia muy larga de características de audio en fragmentos cortos superpuestos y los procesa...

2 lectura mínimaleer
IA de audio

Separación de música abierta y sin mezclar

Open-Unmix (UMX) es un sistema de aprendizaje profundo de código abierto que divide una canción en sus partes: voz, batería, bajo y otros instrumentos.

2 lectura mínimaleer
IA de audio

Alineación de palabras con marca de tiempo de Whisper

La alineación de palabras susurradas fija cada palabra transcrita a una hora exacta de inicio y finalización en el audio.

2 lectura mínimaleer
IA de audio

Etiquetado de música con Transformers

El etiquetado de música utiliza modelos transformadores para escuchar una canción y predecir etiquetas descriptivas como género, estado de ánimo, instrumentos y tempo.

2 lectura mínimaleer
IA de audio

Detección de inicio en audio

La detección de inicio encuentra los momentos precisos en los que las notas, tiempos o sonidos comienzan en una señal de audio.

2 lectura mínimaleer
IA de audio

Vocodificador generativo MelGAN

MelGAN es un codificador de voz basado en GAN totalmente convolucional que convierte espectrogramas de mel en formas de onda de audio sin procesar en un solo paso de avance rápido.

2 lectura mínimaleer
IA de audio

Codificador de voz multiresolución UnivNet

UnivNet es un codificador de voz GAN que juzga el audio generado utilizando múltiples espectrogramas calculados en diferentes resoluciones STFT, afinando los detalles de alta frecuencia.

2 lectura mínimaleer

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.