Biblioteca de IA gratuita

IA de audio guíasGratis para siempre.

117 Guías en inglés sencillo, rutas de aprendizaje estructuradas y una biblioteca abierta, creada por una organización sin fines de lucro independiente 501(c)(3) para que cualquiera pueda comprender la IA moderna.

117Guías gratuitas
1Pistas temáticas
~2 minPor guía
~4hReading time

Empieza aquí

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Pistas temáticas

Navegar por pista

Salta al área que te interesa. Cada pista tiene varias guías en inglés sencillo.

biblioteca completa

Todas las guías

117 de 1019 guías mostradas. Filtrar por pista o buscar arriba.

IA de audio

Códec de audio de transmisión Mimi

Mimi es un códec de audio neuronal que comprime la voz en un pequeño flujo de tokens discretos en tiempo real, para que los modelos de IA puedan escuchar y hablar con niveles muy bajos...

2 lectura mínimaleer
IA de audio

Escuchar, asistir y deletrear

Listen, Attend and Spell (LAS) es una red neuronal histórica de 2015 que transcribe el habla directamente en caracteres, sin pronunciación hecha a mano...

2 lectura mínimaleer
IA de audio

SpecAugment para reconocimiento de voz

SpecAugment es un método de aumento de datos simple pero poderoso que enmascara y deforma el espectrograma del habla para hacer que los modelos de reconocimiento sean más sólidos.

2 lectura mínimaleer
IA de audio

Etiquetado automático de música

El etiquetado automático de música utiliza el aprendizaje automático para escuchar una canción y adjuntar automáticamente etiquetas descriptivas como género, estado de ánimo, instrumentos y tempo.

2 lectura mínimaleer
IA de audio

Transferencia de timbre musical

La transferencia de timbre remodela el 'color del tono' del audio para que un instrumento suene como otro, convirtiendo una melodía tarareada en una línea de violín o trompeta...

2 lectura mínimaleer
IA de audio

Clasificación de escenas acústicas

La clasificación de escenas acústicas (ASC) entrena a las máquinas para reconocer el entorno en el que se realizó una grabación, una calle concurrida, un parque tranquilo, un tren, una cafetería…

2 lectura mínimaleer
IA de audio

Discurso de NVIDIA Riva y NeMo

NVIDIA Riva es un SDK acelerado por GPU para IA de voz en producción (ASR, TTS y traducción), mientras que NeMo es el conjunto de herramientas de código abierto para capacitación y ajuste...

2 lectura mínimaleer
IA de audio

Arquitectura de voz profunda

DeepSpeech es un modelo de reconocimiento de voz de extremo a extremo introducido por Baidu en 2014 que asigna características de audio sin procesar directamente al texto utilizando un sistema neuronal recurrente...

2 lectura mínimaleer
IA de audio

Incorporaciones de altavoces X-Vector

Los vectores X son huellas digitales numéricas de longitud fija de la voz de un hablante producidas por una red neuronal, que se utilizan para saber quién está hablando independientemente de lo que diga.

2 lectura mínimaleer
IA de audio

Alineación monótona Glow-TTS

Glow-TTS es un modelo de conversión de texto a voz que aprende a alinear texto a voz por sí solo mediante un ingenioso truco de búsqueda, eliminando la necesidad de un alineador independiente.

2 lectura mínimaleer
IA de audio

Vocodificador WaveGAN paralelo

Parallel WaveGAN es un codificador de voz neuronal rápido que convierte un espectrograma mel en una forma de onda de audio sin procesar utilizando una pequeña GAN, generando todas las muestras a la vez.

2 lectura mínimaleer
IA de audio

Vocoder basado en flujo WaveGlow

WaveGlow es un codificador de voz neuronal basado en flujo de NVIDIA que sintetiza formas de onda de voz a partir de espectrogramas mel en una sola pasada sin autorregresión.

2 lectura mínimaleer

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 4 of 10 | AI Understanding