Biblioteca de IA gratuita

IA de audio guíasGratis para siempre.

117 Guías en inglés sencillo, rutas de aprendizaje estructuradas y una biblioteca abierta, creada por una organización sin fines de lucro independiente 501(c)(3) para que cualquiera pueda comprender la IA moderna.

117Guías gratuitas
1Pistas temáticas
~2 minPor guía
~4hReading time

Empieza aquí

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Pistas temáticas

Navegar por pista

Salta al área que te interesa. Cada pista tiene varias guías en inglés sencillo.

biblioteca completa

Todas las guías

117 de 1019 guías mostradas. Filtrar por pista o buscar arriba.

IA de audio

Identificación de la canción de portada

La identificación de la portada detecta cuando dos grabaciones con sonidos muy diferentes son en realidad la misma canción subyacente: una versión acústica en vivo, un remix...

2 lectura mínimaleer
IA de audio

Síntesis de audio diferenciable DDSP

DDSP (Procesamiento de Señal Digital Diferenciable) fusiona los componentes básicos de los sintetizadores clásicos con redes neuronales, por lo que el aprendizaje profundo puede controlar los osciladores...

2 lectura mínimaleer
IA de audio

Síntesis de voz de extremo a extremo de VITS

VITS es un modelo de conversión de texto a voz que convierte el texto directamente en formas de onda de audio sin procesar en un único sistema entrenado, omitiendo el proceso habitual de dos etapas.

2 lectura mínimaleer
IA de audio

FastSpeech y TTS no autorregresivo

FastSpeech genera un espectrograma de voz completo en paralelo en lugar de un cuadro a la vez, lo que hace que la síntesis sea mucho más rápida y estable.

2 lectura mínimaleer
IA de audio

TTS de habla natural y difusión latente

NaturalSpeech es una línea de investigación Microsoft TTS que tiene como objetivo la calidad del habla a nivel humano, y las versiones posteriores utilizan la difusión latente para generar contenido rico y natural...

2 lectura mínimaleer
IA de audio

Reconocimiento de emociones del habla

El reconocimiento de voz y emoción (SER) es una IA que detecta el estado emocional de un hablante (ira, alegría, tristeza, frustración) a partir del sonido de su voz, no solo...

2 lectura mínimaleer
IA de audio

Discurso completo dúplex de Moshi

Moshi es una IA de voz en tiempo real y de código abierto de Kyutai que habla y escucha al mismo tiempo (full-duplex) en lugar de tomar turnos estrictos.

2 lectura mínimaleer
IA de audio

Traducción de voz a voz

La traducción de voz a voz (S2ST) toma palabras habladas en un idioma y produce palabras habladas en otro, idealmente preservando la voz, el tono...

2 lectura mínimaleer
IA de audio

Codificadores de voz HiFi-GAN y GAN

HiFi-GAN es un codificador de voz generativo-adversario que convierte un espectrograma mel en una forma de onda de audio sin procesar casi instantáneamente, produciendo voz con calidad de estudio lejos...

2 lectura mínimaleer
IA de audio

Conversión de grafema a fonema

La conversión de grafema a fonema (G2P) traduce las letras escritas en los sonidos que un sistema de habla realmente debería pronunciar.

2 lectura mínimaleer
IA de audio

Normalización de texto para voz

La normalización del texto es el paso inicial que reescribe el texto escrito sin procesar en palabras completamente habladas antes de que un sistema de voz lo diga.

2 lectura mínimaleer
IA de audio

Códec neuronal SoundStream

SoundStream es el códec de audio neuronal de extremo a extremo de Google que comprime la voz y la música a velocidades de bits extremadamente bajas y al mismo tiempo preserva la calidad.

2 lectura mínimaleer

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding