Biblioteca de IA gratuita

IA de audio guíasGratis para siempre.

117 Guías en inglés sencillo, rutas de aprendizaje estructuradas y una biblioteca abierta, creada por una organización sin fines de lucro independiente 501(c)(3) para que cualquiera pueda comprender la IA moderna.

117Guías gratuitas
1Pistas temáticas
~2 minPor guía
~4hReading time

Empieza aquí

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Pistas temáticas

Navegar por pista

Salta al área que te interesa. Cada pista tiene varias guías en inglés sencillo.

biblioteca completa

Todas las guías

117 de 1019 guías mostradas. Filtrar por pista o buscar arriba.

IA de audio

Vocodificador de difusión DiffWave

DiffWave es un codificador de voz basado en difusión que sintetiza audio eliminando iterativamente el ruido aleatorio en una forma de onda, condicionada a un espectrograma de fusión.

2 lectura mínimaleer
IA de audio

Modelo de audio generativo de corteza

Bark es un modelo de texto a audio de código abierto de Suno que genera no solo voz, sino también risas, suspiros, música y efectos de sonido directamente a partir de indicaciones de texto.

2 lectura mínimaleer
IA de audio

Síntesis autorregresiva TTS de tortuga

Tortoise TTS es un sistema de conversión de texto a voz de código abierto apreciado por sus voces inusualmente naturales y emocionalmente ricas y su fuerte clonación de voces a partir de unos pocos cortos...

2 lectura mínimaleer
IA de audio

Clonación de voz multilingüe XTTS

XTTS es el modelo multilingüe de conversión de texto a voz de Coqui que puede clonar una voz a partir de un clip corto y luego hablar en muchos idiomas diferentes manteniendo...

2 lectura mínimaleer
IA de audio

Generación de audio paralelo SoundStorm

SoundStorm es un modelo de generación de audio Google que produce voz y sonido en paralelo en lugar de un token a la vez, realizando síntesis de audio de alta calidad...

2 lectura mínimaleer
IA de audio

Síntesis de texto a audio AudioGen

AudioGen es un modelo Meta que convierte descripciones de texto en sonidos ambientales y efectos de sonido realistas, como "el ladrido de un perro mientras los pájaros cantan".

2 lectura mínimaleer
IA de audio

Difusión latente de audio estable

Stable Audio es el sistema de conversión de texto a audio de Stability AI que utiliza difusión latente para generar música y efectos de sonido, con control explícito sobre la duración del clip.

2 lectura mínimaleer
IA de audio

Kit de herramientas de reconocimiento de voz Kaldi

Kaldi es un conjunto de herramientas gratuito y de código abierto que se convirtió en la plataforma de investigación dominante para crear sistemas de reconocimiento de voz.

2 lectura mínimaleer
IA de audio

Wav2Letter ASR convolucional

Wav2Letter es un sistema de reconocimiento de voz de extremo a extremo de Facebook AI que utilizaba únicamente redes neuronales convolucionales, sin recurrencia.

2 lectura mínimaleer
IA de audio

Jasper y QuartzNet ASR

Jasper y QuartzNet son los modelos de reconocimiento de voz convolucional de extremo a extremo de NVIDIA, siendo QuartzNet un rediseño dramáticamente más pequeño y eficiente...

2 lectura mínimaleer
IA de audio

Modelos de difusión para audio

Los modelos de difusión generan audio aprendiendo a revertir un proceso de generación de ruido paso a paso, convirtiendo el ruido aleatorio en habla, música o efectos de sonido coherentes.

2 lectura mínimaleer
IA de audio

Detección de eventos de sonido

La detección de eventos de sonido (SED) identifica qué sonidos ocurren en una transmisión de audio y exactamente cuándo comienzan y terminan.

2 lectura mínimaleer

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 7 of 10 | AI Understanding