Biblioteca de IA gratuita

IA de áudio guiasLivre para sempre.

117 guias em inglês simples, caminhos de aprendizagem estruturados e uma biblioteca aberta — criada por uma organização sem fins lucrativos 501(c)(3) independente para que qualquer pessoa possa entender a IA moderna.

117Guias gratuitos
1Faixas de tópico
~2 minPor guia
~4hTempo de leitura

Comece aqui

Cinco cursos baseados em resultados

Cada curso inclui resultados explícitos, competências mapeadas, atividades práticas e um objetivo final aplicado.

Faixas de tópico

Navegue por faixa

Entre na área de seu interesse. Cada faixa tem vários guias em inglês simples.

Biblioteca completa

Todos os guias

117 de 1019 guias mostrados. Filtre por faixa ou pesquise acima.

IA de áudio

Vocoder de difusão DiffWave

DiffWave é um vocoder baseado em difusão que sintetiza áudio eliminando iterativamente o ruído aleatório em uma forma de onda, condicionada a um espectrograma mel.

2 minutos de leituraLeia
IA de áudio

Modelo de áudio generativo Bark

Bark é um modelo de texto para áudio de código aberto da Suno que gera não apenas fala, mas risos, suspiros, música e efeitos sonoros diretamente de prompts de texto.

2 minutos de leituraLeia
IA de áudio

Síntese Autoregressiva Tartaruga TTS

Tortoise TTS é um sistema de conversão de texto em fala de código aberto, valorizado por vozes extraordinariamente naturais e emocionalmente ricas e forte clonagem de voz em apenas alguns curtos…

2 minutos de leituraLeia
IA de áudio

Clonagem de voz entre idiomas XTTS

XTTS é o modelo multilíngue de conversão de texto em fala da Coqui que pode clonar uma voz a partir de um clipe curto e depois falar em vários idiomas diferentes, preservando…

2 minutos de leituraLeia
IA de áudio

Geração de áudio paralelo SoundStorm

SoundStorm é um modelo de geração de áudio Google que produz fala e som em paralelo, em vez de um token por vez, fazendo síntese de áudio de alta qualidade…

2 minutos de leituraLeia
IA de áudio

Síntese de texto para áudio AudioGen

AudioGen é um modelo Meta que transforma descrições de texto em sons ambientais e efeitos sonoros realistas, como 'cachorro latindo enquanto pássaros cantam'.

2 minutos de leituraLeia
IA de áudio

Difusão latente de áudio estável

Stable Audio é o sistema de texto para áudio do Stability AI que usa difusão latente para gerar música e efeitos sonoros, com controle explícito sobre a duração do clipe.

2 minutos de leituraLeia
IA de áudio

Kit de ferramentas de reconhecimento de fala Kaldi

Kaldi é um kit de ferramentas gratuito e de código aberto que se tornou a plataforma de pesquisa dominante para a construção de sistemas de reconhecimento de fala.

2 minutos de leituraLeia
IA de áudio

Wav2Letter ASR convolucional

Wav2Letter é um sistema de reconhecimento de fala ponta a ponta do Facebook AI que usa apenas redes neurais convolucionais, sem recorrência.

2 minutos de leituraLeia
IA de áudio

Jasper e QuartzNet ASR

Jasper e QuartzNet são modelos de reconhecimento de voz convolucional ponta a ponta da NVIDIA, com QuartzNet sendo um redesenho dramaticamente menor e eficiente…

2 minutos de leituraLeia
IA de áudio

Modelos de difusão para áudio

Os modelos de difusão geram áudio aprendendo a reverter um processo de ruído passo a passo, transformando ruído aleatório em fala, música ou efeitos sonoros coerentes.

2 minutos de leituraLeia
IA de áudio

Detecção de eventos sonoros

A detecção de eventos sonoros (SED) identifica quais sons ocorrem em um fluxo de áudio e exatamente quando eles começam e param.

2 minutos de leituraLeia

Terminou de ler? Prove.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.