Biblioteca de IA gratuita

IA de áudio guiasLivre para sempre.

117 guias em inglês simples, caminhos de aprendizagem estruturados e uma biblioteca aberta — criada por uma organização sem fins lucrativos 501(c)(3) independente para que qualquer pessoa possa entender a IA moderna.

117Guias gratuitos
1Faixas de tópico
~2 minPor guia
~4hTempo de leitura

Comece aqui

Cinco cursos baseados em resultados

Cada curso inclui resultados explícitos, competências mapeadas, atividades práticas e um objetivo final aplicado.

Faixas de tópico

Navegue por faixa

Entre na área de seu interesse. Cada faixa tem vários guias em inglês simples.

Biblioteca completa

Todos os guias

117 de 1019 guias mostrados. Filtre por faixa ou pesquise acima.

IA de áudio

Identificação da música cover

A identificação da música cover detecta quando duas gravações com sons muito diferentes são, na verdade, a mesma música subjacente – uma versão acústica ao vivo, um remix…

2 minutos de leituraLeia
IA de áudio

Síntese de áudio diferenciável DDSP

O DDSP (Processamento de Sinais Digitais Diferenciados) funde blocos de construção de sintetizadores clássicos com redes neurais, para que o aprendizado profundo possa controlar os osciladores…

2 minutos de leituraLeia
IA de áudio

Síntese de fala ponta a ponta VITS

VITS é um modelo de conversão de texto em fala que transforma texto diretamente em formas de onda de áudio brutas em um único sistema treinado, ignorando o pipeline usual de dois estágios.

2 minutos de leituraLeia
IA de áudio

FastSpeech e TTS não autorregressivo

O FastSpeech gera um espectrograma de fala inteiro em paralelo, em vez de um quadro por vez, tornando a síntese dramaticamente mais rápida e estável.

2 minutos de leituraLeia
IA de áudio

NaturalSpeech e TTS de difusão latente

NaturalSpeech é uma linha de pesquisa TTS Microsoft que visa qualidade de fala em nível humano, com versões posteriores usando difusão latente para gerar riqueza, natural…

2 minutos de leituraLeia
IA de áudio

Reconhecimento de emoções de fala

O Speech Emotion Recognition (SER) é uma IA que detecta o estado emocional de um locutor – raiva, alegria, tristeza, frustração – a partir do som de sua voz, não apenas…

2 minutos de leituraLeia
IA de áudio

Discurso Moshi Full-Duplex

Moshi é uma IA de voz em tempo real e de código aberto da Kyutai que fala e ouve ao mesmo tempo – full-duplex – em vez de fazer turnos rígidos.

2 minutos de leituraLeia
IA de áudio

Tradução de fala para fala

A Tradução de Fala para Fala (S2ST) pega palavras faladas em um idioma e produz palavras faladas em outro - de preferência preservando a voz e o tom do locutor…

2 minutos de leituraLeia
IA de áudio

Vocodificadores HiFi-GAN e GAN

HiFi-GAN é um vocoder generativo-adversário que transforma um espectrograma mel em uma forma de onda de áudio bruta quase instantaneamente, produzindo fala com qualidade de estúdio…

2 minutos de leituraLeia
IA de áudio

Conversão de grafema para fonema

A conversão de grafema para fonema (G2P) traduz letras escritas nos sons que um sistema de fala deveria realmente pronunciar.

2 minutos de leituraLeia
IA de áudio

Normalização de texto para fala

A normalização de texto é a etapa inicial que reescreve o texto escrito bruto em palavras totalmente faladas antes que um sistema de fala o diga.

2 minutos de leituraLeia
IA de áudio

Codec neural SoundStream

SoundStream é o codec de áudio neural ponta a ponta do Google que compacta fala e música em taxas de bits extremamente baixas, preservando a qualidade.

2 minutos de leituraLeia

Terminou de ler? Prove.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.