Biblioteca de IA gratuita

IA de áudio guiasLivre para sempre.

117 guias em inglês simples, caminhos de aprendizagem estruturados e uma biblioteca aberta — criada por uma organização sem fins lucrativos 501(c)(3) independente para que qualquer pessoa possa entender a IA moderna.

117Guias gratuitos
1Faixas de tópico
~2 minPor guia
~4hTempo de leitura

Comece aqui

Cinco cursos baseados em resultados

Cada curso inclui resultados explícitos, competências mapeadas, atividades práticas e um objetivo final aplicado.

Faixas de tópico

Navegue por faixa

Entre na área de seu interesse. Cada faixa tem vários guias em inglês simples.

Biblioteca completa

Todos os guias

117 de 1019 guias mostrados. Filtre por faixa ou pesquise acima.

IA de áudio

Síntese de Voz Cantada

Singing Voice Synthesis (SVS) é uma IA que transforma uma melodia e letra escritas em uma performance vocal totalmente cantada.

2 minutos de leituraLeia
IA de áudio

ÁudioLM

AudioLM é uma estrutura de pesquisa Google que gera áudio realista - fala ou música de piano - tratando o som como uma linguagem e prevendo-o como token…

2 minutos de leituraLeia
IA de áudio

MusicGen

MusicGen é o modelo de IA de Meta que gera música a partir de uma descrição de texto e, opcionalmente, uma melodia que você cantarola ou carrega.

2 minutos de leituraLeia
IA de áudio

Identificação de palavras-chave e palavras de ativação

A detecção de palavras-chave é a tecnologia sempre atenta que permite que um dispositivo espere por uma única frase de gatilho como 'Ei, Siri' ou 'Alexa' antes de saltar…

2 minutos de leituraLeia
IA de áudio

Alinhamento Forçado

O alinhamento forçado alinha automaticamente uma transcrição conhecida com seu áudio, marcando exatamente quando cada palavra ou som começa e termina.

2 minutos de leituraLeia
IA de áudio

Espectrogramas Mel

Um espectrograma mel é uma imagem do som ao longo do tempo, com frequência espaçada da mesma forma que os ouvidos humanos percebem o tom.

2 minutos de leituraLeia
IA de áudio

Classificação Temporal Conexionista

A Classificação Temporal Conexionista (CTC) é uma função de perda e método de decodificação que permite que redes neurais transformem uma longa sequência de áudio em texto sem…

2 minutos de leituraLeia
IA de áudio

Modelos de transdutores RNN

O RNN-Transducer (RNN-T) é uma arquitetura de reconhecimento de fala amigável para streaming que corrige a maior fraqueza do CTC - sua incapacidade de modelar dependências…

2 minutos de leituraLeia
IA de áudio

Arquitetura Conformista

O Conformer é um bloco de rede neural que combina convolução com autoatenção, capturando padrões sonoros locais refinados e contexto de longo alcance…

2 minutos de leituraLeia

Terminou de ler? Prove.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.