Biblioteca de IA gratuita

IA de áudio guiasLivre para sempre.

117 guias em inglês simples, caminhos de aprendizagem estruturados e uma biblioteca aberta — criada por uma organização sem fins lucrativos 501(c)(3) independente para que qualquer pessoa possa entender a IA moderna.

117Guias gratuitos
1Faixas de tópico
~2 minPor guia
~4hTempo de leitura

Comece aqui

Cinco cursos baseados em resultados

Cada curso inclui resultados explícitos, competências mapeadas, atividades práticas e um objetivo final aplicado.

Faixas de tópico

Navegue por faixa

Entre na área de seu interesse. Cada faixa tem vários guias em inglês simples.

Biblioteca completa

Todos os guias

117 de 1019 guias mostrados. Filtre por faixa ou pesquise acima.

IA de áudio

Separação de Haste Spleeter

Spleeter é uma ferramenta de código aberto da Deezer que divide uma música finalizada em faixas separadas (vocais, bateria, baixo e muito mais) usando aprendizado profundo.

2 minutos de leituraLeia
IA de áudio

Estimativa de pitch CREPE

CREPE é um modelo de aprendizagem profunda que estima a frequência fundamental (pitch) de um sinal de áudio monofônico diretamente de sua forma de onda bruta.

2 minutos de leituraLeia
IA de áudio

Métricas de qualidade de fala PESQ e STOI

PESQ e STOI são métricas objetivas padrão que avaliam quão bem a fala processada soa e quão compreensível ela é, sem a necessidade de ouvintes humanos.

2 minutos de leituraLeia
IA de áudio

Vocoding de filtro de origem e MUNDO

Um vocoder é uma ferramenta que desmonta a fala em seus blocos de construção e a reconstrói.

2 minutos de leituraLeia
IA de áudio

Avaliação da pontuação média de opinião

Mean Opinion Score (MOS) é uma classificação média de 1 a 5 de ouvintes humanos que mede a qualidade dos sons de áudio sintetizados ou transmitidos.

2 minutos de leituraLeia
IA de áudio

Transformada Constant-Q para Áudio

A Transformada Q Constante (CQT) é uma análise de frequência que usa caixas espaçadas logaritmicamente correspondentes ao tom musical, em vez de caixas espaçadas uniformemente…

2 minutos de leituraLeia
IA de áudio

Recursos de banco de filtros e PLP

Os recursos Filterbank e Perceptual Linear Prediction (PLP) são formas de resumir um sinal de fala em números compactos e perceptualmente significativos que maquinam…

2 minutos de leituraLeia
IA de áudio

StyleTTS 2 Difusão de Estilo

StyleTTS 2 é um modelo de conversão de texto em fala que trata o 'estilo' de voz - prosódia, emoção e timbre do locutor - como uma variável aleatória amostrada com um modelo de difusão…

2 minutos de leituraLeia
IA de áudio

TTS FastPitch Pitch controlável

FastPitch é um modelo de conversão de texto em fala rápido e não autorregressivo que prevê explicitamente o tom (frequência fundamental) de cada token de entrada, permitindo que você…

2 minutos de leituraLeia
IA de áudio

Geração de fala com correspondência de fluxo de caixa de voz

Voicebox é o modelo de geração de fala guiada por texto de Meta treinado com um objetivo de correspondência de fluxo para 'preencher' o áudio mascarado, permitindo que um modelo faça voz zero-shot…

2 minutos de leituraLeia
IA de áudio

Desafio de supressão de ruído profundo

O Desafio Deep Noise Suppression (DNS) é uma competição Microsoft que incentiva os pesquisadores a construir redes neurais que eliminam o ruído de fundo…

2 minutos de leituraLeia
IA de áudio

Subtração espectral e filtragem de Wiener

A subtração espectral e a filtragem de Wiener são os clássicos cavalos de batalha da redução de ruído antes do aprendizado profundo.

2 minutos de leituraLeia

Terminou de ler? Prove.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.