Biblioteca de IA gratuita

IA de áudio guiasLivre para sempre.

117 guias em inglês simples, caminhos de aprendizagem estruturados e uma biblioteca aberta — criada por uma organização sem fins lucrativos 501(c)(3) independente para que qualquer pessoa possa entender a IA moderna.

117Guias gratuitos
1Faixas de tópico
~2 minPor guia
~4hTempo de leitura

Comece aqui

Cinco cursos baseados em resultados

Cada curso inclui resultados explícitos, competências mapeadas, atividades práticas e um objetivo final aplicado.

Faixas de tópico

Navegue por faixa

Entre na área de seu interesse. Cada faixa tem vários guias em inglês simples.

Biblioteca completa

Todos os guias

117 de 1019 guias mostrados. Filtre por faixa ou pesquise acima.

IA de áudio

Beamforming e matrizes de microfone

Beamforming usa vários microfones para ouvir em uma direção escolhida, amplificando o som de um alvo enquanto suprime todo o resto.

2 minutos de leituraLeia
IA de áudio

Difusão de espectrograma de rifusão

Riffusion é um hack inteligente que gera música tratando o som como uma imagem: ele ajusta o modelo de imagem de Difusão Estável para pintar espectrogramas e então…

2 minutos de leituraLeia
IA de áudio

MusicLM: tokens semânticos e acústicos hierárquicos

Saiba como Google MusicLM usa tokens semânticos e acústicos hierárquicos, SoundStream e MuLan para transformar prompts de texto em música coerente.

2 minutos de leituraLeia
IA de áudio

Aprimoramento de fala Noise2Noise

Noise2Noise é um truque de treinamento que permite que um modelo aprenda a remover ruído sem nunca ver uma referência limpa, aprendendo com pares de ruídos diferentes…

2 minutos de leituraLeia
IA de áudio

Separação de domínio de tempo Conv-TasNet

Conv-TasNet é uma rede neural que separa áudio mixado (como duas pessoas conversando ao mesmo tempo) trabalhando diretamente na forma de onda do som bruto…

2 minutos de leituraLeia
IA de áudio

Separação RNN de caminho duplo

Dual-Path RNN (DPRNN) é uma arquitetura de separação de áudio que divide uma sequência muito longa de recursos de áudio em pequenos pedaços sobrepostos e os processa…

2 minutos de leituraLeia
IA de áudio

Separação de músicas abertas e não mixadas

Open-Unmix (UMX) é um sistema de aprendizado profundo de código aberto que divide uma música em suas partes: vocais, bateria, baixo e outros instrumentos.

2 minutos de leituraLeia
IA de áudio

Alinhamento de palavras com carimbo de data e hora do sussurro

O alinhamento de palavras sussurradas fixa cada palavra transcrita em um horário exato de início e término no áudio.

2 minutos de leituraLeia
IA de áudio

Marcação de música com Transformers

A marcação musical usa modelos de transformadores para ouvir uma música e prever rótulos descritivos como gênero, humor, instrumentos e andamento.

2 minutos de leituraLeia
IA de áudio

Detecção de início em áudio

A detecção de início encontra os momentos precisos em que notas, batidas ou sons começam em um sinal de áudio.

2 minutos de leituraLeia
IA de áudio

Vocoder generativo MelGAN

MelGAN é um vocoder totalmente convolucional baseado em GAN que transforma espectrogramas mel em formas de onda de áudio brutas em uma única passagem rápida.

2 minutos de leituraLeia
IA de áudio

Vocoder de multi-resolução UnivNet

UnivNet é um vocoder GAN que avalia o áudio gerado usando vários espectrogramas calculados em diferentes resoluções STFT, aprimorando os detalhes de alta frequência.

2 minutos de leituraLeia

Terminou de ler? Prove.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.