Biblioteca de IA gratuita

IA de áudio guiasLivre para sempre.

117 guias em inglês simples, caminhos de aprendizagem estruturados e uma biblioteca aberta — criada por uma organização sem fins lucrativos 501(c)(3) independente para que qualquer pessoa possa entender a IA moderna.

117Guias gratuitos
1Faixas de tópico
~2 minPor guia
~4hTempo de leitura

Comece aqui

Cinco cursos baseados em resultados

Cada curso inclui resultados explícitos, competências mapeadas, atividades práticas e um objetivo final aplicado.

Faixas de tópico

Navegue por faixa

Entre na área de seu interesse. Cada faixa tem vários guias em inglês simples.

Biblioteca completa

Todos os guias

117 de 1019 guias mostrados. Filtre por faixa ou pesquise acima.

IA de áudio

Codec de áudio de streaming Mimi

Mimi é um codec de áudio neural que comprime a fala em um pequeno fluxo de tokens discretos em tempo real, para que os modelos de IA possam ouvir e falar com voz muito baixa.

2 minutos de leituraLeia
IA de áudio

Ouça, assista e soletre

Ouvir, Atender e Soletrar (LAS) é uma rede neural marcante de 2015 que transcreve a fala diretamente em caracteres, sem pronúncia construída à mão…

2 minutos de leituraLeia
IA de áudio

SpecAugment para reconhecimento de fala

SpecAugment é um método simples, mas poderoso de aumento de dados que mascara e distorce o espectrograma da fala para tornar os modelos de reconhecimento mais robustos.

2 minutos de leituraLeia
IA de áudio

Marcação automática de música

A etiquetagem automática de música usa aprendizado de máquina para ouvir uma música e anexar automaticamente rótulos descritivos como gênero, humor, instrumentos e andamento.

2 minutos de leituraLeia
IA de áudio

Transferência Musical de Timbre

A transferência de timbre remodela a 'cor do tom' do áudio para que um instrumento soe como outro, transformando uma melodia cantarolada em um violino ou uma linha de trompete...

2 minutos de leituraLeia
IA de áudio

Classificação de Cena Acústica

A classificação de cena acústica (ASC) treina máquinas para reconhecer o ambiente em que a gravação foi feita, uma rua movimentada, um parque tranquilo, um trem, um café…

2 minutos de leituraLeia
IA de áudio

Discurso NVIDIA Riva e NeMo

NVIDIA Riva é um SDK acelerado por GPU para IA de produção de fala (ASR, TTS e tradução), enquanto NeMo é o kit de ferramentas de código aberto para treinamento e ajuste fino…

2 minutos de leituraLeia
IA de áudio

Arquitetura DeepSpeech

DeepSpeech é um modelo de reconhecimento de fala ponta a ponta introduzido pelo Baidu em 2014 que mapeia recursos de áudio brutos diretamente para texto usando um neural recorrente…

2 minutos de leituraLeia
IA de áudio

Incorporações de alto-falantes X-Vector

Os vetores X são impressões digitais numéricas de comprimento fixo da voz de um locutor, produzidas por uma rede neural, usadas para dizer quem está falando, independentemente do que digam.

2 minutos de leituraLeia
IA de áudio

Alinhamento Monotônico Glow-TTS

Glow-TTS é um modelo de conversão de texto em fala que aprende a alinhar texto com fala por conta própria usando um truque de pesquisa inteligente, eliminando a necessidade de um alinhador separado.

2 minutos de leituraLeia
IA de áudio

Vocoder WaveGAN paralelo

Parallel WaveGAN é um vocoder neural rápido que transforma um espectrograma mel em uma forma de onda de áudio bruta usando um pequeno GAN, gerando todas as amostras de uma vez.

2 minutos de leituraLeia
IA de áudio

Vocoder baseado em fluxo WaveGlow

WaveGlow é um vocoder neural baseado em fluxo da NVIDIA que sintetiza formas de onda de fala a partir de espectrogramas mel em uma única passagem sem autorregressão.

2 minutos de leituraLeia

Terminou de ler? Prove.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.