GUIA de IA de áudio

Jasper e QuartzNet ASR

Jasper e QuartzNet são modelos de reconhecimento de voz convolucional ponta a ponta da NVIDIA, com QuartzNet sendo um redesenho dramaticamente menor e eficiente do Jasper.

2 minutos de leituraÚltima atualização

Visão geral

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

Mergulho profundo

Jasper (Just Another Speech Recognizer), lançado pela NVIDIA em 2019, é uma rede convolucional 1D profunda, de até 54 camadas, que mapeia recursos do espectrograma mel para caracteres usando perda de CTC. Ele introduziu conexões residuais densas para que os gradientes fluíssem de forma limpa através de pilhas muito profundas. QuartzNet, lançado no mesmo ano, manteve a estrutura de bloco de Jasper, mas substituiu as convoluções padrão por convoluções separáveis ​​por canal de tempo, dividindo cada filtro em uma convolução temporal profunda e uma etapa de mistura de canal pontual. Essa fatoração reduziu os parâmetros de cerca de 333 milhões de Jasper para cerca de 19 milhões, ao mesmo tempo em que correspondia à precisão do Librispeech. Ambos vêm com o kit de ferramentas NeMo da NVIDIA e são ajustados para treinamento rápido de GPU e inferência em tempo real, tornando-os blocos de construção populares para ASR de produção.

Visão Técnica

A eficiência do QuartzNet vem de convoluções separáveis ​​por canal de tempo, a mesma ideia por trás do MobileNet. Uma convolução 1D normal mistura tempo e canais, custando K vezes C-in vezes C-out pesos. Separá-lo em uma convolução profunda ao longo do tempo mais uma convolução pontual 1x1 sobre os canais reduz os parâmetros para K vezes C mais C-in vezes C-out. Empilhado em blocos residuais e treinado com CTC, isso fornece precisão próxima ao Jasper em uma fração do tamanho e cálculo do modelo.

Impacto Estratégico

Acesso e alcance

Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.

Custo e orçamento

As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.

Velocidade e escala

Os sistemas voltados para o cliente podem processar interações faladas em maior escala.

O futuro do Jasper e QuartzNet ASR

A linhagem de convolução separável da QuartzNet levou diretamente ao Citrinet da NVIDIA e aos modelos Conformer amplamente usados, que adicionam autoatenção para capturar o contexto global junto com as convoluções locais. Espere um movimento contínuo em direção a arquiteturas híbridas de convolução mais atenção e decodificadores de transdutores (RNN-T) para streaming. A lição principal, convoluções com parâmetros eficientes para implantação de borda e em tempo real, permanece central à medida que o ASR avança para telefones, carros e dispositivos incorporados.

Implementação no mundo real

Transcrição em tempo real e assistentes de voz implantados em GPUs NVIDIA por meio do kit de ferramentas NeMo

ASR de borda e incorporado onde o tamanho reduzido do QuartzNet se adapta a dispositivos com restrição de memória

Aprimorando pontos de verificação QuartzNet pré-treinados para vocabulários específicos de domínio, como termos médicos ou jurídicos

Análise de call center transcrevendo grandes volumes de áudio de forma rápida e econômica

Riscos e guarda-corpos

Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.

A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.

O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.

Roteiro de implementação

1

Obtenha consentimento explícito para captura, clonagem e reutilização de voz.

2

Teste a qualidade em diversos alto-falantes e condições de fundo.

3

Defina quando um ser humano deve revisar ou aprovar os resultados.

4

Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Wav2Letter ASR convolucional

Perguntas frequentes

What is Jasper and QuartzNet ASR?

Jasper e QuartzNet são modelos de reconhecimento de voz convolucional ponta a ponta da NVIDIA, com QuartzNet sendo um redesenho dramaticamente menor e eficiente do Jasper. Eles são importantes para mostrar como obter grande precisão com muito menos parâmetros, ideal para implantação.

Qual inovação importante permite que o QuartzNet use muito menos parâmetros do que o Jasper?

QuartzNet substitui convoluções padrão por convoluções separáveis ​​por canal de tempo, reduzindo drasticamente a contagem de parâmetros e preservando a precisão.

Aproximadamente quantos parâmetros o QuartzNet tem em comparação com os ~333 milhões de Jasper?

QuartzNet diminui para cerca de 19 milhões de parâmetros, uma redução de cerca de 17x, ao mesmo tempo que corresponde à precisão do Librispeech de Jasper.

Qual empresa desenvolveu Jasper e QuartzNet?

Ambos os modelos foram desenvolvidos pela NVIDIA e são distribuídos por meio de seu kit de ferramentas de IA conversacional NeMo.

Qual função de perda Jasper e QuartzNet usam para treinar sem alinhamentos explícitos?

Ambos usam perda de CTC, que alinha áudio de comprimento variável a sequências de caracteres sem exigir rótulos por quadro.

Que recurso estrutural ajuda os gradientes a fluir através da rede muito profunda (até 54 camadas) do Jasper?

Jasper usa conexões residuais densas (salto) para que os gradientes se propaguem de forma limpa através de sua pilha convolucional profunda.