Libreria AI gratuita

IA audio guideLibero per sempre.

117 Guide in inglese semplice, percorsi di apprendimento strutturati e una libreria aperta, realizzati da un'organizzazione no profit 501(c)(3) indipendente in modo che chiunque possa comprendere l'intelligenza artificiale moderna.

117Guide gratuite
1Tracce di argomenti
~2 minPer guida
~4hTempo di lettura

Inizia qui

Cinque Corsi basati sui risultati

Ogni corso include risultati espliciti, competenze mappate, attività di pratica e un capstone applicato.

Tracce di argomenti

Sfoglia per traccia

Entra nell'area che ti interessa. Ogni traccia ha più guide in inglese semplice.

Libreria completa

Tutte le guide

117 di 1019 guide mostrate. Filtra per traccia o cerca sopra.

IA audio

Codec audio in streaming Mimi

Mimi è un codec audio neurale che comprime il parlato in un minuscolo flusso di token discreti in tempo reale, in modo che i modelli di intelligenza artificiale possano ascoltare e parlare con un...

2 minimo lettoLeggi
IA audio

Ascolta Partecipa e scrivi

Listen, Attend and Spell (LAS) è una rete neurale storica del 2015 che trascrive il parlato direttamente in caratteri, senza pronuncia costruita manualmente...

2 minimo lettoLeggi
IA audio

SpecAugment per il riconoscimento vocale

SpecAugment è un metodo di potenziamento dei dati semplice ma potente che maschera e deforma lo spettrogramma del parlato per rendere i modelli di riconoscimento più robusti.

2 minimo lettoLeggi
IA audio

Etichettatura automatica della musica

La codifica automatica della musica utilizza l'apprendimento automatico per ascoltare un brano e allegare automaticamente etichette descrittive come genere, umore, strumenti e tempo.

2 minimo lettoLeggi
IA audio

Trasferimento del timbro musicale

Il trasferimento del timbro rimodella il "colore tonale" dell'audio in modo che uno strumento suoni come un altro, trasformando una melodia canticchiata in una linea di violino o di tromba...

2 minimo lettoLeggi
IA audio

Classificazione delle scene acustiche

La classificazione della scena acustica (ASC) addestra le macchine a riconoscere l'ambiente in cui è stata effettuata una registrazione, una strada trafficata, un parco tranquillo, un treno, un bar...

2 minimo lettoLeggi
IA audio

Discorso NVIDIA Riva e NeMo

NVIDIA Riva è un SDK con accelerazione GPU per l'intelligenza artificiale vocale di produzione (ASR, TTS e traduzione), mentre NeMo è il toolkit open source per la formazione e la messa a punto...

2 minimo lettoLeggi
IA audio

Architettura del discorso profondo

DeepSpeech è un modello di riconoscimento vocale end-to-end introdotto da Baidu nel 2014 che mappa le caratteristiche audio grezze direttamente sul testo utilizzando un sistema neurale ricorrente...

2 minimo lettoLeggi
IA audio

Incorporamenti per altoparlanti X-Vector

I vettori X sono impronte numeriche di lunghezza fissa della voce di chi parla prodotte da una rete neurale, utilizzate per capire chi sta parlando indipendentemente da ciò che dice.

2 minimo lettoLeggi
IA audio

Allineamento monotono Glow-TTS

Glow-TTS è un modello di sintesi vocale che impara ad allineare il testo alla voce da solo utilizzando un trucco di ricerca intelligente, eliminando la necessità di un allineatore separato.

2 minimo lettoLeggi
IA audio

Vocoder WaveGAN parallelo

Parallel WaveGAN è un vocoder neurale veloce che trasforma uno spettrogramma mel in una forma d'onda audio grezza utilizzando un piccolo GAN, generando tutti i campioni contemporaneamente.

2 minimo lettoLeggi
IA audio

Vocoder basato sul flusso WaveGlow

WaveGlow è un vocoder neurale basato sul flusso di NVIDIA che sintetizza le forme d'onda del parlato dagli spettrogrammi mel in un unico passaggio senza autoregressione.

2 minimo lettoLeggi

Hai finito di leggere? Dimostralo.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.