Libreria AI gratuita

IA audio guideLibero per sempre.

117 Guide in inglese semplice, percorsi di apprendimento strutturati e una libreria aperta, realizzati da un'organizzazione no profit 501(c)(3) indipendente in modo che chiunque possa comprendere l'intelligenza artificiale moderna.

117Guide gratuite
1Tracce di argomenti
~2 minPer guida
~4hTempo di lettura

Inizia qui

Cinque Corsi basati sui risultati

Ogni corso include risultati espliciti, competenze mappate, attività di pratica e un capstone applicato.

Tracce di argomenti

Sfoglia per traccia

Entra nell'area che ti interessa. Ogni traccia ha più guide in inglese semplice.

Libreria completa

Tutte le guide

117 di 1019 guide mostrate. Filtra per traccia o cerca sopra.

IA audio

Identificazione del brano di copertina

L'identificazione della cover rileva quando due registrazioni dal suono molto diverso sono in realtà la stessa canzone sottostante: una versione acustica dal vivo, un remix...

2 minimo lettoLeggi
IA audio

Sintesi audio differenziabile DDSP

DDSP (Differentiable Digital Signal Processing) fonde i classici elementi costitutivi del sintetizzatore con le reti neurali, in modo che il deep learning possa controllare gli oscillatori...

2 minimo lettoLeggi
IA audio

Sintesi vocale end-to-end VITS

VITS è un modello di sintesi vocale che trasforma il testo direttamente in forme d'onda audio grezze in un unico sistema addestrato, saltando la consueta pipeline a due fasi.

2 minimo lettoLeggi
IA audio

FastSpeech e TTS non autoregressivo

FastSpeech genera un intero spettrogramma vocale in parallelo anziché un fotogramma alla volta, rendendo la sintesi notevolmente più veloce e più stabile.

2 minimo lettoLeggi
IA audio

NaturalSpeech e diffusione latente TTS

NaturalSpeech è una linea di ricerca TTS Microsoft che mira alla qualità del parlato a livello umano, con versioni successive che utilizzano la diffusione latente per generare suoni ricchi e naturali...

2 minimo lettoLeggi
IA audio

Riconoscimento delle emozioni vocali

Speech Emotion Recognition (SER) è un'intelligenza artificiale che rileva lo stato emotivo di chi parla (rabbia, gioia, tristezza, frustrazione) dal suono della sua voce, non solo...

2 minimo lettoLeggi
IA audio

Discorso Moshi full-duplex

Moshi è un'intelligenza artificiale vocale open source e in tempo reale di Kyutai che parla e ascolta allo stesso tempo - full duplex - invece di fare turni rigidi.

2 minimo lettoLeggi
IA audio

Traduzione da parlato a parlato

La traduzione vocale (S2ST) prende le parole pronunciate in una lingua e le produce in un'altra, preservando idealmente la voce, il tono...

2 minimo lettoLeggi
IA audio

Vocoder HiFi-GAN e GAN

HiFi-GAN è un vocoder generativo-avversario che trasforma quasi istantaneamente uno spettrogramma mel in una forma d'onda audio grezza, producendo un parlato di qualità da studio di gran lunga...

2 minimo lettoLeggi
IA audio

Conversione da grafema a fonema

La conversione da grafema a fonema (G2P) traduce le lettere scritte nei suoni che un sistema vocale dovrebbe effettivamente pronunciare.

2 minimo lettoLeggi
IA audio

Normalizzazione del testo per il parlato

La normalizzazione del testo è il passaggio front-end che riscrive il testo scritto grezzo in parole completamente pronunciate prima che un sistema vocale lo pronunci.

2 minimo lettoLeggi
IA audio

Codec neurale SoundStream

SoundStream è il codec audio neurale end-to-end di Google che comprime parlato e musica a bitrate estremamente bassi preservando la qualità.

2 minimo lettoLeggi

Hai finito di leggere? Dimostralo.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.