Libreria AI gratuita

IA audio guideLibero per sempre.

117 Guide in inglese semplice, percorsi di apprendimento strutturati e una libreria aperta, realizzati da un'organizzazione no profit 501(c)(3) indipendente in modo che chiunque possa comprendere l'intelligenza artificiale moderna.

117Guide gratuite
1Tracce di argomenti
~2 minPer guida
~4hTempo di lettura

Inizia qui

Cinque Corsi basati sui risultati

Ogni corso include risultati espliciti, competenze mappate, attività di pratica e un capstone applicato.

Tracce di argomenti

Sfoglia per traccia

Entra nell'area che ti interessa. Ogni traccia ha più guide in inglese semplice.

Libreria completa

Tutte le guide

117 di 1019 guide mostrate. Filtra per traccia o cerca sopra.

IA audio

Vocoder a diffusione DiffWave

DiffWave è un vocoder basato sulla diffusione che sintetizza l'audio eliminando iterativamente il rumore casuale in una forma d'onda, condizionata su uno spettrogramma mel.

2 minimo lettoLeggi
IA audio

Modello audio generativo della corteccia

Bark è un modello da testo ad audio open source di Suno che genera non solo parlato ma risate, sospiri, musica ed effetti sonori direttamente da istruzioni di testo.

2 minimo lettoLeggi
IA audio

Sintesi autoregressiva della TTS della tartaruga

Tortoise TTS è un sistema di sintesi vocale open source apprezzato per voci insolitamente naturali, emotivamente ricche e per una forte clonazione vocale da pochi brevi...

2 minimo lettoLeggi
IA audio

Clonazione vocale interlinguistica XTTS

XTTS è il modello di sintesi vocale multilingue di Coqui che può clonare una voce da una breve clip e quindi parlare in molte lingue diverse preservando...

2 minimo lettoLeggi
IA audio

Generazione audio parallela SoundStorm

SoundStorm è un modello di generazione audio Google che produce parlato e suono in parallelo anziché un token alla volta, realizzando una sintesi audio di alta qualità...

2 minimo lettoLeggi
IA audio

Sintesi testo-audio AudioGen

AudioGen è un modello Meta che trasforma le descrizioni di testo in suoni ambientali ed effetti sonori realistici, come "il cane che abbaia mentre gli uccelli cinguettano".

2 minimo lettoLeggi
IA audio

Diffusione latente audio stabile

Stable Audio è il sistema testo-audio di Stability AI che utilizza la diffusione latente per generare musica ed effetti sonori, con controllo esplicito sulla lunghezza della clip.

2 minimo lettoLeggi
IA audio

Kit di strumenti di riconoscimento vocale Kaldi

Kaldi è un toolkit gratuito e open source che è diventato la piattaforma di ricerca dominante per la creazione di sistemi di riconoscimento vocale.

2 minimo lettoLeggi
IA audio

ASR convoluzionale Wav2Letter

Wav2Letter è un sistema di riconoscimento vocale end-to-end di Facebook AI che utilizza solo reti neurali convoluzionali, nessuna ricorrenza.

2 minimo lettoLeggi
IA audio

Jasper e QuartzNet ASR

Jasper e QuartzNet sono i modelli di riconoscimento vocale convoluzionale end-to-end di NVIDIA, con QuartzNet che è una riprogettazione notevolmente più piccola ed efficiente...

2 minimo lettoLeggi
IA audio

Modelli di diffusione per l'audio

I modelli di diffusione generano l’audio imparando a invertire un processo di rumore passo dopo passo, trasformando il rumore casuale in parlato, musica o effetti sonori coerenti.

2 minimo lettoLeggi
IA audio

Rilevamento di eventi sonori

Il rilevamento degli eventi sonori (SED) identifica quali suoni si verificano in un flusso audio e esattamente quando iniziano e si fermano.

2 minimo lettoLeggi

Hai finito di leggere? Dimostralo.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.