Libreria AI gratuita

IA audio guideLibero per sempre.

117 Guide in inglese semplice, percorsi di apprendimento strutturati e una libreria aperta, realizzati da un'organizzazione no profit 501(c)(3) indipendente in modo che chiunque possa comprendere l'intelligenza artificiale moderna.

117Guide gratuite
1Tracce di argomenti
~2 minPer guida
~4hTempo di lettura

Inizia qui

Cinque Corsi basati sui risultati

Ogni corso include risultati espliciti, competenze mappate, attività di pratica e un capstone applicato.

Tracce di argomenti

Sfoglia per traccia

Entra nell'area che ti interessa. Ogni traccia ha più guide in inglese semplice.

Libreria completa

Tutte le guide

117 di 1019 guide mostrate. Filtra per traccia o cerca sopra.

IA audio

Beamforming e array di microfoni

Il beamforming utilizza più microfoni per ascoltare in una direzione prescelta, amplificando il suono proveniente da un bersaglio sopprimendo tutto il resto.

2 minimo lettoLeggi
IA audio

Diffusione dello spettrogramma di diffusione

Riffusion è un trucco intelligente che genera musica trattando il suono come un'immagine: mette a punto il modello di immagine Stable Diffusion per dipingere spettrogrammi, quindi...

2 minimo lettoLeggi
IA audio

MusicLM: token semantici e acustici gerarchici

Scopri come Google MusicLM utilizza token acustici e semantici gerarchici, SoundStream e MuLan per trasformare i suggerimenti di testo in musica coerente.

2 minimo lettoLeggi
IA audio

Miglioramento del parlato Noise2Noise

Noise2Noise è un trucco di addestramento che consente a un modello di imparare a rimuovere il rumore senza mai vedere un riferimento pulito, imparando da coppie di rumori diversamente rumorosi...

2 minimo lettoLeggi
IA audio

Separazione del dominio temporale Conv-TasNet

Conv-TasNet è una rete neurale che separa l'audio mixato (come due persone che parlano contemporaneamente) lavorando invece direttamente sulla forma d'onda del suono grezzo...

2 minimo lettoLeggi
IA audio

Separazione RNN a doppio percorso

Dual-Path RNN (DPRNN) è un'architettura di separazione audio che divide una sequenza molto lunga di funzionalità audio in brevi blocchi sovrapposti e li elabora...

2 minimo lettoLeggi
IA audio

Separazione musicale Open-Unmix

Open-Unmix (UMX) è un sistema di deep learning open source che divide una canzone nelle sue parti: voce, batteria, basso e altri strumenti.

2 minimo lettoLeggi
IA audio

Allineamento delle parole con timestamp di Whisper

L'allineamento delle parole sussurrate fissa ogni parola trascritta a un'ora esatta di inizio e fine nell'audio.

2 minimo lettoLeggi
IA audio

Tagging musicale con Transformers

Il tagging musicale utilizza modelli di trasformatori per ascoltare una canzone e prevedere etichette descrittive come genere, umore, strumenti e tempo.

2 minimo lettoLeggi
IA audio

Rilevamento dell'inizio nell'audio

Il rilevamento dell'inizio rileva i momenti precisi in cui note, battute o suoni iniziano in un segnale audio.

2 minimo lettoLeggi
IA audio

Vocoder generativo MelGAN

MelGAN è un vocoder completamente convoluzionale basato su GAN che trasforma gli spettrogrammi Mel in forme d'onda audio grezze in un unico passaggio veloce in avanti.

2 minimo lettoLeggi
IA audio

Vocoder multirisoluzione UnivNet

UnivNet è un vocoder GAN che giudica l'audio generato utilizzando più spettrogrammi calcolati a diverse risoluzioni STFT, rendendo più nitidi i dettagli ad alta frequenza.

2 minimo lettoLeggi

Hai finito di leggere? Dimostralo.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.