Bibliothèque IA gratuite

IA audio GuidesLibre pour toujours.

117 des guides en anglais simple, des parcours d'apprentissage structurés et une bibliothèque ouverte — construits par une organisation à but non lucratif indépendante 501(c)(3) pour que tout le monde puisse comprendre l'IA moderne.

117Guides gratuits
1Pistes thématiques
~2 minPar guide
~4hTemps de lecture

Commencez ici

Cinq cours axés sur les résultats

Chaque cours comprend des résultats explicites, des compétences cartographiées, des activités pratiques et une synthèse appliquée.

Pistes thématiques

Parcourir par piste

Sautez dans la zone qui vous tient à cœur. Chaque piste comporte plusieurs guides en anglais simple.

Bibliothèque complète

Tous les guides

117 de 1019 guides illustrés. Filtrez par piste ou recherchez ci-dessus.

IA audio

Formation de faisceaux et réseaux de microphones

Le Beamforming utilise plusieurs microphones pour écouter dans une direction choisie, amplifiant le son d'une cible tout en supprimant tout le reste.

2 lecture min.Lire
IA audio

Spectrogramme de Riffusion Diffusion

Riffusion est un hack intelligent qui génère de la musique en traitant le son comme une image : il affine le modèle d'image Stable Diffusion pour peindre des spectrogrammes, puis…

2 lecture min.Lire
IA audio

MusicLM : jetons sémantiques et acoustiques hiérarchiques

Découvrez comment Google MusicLM utilise des jetons sémantiques et acoustiques hiérarchiques, SoundStream et MuLan pour transformer les invites textuelles en musique cohérente.

2 lecture min.Lire
IA audio

Amélioration de la parole Noise2Noise

Noise2Noise est une astuce d'entraînement qui permet à un modèle d'apprendre à supprimer le bruit sans jamais voir une référence propre, en apprenant à partir de paires de bruits différents…

2 lecture min.Lire
IA audio

Séparation du domaine temporel Conv-TasNet

Conv-TasNet est un réseau neuronal qui sépare l'audio mixé (comme deux personnes parlant en même temps) en travaillant directement sur la forme d'onde sonore brute…

2 lecture min.Lire
IA audio

Séparation RNN à double chemin

Dual-Path RNN (DPRNN) est une architecture de séparation audio qui divise une très longue séquence de fonctionnalités audio en courts morceaux qui se chevauchent et les traite…

2 lecture min.Lire
IA audio

Séparation de musique ouverte-unmix

Open-Unmix (UMX) est un système d'apprentissage profond open source qui divise une chanson en plusieurs parties : chant, batterie, basse et autres instruments.

2 lecture min.Lire
IA audio

Alignement des mots horodatés Whisper

L’alignement des mots chuchotés épingle chaque mot transcrit à une heure de début et de fin exacte dans l’audio.

2 lecture min.Lire
IA audio

Marquage musical avec Transformers

Le balisage musical utilise des modèles de transformateur pour écouter une chanson et prédire des étiquettes descriptives telles que le genre, l'ambiance, les instruments et le tempo.

2 lecture min.Lire
IA audio

Détection de début dans l'audio

La détection d'apparition trouve les moments précis où les notes, les battements ou les sons commencent dans un signal audio.

2 lecture min.Lire
IA audio

Vocodeur génératif MelGAN

MelGAN est un vocodeur entièrement convolutif basé sur GAN qui transforme les spectrogrammes mel en formes d'onde audio brutes en un seul passage rapide.

2 lecture min.Lire
IA audio

Vocodeur multi-résolution UnivNet

UnivNet est un vocodeur GAN qui évalue l'audio généré à l'aide de plusieurs spectrogrammes calculés à différentes résolutions STFT, affinant ainsi les détails haute fréquence.

2 lecture min.Lire

Vous avez fini de lire ? Prouvez-le.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.