Bibliothèque IA gratuite

IA audio GuidesLibre pour toujours.

117 des guides en anglais simple, des parcours d'apprentissage structurés et une bibliothèque ouverte — construits par une organisation à but non lucratif indépendante 501(c)(3) pour que tout le monde puisse comprendre l'IA moderne.

117Guides gratuits
1Pistes thématiques
~2 minPar guide
~4hTemps de lecture

Commencez ici

Cinq cours axés sur les résultats

Chaque cours comprend des résultats explicites, des compétences cartographiées, des activités pratiques et une synthèse appliquée.

Pistes thématiques

Parcourir par piste

Sautez dans la zone qui vous tient à cœur. Chaque piste comporte plusieurs guides en anglais simple.

Bibliothèque complète

Tous les guides

117 de 1019 guides illustrés. Filtrez par piste ou recherchez ci-dessus.

IA audio

Vocodeur de diffusion DiffWave

DiffWave est un vocodeur basé sur la diffusion qui synthétise l'audio en débruitant de manière itérative le bruit aléatoire en une forme d'onde, conditionnée par un spectrogramme Mel.

2 lecture min.Lire
IA audio

Modèle audio génératif d’écorce

Bark est un modèle texte-audio open source de Suno qui génère non seulement de la parole, mais aussi des rires, des soupirs, de la musique et des effets sonores directement à partir d'invites textuelles.

2 lecture min.Lire
IA audio

Synthèse autorégressive TTS de tortue

Tortoise TTS est un système de synthèse vocale open source apprécié pour ses voix inhabituellement naturelles et riches en émotions et son clonage de voix puissant à partir de quelques courts…

2 lecture min.Lire
IA audio

Clonage vocal multilingue XTTS

XTTS est le modèle de synthèse vocale multilingue de Coqui qui peut cloner une voix à partir d'un court clip, puis parler dans de nombreuses langues différentes tout en préservant…

2 lecture min.Lire
IA audio

Génération audio parallèle SoundStorm

SoundStorm est un modèle de génération audio Google qui produit la parole et le son en parallèle plutôt qu'un jeton à la fois, réalisant une synthèse audio de haute qualité…

2 lecture min.Lire
IA audio

Synthèse texte-audio AudioGen

AudioGen est un modèle Meta qui transforme les descriptions textuelles en sons environnementaux et en effets sonores réalistes, comme « un chien aboie pendant que les oiseaux gazouillent ».

2 lecture min.Lire
IA audio

Diffusion audio latente stable

Stable Audio est le système texte-audio de Stability AI qui utilise la diffusion latente pour générer de la musique et des effets sonores, avec un contrôle explicite sur la durée du clip.

2 lecture min.Lire
IA audio

Boîte à outils de reconnaissance vocale Kaldi

Kaldi est une boîte à outils gratuite et open source qui est devenue la plateforme de recherche dominante pour la création de systèmes de reconnaissance vocale.

2 lecture min.Lire
IA audio

ASR convolutif Wav2Letter

Wav2Letter est un système de reconnaissance vocale de bout en bout de Facebook AI qui utilisait uniquement des réseaux neuronaux convolutifs, sans récurrence.

2 lecture min.Lire
IA audio

Jasper et QuartzNet ASR

Jasper et QuartzNet sont les modèles de reconnaissance vocale convolutive de bout en bout de NVIDIA, QuartzNet étant une refonte considérablement plus petite et efficace…

2 lecture min.Lire
IA audio

Modèles de diffusion pour l'audio

Les modèles de diffusion génèrent de l'audio en apprenant à inverser un processus de bruit étape par étape, transformant le bruit aléatoire en parole, musique ou effets sonores cohérents.

2 lecture min.Lire
IA audio

Détection d'événements sonores

La détection d'événements sonores (SED) identifie les sons qui se produisent dans un flux audio et le moment exact où ils commencent et s'arrêtent.

2 lecture min.Lire

Vous avez fini de lire ? Prouvez-le.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.