Bibliothèque IA gratuite

IA audio GuidesLibre pour toujours.

117 des guides en anglais simple, des parcours d'apprentissage structurés et une bibliothèque ouverte — construits par une organisation à but non lucratif indépendante 501(c)(3) pour que tout le monde puisse comprendre l'IA moderne.

117Guides gratuits
1Pistes thématiques
~2 minPar guide
~4hTemps de lecture

Commencez ici

Cinq cours axés sur les résultats

Chaque cours comprend des résultats explicites, des compétences cartographiées, des activités pratiques et une synthèse appliquée.

Pistes thématiques

Parcourir par piste

Sautez dans la zone qui vous tient à cœur. Chaque piste comporte plusieurs guides en anglais simple.

Bibliothèque complète

Tous les guides

117 de 1019 guides illustrés. Filtrez par piste ou recherchez ci-dessus.

IA audio

Identification de la chanson de reprise

L'identification des reprises détecte lorsque deux enregistrements au son très différent sont en réalité la même chanson sous-jacente : une version acoustique live, un remix...

2 lecture min.Lire
IA audio

Synthèse audio différenciable DDSP

Le DDSP (Differentiable Digital Signal Processing) fusionne les éléments constitutifs d'un synthétiseur classique avec des réseaux de neurones, afin que l'apprentissage profond puisse contrôler les oscillateurs...

2 lecture min.Lire
IA audio

Synthèse vocale de bout en bout VITS

VITS est un modèle de synthèse vocale qui transforme le texte directement en formes d'onde audio brutes dans un seul système entraîné, évitant ainsi le pipeline habituel en deux étapes.

2 lecture min.Lire
IA audio

FastSpeech et TTS non autorégressif

FastSpeech génère un spectrogramme vocal entier en parallèle plutôt qu'une image à la fois, ce qui rend la synthèse considérablement plus rapide et plus stable.

2 lecture min.Lire
IA audio

NaturalSpeech et diffusion latente TTS

NaturalSpeech est une ligne de recherche Microsoft TTS visant une qualité vocale au niveau humain, avec des versions ultérieures utilisant la diffusion latente pour générer des contenus riches et naturels…

2 lecture min.Lire
IA audio

Reconnaissance des émotions vocales

La reconnaissance vocale des émotions (SER) est une IA qui détecte l'état émotionnel d'un locuteur (colère, joie, tristesse, frustration) à partir du son de sa voix, et pas seulement…

2 lecture min.Lire
IA audio

Discours Moshi en duplex intégral

Moshi est une IA vocale open source en temps réel de Kyutai qui parle et écoute en même temps – en duplex intégral – au lieu de se relayer strictement.

2 lecture min.Lire
IA audio

Traduction parole-parole

La traduction parole-parole (S2ST) prend des mots parlés dans une langue et produit des mots parlés dans une autre – en préservant idéalement la voix, le ton de l'orateur…

2 lecture min.Lire
IA audio

Vocodeurs HiFi-GAN et GAN

HiFi-GAN est un vocodeur génératif-adversatif qui transforme presque instantanément un spectrogramme Mel en une forme d'onde audio brute, produisant une parole de qualité studio jusqu'à présent…

2 lecture min.Lire
IA audio

Conversion graphème en phonème

La conversion graphème-phonème (G2P) traduit les lettres écrites en sons qu'un système vocal devrait réellement prononcer.

2 lecture min.Lire
IA audio

Normalisation du texte pour la parole

La normalisation du texte est l'étape frontale qui réécrit le texte écrit brut en mots entièrement prononcés avant qu'un système vocal ne le prononce.

2 lecture min.Lire
IA audio

Codec neuronal SoundStream

SoundStream est le codec audio neuronal de bout en bout de Google qui compresse la parole et la musique à des débits extrêmement faibles tout en préservant la qualité.

2 lecture min.Lire

Vous avez fini de lire ? Prouvez-le.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding