Bibliothèque IA gratuite

IA audio GuidesLibre pour toujours.

117 des guides en anglais simple, des parcours d'apprentissage structurés et une bibliothèque ouverte — construits par une organisation à but non lucratif indépendante 501(c)(3) pour que tout le monde puisse comprendre l'IA moderne.

117Guides gratuits
1Pistes thématiques
~2 minPar guide
~4hTemps de lecture

Commencez ici

Cinq cours axés sur les résultats

Chaque cours comprend des résultats explicites, des compétences cartographiées, des activités pratiques et une synthèse appliquée.

Pistes thématiques

Parcourir par piste

Sautez dans la zone qui vous tient à cœur. Chaque piste comporte plusieurs guides en anglais simple.

Bibliothèque complète

Tous les guides

117 de 1019 guides illustrés. Filtrez par piste ou recherchez ci-dessus.

IA audio

Codec audio en streaming Mimi

Mimi est un codec audio neuronal qui compresse la parole en un minuscule flux de jetons discrets en temps réel, afin que les modèles d'IA puissent écouter et parler avec un débit très faible…

2 lecture min.Lire
IA audio

Écouter, assister et épeler

Listen, Attend and Spell (LAS) est un réseau neuronal phare de 2015 qui transcrit la parole directement en caractères, sans prononciation manuelle…

2 lecture min.Lire
IA audio

SpecAugment pour la reconnaissance vocale

SpecAugment est une méthode d'augmentation de données simple mais puissante qui masque et déforme le spectrogramme de la parole pour rendre les modèles de reconnaissance plus robustes.

2 lecture min.Lire
IA audio

Marquage automatique de la musique

Le marquage automatique de la musique utilise l'apprentissage automatique pour écouter une chanson et attacher automatiquement des étiquettes descriptives telles que le genre, l'ambiance, les instruments et le tempo.

2 lecture min.Lire
IA audio

Transfert de timbre musical

Le transfert de timbre remodèle la « couleur sonore » de l'audio afin qu'un instrument sonne comme un autre, transformant une mélodie fredonnée en une ligne de violon ou de trompette…

2 lecture min.Lire
IA audio

Classification des scènes acoustiques

La classification de scènes acoustiques (ASC) entraîne les machines à reconnaître l’environnement dans lequel un enregistrement a été réalisé, une rue animée, un parc calme, un train, un café…

2 lecture min.Lire
IA audio

NVIDIA Riva et NeMo Discours

NVIDIA Riva est un SDK accéléré par GPU pour l'IA vocale de production (ASR, TTS et traduction), tandis que NeMo est la boîte à outils open source pour la formation et le réglage fin…

2 lecture min.Lire
IA audio

Architecture de parole profonde

DeepSpeech est un modèle de reconnaissance vocale de bout en bout introduit par Baidu en 2014 qui mappe les fonctionnalités audio brutes directement au texte à l'aide d'un neurone récurrent…

2 lecture min.Lire
IA audio

Intégrations de haut-parleurs X-Vector

Les vecteurs X sont des empreintes numériques de longueur fixe de la voix d'un locuteur produites par un réseau neuronal, utilisées pour savoir qui parle, indépendamment de ce qu'il dit.

2 lecture min.Lire
IA audio

Alignement monotone Glow-TTS

Glow-TTS est un modèle de synthèse vocale qui apprend à aligner le texte sur la parole tout seul à l'aide d'une astuce de recherche intelligente, éliminant ainsi le besoin d'un aligneur séparé.

2 lecture min.Lire
IA audio

Vocodeur WaveGAN parallèle

Parallel WaveGAN est un vocodeur neuronal rapide qui transforme un spectrogramme Mel en une forme d'onde audio brute à l'aide d'un petit GAN, générant tous les échantillons à la fois.

2 lecture min.Lire
IA audio

Vocodeur basé sur le flux WaveGlow

WaveGlow est un vocodeur neuronal basé sur le flux de NVIDIA qui synthétise les formes d'onde vocales à partir de spectrogrammes Mel en un seul passage sans autorégression.

2 lecture min.Lire

Vous avez fini de lire ? Prouvez-le.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 4 of 10 | AI Understanding