GUIDE de l'IA audio

Synthèse texte-audio AudioGen

AudioGen est un modèle Meta qui transforme les descriptions textuelles en sons environnementaux et en effets sonores réalistes, comme « un chien aboie pendant que les oiseaux gazouillent ». C’est important car cela permet aux créateurs de générer de l’audio non vocal à partir d’un langage simple, une capacité absente depuis longtemps de l’IA générative.

2 minutes de lectureDernière mise à jour

Plongée profonde

AudioGen, publié par Meta AI en 2022, est un modèle de langage autorégressif qui génère de l'audio général (effets sonores, scènes ambiantes, sons d'animaux et d'objets) directement à partir d'invites de texte. Contrairement aux systèmes de synthèse vocale, il cible le monde désordonné du son quotidien. Il compresse d'abord l'audio brut en une séquence de jetons discrets à l'aide d'un codec neuronal (un auto-encodeur de style EnCodec avec quantification vectorielle résiduelle). Un modèle de langage Transformer apprend ensuite à prédire ces jetons audio en fonction d'une description textuelle codée par un encodeur de texte distinct. Pour améliorer la compréhension de la composition, les auteurs ont mélangé et concaténé des échantillons audio pendant la formation afin que le modèle puisse apprendre des combinaisons telles que des sons qui se chevauchent. AudioGen est ensuite devenu partie intégrante de la bibliothèque AudioCraft de Meta aux côtés du modèle musical MusicGen.

Aperçu technique

AudioGen comporte deux étapes. Tout d’abord, un auto-encodeur audio apprend à mapper les formes d’onde sur un flux compact de jetons discrets et inversement. Deuxièmement, un transformateur est formé avec un objectif de modélisation du langage pour prédire le prochain jeton audio en fonction des jetons précédents et du conditionnement du texte. Le guidage sans classificateur et la modélisation de livres de codes multi-flux améliorent la fidélité et l'alignement du texte. Générer de l'audio signifie échantillonner les jetons de manière autorégressive, puis les décoder en une forme d'onde avec le codec.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir de la synthèse texte-audio d'AudioGen

La conversion texte-audio se dirige vers des fréquences d'échantillonnage plus élevées, des scènes cohérentes plus longues et un contrôle plus strict du timing et du placement spatial des sons. Attendez-vous à une intégration dans des outils vidéo qui ajoutent automatiquement des effets sonores correspondants, des outils d'accessibilité qui décrivent les scènes de manière audible et des moteurs de jeu qui synthétisent l'audio ambiant à la demande. La combinaison de modèles de jetons de style AudioGen avec des méthodes de diffusion et des encodeurs de texte plus puissants devrait améliorer le réalisme, tandis que les outils de filigrane et de provenance aideront à distinguer le son synthétique du son enregistré.

Mise en œuvre dans le monde réel

Génération de Foley et d'effets sonores pour les films et les jeux à partir d'invites de texte

Création de paysages sonores ambiants (pluie, circulation, forêts) pour les applications et les outils de méditation

Prototypage audio pour des projets vidéo sans bibliothèques de licences

Produire des sons d'alerte et de notification personnalisés décrits en langage simple

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioGen Text-to-Audio Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Synthèse audio différenciable DDSP

Questions fréquemment posées

What is AudioGen Text-to-Audio Synthesis?

AudioGen est un modèle Meta qui transforme les descriptions textuelles en sons environnementaux et en effets sonores réalistes, comme « un chien aboie pendant que les oiseaux gazouillent ». C’est important car cela permet aux créateurs de générer de l’audio non vocal à partir d’un langage simple, une capacité absente depuis longtemps de l’IA générative.

Que génère principalement AudioGen ?

AudioGen est spécialisé dans l'audio général non vocal, tel que les sons environnementaux et les effets produits à partir d'invites textuelles.

Quelle est la première étape du pipeline d’AudioGen ?

Un auto-encodeur de codec neuronal compresse l'audio brut en jetons discrets que le modèle de langage peut ensuite prédire.

Quel type de modèle prédit les jetons audio ?

AudioGen utilise un transformateur autorégressif qui prédit les jetons audio les uns après les autres, en fonction du texte.

Pourquoi les auteurs ont-ils mixé et enchaîné l’audio pendant la formation ?

L'augmentation avec des clips mixés et concaténés a amélioré la capacité d'AudioGen à composer plusieurs sons décrits ensemble dans une invite.

Quelle bibliothèque Meta plus grande inclut AudioGen ?

AudioGen fait partie de la bibliothèque AudioCraft de Meta, qui contient également le modèle MusicGen.