GUIDE de l'IA audio

Juke-box

Jukebox est le réseau neuronal 2020 de OpenAI qui génère de l'audio musical brut, avec des voix chantées, des instruments et même des paroles dans le style d'artistes spécifiques.

2 minutes de lectureDernière mise à jour

Aperçu

It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.

Plongée profonde

Lancé par OpenAI en avril 2020, Jukebox génère de la musique sous forme d'audio brut plutôt que de notes symboliques, ce qui signifie qu'il produit le son réel, y compris les voix. Il a été formé sur environ 1,2 million de chansons (environ la moitié en anglais) extraites du Web, associées aux paroles et aux métadonnées de LyricWiki. Vous pouvez le conditionner à un genre, à un style d'artiste et à des paroles, et il chantera de manière reconnaissable (bien que floue) comme cet artiste. Les sorties durent plusieurs minutes. Le problème réside dans la rapidité et la fidélité : la génération a été extrêmement lente, prenant environ neuf heures pour restituer une seule minute d'audio, et les résultats ont une qualité sourde et bruyante. Jukebox était une recherche, pas un produit raffiné, mais il a remodelé les attentes quant à ce qui était possible.

Aperçu technique

Jukebox compresse l'audio brut à l'aide d'encodeurs automatiques VQ-VAE à trois résolutions temporelles, transformant une longue forme d'onde en une séquence beaucoup plus courte de codes discrets. Les transformateurs autorégressifs prédisent ensuite ces codes un par un, en fonction de l'artiste, du genre et des paroles, et les suréchantillonneurs ajoutent des détails haute fréquence. Le décodage des codes de niveau inférieur en une forme d'onde de 44,1 kHz est ce qui rend la génération si lente, car des millions d'échantillons audio doivent être produits séquentiellement.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir du juke-box

Jukebox lui-même est désormais en grande partie une étape historique, remplacé par des modèles de diffusion plus rapide et d'audio latent comme ceux derrière Suno et Udio qui génèrent des chansons de qualité proche d'un CD en quelques secondes. Ses idées fondamentales – jetons audio discrets et conditionnement sur les paroles – perdurent dans les systèmes modernes. Attendez-vous à ce que les futurs modèles audio bruts continuent de réduire le temps de génération, d'affiner la clarté vocale et d'ajouter des contrôles précis, tandis que les questions de droit d'auteur soulevées pour la première fois par Jukebox à propos de la formation sur les enregistrements protégés par le droit d'auteur ne feront que s'accentuer.

Mise en œuvre dans le monde réel

Des chercheurs étudient comment les réseaux de neurones peuvent modéliser des voix audio et chantées brutes de longue durée, en utilisant Jukebox comme architecture de référence.

Musiciens et amateurs génèrent des «reprises IA» étranges et lo-fi qui chantent de nouvelles paroles dans le style brut d'un artiste choisi.

Des enseignants démontrent le passage de la génération de notes de style MIDI à la synthèse audio brute complète avec chant.

Des concepteurs sonores et des artistes expérimentaux exploitent les textures brumeuses et oniriques de Jukebox comme matière première pour le remixage et le collage.

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Génération de musique symbolique

Questions fréquemment posées

What is Jukebox?

Jukebox est le réseau neuronal 2020 de OpenAI qui génère de l'audio musical brut, avec des voix chantées, des instruments et même des paroles dans le style d'artistes spécifiques. C’était une preuve historique que l’IA pouvait modéliser la forme d’onde réelle de la musique d’une chanson, et pas seulement les notes.

Qu’est-ce qui différencie Jukebox des anciens systèmes d’IA de musique symbolique qui produisent du MIDI ?

Jukebox modélise le son réel de la musique sous forme d'audio brut, de sorte qu'il peut produire des timbres de voix et d'instruments, contrairement aux systèmes symboliques qui ne produisent que des données de notes.

Qui a sorti Jukebox et quand environ ?

OpenAI a lancé Jukebox en avril 2020 comme modèle de recherche pour générer de la musique avec du chant.

Quelle était la principale limitation pratique de Jukebox ?

Parce qu'il décode échantillon audio brut échantillon par échantillon, Jukebox a mis environ neuf heures pour produire une seule minute de musique, ce qui le rend peu pratique pour une utilisation en temps réel.

Quelle technique de base Jukebox utilise-t-il pour rendre l'audio brut long gérable pour ses Transformers ?

Jukebox utilise des encodeurs automatiques VQ-VAE pour compresser la forme d'onde en jetons discrets, que Transformers modélise ensuite de manière autorégressive avant de sur-échantillonner en audio.

Sur quoi pouvez-vous conditionner la sortie de Jukebox ?

Jukebox accepte un genre, un artiste à imiter et des paroles, et tentera de chanter ces mots dans ce style.