Juke-box
Jukebox est le réseau neuronal 2020 de OpenAI qui génère de l'audio musical brut, avec des voix chantées, des instruments et même des paroles dans le style d'artistes spécifiques.
Aperçu
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
Plongée profonde
Lancé par OpenAI en avril 2020, Jukebox génère de la musique sous forme d'audio brut plutôt que de notes symboliques, ce qui signifie qu'il produit le son réel, y compris les voix. Il a été formé sur environ 1,2 million de chansons (environ la moitié en anglais) extraites du Web, associées aux paroles et aux métadonnées de LyricWiki. Vous pouvez le conditionner à un genre, à un style d'artiste et à des paroles, et il chantera de manière reconnaissable (bien que floue) comme cet artiste. Les sorties durent plusieurs minutes. Le problème réside dans la rapidité et la fidélité : la génération a été extrêmement lente, prenant environ neuf heures pour restituer une seule minute d'audio, et les résultats ont une qualité sourde et bruyante. Jukebox était une recherche, pas un produit raffiné, mais il a remodelé les attentes quant à ce qui était possible.
Aperçu technique
Jukebox compresse l'audio brut à l'aide d'encodeurs automatiques VQ-VAE à trois résolutions temporelles, transformant une longue forme d'onde en une séquence beaucoup plus courte de codes discrets. Les transformateurs autorégressifs prédisent ensuite ces codes un par un, en fonction de l'artiste, du genre et des paroles, et les suréchantillonneurs ajoutent des détails haute fréquence. Le décodage des codes de niveau inférieur en une forme d'onde de 44,1 kHz est ce qui rend la génération si lente, car des millions d'échantillons audio doivent être produits séquentiellement.
Impact stratégique
Accès et portée
Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.
Coût et budget
Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.
Vitesse et échelle
Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.
L'avenir du juke-box
Jukebox lui-même est désormais en grande partie une étape historique, remplacé par des modèles de diffusion plus rapide et d'audio latent comme ceux derrière Suno et Udio qui génèrent des chansons de qualité proche d'un CD en quelques secondes. Ses idées fondamentales – jetons audio discrets et conditionnement sur les paroles – perdurent dans les systèmes modernes. Attendez-vous à ce que les futurs modèles audio bruts continuent de réduire le temps de génération, d'affiner la clarté vocale et d'ajouter des contrôles précis, tandis que les questions de droit d'auteur soulevées pour la première fois par Jukebox à propos de la formation sur les enregistrements protégés par le droit d'auteur ne feront que s'accentuer.
Mise en œuvre dans le monde réel
Des chercheurs étudient comment les réseaux de neurones peuvent modéliser des voix audio et chantées brutes de longue durée, en utilisant Jukebox comme architecture de référence.
Musiciens et amateurs génèrent des «reprises IA» étranges et lo-fi qui chantent de nouvelles paroles dans le style brut d'un artiste choisi.
Des enseignants démontrent le passage de la génération de notes de style MIDI à la synthèse audio brute complète avec chant.
Des concepteurs sonores et des artistes expérimentaux exploitent les textures brumeuses et oniriques de Jukebox comme matière première pour le remixage et le collage.
Risques et garde-fous
Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.
La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.
L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.
Feuille de route de mise en œuvre
Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.
Testez la qualité sur divers locuteurs et conditions d’arrière-plan.
Définissez quand un humain doit examiner ou approuver les résultats.
Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Génération de musique symbolique
Questions fréquemment posées
What is Jukebox?
Jukebox est le réseau neuronal 2020 de OpenAI qui génère de l'audio musical brut, avec des voix chantées, des instruments et même des paroles dans le style d'artistes spécifiques. C’était une preuve historique que l’IA pouvait modéliser la forme d’onde réelle de la musique d’une chanson, et pas seulement les notes.
Qu’est-ce qui différencie Jukebox des anciens systèmes d’IA de musique symbolique qui produisent du MIDI ?
Jukebox modélise le son réel de la musique sous forme d'audio brut, de sorte qu'il peut produire des timbres de voix et d'instruments, contrairement aux systèmes symboliques qui ne produisent que des données de notes.
Qui a sorti Jukebox et quand environ ?
OpenAI a lancé Jukebox en avril 2020 comme modèle de recherche pour générer de la musique avec du chant.
Quelle était la principale limitation pratique de Jukebox ?
Parce qu'il décode échantillon audio brut échantillon par échantillon, Jukebox a mis environ neuf heures pour produire une seule minute de musique, ce qui le rend peu pratique pour une utilisation en temps réel.
Quelle technique de base Jukebox utilise-t-il pour rendre l'audio brut long gérable pour ses Transformers ?
Jukebox utilise des encodeurs automatiques VQ-VAE pour compresser la forme d'onde en jetons discrets, que Transformers modélise ensuite de manière autorégressive avant de sur-échantillonner en audio.
Sur quoi pouvez-vous conditionner la sortie de Jukebox ?
Jukebox accepte un genre, un artiste à imiter et des paroles, et tentera de chanter ces mots dans ce style.