Juke-box
Jukebox è la rete neurale 2020 di OpenAI che genera audio musicale grezzo, completo di voci cantate, strumenti e persino testi nello stile di artisti specifici.
Panoramica
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
Immersione profonda
Rilasciato da OpenAI nell'aprile 2020, Jukebox genera musica come audio grezzo anziché come note simboliche, il che significa che produce il suono reale, inclusa la voce. È stato addestrato su circa 1,2 milioni di canzoni (circa la metà in lingua inglese) recuperate dal web, abbinate a testi e metadati da LyricWiki. Puoi condizionarlo su un genere, uno stile di artista e testi, e canterà in modo riconoscibile (anche se confuso) come quell'artista. Le uscite durano diversi minuti. Il problema è la velocità e la fedeltà: la generazione è stata estremamente lenta, impiegando circa nove ore per riprodurre un singolo minuto di audio, e i risultati hanno una qualità ovattata e rumorosa. Jukebox era una ricerca, non un prodotto raffinato, ma rimodellava le aspettative su ciò che era possibile.
Approfondimento tecnico
Jukebox comprime l'audio grezzo utilizzando gli autoencoder VQ-VAE a tre risoluzioni temporali, trasformando una lunga forma d'onda in una sequenza molto più breve di codici discreti. I trasformatori autoregressivi quindi predicono questi codici uno alla volta, in base all'artista, al genere e ai testi, e gli upsampler aggiungono dettagli ad alta frequenza. Decodificare i codici di livello inferiore in una forma d'onda a 44,1 kHz è ciò che rende la generazione così lenta, perché milioni di campioni audio devono essere prodotti in sequenza.
Impatto strategico
Accedere e raggiungere
Migliora l'accessibilità attraverso la trascrizione, la narrazione e le interfacce vocali.
Costo e budget
I team media possono fornire audio raffinato più velocemente con budget inferiori.
Velocità e scala
I sistemi rivolti al cliente possono elaborare le interazioni parlate su scala più ampia.
Il futuro del Jukebox
Lo stesso Jukebox è ormai in gran parte una pietra miliare storica, sostituito da modelli a diffusione più rapida e audio latente come quelli dietro Suno e Udio che generano brani di qualità quasi CD in pochi secondi. Le sue idee fondamentali – token audio discreti e condizionamento sui testi – continuano a vivere nei sistemi moderni. Aspettatevi che i futuri modelli di audio grezzo continuino a ridurre i tempi di generazione, ad affinare la chiarezza vocale e ad aggiungere controlli precisi, mentre le domande sul copyright sollevate per la prima volta da Jukebox sulla formazione sulle registrazioni protette da copyright diventano solo più forti.
Implementazione nel mondo reale
Ricercatori che studiano come le reti neurali possono modellare audio grezzo e voci cantate di lunga durata, utilizzando Jukebox come architettura di riferimento.
Musicisti e hobbisti che generano inquietanti "cover AI" lo-fi che cantano nuovi testi nello stile grezzo di un artista scelto.
Educatori che dimostrano il salto dalla generazione di note in stile MIDI alla sintesi audio grezza completa con voce.
Sound designer e artisti sperimentali che raccolgono le trame nebulose e oniriche di Jukebox come materia prima per remix e collage.
Rischi e guardrail
I rischi di uso improprio della voce e di impersonificazione aumentano quando manca il consenso.
La precisione può diminuire se si considerano accenti, dialetti o ambienti rumorosi.
L'audio sintetico può essere confuso con un parlato autentico senza un'etichettatura chiara.
Tabella di marcia per l'implementazione
Ottieni il consenso esplicito per l'acquisizione, la clonazione e il riutilizzo della voce.
Testare la qualità su diversi altoparlanti e condizioni di fondo.
Definire quando un essere umano deve rivedere o approvare gli output.
Etichettare l'audio sintetico e conservare i registri di provenienza per responsabilità.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Generazione di musica simbolica
Domande frequenti
What is Jukebox?
Jukebox è la rete neurale 2020 di OpenAI che genera audio musicale grezzo, completo di voci cantate, strumenti e persino testi nello stile di artisti specifici. È stata una prova fondamentale del fatto che l’intelligenza artificiale può modellare la forma d’onda effettiva della musica lunga una canzone, non solo le note.
Cosa rende Jukebox diverso dai precedenti sistemi di intelligenza artificiale musicale simbolica che emettono MIDI?
Jukebox modella il suono reale della musica come audio grezzo, in modo da poter produrre timbri vocali e strumenti, a differenza dei sistemi simbolici che emettono solo dati di note.
Chi ha pubblicato Jukebox e più o meno quando?
OpenAI ha rilasciato Jukebox nell'aprile 2020 come modello di ricerca per generare musica con la voce.
Qual è stata la principale limitazione pratica di Jukebox?
Poiché decodifica campione audio grezzo per campione, Jukebox ha impiegato circa nove ore per produrre un singolo minuto di musica, rendendolo poco pratico per l'uso in tempo reale.
Quale tecnica di base utilizza Jukebox per rendere gestibile l'audio lungo e grezzo per i suoi Transformers?
Jukebox utilizza gli autocodificatori VQ-VAE per comprimere la forma d'onda in token discreti, che Transformers poi modella in modo autoregressivo prima di sovracampionare nuovamente in audio.
Su cosa puoi condizionare l'output di Jukebox?
Jukebox accetta un genere, un artista da imitare e dei testi, e tenterà di cantare quelle parole in quello stile.