Jukeboks
Jukebox er OpenAIs 2020 nevrale nettverk som genererer rå musikklyd – komplett med sangstemmer, instrumenter og til og med tekster i stil med spesifikke artister.
Oversikt
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
Dypdykk
Utgitt av OpenAI i april 2020, genererer Jukebox musikk som rålyd i stedet for symbolske notater, noe som betyr at den produserer den faktiske lyden inkludert vokal. Den ble trent på omtrent 1,2 millioner sanger (omtrent halvparten engelskspråklige) skrapet fra nettet, sammen med tekster og metadata fra LyricWiki. Du kan betinge den på en sjanger, en artiststil og tekster, og den vil synge gjenkjennelig (hvis tåkete) som den artisten. Utgangene varer flere minutter. Fangsten er hastighet og troskap: genereringen var ekstremt sakte, og tok rundt ni timer å gjengi et enkelt minutt med lyd, og resultatene har en dempet, støyende kvalitet. Jukebox var forskning, ikke et polert produkt, men det omskapte forventningene til hva som var mulig.
Teknisk innsikt
Jukebox komprimerer rålyd ved hjelp av VQ-VAE-autokodere med tre tidsoppløsninger, og gjør en lang bølgeform til en mye kortere sekvens av diskrete koder. Autoregressive Transformers forutsier deretter disse kodene én om gangen, avhengig av artist, sjanger og tekster, og upsamplere legger til høyfrekvente detaljer. Å dekode bunnnivåkodene tilbake til en bølgeform på 44,1 kHz er det som gjør genereringen så treg, fordi millioner av lydprøver må produseres sekvensielt.
Strategisk innvirkning
Access and reach
Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.
Cost and budget
Medieteam kan sende polert lyd raskere med mindre budsjetter.
Speed and scale
Kundevendte systemer kan behandle talte interaksjoner i større skala.
Jukeboxens fremtid
Jukebox i seg selv er i stor grad en historisk milepæl nå, erstattet av raskere spredning og latent-lydmodeller som de bak Suno og Udio som genererer sanger av nesten CD-kvalitet på sekunder. Dens kjerneideer – diskrete lydtokens og kondisjonering på tekster – lever videre i moderne systemer. Forvent at fremtidige rålydmodeller vil fortsette å krympe generasjonstiden, skjerpe vokalklarheten og legge til fine kontroller, mens opphavsrettsspørsmålene Jukebox først stilte om opplæring på opphavsrettsbeskyttede opptak bare blir høyere.
Real-World Implementering
Forskere som studerer hvordan nevrale nettverk kan modellere langformede rålyd- og sangstemmer ved å bruke Jukebox som referansearkitektur.
Musikere og hobbyister genererer skumle, lo-fi 'AI-covers' som synger nye tekster i den røffe stilen til en valgt artist.
Lærere demonstrerer spranget fra generering av MIDI-noter til full rålydsyntese med vokal.
Lyddesignere og eksperimentelle artister høster Jukeboxs disige, drømmeaktige teksturer som råmateriale for remiksing og collage.
Risikoer og rekkverk
Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.
Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.
Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.
Veikart for implementering
Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.
Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.
Definer når et menneske må gjennomgå eller godkjenne utdata.
Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Symbolsk musikkgenerasjon
Ofte stilte spørsmål
What is Jukebox?
Jukebox er OpenAIs 2020 nevrale nettverk som genererer rå musikklyd – komplett med sangstemmer, instrumenter og til og med tekster i stil med spesifikke artister. Det var et landemerkebevis på at AI kunne modellere den faktiske bølgeformen til musikk i sanglengde, ikke bare noter.
Hva gjør Jukebox forskjellig fra tidligere symbolsk musikk-AI som systemer som sender ut MIDI?
Jukebox modellerer selve lyden av musikk som rålyd, slik at den kan produsere vokal og instrumentklang, i motsetning til symbolske systemer som bare sender ut notedata.
Hvem ga ut Jukebox og omtrent når?
OpenAI ga ut Jukebox i april 2020 som en forskningsmodell for å generere musikk med vokal.
Hva var en viktig praktisk begrensning for Jukebox?
Fordi den dekoder rå lydprøve for prøve, tok Jukebox i størrelsesorden ni timer å produsere ett enkelt minutt med musikk, noe som gjør det upraktisk for bruk i sanntid.
Hvilken kjerneteknikk bruker Jukebox for å gjøre lang rålyd håndterbar for Transformers?
Jukebox bruker VQ-VAE autoenkodere for å komprimere bølgeformen til diskrete tokens, som Transformers deretter modellerer autoregressivt før de oppsampler tilbake til lyd.
Hva kan du betinge Jukebox sin utgang på?
Jukebox aksepterer en sjanger, en artist å imitere, og tekster, og vil forsøke å synge disse ordene i den stilen.