Audio AI GUIDE

Jukeboks

Jukebox er OpenAIs 2020 nevrale nettverk som genererer rå musikklyd – komplett med sangstemmer, instrumenter og til og med tekster i stil med spesifikke artister.

2 min lesingSist oppdatert

Oversikt

It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.

Dypdykk

Utgitt av OpenAI i april 2020, genererer Jukebox musikk som rålyd i stedet for symbolske notater, noe som betyr at den produserer den faktiske lyden inkludert vokal. Den ble trent på omtrent 1,2 millioner sanger (omtrent halvparten engelskspråklige) skrapet fra nettet, sammen med tekster og metadata fra LyricWiki. Du kan betinge den på en sjanger, en artiststil og tekster, og den vil synge gjenkjennelig (hvis tåkete) som den artisten. Utgangene varer flere minutter. Fangsten er hastighet og troskap: genereringen var ekstremt sakte, og tok rundt ni timer å gjengi et enkelt minutt med lyd, og resultatene har en dempet, støyende kvalitet. Jukebox var forskning, ikke et polert produkt, men det omskapte forventningene til hva som var mulig.

Teknisk innsikt

Jukebox komprimerer rålyd ved hjelp av VQ-VAE-autokodere med tre tidsoppløsninger, og gjør en lang bølgeform til en mye kortere sekvens av diskrete koder. Autoregressive Transformers forutsier deretter disse kodene én om gangen, avhengig av artist, sjanger og tekster, og upsamplere legger til høyfrekvente detaljer. Å dekode bunnnivåkodene tilbake til en bølgeform på 44,1 kHz er det som gjør genereringen så treg, fordi millioner av lydprøver må produseres sekvensielt.

Strategisk innvirkning

Access and reach

Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.

Cost and budget

Medieteam kan sende polert lyd raskere med mindre budsjetter.

Speed and scale

Kundevendte systemer kan behandle talte interaksjoner i større skala.

Jukeboxens fremtid

Jukebox i seg selv er i stor grad en historisk milepæl nå, erstattet av raskere spredning og latent-lydmodeller som de bak Suno og Udio som genererer sanger av nesten CD-kvalitet på sekunder. Dens kjerneideer – diskrete lydtokens og kondisjonering på tekster – lever videre i moderne systemer. Forvent at fremtidige rålydmodeller vil fortsette å krympe generasjonstiden, skjerpe vokalklarheten og legge til fine kontroller, mens opphavsrettsspørsmålene Jukebox først stilte om opplæring på opphavsrettsbeskyttede opptak bare blir høyere.

Real-World Implementering

Forskere som studerer hvordan nevrale nettverk kan modellere langformede rålyd- og sangstemmer ved å bruke Jukebox som referansearkitektur.

Musikere og hobbyister genererer skumle, lo-fi 'AI-covers' som synger nye tekster i den røffe stilen til en valgt artist.

Lærere demonstrerer spranget fra generering av MIDI-noter til full rålydsyntese med vokal.

Lyddesignere og eksperimentelle artister høster Jukeboxs disige, drømmeaktige teksturer som råmateriale for remiksing og collage.

Risikoer og rekkverk

Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.

Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.

Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.

Veikart for implementering

1

Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.

2

Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.

3

Definer når et menneske må gjennomgå eller godkjenne utdata.

4

Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Symbolsk musikkgenerasjon

Ofte stilte spørsmål

What is Jukebox?

Jukebox er OpenAIs 2020 nevrale nettverk som genererer rå musikklyd – komplett med sangstemmer, instrumenter og til og med tekster i stil med spesifikke artister. Det var et landemerkebevis på at AI kunne modellere den faktiske bølgeformen til musikk i sanglengde, ikke bare noter.

Hva gjør Jukebox forskjellig fra tidligere symbolsk musikk-AI som systemer som sender ut MIDI?

Jukebox modellerer selve lyden av musikk som rålyd, slik at den kan produsere vokal og instrumentklang, i motsetning til symbolske systemer som bare sender ut notedata.

Hvem ga ut Jukebox og omtrent når?

OpenAI ga ut Jukebox i april 2020 som en forskningsmodell for å generere musikk med vokal.

Hva var en viktig praktisk begrensning for Jukebox?

Fordi den dekoder rå lydprøve for prøve, tok Jukebox i størrelsesorden ni timer å produsere ett enkelt minutt med musikk, noe som gjør det upraktisk for bruk i sanntid.

Hvilken kjerneteknikk bruker Jukebox for å gjøre lang rålyd håndterbar for Transformers?

Jukebox bruker VQ-VAE autoenkodere for å komprimere bølgeformen til diskrete tokens, som Transformers deretter modellerer autoregressivt før de oppsampler tilbake til lyd.

Hva kan du betinge Jukebox sin utgang på?

Jukebox aksepterer en sjanger, en artist å imitere, og tekster, og vil forsøke å synge disse ordene i den stilen.