Audio AI ÚTMUTATÓ

Jukebox

A Jukebox a OpenAI 2020-as neurális hálózata, amely nyers zenei hangot generál – kiegészítve énekhangokkal, hangszerekkel és még szövegekkel is, bizonyos előadók stílusában.

2 perc olvasásUtoljára frissítve

Áttekintés

It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.

Mély merülés

A OpenAI által 2020 áprilisában kiadott Jukebox a zenét nyers hanganyagként generálja, nem pedig szimbolikus hangjegyeket, vagyis a tényleges hangot hozza létre, beleértve az éneket is. Körülbelül 1,2 millió, az internetről lekapart dalra (körülbelül a fele angol nyelvű) képezték ki, párosítva a LyricWiki szövegeivel és metaadataival. Feltételezheti egy műfajt, egy előadói stílust és szöveget, és felismerhetően (ha homályosan) fog énekelni, mint az adott előadó. A kimenetek több percig futnak. A csapás a sebesség és a hűség: az előállítás rendkívül lassú volt, körülbelül kilenc óra alatt egyetlen percnyi hangot is előállított, és az eredmények tompa, zajos minőséget mutatnak. A Jukebox kutatás volt, nem egy csiszolt termék, de átformálta a lehetséges elvárásokat.

Technikai betekintés

A Jukebox VQ-VAE autoenkóderekkel tömöríti a nyers hangot három időfelbontással, így a hosszú hullámformát diszkrét kódok sokkal rövidebb sorozatává alakítja. Az autoregresszív transzformátorok egyenként előrejelzik ezeket a kódokat, előadótól, műfajtól és dalszövegtől függően, az upsamplerek pedig nagyfrekvenciás részleteket adnak hozzá. Az alsó szintű kódok 44,1 kHz-es hullámformára való visszakódolása miatt a generálás olyan lelassult, mert több millió hangmintát kell egymás után előállítani.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A Jukebox jövője

Maga a Jukebox nagyrészt történelmi mérföldkő, amelyet felváltanak a gyorsabb diffúziós és látens hangmodellek, mint például a Suno és az Udio mögött, amelyek csaknem CD-minőségű dalokat generálnak másodpercek alatt. Alapötletei – diszkrét hangjelzők és a dalszövegek kondicionálása – a modern rendszerekben élnek. A jövőbeli nyers hangmodellektől azt kell várni, hogy folyamatosan csökkenjen a generálási idő, élesebbé váljon a hang, és finom vezérléseket adjon, miközben a Jukebox által először felvetett szerzői jogi kérdések a szerzői joggal védett felvételekkel kapcsolatos képzéssel kapcsolatban csak egyre hangosabbak lesznek.

Valós megvalósítás

A kutatók azt tanulmányozzák, hogy a neurális hálózatok hogyan modellezhetik a hosszú formájú nyers hangot és az énekhangokat, a Jukeboxot referenciaarchitektúraként használva.

Zenészek és hobbisták kísérteties, lo-fi „AI-borítókat” generálnak, amelyek új dalszövegeket énekelnek egy kiválasztott előadó durva stílusában.

Az oktatók bemutatják az ugrást a MIDI-stílusú hangjegygenerálástól a teljes nyers hangszintézisig, vokállal.

Hangtervezők és kísérletező művészek, akik a Jukebox homályos, álomszerű textúráit gyűjtik össze remixelés és kollázs alapanyagaként.

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Szimbolikus zenegeneráció

Gyakran ismételt kérdések

What is Jukebox?

A Jukebox a OpenAI 2020-as neurális hálózata, amely nyers zenei hangot generál – kiegészítve énekhangokkal, hangszerekkel és még szövegekkel is, bizonyos előadók stílusában. Mérföldkőnek számító bizonyítéka volt annak, hogy a mesterséges intelligencia képes modellezni a dalhosszúságú zene tényleges hullámformáját, nem csak a hangjegyeket.

Miben különbözik a Jukebox a korábbi szimbolikus zenei AI-szerű rendszerektől, amelyek MIDI-t adnak ki?

A Jukebox a zene tényleges hangját nyers hangként modellezi, így énekhangokat és hangszerhangokat képes előállítani, ellentétben a szimbolikus rendszerekkel, amelyek csak hangjegyadatokat adnak ki.

Ki adta ki a Jukeboxot és nagyjából mikor?

A OpenAI 2020 áprilisában adta ki a Jukeboxot, mint kutatási modellt az énekhanggal történő zene generálására.

Mi volt a Jukebox fő gyakorlati korlátja?

Mivel a nyers hangmintát mintánként dekódolja, a Jukeboxnak nagyságrendileg kilenc órába telt egy percnyi zene elkészítése, így a valós idejű használat nem volt praktikus.

Milyen alapvető technikát használ a Jukebox, hogy kezelhetővé tegye a hosszú nyers hangot a Transformers számára?

A Jukebox VQ-VAE autoenkódereket használ a hullámforma diszkrét tokenekbe való tömörítésére, amelyeket a Transformers autoregresszíven modellez, mielőtt visszamintavételezné a hangot.

Mire lehet beállítani a Jukebox kimenetét?

A Jukebox elfogad egy műfajt, utánozandó előadót és szöveget, és megpróbálja ezeket a szavakat ebben a stílusban elénekelni.