GHID audio AI

Tonomat

Jukebox este rețeaua neuronală 2020 a OpenAI care generează sunet muzical brut — complet cu voci cântătoare, instrumente și chiar versuri în stilul anumitor artiști.

2 minute de lecturăUltima actualizare

Prezentare generală

A fost o dovadă de referință că inteligența artificială putea modela forma reală de undă a muzicii de lungimea unui cântec, nu doar note.

Scufundare în profunzime

Lansat de OpenAI în aprilie 2020, Jukebox generează muzică ca sunet brut, mai degrabă decât note simbolice, ceea ce înseamnă că produce sunetul real, inclusiv vocea. A fost antrenat pe aproximativ 1,2 milioane de cântece (aproximativ jumătate în limba engleză) scoase de pe web, asociate cu versuri și metadate de la LyricWiki. Îl poți condiționa de un gen, de un stil de artist și de versuri și va cânta ușor de recunoscut (dacă neclar) ca acel artist. Ieșirile durează câteva minute. Captura este viteza și fidelitatea: generarea a fost extrem de lentă, a durat aproximativ nouă ore pentru a reda un singur minut de sunet, iar rezultatele au o calitate înăbușită, zgomotoasă. Jukebox a fost cercetare, nu un produs lustruit, dar a remodelat așteptările pentru ceea ce era posibil.

Perspectivă tehnică

Jukebox comprimă audio brut folosind autoencodere VQ-VAE la trei rezoluții de timp, transformând o formă de undă lungă într-o secvență mult mai scurtă de coduri discrete. Transformatoarele autoregressive prezic apoi aceste coduri pe rând, în funcție de artist, gen și versuri, iar eșantionarele adaugă detalii de înaltă frecvență. Decodificarea codurilor de nivel inferior la o formă de undă de 44,1 kHz este ceea ce face generarea atât de lentă, deoarece milioane de mostre audio trebuie produse secvenţial.

Impact strategic

Acces și acoperire

Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.

Cost și buget

Echipele media pot livra audio mai rapid cu bugete mai mici.

Viteză și scară

Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.

Viitorul Jukebox-ului

Jukebox-ul în sine este în mare măsură o piatră de hotar istorică acum, înlocuit de difuzie mai rapidă și modele audio latente, cum ar fi cele din spatele Suno și Udio, care generează melodii de calitate aproape de CD în câteva secunde. Ideile sale de bază – jetoane audio discrete și condiționarea versurilor – trăiesc în sistemele moderne. Așteptați-vă că viitoarele modele audio brute vor continua să reducă timpul de generație, să clarifice claritatea vocală și să adauge controale fine, în timp ce întrebările privind drepturile de autor pe care Jukebox le-a ridicat pentru prima dată cu privire la instruirea înregistrărilor protejate prin drepturi de autor devin mai puternice.

Implementare în lumea reală

Cercetătorii care studiază modul în care rețelele neuronale pot modela sunetul brut de formă lungă și vocile cântând, folosind Jukebox ca arhitectură de referință.

Muzicieni și pasionați care generează „coperte AI” stranii, lo-fi, care cântă versuri noi în stilul brut al unui artist ales.

Educatori care demonstrează saltul de la generarea de note în stil MIDI la sinteza audio brută completă cu voce.

Designeri de sunet și artiști experimentali care recoltează texturile neclare și de vis ale lui Jukebox ca materie primă pentru remixare și colaj.

Riscuri și balustrade

Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.

Precizia poate scădea în accente, dialecte sau medii zgomotoase.

Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.

Foaia de parcurs de implementare

1

Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.

2

Testați calitatea pe diverse difuzoare și condiții de fundal.

3

Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.

4

Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Generația de muzică simbolică

Întrebări frecvente

Ce este Jukebox-ul?

Jukebox este rețeaua neuronală 2020 a OpenAI care generează sunet muzical brut — complet cu voci cântătoare, instrumente și chiar versuri în stilul anumitor artiști. A fost o dovadă de reper că AI ar putea modela forma de undă reală a muzicii cu lungimea cântecului, nu doar note.

Ce face Jukebox-ul diferit de sistemele anterioare de tip AI muzical simbolic care scot MIDI?

Jukebox modelează sunetul real al muzicii ca sunet brut, astfel încât să poată produce voci și timbre ale instrumentelor, spre deosebire de sistemele simbolice care scot doar date despre note.

Cine a lansat Jukebox și, aproximativ, când?

OpenAI a lansat Jukebox în aprilie 2020 ca model de cercetare pentru generarea muzicii cu voce.

Care a fost o limitare practică majoră a Jukebox-ului?

Deoarece decodifică probă audio brută cu probă, Jukebox a durat aproximativ nouă ore pentru a produce un singur minut de muzică, făcându-l nepractic pentru utilizarea în timp real.

Ce tehnică de bază folosește Jukebox pentru a face sunetul brut lung ușor de gestionat pentru transformatoarele sale?

Jukebox folosește codificatoare automate VQ-VAE pentru a comprima forma de undă în token-uri discrete, pe care Transformers le modelează apoi autoregresiv înainte de a supraeșantiona înapoi în audio.

Pe ce poți condiționa ieșirea Jukebox-ului?

Jukebox acceptă un gen, un artist de imitat și versuri și va încerca să cânte acele cuvinte în acel stil.