GHID audio AI
Extensia și continuarea muzicii AI
Extensia muzicală AI folosește un model generativ pentru a continua un clip audio existent, pentru a regenera o secțiune din mijloc (inpainting), pentru a-l modifica sau pentru a adăuga și înlocui tulpinile instrumentelor individuale.
Pe această pagină4 minute de citit
Prezentare generală
Permite ca o idee scurtă să crească într-o piesă completă sau o preluare defectuoasă să fie reparată fără reînregistrare. Contează pentru că schimbă modul în care oamenii redactează și editează muzica, dar are limite clare de calitate și nu elimină drepturile celui care deține sunetul original.
Scufundare în profunzime
Extensia preia un clip existent și generează ceea ce urmează. O abordare comună este continuarea autoregresivă. MusicGen de la Meta, lansat în 2023 ca parte a AudioCraft, convertește sunetul în jetoane discrete cu un codec neuronal numit EnCodec și prezice alte jetoane după cele pe care le furnizați, la fel cum un model de limbă continuă o propoziție. Serviciile pentru consumatori precum Suno și Udio oferă acest lucru ca o funcție de extindere, permițându-vă de obicei să alegeți un punct de pornire și să schimbați versurile sau stilul pentru noua secțiune. Inpainting regenerează o regiune mascată din mijloc, păstrând în același timp sunetul pe ambele părți, util pentru fixarea unei versuri sau înlocuirea a patru bare. Modelele de difuzie se potrivesc acestui lucru deoarece sunetul cunoscut poate fi menținut fix în timp ce numai intervalul mascat este dezgomotat. Modurile audio-la-audio sau remix, cum ar fi cel introdus de Stability AI cu Stable Audio 2.0 în 2024, adaugă parțial zgomot la o intrare și o regenerează sub un nou prompt, astfel încât structura să supraviețuiască în timp ce timbrul și stilul se schimbă. O setare de putere controlează cât de mult rămâne din original. Munca stem combină separarea și generarea. Modelele de separare a surselor, cum ar fi Demucs open-source de la Meta, împart un mix în voce, tobe, bas și altele; un generator poate adăuga sau înlocui o parte condiționată de restul. Limitele sunt reale. Extensiile lungi se deplasează: tempo-ul, cheia, echilibrul mix și timbrul vocal pot rătăci. Unirile pot face clic sau pot sări în zgomot. Modelele văd o fereastră de context limitată, așa că un motiv din primul minut poate fi uitat. O concepție greșită comună este că modelul înțelege structura cântecului așa cum o face un muzician; se potrivește modele în audio recent. Drepturile persistă, de asemenea: extinderea unei înregistrări comerciale pe care nu o dețineți creează un derivat al acesteia, iar condițiile multor servicii interzic încărcarea audio la care nu aveți drepturi.
Impact strategic
Acces și acoperire
Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.
Cost și buget
Echipele media pot livra audio mai rapid cu bugete mai mici.
Viteză și scară
Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.
Viitorul extinderii și continuării muzicii AI
Cercetarea împinge către un context mai lung, o mai bună cunoaștere a structurii și un control mai fin asupra tulpinilor individuale, ceea ce ar trebui să reducă deriva și să facă editările la nivel de secțiune mai previzibile. Integrarea în stațiile de lucru audio digitale este o direcție probabilă, deoarece editarea în interiorul unui proiect existent este mai utilă decât generarea de melodii întregi într-un browser. Calitatea la nivelul cusăturilor și păstrarea identității unui anumit cântăreț rămân probleme grele. În ceea ce privește drepturile, acordurile de filtrare a încărcării și de licențiere între servicii și deținătorii de drepturi sunt încă în curs de dezvoltare, așa că ceea ce utilizatorii pot extinde din punct de vedere legal va depinde de evoluția termenilor și a rezultatelor instanței, mai degrabă decât de tehnologie.
Implementare în lumea reală
Un compozitor fredonează o idee de refren de 20 de secunde, o încarcă într-un generator de muzică și folosește o funcție Extend de la marcajul 0:18 pentru a produce un vers și un pod care continuă în aceeași tonalitate și tempo.
Un editor de podcast are un pat de muzică licențiat de 30 de secunde, care este prea scurt pentru introducere, așa că generează o continuare și o efectuează încrucișare la o linie de bar pentru a ajunge la 60 de secunde.
Un producător separă un demo vechi în voce, tobe, bas și alte ramuri cu Demucs, dezactivează tulpina slabă a tobei și are un model care generează o nouă parte de tobe condiționată de tulpinile rămase.
O trupă pictează două bare în care cântăreața a pufnit un vers, păstrând sunetul de ambele părți intact, apoi verifică dacă vocea regenerată sună în continuare ca aceeași cântăreață.
Riscuri și balustrade
Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.
Precizia poate scădea în accente, dialecte sau medii zgomotoase.
Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.
Foaia de parcurs de implementare
Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.
Testați calitatea pe diverse difuzoare și condiții de fundal.
Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.
Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AI Music Extension and Continuation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Întrebări frecvente
Ce este extensia și continuarea muzicii AI?
Extensia muzicală AI folosește un model generativ pentru a continua un clip audio existent, pentru a regenera o secțiune din mijloc (inpainting), pentru a-l modifica sau pentru a adăuga și înlocui tulpinile instrumentelor individuale. Permite ca o idee scurtă să crească într-o piesă completă sau o preluare defectuoasă să fie reparată fără reînregistrare. Contează pentru că schimbă modul în care oamenii redactează și editează muzica, dar are limite clare de calitate și nu elimină drepturile celui care deține sunetul original.
Cum continuă un model autoregresiv precum MusicGen un clip audio?
Clipul este convertit în jetoane discrete, iar modelul prezice ce jetoane urmează, similar modului în care un model de limbă continuă textul.
Ce codec neuronal folosește MusicGen pentru a transforma sunetul în jetoane?
MusicGen se bazează pe EnCodec, un codec audio neuronal de la Meta, pentru a reprezenta sunetul ca simboluri discrete.
Ce face audio inpainting?
Inpainting umple sau înlocuiește un interval selectat, cum ar fi un versuri flushed, păstrând în același timp sunetul intact.
De ce modelele de difuzie sunt potrivite pentru pictură în interior?
Difuzia poate constrânge regiuni cunoscute în timpul reducerii zgomotului, astfel încât numai secțiunea lipsă este regenerată pentru a se potrivi cu mediul înconjurător.
Într-un mod remix sau audio-la-audio, ce controlează setarea puterii?
Puterea mai mare adaugă mai mult zgomot și regenerează mai mult, schimbând și mai mult intrarea; rezistența mai mică își păstrează mai mult structura.
Continuați să învățați
Ghiduri conexe
Mai multe ghiduri alese pentru acest subiect