Audio AI GUIDE

MusicGen

MusicGen er Metas AI-modell som genererer musikk fra en tekstbeskrivelse, og eventuelt en melodi du nynner eller laster opp.

2 min lesingSist oppdatert

Oversikt

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Dypdykk

MusicGen ble utgitt av Meta AI i 2023 som en del av AudioCraft-prosjektet, og forvandler prompter som 'et optimistisk synthpopspor fra 80-tallet med en drivende basslinje' til omtrent 12 sekunders (utvidbare) musikkklipp. I motsetning til flertrinnssystemer, bruker MusicGen en enkelt Transformer-språkmodell som forutsier lydtokens produsert av Metas EnCodec nevrale kodek. Dens smarte bidrag er et token-interleaving-mønster (kalt delay interleaving) som lar én modell håndtere EnCodecs multiple parallelle token-strømmer effektivt, og unngår kaskaden av separate modeller tidligere tilnærminger som trengs. MusicGen kan styres på to måter samtidig: ved en tekstbeskrivelse og ved en referansemelodi, slik at du kan be om en "jazzversjon" av en melodi du nynner. Meta ga åpent ut koden og vektene, og ga næring til en bølge av fellesskapsverktøy og eksperimenter.

Teknisk innsikt

MusicGen representerer lyd som parallelle strømmer av diskrete tokens fra EnCodec-kodeken, der hver strøm fanger forskjellige detaljer. I stedet for å modellere strømmer med separate modeller, interleaver MusicGen dem med kontrollerte forsinkelser, slik at en enkelt autoregressiv Transformer forutsier dem i ett pass. Tekstkondisjonering kommer fra en T5-tekstkoder, mens valgfri melodikondisjonering bruker et kromagram (lydens tonehøydeklasseprofil) slik at modellen følger en melodi uten å kopiere den nøyaktige innspillingen.

Strategisk innvirkning

Access and reach

Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.

Cost and budget

Medieteam kan sende polert lyd raskere med mindre budsjetter.

Speed and scale

Kundevendte systemer kan behandle talte interaksjoner i større skala.

Fremtiden til MusicGen

MusicGens åpne utgivelse satte en grunnlinje som etterfølgerne tar sikte på å slå med lengre, høyere kvalitet og stereoutgang, pluss finere kontroll over struktur, instrumentering og sangseksjoner. Forvent tettere integrering i musikkproduksjonsprogramvare, interaktiv generering i sanntid og bedre verktøy for å redigere eller utvide eksisterende spor. Som med all generativ musikk, skjerper den spørsmål om opphavsrett til opplæringsdata, artistkompensasjon og hvordan man kan merke AI-genererte sanger på en oversvømmet markedsplass.

Real-World Implementering

Generer royaltyfri bakgrunnsmusikk for en YouTube-video fra en tekstmelding

Nynner på en melodi og ber MusicGen om et fullstendig orkesterarrangement av den

Spillutviklere lager prototyper av lydspor på nivå i forskjellige sjangere raskt

Forskere og hobbyister kjører åpen kildekodevekter for å eksperimentere med tekst-til-musikk

Risikoer og rekkverk

Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.

Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.

Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.

Veikart for implementering

1

Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.

2

Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.

3

Definer når et menneske må gjennomgå eller godkjenne utdata.

4

Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ofte stilte spørsmål

What is MusicGen?

MusicGen er Metas AI-modell som genererer musikk fra en tekstbeskrivelse, og eventuelt en melodi du nynner eller laster opp. Det er viktig fordi det setter høykvalitets, kontrollerbar musikkskaping inn i en enkelt, åpent utgitt modell som hobbyister og forskere faktisk kan kjøre.

Hvilke to typer input kan styre MusicGen samtidig?

MusicGen godtar en tekstmelding og eventuelt en melodi, slik at du kan be om en stilistisk versjon av en melodi du gir.

Hvilken nevrale kodek produserer lydtokenene MusicGen forutsier?

MusicGen modellerer diskrete tokens generert av Metas EnCodec-kodek, som også dekoder de forutsagte tokenene tilbake til lyd.

Hva er MusicGens viktigste arkitektoniske forenkling i forhold til tidligere tilnærminger?

Ved å interleave EnCodecs parallelle token-strømmer med kontrollerte forsinkelser, kan én autoregressiv transformator modellere dem i en enkelt omgang, og unngå en kaskade av modeller.

Hvordan følger MusicGen en gitt melodi uten å kopiere det eksakte opptaket?

Et kromagram fanger opp hvilke tonehøydeklasser som er tilstede over tid, og lar MusicGen matche melodiens harmoni og kontur uten å reprodusere den originale klangen.

Hvilket prosjekt og hvilket selskap ga ut MusicGen?

MusicGen ble utgitt i 2023 som en del av Meta AIs AudioCraft-prosjekt, med åpen kode og modellvekter.