Automatisk merking av musikk
Automatisk merking av musikk bruker maskinlæring for å lytte til en sang og automatisk legge ved beskrivende etiketter som sjanger, stemning, instrumenter og tempo.
Oversikt
It powers the search, recommendation, and organization features behind every major streaming service.
Dypdykk
Autotagging av musikk behandler merking som et klassifiseringsproblem med flere etiketter: et enkelt spor kan være "rock", "energisk" og "gitardrevet" på en gang. Moderne systemer konverterer rålyd til et mel-spektrogram (et tidsfrekvensbilde av lyden) og mater det gjennom et konvolusjonelt eller transformatorbasert nevralt nettverk trent på datasett som MagnaTagATune, Million Song Dataset eller MTG-Jamendo. Modellen gir ut en sannsynlighet for hver mulig tag. Fordi merkelapper som er påført mennesker er støyende og ufullstendige, er treningen utfordrende, og etikettene er ubalanserte. Den samme ryggraden kommer i økende grad fra selvovervåkede lydmodeller, så en enkelt representasjon mater tagging, anbefaling og likhetssøk i stedet for å bygge en egen modell for hver tag.
Teknisk innsikt
Lyden er delt inn i korte overlappende rammer, transformert via Short-Time Fourier Transform, og kartlagt på mel-skalaen som etterligner menneskelig tonehøydeoppfatning. En CNN leser dette spektrogrammet som et bilde, og lærer filtre for harmoniske mønstre, rytme og klang. Det siste laget bruker sigmoid-aktiveringer (ikke softmax) fordi tagger er uavhengige og ikke-eksklusive, og er optimert med binær kryssentropi på tvers av hundrevis av mulige etiketter.
Strategisk innvirkning
Access and reach
Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.
Cost and budget
Medieteam kan sende polert lyd raskere med mindre budsjetter.
Speed and scale
Kundevendte systemer kan behandle talte interaksjoner i større skala.
Fremtiden for musikk auto-tagging
Automatisk merking skifter mot systemer med åpent ordforråd og tekstsøkbare systemer bygget på lydspråkmodeller som CLAP, der brukere søker etter "drømmende synth-spor for å studere" uten forhåndsdefinerte tagger. Forvent tettere kobling med generative musikkverktøy, bedre håndtering av sjeldne sjangre og ikke-vestlig musikk, og tagging på enheten for personvern. Bildetekstmodeller som skriver fullstendige naturspråklige beskrivelser av et spor, i stedet for diskrete tagger, er neste grense.
Real-World Implementering
Spotify og lignende tjenester som merker nye opplastinger med sjanger og stemning for å gi "Discover Weekly"-stilanbefalinger
Produksjonsmusikkbiblioteker som lar videoredigerere filtrere millioner av lagerspor ved å "oppløfte bedriften" eller "spent filmisk"
DJ-programvare som automatisk oppdager BPM, nøkkel og energi slik at spor kan sorteres og beatmatches automatisk
Musikklisensieringsplattformer som merker instrumentering og stemning for å matche sanger med annonsetruser
Risikoer og rekkverk
Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.
Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.
Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.
Veikart for implementering
Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.
Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.
Definer når et menneske må gjennomgå eller godkjenne utdata.
Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Music Auto-Tagging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Musikkmerking med Transformers
Ofte stilte spørsmål
What is Music Auto-Tagging?
Automatisk merking av musikk bruker maskinlæring for å lytte til en sang og automatisk legge ved beskrivende etiketter som sjanger, stemning, instrumenter og tempo. Den driver søke-, anbefalings- og organisasjonsfunksjonene bak alle større strømmetjenester.
Hvorfor bruker automatisk merking av musikk sigmoid-aktiveringer i utgangslaget i stedet for softmax?
Automatisk merking er multi-label: et spor kan være 'rock', 'energisk' og 'gitar' samtidig, så hver tag trenger sin egen uavhengige sannsynlighet via sigmoid.
Hvilken inputrepresentasjon mater de fleste moderne automerkingsmodeller inn i deres nevrale nettverk?
Lyd konverteres vanligvis til et mel-spektrogram, et tidsfrekvensbilde som en CNN kan behandle omtrent som et fotografi.
Hvorfor brukes mel-skalaen i stedet for en vanlig lineær frekvensskala?
Mel-skalaen rommer frekvenser for å matche menneskelig tonehøydeoppfatning, og gir mer oppløsning til de lavere frekvensene våre ører bryr seg mest om.
Hva er en stor utfordring når du trener modeller for automatisk merking på datasett fra den virkelige verden?
Crowd-sourcede tagger er inkonsekvente og mange gyldige tagger mangler rett og slett, og noen tagger vises langt oftere enn andre, noe som gjør læringen vanskeligere.
Hvilket datasett brukes vanligvis til å trene og måle systemer for automatisk merking av musikk?
MagnaTagATune, sammen med Million Song Dataset og MTG-Jamendo, er en standard målestokk for musikktagging. ImageNet er for bilder, SQuAD for tekst QA og LibriSpeech for tale.