Audio AI-GIDS

CREPE-pitchschatting

CREPE is een deep-learning model dat de fundamentele frequentie (toonhoogte) van een monofoon audiosignaal rechtstreeks schat op basis van de ruwe golfvorm.

2 min readLaatst bijgewerkt

Overzicht

It set a new accuracy standard for pitch tracking, especially on noisy or difficult recordings.

Diepe duik

CREPE (Convolutional Representation for Pitch Estimation), geïntroduceerd in 2018 door Kim, Salamon, Li en Bello, voorspelt de toonhoogte van (monofonische) audio met één noot, zoals een gezongen stem of een solo-instrument. In tegenstelling tot klassieke algoritmen zoals YIN of pYIN die afhankelijk zijn van autocorrelatie van het signaal, is CREPE een diep convolutioneel neuraal netwerk dat rechtstreeks is getraind op audioframes in het tijddomein. Het raamt de toonhoogteschatting op als een classificatieprobleem: het levert een waarschijnlijkheidsverdeling op over 360 toonhoogtebakken die grofweg zes octaven beslaan, elk met een onderlinge afstand van 20 cent. De bak met de hoogste activering, verfijnd met een lokaal gewogen gemiddelde, geeft de geschatte frequentie plus een betrouwbaarheidsscore. CREPE bleek aanzienlijk robuuster dan signaalverwerkingsmethoden, vooral onder ruis, en is nu een standaardcomponent in veel muziek- en spraakanalysepijplijnen.

Technisch inzicht

CREPE neemt een audioframe van 1024 monsters en geeft dit door zes gestapelde convolutionele lagen, eindigend in een uitvoerlaag van 360 eenheden met sigmoïde activeringen. Elke eenheid komt overeen met een toonbak met een onderlinge afstand van 20 cent over ongeveer zes octaven. Het netwerk is getraind met binaire kruis-entropie tegen een Gaussiaans wazig doel gecentreerd op de ware toonhoogte. Bij gevolgtrekking is de voorspelde frequentie het lokaal gewogen gemiddelde van activeringen rond de piekbak, en dient de piekhoogte als een betrouwbaarheidswaarde.

Strategische impact

Access and reach

Het verbetert de toegankelijkheid via transcriptie, gesproken tekst en spraakinterfaces.

Cost and budget

Mediateams kunnen met kleinere budgetten sneller gepolijste audio leveren.

Speed and scale

Klantgerichte systemen kunnen gesproken interacties op grotere schaal verwerken.

De toekomst van CREPE-pitchschatting

De toonhoogteschatting evolueert in de richting van gezamenlijke modellen die omgaan met polyfonie (meerdere gelijktijdige noten), een lagere latentie voor realtime afstemming en automatische harmonie, en kleinere gedestilleerde netwerken die op telefoons en ingebedde apparaten draaien. De vertrouwensoutputs van CREPE worden steeds vaker gebruikt voor downstream-taken zoals automatische transcriptie, stemcorrectie en expressieve prestatieanalyse. Zelfbeheerde en multitask-benaderingen die toonhoogte naast timbre en articulatie leren, zullen waarschijnlijk de CREPE-achtige nauwkeurigheid uitbreiden tot voorbij zuivere monofone audio.

Implementatie in de echte wereld

Het volgen van de toonhoogte van een zanger voor realtime afstemmingsfeedback in apps voor stemtraining

Aansturen van tools voor automatische afstemming en toonhoogtecorrectie met nauwkeurige fundamentele frequentiecurven

Melodieën van solo-instrumenten omzetten in MIDI of bladmuziek

Analyseren van intonatie en vibrato in muziekonderwijs en uitvoeringsonderzoek

Risico's en vangrails

Het risico op stemmisbruik en imitatie neemt toe als de toestemming ontbreekt.

De nauwkeurigheid kan afnemen bij accenten, dialecten of luidruchtige omgevingen.

Synthetische audio kan worden aangezien voor authentieke spraak zonder duidelijke labels.

Implementatie routekaart

1

Verkrijg expliciete toestemming voor het vastleggen, klonen en hergebruiken van spraak.

2

Test de kwaliteit van diverse sprekers en achtergrondomstandigheden.

3

Bepaal wanneer een mens de output moet beoordelen of goedkeuren.

4

Label synthetische audio en houd de herkomstgegevens bij voor verantwoording.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CREPE Pitch Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

FastPitch pitch-controleerbare TTS

Frequently asked questions

What is CREPE Pitch Estimation?

CREPE is een deep-learning model dat de fundamentele frequentie (toonhoogte) van een monofoon audiosignaal rechtstreeks schat op basis van de ruwe golfvorm. Het zette een nieuwe nauwkeurigheidsnorm voor het volgen van de toonhoogte, vooral bij luidruchtige of moeilijke opnames.

Wat schat CREPE op basis van een audiosignaal?

CREPE voorspelt de fundamentele frequentie, dat wil zeggen de waargenomen toonhoogte, van monofone audio.

CREPE is in de eerste plaats ontworpen voor welk soort audio?

CREPE schat de toonhoogte voor monofone signalen, zoals een enkele stem of een solo-instrument.

Hoe kadert CREPE de pitch-schattingstaak intern?

CREPE voert een waarschijnlijkheidsverdeling uit over 360 pitchbins, waarbij schattingen als classificatie worden behandeld.

Wat neemt CREPE als directe input?

In tegenstelling tot op spectrogrammen gebaseerde methoden werkt CREPE op ruwe golfvormframes via convolutionele lagen.

Hoe ver staan de pitchbins van CREPE ongeveer uit elkaar?

CREPE gebruikt 360 bakken met een onderlinge afstand van 20 cent, wat een resolutie van een halve toon oplevert over ongeveer zes octaven.