PANDUAN Audio AI

Estimasi Pitch CREPE

CREPE adalah model pembelajaran mendalam yang memperkirakan frekuensi dasar (pitch) sinyal audio monofonik langsung dari bentuk gelombang mentahnya.

2 min readTerakhir diperbarui

Ikhtisar

It set a new accuracy standard for pitch tracking, especially on noisy or difficult recordings.

Menyelam Lebih Dalam

CREPE (Convolutional Representation for Pitch Estimation), yang diperkenalkan pada tahun 2018 oleh Kim, Salamon, Li, dan Bello, memprediksi nada audio nada tunggal (monofonik) seperti suara yang dinyanyikan atau instrumen solo. Tidak seperti algoritme klasik seperti YIN atau pYIN yang mengandalkan autokorelasi sinyal, CREPE adalah jaringan saraf konvolusional mendalam yang dilatih langsung pada bingkai audio domain waktu. Ini membingkai estimasi nada sebagai masalah klasifikasi: ini menghasilkan distribusi probabilitas pada 360 wadah nada yang mencakup kira-kira enam oktaf, masing-masing berjarak 20 sen. Nampan dengan aktivasi tertinggi, disempurnakan dengan rata-rata tertimbang lokal, memberikan perkiraan frekuensi ditambah skor kepercayaan. CREPE terbukti jauh lebih kuat dibandingkan metode pemrosesan sinyal, terutama di bawah kebisingan, dan sekarang menjadi komponen standar di banyak jalur analisis musik dan ucapan.

Wawasan Teknis

CREPE mengambil bingkai audio 1024 sampel dan meneruskannya melalui enam lapisan konvolusional bertumpuk, diakhiri dengan lapisan keluaran 360 unit dengan aktivasi sigmoid. Setiap unit sesuai dengan pitch bin yang berjarak 20 sen dalam jarak sekitar enam oktaf. Jaringan dilatih dengan entropi silang biner terhadap target kabur Gaussian yang berpusat pada nada sebenarnya. Sebagai kesimpulan, frekuensi yang diprediksi adalah rata-rata tertimbang lokal dari aktivasi di sekitar wadah puncak, dan tinggi puncak berfungsi sebagai nilai keyakinan.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan Estimasi Pitch CREPE

Estimasi nada kini beralih ke model gabungan yang menangani polifoni (beberapa nada simultan), latensi lebih rendah untuk penyetelan real-time dan harmoni otomatis, serta jaringan sulingan lebih kecil yang berjalan di ponsel dan perangkat tertanam. Output kepercayaan diri CREPE semakin banyak dimasukkan ke dalam tugas-tugas hilir seperti transkripsi otomatis, koreksi vokal, dan analisis kinerja ekspresif. Pendekatan dengan pengawasan mandiri dan multitugas yang mempelajari nada bersamaan dengan timbre dan artikulasi kemungkinan akan memperluas akurasi gaya CREPE melampaui audio monofonik yang bersih.

Implementasi Dunia Nyata

Melacak nada penyanyi untuk mendapatkan umpan balik penyetelan waktu nyata di aplikasi pelatihan vokal

Mengemudikan alat penalaan otomatis dan koreksi nada dengan kurva frekuensi dasar yang akurat

Mentranskripsikan melodi instrumen solo ke dalam MIDI atau lembaran musik

Menganalisis intonasi dan vibrato dalam pendidikan musik dan penelitian pertunjukan

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CREPE Pitch Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

TTS yang Dapat Dikendalikan Pitch FastPitch

Pertanyaan yang sering diajukan

What is CREPE Pitch Estimation?

CREPE adalah model pembelajaran mendalam yang memperkirakan frekuensi dasar (pitch) sinyal audio monofonik langsung dari bentuk gelombang mentahnya. Ini menetapkan standar akurasi baru untuk pelacakan nada, terutama pada rekaman yang berisik atau sulit.

Berapa perkiraan CREPE dari sinyal audio?

CREPE memprediksi frekuensi fundamental, yaitu nada yang dirasakan, dari audio monofonik.

CREPE dirancang terutama untuk jenis audio apa?

CREPE memperkirakan nada untuk sinyal monofonik seperti suara tunggal atau instrumen solo.

Bagaimana CREPE menyusun tugas estimasi nada secara internal?

CREPE mengeluarkan distribusi probabilitas pada 360 pitch bin, memperlakukan estimasi sebagai klasifikasi.

Apa yang diambil CREPE sebagai masukan langsungnya?

Tidak seperti metode berbasis spektogram, CREPE beroperasi pada bingkai bentuk gelombang mentah melalui lapisan konvolusional.

Kira-kira seberapa jauh jarak tempat sampah CREPE?

CREPE menggunakan 360 bins dengan jarak 20 sen, memberikan resolusi sub-semitone sekitar enam oktaf.