Аудио AI РЪКОВОДСТВО

Оценка на стъпката на CREPE

CREPE е модел за дълбоко обучение, който оценява основната честота (височина) на монофоничен аудио сигнал директно от необработената му форма на вълната.

2 min readПоследна актуализация

Преглед

It set a new accuracy standard for pitch tracking, especially on noisy or difficult recordings.

Дълбоко гмуркане

CREPE (Convolutional Representation for Pitch Estimation), въведен през 2018 г. от Ким, Саламон, Ли и Бело, предсказва височината на звука с една нота (монофоничен), като изпят глас или солов инструмент. За разлика от класическите алгоритми като YIN или pYIN, които разчитат на автокорелация на сигнала, CREPE е дълбока конволюционна невронна мрежа, обучена директно върху аудио рамки във времева област. Той очертава оценката на височината на звука като класификационен проблем: извежда разпределение на вероятността върху 360 интервала на височината, обхващащи приблизително шест октави, всеки с разстояние от 20 цента. Кошчето с най-високо активиране, прецизирано с местна претеглена средна стойност, дава прогнозната честота плюс оценка за достоверност. CREPE се оказа значително по-стабилен от методите за обработка на сигнали, особено при шум, и сега е стандартен компонент в много канали за анализ на музика и реч.

Техническа информация

CREPE взема аудио кадър от 1024 семпла и го прекарва през шест подредени конволюционни слоя, завършвайки в изходен слой от 360 единици със сигмоидни активации. Всяка единица съответства на поле за височина, разположено на 20 цента един от друг в около шест октави. Мрежата се обучава с двоична кръстосана ентропия срещу замъглена по Гаус цел, центрирана върху истинската стъпка. При извод прогнозираната честота е локалната среднопретеглена стойност на активациите около пиковия бин, а пиковата височина служи като стойност на достоверност.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на CREPE Pitch Estimation

Оценката на височината се насочва към съвместни модели, които обработват полифония (няколко едновременни ноти), по-ниска латентност за настройка в реално време и автоматична хармония и по-малки дестилирани мрежи, които работят на телефони и вградени устройства. Резултатите за увереност на CREPE все повече се подават в задачи надолу по веригата като автоматична транскрипция, вокална корекция и експресивен анализ на изпълнението. Самоконтролираните и многозадачни подходи, които научават височината заедно с тембъра и артикулацията, вероятно ще разширят точността в стил CREPE отвъд чистото монофонично аудио.

Внедряване в реалния свят

Проследяване на звука на певеца за обратна връзка за настройка в реално време в приложения за вокално обучение

Управляващи инструменти за автоматична настройка и корекция на височината с точни криви на основната честота

Транскрибиране на мелодии за солови инструменти в MIDI или ноти

Анализ на интонацията и вибрато в музикалното образование и изследване на изпълнението

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CREPE Pitch Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

FastPitch Pitch-Controllable TTS

Frequently asked questions

What is CREPE Pitch Estimation?

CREPE е модел за дълбоко обучение, който оценява основната честота (височина) на монофоничен аудио сигнал директно от необработената му форма на вълната. Той постави нов стандарт за точност за проследяване на височината, особено при шумни или трудни записи.

Какво оценява CREPE от аудио сигнал?

CREPE прогнозира основната честота, т.е. възприеманата височина на монофоничното аудио.

CREPE е предназначен основно за какъв вид аудио?

CREPE оценява височината на звука за монофонични сигнали като един глас или солов инструмент.

Как CREPE оформя задачата за оценка на височината вътрешно?

CREPE извежда разпределение на вероятността над 360 интервала на стъпката, като третира оценката като класификация.

Какво приема CREPE като пряк вход?

За разлика от методите, базирани на спектрограма, CREPE работи върху кадри с необработена вълнова форма чрез конволюционни слоеве.

Приблизително колко далеч един от друг са кошчетата на CREPE?

CREPE използва 360 контейнера, разположени на 20 цента един от друг, като дава разделителна способност под полутон в около шест октави.