Аудио AI РЪКОВОДСТВО

Автоматична музикална транскрипция

Автоматичната музикална транскрипция (AMT) преобразува суров аудиозапис на музика в символна нотация като ноти, MIDI или пиано.

2 min readПоследна актуализация

Преглед

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

Дълбоко гмуркане

Системите AMT слушат форма на аудио вълна и извеждат кои ноти се възпроизвеждат, кога започват, колко време продължават и понякога кой инструмент ги възпроизвежда. Основното предизвикателство е полифонията: когато няколко ноти звучат едновременно, техните хармоници се припокриват и се размиват заедно в честотния спектър, така че може да е трудно да се отделят отделни до и сол от една по-силна нота. Съвременните системи преобразуват аудио във времево-честотно представяне, като мел-спектрограма или Constant-Q Transform, след което използват дълбоки невронни мрежи, за да предскажат началото на нотите, отместванията и височината. Моделът Onsets and Frames на Google беше забележителност за транскрипция на пиано, докато по-нови модели трансформатори като MT3 транскрибират няколко инструмента наведнъж.

Техническа информация

Ключово прозрение е разделянето на откриването на началото от откриването на височина на ниво рамка. Модели като Onsets и Frames използват една мрежова глава, за да забележат точния момент, в който започва нота (остро, енергично събитие) и друга, за да проследят кои височини звучат във всеки кадър. Предсказанията на началото след това затварят изходните кадри, драматично намалявайки фалшивите бележки. Трансформацията Constant-Q помага, защото разпределя логаритмично интервалите на честотите, съответствайки на това как музикалните височини са разположени на една октава.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на автоматичната музикална транскрипция

AMT преминава от соло пиано към надеждна мулти-инструментална и пълнолентова транскрипция, включително барабани, вокали и експресивни техники като бендове и вибрато. Трансформаторните архитектури, обучени на големи синтетични и подравнени масиви от данни, затварят празнината. Очаквайте по-тясна интеграция с разделяне на източника, транскрипция в реално време за изпълнение на живо и инструменти, които улавят микровреме и динамика, не само бележки. Дългосрочната цел е система, която превръща всеки запис в редактируем, четим от хора резултат.

Внедряване в реалния свят

AnthemScore и подобни приложения, конвертиращи MP3 записи в редактируеми ноти за музиканти, които учат песни на слух

Извличане на MIDI от запис на пиано, така че продуцентът да може да прегласува или да квантува изпълнението в DAW

Инструменти за музикално обучение, които сравняват изсвирените ноти на ученика с резултата, за да маркират грешни или пропуснати ноти

Музиколози, транскрибиращи исторически или импровизирани записи (като джаз соло) в ноти за анализ

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Символично музикално поколение

Frequently asked questions

What is Automatic Music Transcription?

Автоматичната музикална транскрипция (AMT) преобразува суров аудиозапис на музика в символна нотация като ноти, MIDI или пиано. Той се справя с един от най-трудните проблеми в аудио AI: разплитане на много припокриващи се ноти, изсвирени наведнъж.

Какво основно извежда автоматичното музикално преписване?

AMT преобразува аудиозапис в символна нотация като MIDI, пиано рол или ноти, описващи изсвирените ноти.

Защо полифоничната музика е особено трудна за транскрибиране?

Когато няколко ноти звучат наведнъж, техните хармоници се припокриват, което затруднява отделянето на отделните височини.

Какво беше забележително в модела Начало и рамки на Google?

Onsets и Frames използват една глава за откриване на прецизни начални ноти и друга за продължителни височини, като началните моменти определят изхода на рамката.

Защо Constant-Q Transform е полезен за музика?

Музикалните височини са разпределени логаритмично (октавите се удвояват по честота) и разпределените по логаритмични интервали бинове на CQT се изравняват естествено с това.

Какво означава „начало“ в транскрипцията?

Началото е острият, енергичен момент, когато започва нота, която е по-лесна за прецизно локализиране, отколкото нейната устойчивост.