Автоматична музикална транскрипция
Автоматичната музикална транскрипция (AMT) преобразува суров аудиозапис на музика в символна нотация като ноти, MIDI или пиано.
Преглед
It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.
Дълбоко гмуркане
Системите AMT слушат форма на аудио вълна и извеждат кои ноти се възпроизвеждат, кога започват, колко време продължават и понякога кой инструмент ги възпроизвежда. Основното предизвикателство е полифонията: когато няколко ноти звучат едновременно, техните хармоници се припокриват и се размиват заедно в честотния спектър, така че може да е трудно да се отделят отделни до и сол от една по-силна нота. Съвременните системи преобразуват аудио във времево-честотно представяне, като мел-спектрограма или Constant-Q Transform, след което използват дълбоки невронни мрежи, за да предскажат началото на нотите, отместванията и височината. Моделът Onsets and Frames на Google беше забележителност за транскрипция на пиано, докато по-нови модели трансформатори като MT3 транскрибират няколко инструмента наведнъж.
Техническа информация
Ключово прозрение е разделянето на откриването на началото от откриването на височина на ниво рамка. Модели като Onsets и Frames използват една мрежова глава, за да забележат точния момент, в който започва нота (остро, енергично събитие) и друга, за да проследят кои височини звучат във всеки кадър. Предсказанията на началото след това затварят изходните кадри, драматично намалявайки фалшивите бележки. Трансформацията Constant-Q помага, защото разпределя логаритмично интервалите на честотите, съответствайки на това как музикалните височини са разположени на една октава.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на автоматичната музикална транскрипция
AMT преминава от соло пиано към надеждна мулти-инструментална и пълнолентова транскрипция, включително барабани, вокали и експресивни техники като бендове и вибрато. Трансформаторните архитектури, обучени на големи синтетични и подравнени масиви от данни, затварят празнината. Очаквайте по-тясна интеграция с разделяне на източника, транскрипция в реално време за изпълнение на живо и инструменти, които улавят микровреме и динамика, не само бележки. Дългосрочната цел е система, която превръща всеки запис в редактируем, четим от хора резултат.
Внедряване в реалния свят
AnthemScore и подобни приложения, конвертиращи MP3 записи в редактируеми ноти за музиканти, които учат песни на слух
Извличане на MIDI от запис на пиано, така че продуцентът да може да прегласува или да квантува изпълнението в DAW
Инструменти за музикално обучение, които сравняват изсвирените ноти на ученика с резултата, за да маркират грешни или пропуснати ноти
Музиколози, транскрибиращи исторически или импровизирани записи (като джаз соло) в ноти за анализ
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Automatic Music Transcription quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Символично музикално поколение
Frequently asked questions
What is Automatic Music Transcription?
Автоматичната музикална транскрипция (AMT) преобразува суров аудиозапис на музика в символна нотация като ноти, MIDI или пиано. Той се справя с един от най-трудните проблеми в аудио AI: разплитане на много припокриващи се ноти, изсвирени наведнъж.
Какво основно извежда автоматичното музикално преписване?
AMT преобразува аудиозапис в символна нотация като MIDI, пиано рол или ноти, описващи изсвирените ноти.
Защо полифоничната музика е особено трудна за транскрибиране?
Когато няколко ноти звучат наведнъж, техните хармоници се припокриват, което затруднява отделянето на отделните височини.
Какво беше забележително в модела Начало и рамки на Google?
Onsets и Frames използват една глава за откриване на прецизни начални ноти и друга за продължителни височини, като началните моменти определят изхода на рамката.
Защо Constant-Q Transform е полезен за музика?
Музикалните височини са разпределени логаритмично (октавите се удвояват по честота) и разпределените по логаритмични интервали бинове на CQT се изравняват естествено с това.
Какво означава „начало“ в транскрипцията?
Началото е острият, енергичен момент, когато започва нота, която е по-лесна за прецизно локализиране, отколкото нейната устойчивост.