Музикално етикетиране с Transformers
Музикалното маркиране използва трансформаторни модели за слушане на песен и предвиждане на описателни етикети като жанр, настроение, инструменти и темпо.
Преглед
It powers search, recommendation, and auto-organization across huge music catalogs.
Дълбоко гмуркане
Автоматичното маркиране на музика е проблем с класификацията на множество етикети: една песен може да бъде „рок“, „енергична“, „китара“ и „инструментална“ едновременно. Трансформаторите се справят с него, като превръщат звука в спектрограма (честотно-времево изображение) и подават парчета от него през слоеве за самовнимание, подобно на Vision Transformer, който обработва изображения. Модели като Audio Spectrogram Transformer (AST) и MERT научават модели на дълги разстояния в цяла песен, улавяйки как припевът се свързва с куплет с минути разстояние. Много от тях са предварително обучени, самоконтролирани върху милиони немаркирани клипове, след което са фино настроени върху маркирани набори от данни като MagnaTagATune или Million Song Dataset. Тъй като таговете не се изключват взаимно, последният слой използва сигмоидни изходи, оценени спрямо показатели като средна средна точност и ROC-AUC.
Техническа информация
Суровият звук се преобразува в спектрограма на log-Mel, разделя се на припокриващи се пачове и се вгражда линейно с позиционно кодиране. Самовниманието позволява на всеки пач да претегля всеки друг пач, така че далечните музикални събития влияят на всеки етикет. За разлика от класификаторите на изображения с единичен етикет, музикалното маркиране прилага сигмоид на етикет, а не един softmax, тъй като етикетите се срещат едновременно. Самостоятелно контролирано предварително обучение (предсказване на маскирани аудио токени) дава силни представяния преди фина настройка на по-малки набори с етикети.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на музикалното етикетиране с Transformers
Маркирането се слива с разбирането на естествения език, така че можете да търсите „мечтано lo-fi с пукане на винил за изучаване“ вместо фиксирани бутони за жанр. Контрастни модели на аудио-текст, като CLAP, подравняват музиката и описанията в едно пространство, позволявайки етикети с нулев удар, никога невиждани в обучението. Очаквайте по-богати, по-подробни етикети, по-добро управление на фюжън жанрове и маркиране на устройството за поверителност. Дебатите за правата и приписването около обучението по защитени с авторски права каталози ще оформят какви данни могат да използват тези модели.
Внедряване в реалния свят
Автоматично генериране на тагове за жанр и настроение, така че услугите за стрийминг да могат да създават плейлисти за „фокус“ или „тренировка“
Позволяване на музикалните библиотеки да извеждат песни за „оптимистична акустична китара“ за видео редактори, търсещи лиценз за синхронизиране
Захранване на двигатели за препоръки, които намират звуково подобни песни извън това, което потребителите изрично са оценили
Автоматично организиране на семплова колекция на продуцент по открит инструмент, тон и темпо
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Music Tagging with Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Автоматично маркиране на музика
Frequently asked questions
What is Music Tagging with Transformers?
Музикалното маркиране използва трансформаторни модели за слушане на песен и предвиждане на описателни етикети като жанр, настроение, инструменти и темпо. Той осигурява търсене, препоръчване и автоматично организиране в огромни музикални каталози.
Защо музикалното маркиране се третира като проблем с множество етикети?
Една песен може да бъде едновременно рок, енергична и китарна, така че към една песен се прилагат множество етикети.
Какво входно представяне обикновено използват трансформаторните маркери?
Аудиото се преобразува във времево-честотна спектрограма, след което се закърпва и захранва чрез самовнимание като пачове на изображения.
Защо моделите за маркиране на музика използват сигмоиден изход за етикет вместо един softmax?
Softmax принуждава вероятностите да се сумират до едно (единичен избор); sigmoid позволява всеки таг да бъде независимо верен.
Каква е ролята на самоконтролираното предварително обучение за модели като MERT?
Предварителното обучение за маскирано аудио предсказване върху големи немаркирани корпуси изгражда представяния, по-късно фино настроени върху маркирани данни.
Кой набор от данни обикновено се използва за фина настройка и сравнителен анализ на музикални маркери?
MagnaTagATune и Million Song Dataset са стандартни тагирани музикални бенчмаркове; MNIST и ImageNet са набори от изображения.