Аудио AI РЪКОВОДСТВО

Автоматично маркиране на музика

Автоматичното маркиране на музика използва машинно обучение, за да слуша песен и автоматично да прикрепя описателни етикети като жанр, настроение, инструменти и темпо.

2 min readПоследна актуализация

Преглед

It powers the search, recommendation, and organization features behind every major streaming service.

Дълбоко гмуркане

Музикалното автоматично маркиране третира етикетирането като проблем с класификацията на множество етикети: една песен може да бъде „рок“, „енергична“ и „задвижвана от китара“ едновременно. Съвременните системи преобразуват необработеното аудио в мел-спектрограма (времево-честотно изображение на звука) и го подават през конволюционна или базирана на трансформатор невронна мрежа, обучена на набори от данни като MagnaTagATune, Million Song Dataset или MTG-Jamendo. Моделът извежда вероятност за всеки възможен таг. Тъй като етикетите, приложени от човека, са шумни и непълни, обучението е предизвикателство и етикетите са небалансирани. Същият гръбнак все повече идва от самоконтролирани аудио модели, така че едно представяне захранва маркиране, препоръки и търсене на сходство, вместо да изгражда отделен модел за всеки етикет.

Техническа информация

Аудиото се разделя на кратки припокриващи се кадри, трансформира се чрез кратковременната трансформация на Фурие и се картографира върху мел скалата, която имитира човешкото възприемане на височината. CNN чете тази спектрограма като изображение, изучавайки филтри за хармонични модели, ритъм и тембър. Последният слой използва сигмоидни активации (не softmax), тъй като етикетите са независими и неизключителни и е оптимизиран с двоична кръстосана ентропия в стотици възможни етикети.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на автоматичното маркиране на музика

Автоматичното маркиране се измества към системи с отворен речник и текстово запитване, изградени върху модели на аудио език като CLAP, където потребителите търсят „мечтана синтезаторна песен за изучаване“ без предварително дефинирани тагове. Очаквайте по-тясно свързване с генеративни музикални инструменти, по-добро боравене с редки жанрове и не-западна музика и маркиране на устройството за поверителност. Моделите за надписи, които пишат пълни описания на естествен език на песен, вместо отделни тагове, са следващата граница.

Внедряване в реалния свят

Spotify и подобни услуги, маркиращи нови качвания с жанр и настроение, за да осигурят препоръки в стил „Discover Weekly“

Производствено-музикални библиотеки, позволяващи на видео редакторите да филтрират милиони налични записи чрез „повдигане на корпоративно“ или „напрегнато кино“

DJ софтуер, който автоматично разпознава BPM, тон и енергия, така че песните да могат да бъдат сортирани и съпоставени автоматично

Платформи за лицензиране на музика, маркиращи инструментариум и настроение, за да съпоставят песните с рекламните кратки текстове

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Auto-Tagging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Музикално етикетиране с Transformers

Frequently asked questions

What is Music Auto-Tagging?

Автоматичното маркиране на музика използва машинно обучение, за да слуша песен и автоматично да прикрепя описателни етикети като жанр, настроение, инструменти и темпо. Той захранва функциите за търсене, препоръки и организация зад всяка основна услуга за стрийминг.

Защо автоматичното маркиране на музика използва сигмоидни активации в своя изходен слой вместо softmax?

Автоматичното маркиране е с няколко етикета: една песен може да бъде „рок“, „енергичен“ и „китара“ едновременно, така че всеки етикет се нуждае от собствена независима вероятност чрез сигмоид.

Какво входно представяне подават повечето съвременни модели за автоматично маркиране в своята невронна мрежа?

Аудиото обикновено се преобразува в мел-спектрограма, честотно-времево изображение, което CNN може да обработва подобно на снимка.

Защо се използва мел скалата вместо обикновена линейна честотна скала?

Мел скалата разпределя честотите, за да съответства на човешкото възприемане на височината, като дава по-голяма разделителна способност на по-ниските честоти, които ушите ни интересуват най-много.

Кое е основното предизвикателство при обучението на модели за автоматично маркиране върху набори от данни от реалния свят?

Етикетите, получени от тълпата, са непоследователни и много валидни тагове просто липсват, а някои тагове се появяват много по-често от други, което прави ученето по-трудно.

Кой набор от данни обикновено се използва за обучение и сравнение на системи за автоматично маркиране на музика?

MagnaTagATune, заедно с Million Song Dataset и MTG-Jamendo, е стандартен еталон за маркиране на музика. ImageNet е за изображения, SQuAD за QA на текст и LibriSpeech за реч.