Аудіо AI GUIDE

Позначення музики за допомогою Transformers

Додавання тегів до музики використовує моделі трансформаторів для прослуховування пісні та прогнозування описових міток, таких як жанр, настрій, інструменти та темп.

2 хвилини читанняОстаннє оновлення

Огляд

It powers search, recommendation, and auto-organization across huge music catalogs.

Глибоке занурення

Автоматичне позначення музики — це проблема класифікації кількох міток: одна композиція може бути «рок», «енергійна», «гітара» та «інструментальна» одночасно. Трансформери вирішують це, перетворюючи аудіо на спектрограму (частотно-часове зображення) і пропускаючи його фрагменти через шари самоуважності, подібно до того, як Vision Transformer розглядає фрагменти зображення. Такі моделі, як Audio Spectrogram Transformer (AST) і MERT, вивчають довгострокові шаблони по всій доріжці, фіксуючи, як приспів співвідноситься з куплетом з інтервалом у кілька хвилин. Багато хто проходить попередню підготовку під самоконтролем на мільйонах кліпів без міток, а потім налаштовується на наборах даних із тегами, як-от MagnaTagATune або Million Song Dataset. Оскільки теги не є взаємовиключними, останній рівень використовує сигмоподібні результати, оцінені за контрольними показниками, такими як середня середня точність і ROC-AUC.

Технічне розуміння

Необроблений аудіо перетворюється на спектрограму log-Mel, розбивається на фрагменти, що перекриваються, і лінійно вбудовується за допомогою позиційного кодування. Самоувага дозволяє кожному патчу зважувати кожен інший, тому віддалені музичні події впливають на кожен тег. На відміну від класифікаторів зображень з однією міткою, музичні теги застосовують сигмоід для кожного тегу, а не один softmax, оскільки мітки зустрічаються одночасно. Самоконтрольоване попереднє навчання (прогнозування замаскованих аудіотокенів) дає чіткі уявлення перед тонким налаштуванням на менших позначених наборах.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє тегування музики з Transformers

Додавання тегів поєднується з розумінням природної мови, тож ви можете шукати «мрійливий lo-fi з тріском вінілу для вивчення» замість фіксованих кнопок жанру. Контрастні аудіо-текстові моделі, як-от CLAP, вирівнюють музику й описи в одному просторі, уможливлюючи нульові теги, яких ніколи не бачили під час навчання. Очікуйте багатших, детальніших міток, кращої обробки ф’южн-жанрів і тегів на пристрої для конфіденційності. Дебати щодо прав і авторства навколо навчання каталогам, захищеним авторським правом, визначатимуть, які дані можуть використовувати ці моделі.

Реалізація в реальному світі

Автоматичне генерування тегів жанру та настрою, щоб сервіси потокового передавання могли створювати списки відтворення «фокус» або «тренування»

Дозволити музичним бібліотекам відображати треки «бадьорої акустичної гітари» для відеоредакторів, які шукають ліцензії на синхронізацію

Розробка механізмів рекомендацій, які знаходять звуково схожі пісні, крім тих, які користувачі явно оцінили

Автоматична організація колекції семплів продюсера за виявленим інструментом, тональністю та темпом

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Tagging with Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Автоматичне тегування музики

Часті запитання

What is Music Tagging with Transformers?

Додавання тегів до музики використовує моделі трансформаторів для прослуховування пісні та прогнозування описових міток, таких як жанр, настрій, інструменти та темп. Він забезпечує пошук, рекомендації та автоматичну організацію величезних музичних каталогів.

Чому тегування музики розглядається як проблема кількох лейблів?

Пісня може бути одночасно роковою, енергійною та гітарною, тому до однієї композиції застосовуються кілька тегів.

Яке вхідне представлення зазвичай використовують трансформаторні тегери?

Аудіо перетворюється на частотно-часову спектрограму, потім доповнюється та подається через самоувагу, як патчі зображення.

Чому моделі додавання музичних тегів використовують сигмоїдний вихід для кожного тегу замість одного softmax?

Softmax змушує суму ймовірностей дорівнювати одиниці (єдиний вибір); sigmoid дозволяє кожному тегу незалежно бути істинним.

Яка роль попередньої підготовки під самоконтролем для таких моделей, як MERT?

Попереднє навчання замаскованому прогнозуванню аудіо на великих корпусах без міток будує уявлення, які пізніше точно налаштовуються на даних із тегами.

Який набір даних зазвичай використовується для точного налаштування та порівняння музичних тегерів?

MagnaTagATune і Million Song Dataset — це стандартні музичні тести з тегами; MNIST і ImageNet — це набори зображень.