Аудіо AI GUIDE

Автоматичне тегування музики

Автоматичне позначення музики використовує машинне навчання для прослуховування пісні та автоматичного додавання описових міток, таких як жанр, настрій, інструменти та темп.

2 хвилини читанняОстаннє оновлення

Огляд

It powers the search, recommendation, and organization features behind every major streaming service.

Глибоке занурення

Автоматичне позначення музики розглядає маркування як проблему класифікації кількох міток: один трек може бути «роковим», «енергійним» і «гітарним» одночасно. Сучасні системи перетворюють необроблений аудіо на мел-спектрограму (частотно-часове зображення звуку) і подають його через згорткову або трансформаторну нейронну мережу, навчену на таких наборах даних, як MagnaTagATune, Million Song Dataset або MTG-Jamendo. Модель видає ймовірність для кожного можливого тегу. Оскільки теги, застосовані людиною, шумні та неповні, навчання є складним, а мітки незбалансовані. Одна і та сама основа все частіше походить від самоконтрольованих аудіо-моделей, тому єдине представлення містить теги, рекомендації та пошук схожості, а не створює окрему модель для кожного тегу.

Технічне розуміння

Аудіо розбивається на короткі кадри, що накладаються один на одного, перетворюються за допомогою короткочасного перетворення Фур’є та відображаються на шкалі Mel, яка імітує людське сприйняття висоти. CNN читає цю спектрограму як зображення, вивчаючи фільтри для гармонійних моделей, ритму та тембру. Останній рівень використовує сигмоїдну активацію (не softmax), оскільки теги є незалежними та невиключними та оптимізовані за допомогою бінарної перехресної ентропії для сотень можливих міток.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє автоматичного позначення музики

Автоматичне позначення тегами зміщується в бік систем із відкритим словником і текстовими запитами, побудованих на моделях аудіомов, таких як CLAP, де користувачі шукають «мрійливий синтезатор для вивчення» без попередньо визначених тегів. Очікуйте більш тісного зв’язку з генеративними музичними інструментами, кращої обробки рідкісних жанрів і не-західної музики, а також тегів на пристрої для конфіденційності. Моделі субтитрів, які пишуть повні описи доріжки природною мовою, а не окремі теги, є наступним рубежем.

Реалізація в реальному світі

Spotify і подібні служби позначають нові завантаження жанром і настроєм, щоб отримати рекомендації в стилі Discover Weekly

Бібліотеки виробничої музики, які дозволяють відеоредакторам фільтрувати мільйони складених треків, «піднімаючи корпоративний» або «напружений кінематограф»

Програмне забезпечення для ді-джеїв автоматично визначає BPM, тональність і енергію, щоб треки можна було автоматично сортувати та підбирати такти

Музичні ліцензійні платформи, які позначають інструменти та настрій, щоб відповідати пісням рекламним записам

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Auto-Tagging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Позначення музики за допомогою Transformers

Часті запитання

What is Music Auto-Tagging?

Автоматичне позначення музики використовує машинне навчання для прослуховування пісні та автоматичного додавання описових міток, таких як жанр, настрій, інструменти та темп. Він забезпечує функції пошуку, рекомендації та організації, що стоять за всіма основними потоковими службами.

Чому автоматичне тегування музики використовує сигмоїдну активацію на вихідному рівні замість softmax?

Автоматичне тегування містить кілька міток: трек може одночасно бути «рок», «енергійний» і «гітара», тому для кожного тега потрібна своя незалежна ймовірність через сигмоід.

Яке вхідне представлення більшість сучасних моделей автоматичного позначення тегами вводять у свою нейронну мережу?

Аудіо зазвичай перетворюється на мел-спектрограму, частотно-часове зображення, яке CNN може обробляти так само, як фотографію.

Чому замість простої лінійної частотної шкали використовується шкала Mel?

Шкала Mel розподіляє частоти відповідно до людського сприйняття висоти, надаючи більшу роздільну здатність нижчим частотам, які найбільше цікаві нашим вухам.

Що є головною проблемою під час навчання моделей автоматичного позначення на реальних наборах даних?

Краудсорсингові теги є непослідовними, і багато дійсних тегів просто відсутні, а деякі теги з’являються набагато частіше, ніж інші, що ускладнює навчання.

Який набір даних зазвичай використовується для навчання та тестування систем автоматичного позначення музичних тегів?

MagnaTagATune, разом із Million Song Dataset і MTG-Jamendo, є стандартним тестом для тегування музики. ImageNet призначений для зображень, SQuAD для перевірки якості тексту, а LibriSpeech для мовлення.