وضع العلامات على الموسيقى مع المحولات
تستخدم علامات الموسيقى نماذج المحولات للاستماع إلى أغنية والتنبؤ بالتسميات الوصفية مثل النوع والمزاج والآلات الموسيقية والإيقاع.
نظرة عامة
It powers search, recommendation, and auto-organization across huge music catalogs.
الغوص العميق
يعد وضع العلامات التلقائي على الموسيقى مشكلة تصنيف متعددة التصنيفات: يمكن أن يكون مسار واحد "موسيقى الروك" و"الحيوي" و"الغيتار" و"الآلات الموسيقية" في وقت واحد. تعالج المحولات ذلك عن طريق تحويل الصوت إلى مخطط طيفي (صورة ذات تردد زمني) وتغذية بقع منه من خلال طبقات الاهتمام الذاتي، مثلما يعالج محول الرؤية بقع الصورة. تتعلم نماذج مثل Audio Spectrogram Transformer (AST) وMERT أنماطًا طويلة المدى عبر المسار بأكمله، مما يلتقط كيفية ارتباط الجوقة بآية تفصل بينها دقائق. يتم تدريب العديد منها مسبقًا تحت الإشراف الذاتي على ملايين المقاطع غير المسماة، ثم يتم ضبطها بدقة على مجموعات البيانات ذات العلامات مثل MagnaTagATune أو Million Song Dataset. نظرًا لأن العلامات لا تستبعد بعضها بعضًا، فإن الطبقة النهائية تستخدم مخرجات سيني تم تسجيلها مقابل معايير مثل متوسط الدقة وROC-AUC.
البصيرة الفنية
يتم تحويل الصوت الخام إلى مخطط طيفي log-Mel، وتقسيمه إلى تصحيحات متداخلة، ودمجه خطيًا مع الترميزات الموضعية. الاهتمام الذاتي يجعل كل رقعة تزن كل رقعة أخرى، لذلك تؤثر الأحداث الموسيقية البعيدة على كل علامة. على عكس مصنفات الصور أحادية التسمية، تطبق علامات الموسيقى سينيًا لكل علامة بدلاً من softmax واحد، نظرًا لأن التسميات تحدث معًا. يوفر التدريب المسبق الخاضع للإشراف الذاتي (التنبؤ بالرموز الصوتية المقنعة) تمثيلات قوية قبل الضبط الدقيق للمجموعات ذات العلامات الأصغر.
التأثير الاستراتيجي
الوصول والوصول
يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.
التكلفة والميزانية
يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.
السرعة والحجم
يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.
مستقبل وضع العلامات على الموسيقى مع المحولات
يتم دمج وضع العلامات مع فهم اللغة الطبيعية حتى تتمكن من البحث عن "lo-fi حالمة مع الفينيل فرقعة للدراسة" بدلاً من أزرار النوع الثابتة. تعمل نماذج النص الصوتي المتباينة مثل CLAP على محاذاة الموسيقى والأوصاف في مساحة واحدة، مما يتيح علامات صفرية لم يسبق لها مثيل في التدريب. توقع تصنيفات أكثر ثراءً ودقة، ومعالجة أفضل لأنواع الدمج، ووضع علامات على الجهاز للخصوصية. ستشكل المناقشات المتعلقة بالحقوق والإسناد حول التدريب على الكتالوجات المحمية بحقوق الطبع والنشر البيانات التي يمكن لهذه النماذج استخدامها.
التنفيذ في العالم الحقيقي
إنشاء علامات النوع والمزاج تلقائيًا حتى تتمكن خدمات البث من إنشاء قوائم تشغيل "التركيز" أو "التمرين".
السماح لمكتبات الموسيقى بعرض مقطوعات "الغيتار الصوتي المبهجة" لمحرري الفيديو الذين يبحثون عن ترخيص المزامنة
تشغيل محركات التوصية التي تعثر على أغانٍ متشابهة صوتيًا تتجاوز ما قام المستخدمون بتقييمه بشكل صريح
تنظيم جمع عينات المنتج عن طريق الأداة والمفتاح والإيقاع المكتشفين تلقائيًا
المخاطر والدرابزين
تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.
يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.
يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.
خارطة طريق التنفيذ
الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.
اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.
تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.
قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Music Tagging with Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
وضع العلامات التلقائي على الموسيقى
الأسئلة المتداولة
What is Music Tagging with Transformers?
تستخدم علامات الموسيقى نماذج المحولات للاستماع إلى أغنية والتنبؤ بالتسميات الوصفية مثل النوع والمزاج والآلات الموسيقية والإيقاع. إنه يدعم البحث والتوصية والتنظيم التلقائي عبر كتالوجات الموسيقى الضخمة.
لماذا يتم التعامل مع وضع علامات الموسيقى على أنها مشكلة متعددة العلامات؟
يمكن أن تكون الأغنية عبارة عن موسيقى روك وحيوية ومدفوعة بالجيتار في الوقت نفسه، لذلك تنطبق علامات متعددة على مسار واحد.
ما هو تمثيل الإدخال الذي تستخدمه أدوات تمييز المحولات عادةً؟
يتم تحويل الصوت إلى مخطط طيفي للتردد الزمني، ثم يتم تصحيحه وتغذيته من خلال الاهتمام الذاتي مثل تصحيحات الصور.
لماذا تستخدم نماذج وضع علامات الموسيقى مخرجًا سينيًا لكل علامة بدلاً من softmax واحد؟
يفرض Softmax مجموع الاحتمالات على واحد (اختيار واحد)؛ يتيح sigmoid أن تكون كل علامة صحيحة بشكل مستقل.
ما هو دور التدريب المسبق الخاضع للإشراف الذاتي لنماذج مثل MERT؟
يؤدي التدريب المسبق على التنبؤ الصوتي المقنع على مجموعات كبيرة غير مُسماة إلى إنشاء تمثيلات تم ضبطها لاحقًا على البيانات الموسومة.
ما هي مجموعة البيانات المستخدمة بشكل شائع لضبط علامات تمييز الموسيقى وقياسها؟
تعد MagnaTagATune وMillion Song Dataset بمثابة معايير قياسية للموسيقى؛ MNIST وImageNet عبارة عن مجموعات صور.