دليل الصوت AI

وضع العلامات التلقائي على الموسيقى

يستخدم وضع العلامات التلقائي على الموسيقى التعلم الآلي للاستماع إلى أغنية وإرفاق تسميات وصفية تلقائيًا مثل النوع والمزاج والآلات الموسيقية والإيقاع.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It powers the search, recommendation, and organization features behind every major streaming service.

الغوص العميق

يتعامل وضع العلامات التلقائي على الموسيقى مع التصنيف باعتباره مشكلة تصنيف متعددة التصنيفات: يمكن أن يكون المسار الفردي "موسيقى الروك" و"الحيوي" و"يحركه الجيتار" في وقت واحد. تقوم الأنظمة الحديثة بتحويل الصوت الخام إلى مخطط طيفي ميل (صورة تردد زمني للصوت) وتغذيته من خلال شبكة عصبية تلافيفية أو قائمة على المحولات مدربة على مجموعات البيانات مثل MagnaTagATune، أو مجموعة بيانات المليون أغنية، أو MTG-Jamendo. يقوم النموذج بإخراج احتمالية لكل علامة محتملة. نظرًا لأن العلامات التي يطبقها الإنسان صاخبة وغير مكتملة، فإن التدريب يمثل تحديًا، كما أن التسميات غير متوازنة. يأتي العمود الفقري نفسه بشكل متزايد من النماذج الصوتية ذاتية الإشراف، لذا فإن التمثيل الفردي يغذي العلامات والتوصية والبحث عن التشابه بدلاً من بناء نموذج منفصل لكل علامة.

البصيرة الفنية

يتم تقسيم الصوت إلى إطارات قصيرة متداخلة، ويتم تحويله عبر تحويل فورييه قصير الوقت، ويتم تعيينه على مقياس ميل الذي يحاكي إدراك طبقة الصوت البشرية. تقرأ شبكة CNN هذا المخطط الطيفي كصورة، وتتعلم المرشحات للأنماط التوافقية والإيقاع والجرس. تستخدم الطبقة النهائية عمليات التنشيط السيني (وليس softmax) لأن العلامات مستقلة وغير حصرية، ويتم تحسينها باستخدام الإنتروبيا الثنائية عبر مئات التصنيفات المحتملة.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل وضع العلامات التلقائي على الموسيقى

يتحول وضع العلامات التلقائي نحو أنظمة المفردات المفتوحة والقابلة للاستعلام عن النص والمبنية على نماذج اللغة الصوتية مثل CLAP، حيث يبحث المستخدمون عن "مسار توليف حالم للدراسة" بدون علامات محددة مسبقًا. توقع اقترانًا أكثر إحكامًا بأدوات الموسيقى التوليدية، والتعامل بشكل أفضل مع الأنواع النادرة والموسيقى غير الغربية، ووضع العلامات على الجهاز للخصوصية. تعد نماذج التسميات التوضيحية التي تكتب أوصافًا كاملة للمسار باللغة الطبيعية، بدلاً من العلامات المنفصلة، ​​هي الحدود التالية.

التنفيذ في العالم الحقيقي

تقوم Spotify والخدمات المشابهة بوضع علامات على التحميلات الجديدة حسب النوع والحالة المزاجية لتشغيل توصيات نمط "Discover Weekly".

مكتبات إنتاج الموسيقى التي تسمح لمحرري الفيديو بتصفية الملايين من مسارات المخزون من خلال "رفع مستوى الشركة" أو "السينما المتوترة"

يقوم برنامج DJ بالكشف التلقائي عن BPM والمفتاح والطاقة بحيث يمكن فرز المسارات ومطابقتها تلقائيًا

تقوم منصات ترخيص الموسيقى بوضع علامات على الآلات الموسيقية والمزاج لمطابقة الأغاني مع ملخصات الإعلانات

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Auto-Tagging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

وضع العلامات على الموسيقى مع المحولات

الأسئلة المتداولة

What is Music Auto-Tagging?

يستخدم وضع العلامات التلقائي على الموسيقى التعلم الآلي للاستماع إلى أغنية وإرفاق تسميات وصفية تلقائيًا مثل النوع والمزاج والآلات الموسيقية والإيقاع. فهو يدعم ميزات البحث والتوصية والتنظيم وراء كل خدمة بث رئيسية.

لماذا يستخدم وضع العلامات التلقائي للموسيقى عمليات التنشيط السيني في طبقة الإخراج الخاصة به بدلاً من softmax؟

العلامات التلقائية متعددة العلامات: يمكن أن يكون المسار "موسيقى الروك" و"الحيوي" و"الغيتار" في وقت واحد، لذلك تحتاج كل علامة إلى احتمالية مستقلة خاصة بها عبر السيني.

ما هو تمثيل المدخلات الذي تغذيه معظم نماذج وضع العلامات التلقائي الحديثة في شبكتها العصبية؟

عادةً ما يتم تحويل الصوت إلى مخطط طيفي ميل، وهو صورة ذات تردد زمني يمكن لشبكة CNN معالجتها مثل الصورة الفوتوغرافية.

لماذا يتم استخدام مقياس ميل بدلا من مقياس التردد الخطي العادي؟

يباعد مقياس ميل الترددات لتتناسب مع إدراك طبقة الصوت البشرية، مما يعطي دقة أكبر للترددات المنخفضة التي تهتم بها آذاننا كثيرًا.

ما هو التحدي الرئيسي عند تدريب نماذج وضع العلامات التلقائي على مجموعات البيانات في العالم الحقيقي؟

العلامات التي يتم الحصول عليها من الحشود غير متسقة والعديد من العلامات الصالحة مفقودة ببساطة، وتظهر بعض العلامات في كثير من الأحيان أكثر من غيرها، مما يجعل التعلم أكثر صعوبة.

ما هي مجموعة البيانات المستخدمة بشكل شائع لتدريب أنظمة وضع العلامات التلقائي على الموسيقى وقياسها؟

يعد MagnaTagATune، جنبًا إلى جنب مع Million Song Dataset وMTG-Jamendo، معيارًا قياسيًا لوضع علامات على الموسيقى. ImageNet مخصص للصور، وSQuAD مخصص للنص QA، وLibriSpeech مخصص للكلام.