دليل الصوت AI

MusicLM: الرموز الدلالية والصوتية الهرمية

MusicLM هو نموذج Google لتحويل النص إلى موسيقى والذي يقوم بإنشاء صوت طويل من خلال تسلسل هرمي من الرموز الدلالية للبنية الموسيقية والرموز الصوتية لتفاصيل الصوت.

قراءة لمدة دقيقتينآخر تحديث

الغوص العميق

أعلنت شركة Google عن بحث في أوائل عام 2023، حيث تقوم MusicLM بتأطير توليد الموسيقى على أنها تتنبأ بتسلسلات من الرموز الصوتية المنفصلة، ​​مثلما يتنبأ نموذج اللغة بالكلمات. يستخدم تسلسلًا هرميًا للتمثيلات: الرموز الدلالية (من نموذج يسمى w2v-BERT) تلتقط بنية عالية المستوى مثل اللحن والإيقاع على مدى فترات طويلة، بينما تلتقط الرموز الصوتية (من برنامج الترميز العصبي SoundStream) تفاصيل دقيقة مثل الجرس والملمس. تقوم المرحلة الأولى بإنشاء رموز دلالية من موجه النص، ثم تقوم المراحل اللاحقة بملء التفاصيل الصوتية المشروطة بتلك الدلالات. يأتي تكييف النص من MuLM/MuLan، وهو عبارة عن دمج نص موسيقي مشترك تم تدريبه بحيث يتم وضع الأوصاف والصوت في نفس المساحة. يتيح هذا النهج المرحلي لـ MusicLM البقاء متسقًا موسيقيًا على مدار دقائق بدلاً من الانجراف بعد بضع ثوانٍ.

البصيرة الفنية

الفكرة الأساسية هي فصل البنية عن الملمس عبر التسلسل الهرمي المميز. الرموز الدلالية الخشنة متفرقة وبطيئة التغير، لذا يمكن للمحول أن يصمم نموذجًا طويل المدى دون طول تسلسل ضخم. الرموز الصوتية كثيفة وعالية السرعة، ولكنها تحتاج فقط إلى التنبؤ بها مشروطًا بالدلالات الثابتة بالفعل، مما يجعل كل مرحلة قابلة للتتبع. يؤدي تكميم المتجهات المتبقية في SoundStream إلى إنتاج أكواد صوتية ذات طبقات يحولها جهاز فك التشفير النهائي إلى أشكال موجية تبلغ 24 كيلو هرتز.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل الموسيقى: الرموز الدلالية والصوتية الهرمية

أصبح نهج الرمز المميز الهرمي لـ MusicLM نموذجًا للأنظمة اللاحقة مثل MusicGen وأدوات الموسيقى التجارية. توقع تكييف اللحن بشكل أكثر إحكامًا (دندنة نغمة، احصل على ترتيب كامل)، وأغاني أطول منظمة بالكامل مع الآيات والجوقات، وإمكانية تحكم أفضل في الآلات الموسيقية والمفاتيح. إن القضايا الشائكة قانونية وأخلاقية: فقد أصبح الآن ترخيص بيانات التدريب، وموافقة الفنان، وإنشاء العلامات المائية للصوت حتى يمكن تمييزه عن الموسيقى التي من صنع الإنسان، أمرًا أساسيًا للنشر.

التنفيذ في العالم الحقيقي

تحويل وصف مشهد مكتوب إلى فيلم أو مقطع دعائي، على سبيل المثال. "بناء أوركسترالي ملحمي مع جوقة"

إنشاء موسيقى خلفية مشروطة بتعليق الصورة أو حتى رسم أوصاف للمنشآت الفنية

تمديد لحن قصير هامد أو صفير إلى ترتيب مجهز بالكامل

إنتاج مقطوعات موسيقية متنوعة بإيقاعات وحالات مزاجية مختلفة لمنشئي الإعلانات والمحتوى

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

جيل الموسيقى الرمزية

الأسئلة المتداولة

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM هو نموذج Google لتحويل النص إلى موسيقى والذي يقوم بإنشاء صوت طويل من خلال تسلسل هرمي من الرموز الدلالية للبنية الموسيقية والرموز الصوتية لتفاصيل الصوت.

كيف يتعامل MusicLM بشكل أساسي مع مهمة توليد الموسيقى؟

يقوم MusicLM بتأطير توليد الموسيقى كتنبؤ انحداري عبر رموز صوتية منفصلة، ​​على غرار الطريقة التي يتنبأ بها نموذج اللغة بالكلمات.

ما هو دور الرموز الدلالية في MusicLM؟

تلتقط الرموز الدلالية (من w2v-BERT) بنية خشنة وبطيئة التغير مثل اللحن والإيقاع على مدى فترات طويلة.

ما هو المكون الذي يوفر التفاصيل الصوتية الدقيقة مثل الجرس والملمس؟

تأتي الرموز الصوتية من برنامج الترميز العصبي SoundStream وتقوم بتشفير التفاصيل الدقيقة مثل الجرس والملمس.

كيف يقوم MusicLM بتوصيل رسالة نصية بالصوت الموسيقي؟

تم تدريب MuLan بحيث يمكن وصف النص ومطابقة الخريطة الصوتية بالنقاط القريبة في مساحة التضمين المشتركة، مما يتيح تكييف النص.

لماذا يساعد التصميم الهرمي المرحلي في البنية طويلة المدى؟

تتغير الرموز الدلالية المتفرقة ببطء، لذلك يمكن للمحول أن يصمم النموذج طويل المدى بكفاءة قبل ملء التفاصيل الصوتية الكثيفة.