MusicGen
MusicGen هو نموذج الذكاء الاصطناعي الخاص بـ Meta والذي يقوم بإنشاء الموسيقى من وصف نصي، واختياريًا من اللحن الذي تدندن به أو تحمّله.
نظرة عامة
It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.
الغوص العميق
تم إصدار MusicGen بواسطة Meta AI في عام 2023 كجزء من مشروع AudioCraft، وهو يحول المطالبات مثل "مسار موسيقى البوب المتفائل من الثمانينيات مع خط جهير قوي" إلى مقاطع موسيقية مدتها 12 ثانية تقريبًا (قابلة للتمديد). على عكس الأنظمة متعددة المراحل، يستخدم MusicGen نموذج لغة محول واحد يتنبأ بالرموز الصوتية التي ينتجها برنامج الترميز العصبي EnCodec الخاص بـ Meta. مساهمتها الذكية هي نمط تشذير الرمز المميز (يُسمى تشذير التأخير) الذي يسمح لنموذج واحد بالتعامل مع تدفقات الرموز المتوازية المتعددة الخاصة بـ EnCodec بكفاءة، مع تجنب سلسلة النماذج المنفصلة المطلوبة في الأساليب السابقة. يمكن توجيه MusicGen بطريقتين في وقت واحد: من خلال وصف نصي ومن خلال لحن مرجعي، حتى تتمكن من طلب "نسخة موسيقى الجاز" من اللحن الذي تدندنه. أصدرت Meta الكود والأوزان علنًا، مما أدى إلى تغذية موجة من أدوات وتجارب المجتمع.
البصيرة الفنية
يمثل MusicGen الصوت كتدفقات متوازية من الرموز المنفصلة من برنامج ترميز EnCodec، حيث يلتقط كل تيار تفاصيل مختلفة. بدلاً من نمذجة التدفقات باستخدام نماذج منفصلة، يقوم MusicGen بتشذيرها بتأخيرات متحكم فيها بحيث يتنبأ بها محول انحدار ذاتي واحد في مسار واحد. يأتي تكييف النص من برنامج تشفير النص T5، بينما يستخدم تكييف اللحن الاختياري مخططًا لونيًا (ملف تعريف درجة الصوت) بحيث يتبع النموذج اللحن دون نسخ تسجيله الدقيق.
التأثير الاستراتيجي
الوصول والوصول
يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.
التكلفة والميزانية
يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.
السرعة والحجم
يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.
مستقبل MusicGen
وضع الإصدار المفتوح لـ MusicGen خطًا أساسيًا يهدف اللاحقون إلى التغلب عليه من خلال إخراج استريو أطول وأكثر دقة، بالإضافة إلى تحكم أكثر دقة في البنية والآلات الموسيقية وأقسام الأغنية. توقع تكاملًا أكثر إحكامًا في برامج إنتاج الموسيقى، والتوليد التفاعلي في الوقت الفعلي، وأدوات أفضل لتحرير المسارات الموجودة أو توسيعها. كما هو الحال مع جميع الموسيقى المنتجة، فإنها تزيد من حدة الأسئلة حول حقوق الطبع والنشر لبيانات التدريب، وتعويض الفنان، وكيفية تصنيف الأغاني التي تم إنشاؤها بواسطة الذكاء الاصطناعي في سوق غارق.
التنفيذ في العالم الحقيقي
إنشاء موسيقى خلفية خالية من حقوق الملكية لمقطع فيديو على YouTube من خلال مطالبة نصية
دندن اللحن واطلب من MusicGen ترتيبًا أوركستراليًا كاملاً له
يقوم مطورو الألعاب بتصميم نماذج أولية للموسيقى التصويرية على مستوى الأنواع المختلفة بسرعة
يقوم الباحثون والهواة بتشغيل الأوزان مفتوحة المصدر لتجربة تحويل النص إلى موسيقى
المخاطر والدرابزين
تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.
يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.
يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.
خارطة طريق التنفيذ
الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.
اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.
تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.
قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MusicGen quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
المحاذاة القسرية
الأسئلة المتداولة
What is MusicGen?
MusicGen هو نموذج الذكاء الاصطناعي الخاص بـ Meta والذي يقوم بإنشاء الموسيقى من وصف نصي، واختياريًا من اللحن الذي تدندن به أو تحمّله. إنه أمر مهم لأنه يضع إنشاء موسيقى عالية الجودة ويمكن التحكم فيها في نموذج واحد مفتوح المصدر يمكن للهواة والباحثين تشغيله فعليًا.
ما نوعان من المدخلات التي يمكن أن توجه MusicGen في نفس الوقت؟
يقبل MusicGen مطالبة نصية، واختياريًا، لحنًا، بحيث يمكنك طلب نسخة أسلوبية من النغمة التي تقدمها.
ما هو برنامج الترميز العصبي الذي ينتج الرموز الصوتية التي يتنبأ بها MusicGen؟
تقوم MusicGen بتصميم الرموز المميزة المنفصلة التي تم إنشاؤها بواسطة برنامج ترميز EnCodec الخاص بـ Meta، والذي يقوم أيضًا بفك تشفير الرموز المميزة المتوقعة مرة أخرى إلى الصوت.
ما هو التبسيط المعماري الرئيسي لـ MusicGen مقارنةً بالمناهج السابقة؟
من خلال تشذير تدفقات الرموز المتوازية لـ EnCodec مع تأخيرات يمكن التحكم فيها، يمكن لمحول انحدار ذاتي واحد أن يصممها في مسار واحد، متجنبًا سلسلة من النماذج.
كيف يتبع MusicGen اللحن المقدم دون نسخ التسجيل الدقيق؟
يلتقط المخطط اللوني فئات طبقة الصوت الموجودة بمرور الوقت، مما يسمح لـ MusicGen بمطابقة تناغم اللحن ومحيطه دون إعادة إنتاج الجرس الأصلي.
ما المشروع والشركة التي أصدرت MusicGen؟
تم إصدار MusicGen في عام 2023 كجزء من مشروع Meta AI's AudioCraft، مع الكود المفتوح وأوزان النماذج.