دليل الصوت AI

النسخ التلقائي للموسيقى

يقوم النسخ التلقائي للموسيقى (AMT) بتحويل التسجيل الصوتي الخام للموسيقى إلى تدوين رمزي مثل النوتة الموسيقية أو MIDI أو لفافة البيانو.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

يتعامل مع واحدة من أصعب المشاكل في الذكاء الاصطناعي الصوتي: فك تشابك العديد من النغمات المتداخلة التي تعزف في آن واحد.

الغوص العميق

تستمع أنظمة AMT إلى شكل موجة صوتية وإخراج النغمات التي يتم تشغيلها ومتى تبدأ ومدة استمرارها وأحيانًا الآلة التي تعزفها. التحدي الأساسي هو تعدد الأصوات: عندما يتم إصدار عدة نغمات في وقت واحد، تتداخل توافقياتها وتتشوش معًا في طيف التردد، لذلك قد يكون من الصعب فصل نغمة C وG واحدة عن نغمة واحدة أعلى صوتًا. تقوم الأنظمة الحديثة بتحويل الصوت إلى تمثيل للتردد الزمني مثل مخطط ميل الطيفي أو تحويل ثابت Q، ثم تستخدم الشبكات العصبية العميقة للتنبؤ ببدء النوتة الموسيقية وإزاحتها وطبقات الصوت. كان نموذج Onsets and Frames الخاص بـ Google علامة بارزة في نسخ البيانو، بينما تقوم نماذج المحولات الأحدث مثل MT3 بنسخ أدوات متعددة في وقت واحد.

البصيرة الفنية

تتمثل إحدى الأفكار الأساسية في فصل اكتشاف البداية عن اكتشاف درجة الصوت على مستوى الإطار. تستخدم النماذج مثل Onsets وFrames رأس شبكة واحدًا لتحديد اللحظة الدقيقة التي تبدأ فيها النغمة (حدث حاد وحيوي) ورأس آخر لتتبع طبقات الصوت التي يتم إصدارها في كل إطار. تقوم تنبؤات البداية بعد ذلك ببوابة مخرجات الإطار، مما يقلل بشكل كبير من الملاحظات الزائفة. يساعد تحويل Constant-Q لأنه يباعد بين صناديق التردد لوغاريتميًا، مما يتوافق مع كيفية تباعد النغمات الموسيقية بمقدار أوكتاف.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل النسخ التلقائي للموسيقى

تنتقل AMT من البيانو المنفرد إلى النسخ الموثوق به متعدد الآلات وكامل النطاق، بما في ذلك الطبول والغناء والتقنيات التعبيرية مثل الانحناءات والاهتزاز. تعمل بنيات المحولات المدربة على مجموعات البيانات الاصطناعية والمحاذاة الكبيرة على سد الفجوة. توقع تكاملًا أكثر إحكامًا مع فصل المصدر، والنسخ في الوقت الفعلي للأداء المباشر، والأدوات التي تلتقط التوقيت الدقيق والديناميكيات، وليس فقط الملاحظات. الهدف طويل المدى هو نظام يحول أي تسجيل إلى نتيجة قابلة للتحرير والقراءة البشرية.

التنفيذ في العالم الحقيقي

يقوم AnthemScore والتطبيقات المشابهة بتحويل تسجيلات MP3 إلى نوتة موسيقية قابلة للتحرير للموسيقيين الذين يتعلمون الأغاني عن طريق الأذن

استخراج MIDI من تسجيل البيانو حتى يتمكن المنتج من إعادة الصوت أو قياس الأداء في DAW

أدوات تعليم الموسيقى التي تقارن النوتات الموسيقية التي عزفها الطالب مع النوتات الموسيقية لتحديد النوتات الخاطئة أو المفقودة

يقوم علماء الموسيقى بنسخ التسجيلات التاريخية أو المرتجلة (مثل المعزوفات المنفردة لموسيقى الجاز) إلى تدوين للتحليل

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

جيل الموسيقى الرمزية

الأسئلة المتداولة

ما هو النسخ التلقائي للموسيقى؟

يقوم النسخ التلقائي للموسيقى (AMT) بتحويل التسجيل الصوتي الخام للموسيقى إلى تدوين رمزي مثل النوتة الموسيقية أو MIDI أو لفافة البيانو. إنه يعالج إحدى أصعب المشكلات في الذكاء الاصطناعي الصوتي: فك تشابك العديد من النغمات المتداخلة التي يتم تشغيلها مرة واحدة.

ما الذي يخرجه النسخ التلقائي للموسيقى في المقام الأول؟

يقوم AMT بتحويل التسجيل الصوتي إلى تدوين رمزي مثل MIDI أو لفة البيانو أو النوتة الموسيقية التي تصف النوتات الموسيقية التي تم تشغيلها.

لماذا يصعب نسخ الموسيقى متعددة الألحان بشكل خاص؟

عندما تُصدر نغمات متعددة في وقت واحد، تتداخل توافقياتها، مما يجعل من الصعب فصل النغمات الفردية الموجودة.

ما الذي كان ملحوظًا في نموذج البداية والإطارات الخاص بـ Google؟

تستخدم البداية والإطارات رأسًا واحدًا لاكتشاف بدايات النغمات الدقيقة ورأسًا آخر للنغمات المستمرة، مع بداية تنطلق من إخراج الإطار.

لماذا يعد تحويل Constant-Q مفيدًا للموسيقى؟

يتم تباعد النغمات الموسيقية لوغاريتميًا (يتضاعف تردد الأوكتافات)، وتتوافق صناديق CQT ذات التباعد اللوغاريتمي بشكل طبيعي مع هذا.

ما الذي تشير إليه "البداية" في النسخ؟

البداية هي اللحظة الحادة والحيوية التي تبدأ فيها النغمة، والتي يكون تحديد موقعها بدقة أسهل من استدامتها.