آڈیو AI گائیڈ

خودکار میوزک ٹرانسکرپشن

آٹومیٹک میوزک ٹرانسکرپشن (AMT) موسیقی کی خام آڈیو ریکارڈنگ کو شیٹ میوزک، MIDI، یا پیانو رول جیسے علامتی اشارے میں تبدیل کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

گہرا غوطہ

اے ایم ٹی سسٹم آڈیو ویوفارم اور آؤٹ پٹ کو سنتے ہیں کہ کون سے نوٹ چلائے جاتے ہیں، وہ کب شروع ہوتے ہیں، کتنی دیر تک چلتے ہیں، اور کبھی کبھی کون سا آلہ انہیں چلاتا ہے۔ بنیادی چیلنج پولی فونی ہے: جب کئی نوٹ بیک وقت آواز دیتے ہیں، تو ان کے ہارمونکس فریکوئنسی سپیکٹرم میں ایک ساتھ اوورلیپ اور دھندلے ہو جاتے ہیں، اس لیے سنگل C اور G کو ایک ہی اونچی آواز سے الگ کرنا مشکل ہو سکتا ہے۔ جدید نظام آڈیو کو ٹائم فریکوئنسی کی نمائندگی میں تبدیل کرتے ہیں جیسے کہ میل سپیکٹروگرام یا Constant-Q Transform، پھر نوٹ آن سیٹس، آفسیٹس اور پچوں کی پیش گوئی کرنے کے لیے گہرے نیورل نیٹ ورکس کا استعمال کرتے ہیں۔ Google کا آنسیٹس اور فریمز ماڈل پیانو ٹرانسکرپشن کے لیے ایک سنگ میل تھا، جب کہ MT3 جیسے نئے ٹرانسفارمر ماڈل ایک ہی وقت میں متعدد آلات کو نقل کرتے ہیں۔

تکنیکی بصیرت

ایک اہم بصیرت آغاز کا پتہ لگانے کو فریم سطح کی پچ کا پتہ لگانے سے الگ کر رہی ہے۔ Onsets اور Frames جیسے ماڈلز ایک نیٹ ورک ہیڈ کا استعمال کرتے ہوئے عین اس لمحے کا پتہ لگاتے ہیں جب نوٹ شروع ہوتا ہے (ایک تیز، پرجوش واقعہ) اور دوسرا یہ معلوم کرنے کے لیے کہ ہر فریم میں کون سی پچ لگ رہی ہے۔ شروع ہونے والی پیشین گوئیاں پھر فریم آؤٹ پٹس کو گیٹ کرتی ہیں، ڈرامائی طور پر جعلی نوٹوں کو کم کرتی ہیں۔ Constant-Q ٹرانسفارم مدد کرتا ہے کیونکہ یہ فریکوئنسی بِنز کو منطقی طور پر خالی کرتا ہے، اس سے میل کھاتا ہے کہ کس طرح میوزیکل پچز کو ایک آکٹیو سے الگ کیا جاتا ہے۔

اسٹریٹجک اثر

رسائی اور رسائی

یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔

لاگت اور بجٹ

میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔

رفتار اور پیمانہ

کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔

خودکار میوزک ٹرانسکرپشن کا مستقبل

AMT سولو پیانو سے قابل بھروسہ ملٹی انسٹرومنٹ اور فل بینڈ ٹرانسکرپشن کی طرف بڑھ رہا ہے، بشمول ڈرم، آواز، اور موڑ اور وائبراٹو جیسی تاثراتی تکنیک۔ بڑے مصنوعی اور منسلک ڈیٹاسیٹس پر تربیت یافتہ ٹرانسفارمر فن تعمیر اس خلا کو ختم کر رہے ہیں۔ ماخذ کی علیحدگی کے ساتھ سخت انضمام کی توقع کریں، لائیو پرفارمنس کے لیے ریئل ٹائم ٹرانسکرپشن، اور ایسے ٹولز جو مائیکرو ٹائمنگ اور ڈائنامکس کو پکڑتے ہیں، نہ کہ صرف نوٹ۔ طویل مدتی ہدف ایک ایسا نظام ہے جو کسی بھی ریکارڈنگ کو قابل تدوین، انسانی پڑھنے کے قابل اسکور میں بدل دیتا ہے۔

حقیقی دنیا کا نفاذ

انتھم سکور اور اسی طرح کی ایپس MP3 ریکارڈنگ کو قابل تدوین شیٹ میوزک میں تبدیل کرنے والے موسیقاروں کے لیے کان سے گانے سیکھنے والے

پیانو کی ریکارڈنگ سے MIDI نکالنا تاکہ ایک پروڈیوسر DAW میں کارکردگی کو دوبارہ آواز دے یا اس کی مقدار درست کر سکے۔

موسیقی کی تعلیم کے ٹولز جو طالب علم کے چلائے گئے نوٹوں کا اسکور کے مقابلے میں غلط یا چھوٹے ہوئے نوٹوں کو جھنڈا کرنے کے لیے موازنہ کرتے ہیں۔

ماہر موسیقی تاریخی یا اصلاحی ریکارڈنگ (جیسے جاز سولوس) کو تجزیہ کے لیے اشارے میں نقل کرتے ہیں۔

خطرات اور گارڈریلز

رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔

درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔

واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔

2

متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔

3

وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔

4

مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

علامتی موسیقی کی نسل

اکثر پوچھے گئے سوالات

What is Automatic Music Transcription?

آٹومیٹک میوزک ٹرانسکرپشن (AMT) موسیقی کی خام آڈیو ریکارڈنگ کو شیٹ میوزک، MIDI، یا پیانو رول جیسے علامتی اشارے میں تبدیل کرتا ہے۔ یہ آڈیو AI میں سب سے مشکل مسائل میں سے ایک سے نمٹتا ہے: ایک ساتھ چلائے جانے والے بہت سے اوورلیپنگ نوٹوں کو ختم کرنا۔

آٹومیٹک میوزک ٹرانسکرپشن بنیادی طور پر کیا آؤٹ پٹ کرتا ہے؟

AMT آڈیو ریکارڈنگ کو ایک علامتی اشارے میں تبدیل کرتا ہے جیسے کہ MIDI، ایک پیانو رول، یا شیٹ میوزک جو چلائے گئے نوٹوں کو بیان کرتا ہے۔

پولی فونک موسیقی کو نقل کرنا خاص طور پر مشکل کیوں ہے؟

جب ایک سے زیادہ نوٹ ایک ساتھ بجتے ہیں تو ان کے ہارمونکس اوورلیپ ہوجاتے ہیں، جس سے یہ الگ کرنا مشکل ہوجاتا ہے کہ کون سی انفرادی پچ موجود ہے۔

Google کے آغاز اور فریم ماڈل کے بارے میں کیا قابل ذکر تھا؟

آغاز اور فریموں نے ایک سر کو درست نوٹ کے آغاز کا پتہ لگانے کے لیے استعمال کیا اور دوسرے کو مستقل پچوں کے لیے، شروع ہونے والے فریم آؤٹ پٹ کو گیٹ کرنے کے ساتھ۔

Constant-Q ٹرانسفارم موسیقی کے لیے کیوں مفید ہے؟

میوزیکل پچز کو لوگارتھمک طور پر فاصلہ دیا جاتا ہے (آکٹوز فریکوئنسی میں دوگنا)، اور CQT کے لاگ اسپیس والے ڈبے قدرتی طور پر اس کے ساتھ سیدھ میں ہوتے ہیں۔

نقل میں 'آغاز' کا کیا مطلب ہے؟

ایک آغاز وہ تیز، توانائی بخش لمحہ ہوتا ہے جب کوئی نوٹ شروع ہوتا ہے، جسے برقرار رکھنے کے مقابلے میں درست طریقے سے مقامی بنانا آسان ہوتا ہے۔