স্বয়ংক্রিয় সঙ্গীত প্রতিলিপি
অটোমেটিক মিউজিক ট্রান্সক্রিপশন (AMT) মিউজিকের কাঁচা অডিও রেকর্ডিংকে শীট মিউজিক, MIDI বা পিয়ানো রোলের মতো প্রতীকী স্বরলিপিতে রূপান্তর করে।
ওভারভিউ
It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.
গভীর ডুব
AMT সিস্টেমগুলি একটি অডিও ওয়েভফর্ম এবং আউটপুট শোনে যে নোটগুলি কখন বাজানো হয়, কখন শুরু হয়, কতক্ষণ স্থায়ী হয় এবং কখনও কখনও কোন যন্ত্রটি তাদের বাজায়। মূল চ্যালেঞ্জটি হল পলিফোনি: যখন একাধিক নোট একই সাথে শোনা যায়, তখন তাদের হারমোনিক্স ফ্রিকোয়েন্সি বর্ণালীতে একসাথে ওভারল্যাপ এবং ঝাপসা হয়ে যায়, তাই একটি একক C এবং একটি G একটি একক জোরে নোট থেকে আলাদা করা কঠিন হতে পারে। আধুনিক সিস্টেম অডিওকে টাইম-ফ্রিকোয়েন্সি উপস্থাপনায় রূপান্তর করে যেমন একটি মেল-স্পেকট্রোগ্রাম বা কনস্ট্যান্ট-কিউ ট্রান্সফর্ম, তারপর নোট অনসেট, অফসেট এবং পিচের পূর্বাভাস দিতে গভীর নিউরাল নেটওয়ার্ক ব্যবহার করে। Google এর অনসেটস এবং ফ্রেম মডেলটি পিয়ানো ট্রান্সক্রিপশনের জন্য একটি ল্যান্ডমার্ক ছিল, যখন MT3 এর মত নতুন ট্রান্সফরমার মডেল একসাথে একাধিক যন্ত্র প্রতিলিপি করে।
প্রযুক্তিগত অন্তর্দৃষ্টি
একটি মূল অন্তর্দৃষ্টি হল ফ্রেম-স্তরের পিচ সনাক্তকরণ থেকে সূচনা সনাক্তকরণকে আলাদা করা। অনসেট এবং ফ্রেমের মতো মডেলগুলি একটি নোট শুরু হওয়ার সুনির্দিষ্ট মুহূর্তটি চিহ্নিত করতে একটি নেটওয়ার্ক হেড ব্যবহার করে (একটি তীক্ষ্ণ, শক্তিশালী ঘটনা) এবং অন্যটি প্রতিটি ফ্রেমে কোন পিচগুলি শোনাচ্ছে তা ট্র্যাক করতে। সূচনা ভবিষ্যদ্বাণী তারপর ফ্রেম আউটপুট গেট, নাটকীয়ভাবে মিথ্যা নোট হ্রাস. কনস্ট্যান্ট-কিউ ট্রান্সফর্ম সাহায্য করে কারণ এটি ফ্রিকোয়েন্সি বিনগুলিকে লগারিদমিকভাবে ফাঁকা করে, মিউজিক্যাল পিচগুলিকে কীভাবে অক্টেভ আলাদা করে রাখা হয় তার সাথে মিলে যায়।
কৌশলগত প্রভাব
অ্যাক্সেস এবং পৌঁছানো
এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।
খরচ ও বাজেট
মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।
গতি এবং স্কেল
গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।
স্বয়ংক্রিয় সঙ্গীত ট্রান্সক্রিপশনের ভবিষ্যত
AMT একক পিয়ানো থেকে নির্ভরযোগ্য মাল্টি-ইন্সট্রুমেন্ট এবং ফুল-ব্যান্ড ট্রান্সক্রিপশনের দিকে এগিয়ে যাচ্ছে, যার মধ্যে ড্রাম, ভোকাল এবং বাঁক এবং ভাইব্রেটোর মতো অভিব্যক্তিপূর্ণ কৌশল রয়েছে। বড় সিন্থেটিক এবং সারিবদ্ধ ডেটাসেটে প্রশিক্ষিত ট্রান্সফরমার আর্কিটেকচারগুলি ব্যবধান বন্ধ করে দিচ্ছে। সোর্স সেপারেশন, লাইভ পারফরম্যান্সের জন্য রিয়েল-টাইম ট্রান্সক্রিপশন এবং মাইক্রো-টাইমিং এবং ডাইনামিকস ক্যাপচার করা টুলস, শুধু নোট নয়, এর সাথে আরও শক্ত ইন্টিগ্রেশন আশা করুন। দীর্ঘমেয়াদী লক্ষ্য হল এমন একটি সিস্টেম যা যেকোনো রেকর্ডিংকে সম্পাদনাযোগ্য, মানব-পাঠযোগ্য স্কোরে পরিণত করে।
বাস্তব-বিশ্ব বাস্তবায়ন
AnthemScore এবং অনুরূপ অ্যাপ্লিকেশনগুলি MP3 রেকর্ডিংগুলিকে সম্পাদনাযোগ্য শীট সঙ্গীতে রূপান্তর করে সঙ্গীতশিল্পীদের জন্য কান দিয়ে গান শেখা
একটি পিয়ানো রেকর্ডিং থেকে MIDI নিষ্কাশন যাতে একজন প্রযোজক DAW-তে পারফরম্যান্সকে পুনরায় ভয়েস বা পরিমাপ করতে পারেন
মিউজিক শিক্ষার টুল যা একজন ছাত্রের বাজানো নোটের স্কোরের সাথে ভুল বা মিস করা নোটের সাথে তুলনা করে
সঙ্গীতবিদরা বিশ্লেষণের জন্য স্বরলিপিতে ঐতিহাসিক বা ইম্প্রোভাইজড রেকর্ডিং (যেমন জ্যাজ সোলো) প্রতিলিপি করছেন
ঝুঁকি এবং প্রহরী
সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।
উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।
সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।
বাস্তবায়ন রোডম্যাপ
ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।
বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।
কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।
সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Automatic Music Transcription quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
প্রতীকী সঙ্গীত প্রজন্ম
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Automatic Music Transcription?
অটোমেটিক মিউজিক ট্রান্সক্রিপশন (AMT) মিউজিকের কাঁচা অডিও রেকর্ডিংকে শীট মিউজিক, MIDI বা পিয়ানো রোলের মতো প্রতীকী স্বরলিপিতে রূপান্তর করে। এটি অডিও এআই-এর সবচেয়ে কঠিন সমস্যাগুলির মধ্যে একটিকে মোকাবেলা করে: একসাথে প্লে করা অনেকগুলি ওভারল্যাপিং নোটগুলিকে আটকানো।
স্বয়ংক্রিয় সঙ্গীত প্রতিলিপি প্রাথমিকভাবে আউটপুট কি?
AMT একটি অডিও রেকর্ডিংকে একটি প্রতীকী স্বরলিপিতে রূপান্তরিত করে যেমন MIDI, একটি পিয়ানো রোল, বা বাজানো নোট বর্ণনা করে শীট সঙ্গীত।
কেন পলিফোনিক সঙ্গীত বিশেষ করে প্রতিলিপি করা কঠিন?
যখন একাধিক নোট একবারে ধ্বনিত হয় তাদের হারমোনিক্স ওভারল্যাপ করে, কোন পৃথক পিচ উপস্থিত রয়েছে তা আলাদা করা কঠিন করে তোলে।
Google এর অনসেট এবং ফ্রেম মডেল সম্পর্কে কী উল্লেখযোগ্য ছিল?
অনসেট এবং ফ্রেমগুলি একটি হেড ব্যবহার করে সুনির্দিষ্ট নোট অনসেট সনাক্ত করতে এবং আরেকটি টেকসই পিচের জন্য, যার ফলে ফ্রেম আউটপুট গেট করা হয়।
কনস্ট্যান্ট-কিউ ট্রান্সফর্ম সঙ্গীতের জন্য উপযোগী কেন?
মিউজিক্যাল পিচগুলি লগারিদমিকভাবে ব্যবধানে (অষ্টভগুলি দ্বিগুণ ফ্রিকোয়েন্সি) এবং CQT-এর লগ-স্পেসড বিনগুলি স্বাভাবিকভাবেই এর সাথে সারিবদ্ধ হয়।
ট্রান্সক্রিপশনে 'শুরু' কী বোঝায়?
একটি সূচনা হল একটি তীক্ষ্ণ, শক্তিশালী মুহূর্ত যখন একটি নোট শুরু হয়, যা টিকিয়ে রাখার চেয়ে সঠিকভাবে স্থানীয়করণ করা সহজ।