অডিও এআই গাইড

স্বয়ংক্রিয় সঙ্গীত প্রতিলিপি

অটোমেটিক মিউজিক ট্রান্সক্রিপশন (AMT) মিউজিকের কাঁচা অডিও রেকর্ডিংকে শীট মিউজিক, MIDI বা পিয়ানো রোলের মতো প্রতীকী স্বরলিপিতে রূপান্তর করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

গভীর ডুব

AMT সিস্টেমগুলি একটি অডিও ওয়েভফর্ম এবং আউটপুট শোনে যে নোটগুলি কখন বাজানো হয়, কখন শুরু হয়, কতক্ষণ স্থায়ী হয় এবং কখনও কখনও কোন যন্ত্রটি তাদের বাজায়। মূল চ্যালেঞ্জটি হল পলিফোনি: যখন একাধিক নোট একই সাথে শোনা যায়, তখন তাদের হারমোনিক্স ফ্রিকোয়েন্সি বর্ণালীতে একসাথে ওভারল্যাপ এবং ঝাপসা হয়ে যায়, তাই একটি একক C এবং একটি G একটি একক জোরে নোট থেকে আলাদা করা কঠিন হতে পারে। আধুনিক সিস্টেম অডিওকে টাইম-ফ্রিকোয়েন্সি উপস্থাপনায় রূপান্তর করে যেমন একটি মেল-স্পেকট্রোগ্রাম বা কনস্ট্যান্ট-কিউ ট্রান্সফর্ম, তারপর নোট অনসেট, অফসেট এবং পিচের পূর্বাভাস দিতে গভীর নিউরাল নেটওয়ার্ক ব্যবহার করে। Google এর অনসেটস এবং ফ্রেম মডেলটি পিয়ানো ট্রান্সক্রিপশনের জন্য একটি ল্যান্ডমার্ক ছিল, যখন MT3 এর মত নতুন ট্রান্সফরমার মডেল একসাথে একাধিক যন্ত্র প্রতিলিপি করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

একটি মূল অন্তর্দৃষ্টি হল ফ্রেম-স্তরের পিচ সনাক্তকরণ থেকে সূচনা সনাক্তকরণকে আলাদা করা। অনসেট এবং ফ্রেমের মতো মডেলগুলি একটি নোট শুরু হওয়ার সুনির্দিষ্ট মুহূর্তটি চিহ্নিত করতে একটি নেটওয়ার্ক হেড ব্যবহার করে (একটি তীক্ষ্ণ, শক্তিশালী ঘটনা) এবং অন্যটি প্রতিটি ফ্রেমে কোন পিচগুলি শোনাচ্ছে তা ট্র্যাক করতে। সূচনা ভবিষ্যদ্বাণী তারপর ফ্রেম আউটপুট গেট, নাটকীয়ভাবে মিথ্যা নোট হ্রাস. কনস্ট্যান্ট-কিউ ট্রান্সফর্ম সাহায্য করে কারণ এটি ফ্রিকোয়েন্সি বিনগুলিকে লগারিদমিকভাবে ফাঁকা করে, মিউজিক্যাল পিচগুলিকে কীভাবে অক্টেভ আলাদা করে রাখা হয় তার সাথে মিলে যায়।

কৌশলগত প্রভাব

অ্যাক্সেস এবং পৌঁছানো

এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।

খরচ ও বাজেট

মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।

গতি এবং স্কেল

গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।

স্বয়ংক্রিয় সঙ্গীত ট্রান্সক্রিপশনের ভবিষ্যত

AMT একক পিয়ানো থেকে নির্ভরযোগ্য মাল্টি-ইন্সট্রুমেন্ট এবং ফুল-ব্যান্ড ট্রান্সক্রিপশনের দিকে এগিয়ে যাচ্ছে, যার মধ্যে ড্রাম, ভোকাল এবং বাঁক এবং ভাইব্রেটোর মতো অভিব্যক্তিপূর্ণ কৌশল রয়েছে। বড় সিন্থেটিক এবং সারিবদ্ধ ডেটাসেটে প্রশিক্ষিত ট্রান্সফরমার আর্কিটেকচারগুলি ব্যবধান বন্ধ করে দিচ্ছে। সোর্স সেপারেশন, লাইভ পারফরম্যান্সের জন্য রিয়েল-টাইম ট্রান্সক্রিপশন এবং মাইক্রো-টাইমিং এবং ডাইনামিকস ক্যাপচার করা টুলস, শুধু নোট নয়, এর সাথে আরও শক্ত ইন্টিগ্রেশন আশা করুন। দীর্ঘমেয়াদী লক্ষ্য হল এমন একটি সিস্টেম যা যেকোনো রেকর্ডিংকে সম্পাদনাযোগ্য, মানব-পাঠযোগ্য স্কোরে পরিণত করে।

বাস্তব-বিশ্ব বাস্তবায়ন

AnthemScore এবং অনুরূপ অ্যাপ্লিকেশনগুলি MP3 রেকর্ডিংগুলিকে সম্পাদনাযোগ্য শীট সঙ্গীতে রূপান্তর করে সঙ্গীতশিল্পীদের জন্য কান দিয়ে গান শেখা

একটি পিয়ানো রেকর্ডিং থেকে MIDI নিষ্কাশন যাতে একজন প্রযোজক DAW-তে পারফরম্যান্সকে পুনরায় ভয়েস বা পরিমাপ করতে পারেন

মিউজিক শিক্ষার টুল যা একজন ছাত্রের বাজানো নোটের স্কোরের সাথে ভুল বা মিস করা নোটের সাথে তুলনা করে

সঙ্গীতবিদরা বিশ্লেষণের জন্য স্বরলিপিতে ঐতিহাসিক বা ইম্প্রোভাইজড রেকর্ডিং (যেমন জ্যাজ সোলো) প্রতিলিপি করছেন

ঝুঁকি এবং প্রহরী

সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।

উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।

সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।

2

বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।

3

কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।

4

সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

প্রতীকী সঙ্গীত প্রজন্ম

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Automatic Music Transcription?

অটোমেটিক মিউজিক ট্রান্সক্রিপশন (AMT) মিউজিকের কাঁচা অডিও রেকর্ডিংকে শীট মিউজিক, MIDI বা পিয়ানো রোলের মতো প্রতীকী স্বরলিপিতে রূপান্তর করে। এটি অডিও এআই-এর সবচেয়ে কঠিন সমস্যাগুলির মধ্যে একটিকে মোকাবেলা করে: একসাথে প্লে করা অনেকগুলি ওভারল্যাপিং নোটগুলিকে আটকানো।

স্বয়ংক্রিয় সঙ্গীত প্রতিলিপি প্রাথমিকভাবে আউটপুট কি?

AMT একটি অডিও রেকর্ডিংকে একটি প্রতীকী স্বরলিপিতে রূপান্তরিত করে যেমন MIDI, একটি পিয়ানো রোল, বা বাজানো নোট বর্ণনা করে শীট সঙ্গীত।

কেন পলিফোনিক সঙ্গীত বিশেষ করে প্রতিলিপি করা কঠিন?

যখন একাধিক নোট একবারে ধ্বনিত হয় তাদের হারমোনিক্স ওভারল্যাপ করে, কোন পৃথক পিচ উপস্থিত রয়েছে তা আলাদা করা কঠিন করে তোলে।

Google এর অনসেট এবং ফ্রেম মডেল সম্পর্কে কী উল্লেখযোগ্য ছিল?

অনসেট এবং ফ্রেমগুলি একটি হেড ব্যবহার করে সুনির্দিষ্ট নোট অনসেট সনাক্ত করতে এবং আরেকটি টেকসই পিচের জন্য, যার ফলে ফ্রেম আউটপুট গেট করা হয়।

কনস্ট্যান্ট-কিউ ট্রান্সফর্ম সঙ্গীতের জন্য উপযোগী কেন?

মিউজিক্যাল পিচগুলি লগারিদমিকভাবে ব্যবধানে (অষ্টভগুলি দ্বিগুণ ফ্রিকোয়েন্সি) এবং CQT-এর লগ-স্পেসড বিনগুলি স্বাভাবিকভাবেই এর সাথে সারিবদ্ধ হয়।

ট্রান্সক্রিপশনে 'শুরু' কী বোঝায়?

একটি সূচনা হল একটি তীক্ষ্ণ, শক্তিশালী মুহূর্ত যখন একটি নোট শুরু হয়, যা টিকিয়ে রাখার চেয়ে সঠিকভাবে স্থানীয়করণ করা সহজ।