অডিও এআই গাইড

প্রতীকী সঙ্গীত প্রজন্ম

সিম্বলিক মিউজিক জেনারেশন স্ট্রাকচার্ড স্বরলিপি হিসাবে সঙ্গীত তৈরি করে — নোট, পিচ, সময়কাল এবং সময় (প্রায়শই MIDI হিসাবে) — কাঁচা অডিও হিসাবে নয়।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It gives composers editable, instrument-agnostic output they can tweak note by note.

গভীর ডুব

একটি সমাপ্ত তরঙ্গরূপ তৈরি করার পরিবর্তে, প্রতীকী সিস্টেমগুলি 'স্কোর' তৈরি করে: পিচ, সময়কাল, বেগ এবং সময় সহ নোটের ক্রম, সাধারণত MIDI বা পিয়ানো-রোল আকারে। যেহেতু আউটপুটটি প্রতীকী, এটি সম্পূর্ণরূপে সম্পাদনাযোগ্য — আপনি একটি একক নোট পরিবর্তন করতে পারেন, যন্ত্রগুলি অদলবদল করতে পারেন, কীগুলি স্থানান্তর করতে পারেন বা এটি একজন মানব অভিনয়কারীর কাছে হস্তান্তর করতে পারেন৷ ল্যান্ডমার্ক প্রজেক্টের মধ্যে রয়েছে Google Magenta's MelodyRNN এবং MusicVAE, OpenAI এর MuseNet (2019), যা অনেক স্টাইল জুড়ে মাল্টি-ইনস্ট্রুমেন্ট কম্পোজিশন তৈরি করেছে, এবং অ্যান্টিসিপেটরি মিউজিক ট্রান্সফরমার কাজ। সুনোর মতো কাঁচা-অডিও সরঞ্জামগুলির মধ্যে ট্রেড-অফ হল যে প্রতীকী মডেলগুলি প্রকৃত শব্দ বা বাস্তবসম্মত কণ্ঠস্বর তৈরি করে না; তাদের শোনার জন্য একটি সিন্থেসাইজার বা নমুনা প্রয়োজন। কিন্তু তারা নির্ভুলতা, নিয়ন্ত্রণযোগ্যতা এবং ক্ষুদ্র, দ্রুত উপস্থাপনা অফার করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

এই মডেলগুলি সঙ্গীতকে একটি ভাষার মতো আচরণ করে: নোট (বা নোট-ইভেন্ট যেমন 'নোট-অন', 'নোট-অফ', টাইম-শিফ্ট) টোকেন হয়ে যায় এবং একটি সিকোয়েন্স মডেল — ঐতিহাসিকভাবে একটি RNN/LSTM, এখন সাধারণত একটি ট্রান্সফরমার — পরবর্তী ইভেন্টের পূর্বাভাস দেয়। কেউ কেউ একটি VAE ব্যবহার করে একটি মসৃণ সুপ্ত স্থান শেখার জন্য যাতে আপনি সুরের মধ্যে ইন্টারপোলেট করতে পারেন। যেহেতু একটি সিম্বলিক সিকোয়েন্স একটি কাঁচা তরঙ্গরূপের চেয়ে হাজার হাজার গুণ ছোট, এই মডেলগুলি অডিও মডেলের তুলনায় অনেক দ্রুত প্রশিক্ষণ দেয় এবং উৎপন্ন করে এবং তাদের আউটপুট যেকোন স্বরলিপি সফ্টওয়্যারে সরাসরি সম্পাদনাযোগ্য।

কৌশলগত প্রভাব

অ্যাক্সেস এবং পৌঁছানো

এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।

খরচ ও বাজেট

মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।

গতি এবং স্কেল

গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।

প্রতীকী সঙ্গীত প্রজন্মের ভবিষ্যত

প্রতীকী প্রজন্ম ক্রমবর্ধমানভাবে অডিওর সাথে যুক্ত হচ্ছে: একটি ট্রান্সফরমার স্কোর রচনা করে, তারপর একটি উচ্চ-মানের নিউরাল সিন্থেসাইজার বা স্যাম্পলার এটিকে রেন্ডার করে, বাস্তবসম্মত শব্দের সাথে সম্পাদনাযোগ্যতার সমন্বয় করে। DAWs এবং স্বরলিপি সরঞ্জামগুলির সাথে কপিলট হিসাবে কঠোর একীকরণের প্রত্যাশা করুন যা সুরেলা পরামর্শ দেয়, বিন্যাস পূরণ করে বা চাহিদা অনুযায়ী সুর চালিয়ে যায়। নিয়ন্ত্রণের উন্নতির সাথে সাথে, সঙ্গীতজ্ঞরা সম্ভবত সিম্বলিক AI কে একটি ইন্টারেক্টিভ কম্পোজিং পার্টনার হিসাবে বিবেচনা করবে, সিম্বলিক-প্লাস-অডিও পাইপলাইন স্টুডিও-গুণমানের আউটপুটের ব্যবধান পূরণ করবে।

বাস্তব-বিশ্ব বাস্তবায়ন

একজন সুরকার Google মেজেন্টা টুল ব্যবহার করে সুর বা সুরের ধারনা তৈরি করতে তারা তারপর একটি DAW-তে নোট দ্বারা নোট সম্পাদনা করে।

একটি গেম স্টুডিও পদ্ধতিগতভাবে MIDI ব্যাকগ্রাউন্ড মিউজিক তৈরি করে যা গেমপ্লের সাথে খাপ খায় এবং যেকোন ইন্সট্রুমেন্ট সেটের সাথে রেন্ডার করা হয়।

সঙ্গীত-শিক্ষা সফ্টওয়্যার স্বয়ংক্রিয়ভাবে তৈরি করা অনুশীলন অনুশীলন এবং একটি নির্বাচিত কী এবং অসুবিধায় অনুষঙ্গী।

একজন প্রযোজক MuseNet-শৈলীর মডেলগুলি ব্যবহার করে জেনার জুড়ে মাল্টি-ইনস্ট্রুমেন্ট ব্যবস্থার খসড়া তৈরি করে, তারপরে সেগুলিকে পরিমার্জন করে এবং পুনরায় সাজায়৷

ঝুঁকি এবং প্রহরী

সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।

উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।

সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।

2

বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।

3

কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।

4

সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Symbolic Music Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

মিউজিকএলএম হায়ারার্কিক্যাল মিউজিক জেনারেশন

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Symbolic Music Generation?

সিম্বলিক মিউজিক জেনারেশন স্ট্রাকচার্ড স্বরলিপি হিসাবে সঙ্গীত তৈরি করে — নোট, পিচ, সময়কাল এবং সময় (প্রায়শই MIDI হিসাবে) — কাঁচা অডিও হিসাবে নয়। এটি সুরকারদের সম্পাদনাযোগ্য, যন্ত্র-অজ্ঞেয়বাদী আউটপুট দেয় তারা নোট করে নোট টুইক করতে পারে।

প্রতীকী সঙ্গীত প্রজন্ম আসলে কী তৈরি করে?

প্রতীকী সিস্টেমগুলি 'স্কোর' আউটপুট করে — প্রকৃত শব্দের পরিবর্তে পিচ, সময়কাল এবং সময়-এর মতো ইভেন্টগুলি নোট করে।

কাঁচা-অডিও প্রজন্মের উপর প্রতীকী আউটপুটের একটি মূল সুবিধা কী?

যেহেতু আউটপুটটি প্রতীকী স্বরলিপি, তাই প্রতিটি নোট সম্পাদনাযোগ্য এবং একজন মানুষের দ্বারা স্থানান্তরিত, পুনরায় উপকরণ বা সঞ্চালিত হতে পারে।

এর মধ্যে কোনটি OpenAI এর একটি সুপরিচিত প্রতীকী সঙ্গীত মডেল?

MuseNet (2019) অনেক বাদ্যযন্ত্রের শৈলী জুড়ে বহু-যন্ত্রের প্রতীকী রচনা তৈরি করেছে।

আধুনিক প্রতীকী মডেলগুলি সাধারণত সঙ্গীতকে গণনামূলকভাবে কীভাবে আচরণ করে?

প্রতীকী মডেলগুলি নোট ইভেন্টগুলিকে টোকেনাইজ করে (যেমন নোট-অন, নোট-অফ, টাইম-শিফ্ট) এবং পরবর্তী ইভেন্টের পূর্বাভাস দেওয়ার জন্য ট্রান্সফরমারগুলির মতো সিকোয়েন্স মডেলগুলি ব্যবহার করে।

কেন সাংকেতিক মডেলগুলি সাধারণত কাঁচা-অডিও মডেলের চেয়ে দ্রুত প্রশিক্ষণ দেয় এবং উৎপন্ন করে?

একটি সিম্বলিক সিকোয়েন্স লক্ষাধিক অডিও নমুনার তুলনায় অনেক বেশি কমপ্যাক্ট, তাই মডেলগুলি এটিকে আরও দক্ষতার সাথে প্রক্রিয়া করে।