অডিও এআই গাইড

মিউজিকএলএম: হায়ারার্কিক্যাল সিমেন্টিক এবং অ্যাকোস্টিক টোকেন

মিউজিকএলএম হল Google-এর টেক্সট-টু-মিউজিক মডেল যা মিউজিক্যাল স্ট্রাকচারের জন্য শব্দার্থিক টোকেন এবং শব্দের বিশদ বিবরণের জন্য অ্যাকোস্টিক টোকেনগুলির একটি শ্রেণিবিন্যাসের মাধ্যমে দীর্ঘ-ফর্মের অডিও তৈরি করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

গভীর ডুব

2023 সালের প্রথম দিকে Google গবেষণার দ্বারা ঘোষিত, MusicLM মিউজিক জেনারেশনকে বিচ্ছিন্ন অডিও টোকেনগুলির পূর্বাভাস দেওয়ার ক্রম হিসাবে ফ্রেম করে, অনেকটা ভাষা মডেল শব্দের ভবিষ্যদ্বাণী করে। এটি উপস্থাপনাগুলির একটি শ্রেণিবিন্যাস ব্যবহার করে: শব্দার্থিক টোকেনগুলি (w2v-BERT নামক একটি মডেল থেকে) দীর্ঘ স্প্যানে সুর এবং তালের মতো উচ্চ-স্তরের কাঠামো ক্যাপচার করে, যখন অ্যাকোস্টিক টোকেনগুলি (সাউন্ডস্ট্রিম নিউরাল কোডেক থেকে) কাঠ এবং টেক্সচারের মতো সূক্ষ্ম বিবরণ ক্যাপচার করে। একটি প্রথম পর্যায় টেক্সট প্রম্পট থেকে শব্দার্থিক টোকেন তৈরি করে, তারপরের পর্যায়গুলি সেই শব্দার্থবিদ্যার উপর শর্তযুক্ত অ্যাকোস্টিক বিস্তারিত পূরণ করে। টেক্সট কন্ডিশনিং MuLM/MuLan থেকে আসে, একটি যৌথ মিউজিক-টেক্সট এমবেডিং প্রশিক্ষিত তাই বর্ণনা এবং অডিও একই জায়গায় ল্যান্ড করে। এই স্টেজড অ্যাপ্রোচ মিউজিকএলএমকে কয়েক সেকেন্ডের পরে প্রবাহিত হওয়ার পরিবর্তে মিনিটের মধ্যে মিউজিকভাবে সামঞ্জস্যপূর্ণ থাকতে দেয়।

প্রযুক্তিগত অন্তর্দৃষ্টি

মূল ধারণা হল একটি টোকেন শ্রেণিবিন্যাস জুড়ে টেক্সচার থেকে গঠনকে ডিকপলিং করা। মোটা শব্দার্থিক টোকেনগুলি বিক্ষিপ্ত এবং ধীর-পরিবর্তনশীল, তাই একটি ট্রান্সফরমার একটি বিশাল ক্রম দৈর্ঘ্য ছাড়াই দীর্ঘমেয়াদী ফর্ম মডেল করতে পারে। অ্যাকোস্টিক টোকেনগুলি ঘন এবং উচ্চ-হারের হয়, তবে তাদের শুধুমাত্র পূর্বাভাস দেওয়া প্রয়োজন আগে থেকেই নির্ধারিত শব্দার্থবিদ্যার উপর শর্তযুক্ত, প্রতিটি পর্যায়কে ট্র্যাক্টেবল করে তোলে। সাউন্ডস্ট্রিমের অবশিষ্ট ভেক্টর কোয়ান্টাইজেশন স্তরযুক্ত অ্যাকোস্টিক কোডগুলি তৈরি করে যা একটি চূড়ান্ত ডিকোডার 24 kHz তরঙ্গরূপে পরিণত হয়।

কৌশলগত প্রভাব

অ্যাক্সেস এবং পৌঁছানো

এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।

খরচ ও বাজেট

মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।

গতি এবং স্কেল

গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।

মিউজিকএলএম-এর ভবিষ্যত: হায়ারার্কিক্যাল সিমেন্টিক এবং অ্যাকোস্টিক টোকেন

মিউজিকএলএম-এর অনুক্রমিক টোকেন পদ্ধতিটি মিউজিকজেন এবং বাণিজ্যিক সঙ্গীত সরঞ্জামগুলির মতো পরবর্তী সিস্টেমগুলির জন্য একটি টেমপ্লেট হয়ে উঠেছে। আরও টাইট মেলোডি কন্ডিশনার আশা করুন (হুম একটি সুর, একটি সম্পূর্ণ ব্যবস্থা পান), শ্লোক এবং কোরাস সহ দীর্ঘ সম্পূর্ণ-গঠিত গান, এবং যন্ত্র এবং কীগুলির উপর আরও ভাল নিয়ন্ত্রণযোগ্যতা। কণ্টকাঠিন্য বিষয়গুলি হল আইনি এবং নৈতিক: প্রশিক্ষণ ডেটা লাইসেন্সিং, শিল্পীর সম্মতি, এবং ওয়াটারমার্কিং জেনারেটেড অডিও যাতে এটি মানবসৃষ্ট সঙ্গীত থেকে আলাদা করা যায় এখন স্থাপনার কেন্দ্রবিন্দু।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি লিখিত দৃশ্যের বর্ণনাকে একটি ফিল্ম বা ট্রেলার স্কোরে পরিণত করা, যেমন গায়কদলের সাথে 'মহাকাব্য অর্কেস্ট্রাল নির্মাণ'

চিত্রের ক্যাপশনে শর্তযুক্ত ব্যাকগ্রাউন্ড মিউজিক তৈরি করা বা এমনকি আর্ট ইনস্টলেশনের জন্য পেইন্টিং বর্ণনা

একটি সম্পূর্ণ যন্ত্রযুক্ত বিন্যাসে একটি সংক্ষিপ্ত গুনগুন করা বা হুইসেল করা সুর প্রসারিত করা

বিজ্ঞাপন এবং বিষয়বস্তু নির্মাতাদের জন্য বিভিন্ন টেম্পো এবং মেজাজে বৈচিত্র্যময় স্টক-মিউজিক ট্র্যাক তৈরি করা

ঝুঁকি এবং প্রহরী

সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।

উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।

সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।

2

বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।

3

কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।

4

সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

প্রতীকী সঙ্গীত প্রজন্ম

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

মিউজিকএলএম হল Google-এর টেক্সট-টু-মিউজিক মডেল যা মিউজিক্যাল স্ট্রাকচারের জন্য শব্দার্থিক টোকেন এবং শব্দের বিশদ বিবরণের জন্য অ্যাকোস্টিক টোকেনগুলির একটি শ্রেণিবিন্যাসের মাধ্যমে দীর্ঘ-ফর্মের অডিও তৈরি করে।

মিউজিক এলএম কীভাবে সঙ্গীত তৈরির কাজকে মৌলিকভাবে আচরণ করে?

মিউজিক এলএম মিউজিক জেনারেশনকে আলাদা অডিও টোকেনগুলির উপর অটোরিগ্রেসিভ ভবিষ্যদ্বাণী হিসাবে ফ্রেম করে, যেমন একটি ভাষা মডেল শব্দের পূর্বাভাস দেয়।

মিউজিকএলএম-এ শব্দার্থিক টোকেনের ভূমিকা কী?

শব্দার্থিক টোকেন (w2v-BERT থেকে) মোটা, ধীর-পরিবর্তনকারী কাঠামো যেমন দীর্ঘ স্প্যানে সুর এবং তাল ক্যাপচার করে।

কোন উপাদান টিম্বার এবং টেক্সচারের মত সূক্ষ্ম শাব্দিক বিবরণ প্রদান করে?

অ্যাকোস্টিক টোকেনগুলি সাউন্ডস্ট্রিম নিউরাল কোডেক থেকে আসে এবং কাঠ এবং টেক্সচারের মতো সূক্ষ্ম বিবরণ এনকোড করে।

মিউজিক্যাল অডিওতে কিভাবে মিউজিকএলএম একটি টেক্সট প্রম্পট সংযোগ করে?

মুলানকে প্রশিক্ষিত করা হয় যাতে পাঠ্য বর্ণনা এবং অডিও মানচিত্রকে একটি শেয়ার্ড এম্বেডিং স্পেসে কাছাকাছি পয়েন্টে মেলে, টেক্সট কন্ডিশনিং সক্ষম করে।

কেন অনুক্রমিক, মঞ্চস্থ নকশা দীর্ঘ-পরিসীমা কাঠামোর সাথে সাহায্য করে?

বিক্ষিপ্ত শব্দার্থিক টোকেনগুলি ধীরে ধীরে পরিবর্তিত হয়, তাই একটি ট্রান্সফরমার ঘন অ্যাকোস্টিক বিশদ পূরণ করার আগে দীর্ঘমেয়াদী ফর্ম দক্ষতার সাথে মডেল করতে পারে।