জুকবক্স
Jukebox হল OpenAI-এর 2020 নিউরাল নেটওয়ার্ক যা কাঁচা মিউজিক অডিও তৈরি করে — গানের কণ্ঠ, যন্ত্র এবং এমনকি নির্দিষ্ট শিল্পীদের শৈলীতে গানের সাথে সম্পূর্ণ।
ওভারভিউ
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
গভীর ডুব
এপ্রিল 2020-এ OpenAI দ্বারা প্রকাশিত, জুকবক্স প্রতীকী নোটের পরিবর্তে কাঁচা অডিও হিসাবে সঙ্গীত তৈরি করে, যার অর্থ এটি ভোকাল সহ প্রকৃত শব্দ তৈরি করে। এটি ওয়েব থেকে স্ক্র্যাপ করা প্রায় 1.2 মিলিয়ন গানের (প্রায় অর্ধেক ইংরেজি-ভাষা) উপর প্রশিক্ষিত ছিল, লিরিকউইকি থেকে গানের কথা এবং মেটাডেটার সাথে যুক্ত। আপনি এটিকে একটি ধারা, একটি শিল্পীর শৈলী এবং গানের উপর শর্ত দিতে পারেন এবং এটি সেই শিল্পীর মতো স্বীকৃতভাবে (যদি অস্পষ্টভাবে) গাইবে। আউটপুট কয়েক মিনিট দীর্ঘ চালানো হয়. ক্যাচটি হল গতি এবং বিশ্বস্ততা: প্রজন্ম অত্যন্ত ধীর ছিল, এক মিনিটের অডিও রেন্ডার করতে প্রায় নয় ঘন্টা সময় লেগেছিল এবং ফলাফলগুলি একটি অস্পষ্ট, কোলাহলপূর্ণ গুণমান। জুকবক্স গবেষণা ছিল, একটি পালিশ পণ্য নয়, তবে যা সম্ভব ছিল তার জন্য এটি প্রত্যাশাকে নতুন আকার দিয়েছে।
প্রযুক্তিগত অন্তর্দৃষ্টি
জুকবক্স তিন সময়ের রেজোলিউশনে VQ-VAE অটোএনকোডার ব্যবহার করে কাঁচা অডিও সংকুচিত করে, একটি দীর্ঘ তরঙ্গরূপকে বিচ্ছিন্ন কোডগুলির একটি অনেক ছোট ক্রমতে পরিণত করে। অটোরিগ্রেসিভ ট্রান্সফর্মাররা তারপরে এই কোডগুলিকে একবারে ভবিষ্যদ্বাণী করে, শিল্পী, জেনার এবং গানের উপর শর্তযুক্ত, এবং আপস্যাম্পলারগুলি উচ্চ-ফ্রিকোয়েন্সি বিশদ যুক্ত করে। নীচের-স্তরের কোডগুলিকে 44.1 kHz ওয়েভফর্মে ডিকোড করা যা প্রজন্মকে এত ধীর করে তোলে, কারণ লক্ষ লক্ষ অডিও নমুনা অবশ্যই ক্রমানুসারে তৈরি করতে হবে।
কৌশলগত প্রভাব
অ্যাক্সেস এবং পৌঁছানো
এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।
খরচ ও বাজেট
মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।
গতি এবং স্কেল
গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।
জুকবক্সের ভবিষ্যত
জুকবক্স নিজেই এখন মূলত একটি ঐতিহাসিক মাইলফলক, সুনো এবং ইউডিওর মতো দ্রুত বিস্তৃতি এবং সুপ্ত-অডিও মডেলগুলি যা সেকেন্ডের মধ্যে কাছাকাছি-সিডি-মানের গান তৈরি করে। এর মূল ধারনাগুলি — বিচ্ছিন্ন অডিও টোকেন এবং লিরিক্সের কন্ডিশনিং — আধুনিক সিস্টেমে লাইভ। ভবিষ্যত কাঁচা-অডিও মডেলগুলি প্রজন্মের সময় সঙ্কুচিত রাখতে, কণ্ঠস্বরকে তীক্ষ্ণ করতে এবং সূক্ষ্ম নিয়ন্ত্রণগুলি যোগ করার আশা করুন, যখন কপিরাইটযুক্ত রেকর্ডিংগুলির প্রশিক্ষণ সম্পর্কে জুকবক্স প্রথম উত্থাপিত কপিরাইট প্রশ্নগুলি কেবল জোরে বাড়তে থাকে৷
বাস্তব-বিশ্ব বাস্তবায়ন
গবেষকরা অধ্যয়ন করছেন কিভাবে নিউরাল নেটওয়ার্কগুলি দীর্ঘ-ফর্মের কাঁচা অডিও এবং গানের কণ্ঠের মডেল করতে পারে, একটি রেফারেন্স আর্কিটেকচার হিসাবে Jukebox ব্যবহার করে৷
মিউজিশিয়ান এবং শৌখিন ব্যক্তিরা উদ্ভট, লো-ফাই 'এআই কভার' তৈরি করছেন যা একজন নির্বাচিত শিল্পীর রুক্ষ শৈলীতে নতুন গান গায়।
MIDI-শৈলী নোট জেনারেশন থেকে কণ্ঠের সাথে সম্পূর্ণ কাঁচা-অডিও সংশ্লেষণে লাফ দেখান শিক্ষকরা।
সাউন্ড ডিজাইনার এবং পরীক্ষামূলক শিল্পীরা রিমিক্সিং এবং কোলাজের কাঁচামাল হিসেবে জুকবক্সের ঝাপসা, স্বপ্নের মতো টেক্সচার সংগ্রহ করছেন।
ঝুঁকি এবং প্রহরী
সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।
উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।
সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।
বাস্তবায়ন রোডম্যাপ
ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।
বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।
কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।
সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
প্রতীকী সঙ্গীত প্রজন্ম
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Jukebox?
Jukebox হল OpenAI-এর 2020 নিউরাল নেটওয়ার্ক যা কাঁচা মিউজিক অডিও তৈরি করে — গানের কণ্ঠ, যন্ত্র এবং এমনকি নির্দিষ্ট শিল্পীদের শৈলীতে গানের সাথে সম্পূর্ণ। এটি একটি যুগান্তকারী প্রমাণ ছিল যে AI গান-দৈর্ঘ্য সঙ্গীতের প্রকৃত তরঙ্গরূপ মডেল করতে পারে, শুধু নোট নয়।
কি জুকবক্সকে আগের সিম্বলিক মিউজিক এআই থেকে আলাদা করে তোলে যেমন সিস্টেম যা MIDI আউটপুট করে?
জুকবক্স মিউজিকের প্রকৃত শব্দকে কাঁচা অডিও হিসাবে মডেল করে, তাই এটি কণ্ঠ এবং যন্ত্রের টিমব্রেস তৈরি করতে পারে, প্রতীকী সিস্টেমের বিপরীতে যা শুধুমাত্র ডেটা নোট করে।
জুকবক্স কে মুক্তি দিয়েছে এবং মোটামুটি কখন?
OpenAI ভোকাল সহ সঙ্গীত তৈরির জন্য একটি গবেষণা মডেল হিসাবে 2020 সালের এপ্রিলে Jukebox প্রকাশ করেছে।
Jukebox এর একটি প্রধান ব্যবহারিক সীমাবদ্ধতা কি ছিল?
যেহেতু এটি নমুনা দ্বারা কাঁচা অডিও নমুনাকে ডিকোড করে, জুকবক্স এক মিনিটের সঙ্গীত তৈরি করতে নয় ঘন্টার অর্ডার নেয়, এটিকে রিয়েল-টাইম ব্যবহারের জন্য অবাস্তব করে তোলে।
জুকবক্স তার ট্রান্সফরমারগুলির জন্য দীর্ঘ কাঁচা অডিও পরিচালনাযোগ্য করতে কোন মূল কৌশল ব্যবহার করে?
জুকবক্স ওয়েভফর্মকে আলাদা টোকেনে সংকুচিত করতে VQ-VAE অটোএনকোডার ব্যবহার করে, যা ট্রান্সফরমার অডিওতে ফিরে আসার আগে অটোরিগ্রেসিভভাবে মডেল করে।
আপনি Jukebox এর আউটপুট কি শর্ত দিতে পারেন?
জুকবক্স একটি ধারা, অনুকরণ করার জন্য একজন শিল্পী এবং গান গ্রহণ করে এবং সেই শৈলীতে সেই শব্দগুলি গাওয়ার চেষ্টা করবে।