অডিও এআই গাইড

জুকবক্স

Jukebox হল OpenAI-এর 2020 নিউরাল নেটওয়ার্ক যা কাঁচা মিউজিক অডিও তৈরি করে — গানের কণ্ঠ, যন্ত্র এবং এমনকি নির্দিষ্ট শিল্পীদের শৈলীতে গানের সাথে সম্পূর্ণ।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.

গভীর ডুব

এপ্রিল 2020-এ OpenAI দ্বারা প্রকাশিত, জুকবক্স প্রতীকী নোটের পরিবর্তে কাঁচা অডিও হিসাবে সঙ্গীত তৈরি করে, যার অর্থ এটি ভোকাল সহ প্রকৃত শব্দ তৈরি করে। এটি ওয়েব থেকে স্ক্র্যাপ করা প্রায় 1.2 মিলিয়ন গানের (প্রায় অর্ধেক ইংরেজি-ভাষা) উপর প্রশিক্ষিত ছিল, লিরিকউইকি থেকে গানের কথা এবং মেটাডেটার সাথে যুক্ত। আপনি এটিকে একটি ধারা, একটি শিল্পীর শৈলী এবং গানের উপর শর্ত দিতে পারেন এবং এটি সেই শিল্পীর মতো স্বীকৃতভাবে (যদি অস্পষ্টভাবে) গাইবে। আউটপুট কয়েক মিনিট দীর্ঘ চালানো হয়. ক্যাচটি হল গতি এবং বিশ্বস্ততা: প্রজন্ম অত্যন্ত ধীর ছিল, এক মিনিটের অডিও রেন্ডার করতে প্রায় নয় ঘন্টা সময় লেগেছিল এবং ফলাফলগুলি একটি অস্পষ্ট, কোলাহলপূর্ণ গুণমান। জুকবক্স গবেষণা ছিল, একটি পালিশ পণ্য নয়, তবে যা সম্ভব ছিল তার জন্য এটি প্রত্যাশাকে নতুন আকার দিয়েছে।

প্রযুক্তিগত অন্তর্দৃষ্টি

জুকবক্স তিন সময়ের রেজোলিউশনে VQ-VAE অটোএনকোডার ব্যবহার করে কাঁচা অডিও সংকুচিত করে, একটি দীর্ঘ তরঙ্গরূপকে বিচ্ছিন্ন কোডগুলির একটি অনেক ছোট ক্রমতে পরিণত করে। অটোরিগ্রেসিভ ট্রান্সফর্মাররা তারপরে এই কোডগুলিকে একবারে ভবিষ্যদ্বাণী করে, শিল্পী, জেনার এবং গানের উপর শর্তযুক্ত, এবং আপস্যাম্পলারগুলি উচ্চ-ফ্রিকোয়েন্সি বিশদ যুক্ত করে। নীচের-স্তরের কোডগুলিকে 44.1 kHz ওয়েভফর্মে ডিকোড করা যা প্রজন্মকে এত ধীর করে তোলে, কারণ লক্ষ লক্ষ অডিও নমুনা অবশ্যই ক্রমানুসারে তৈরি করতে হবে।

কৌশলগত প্রভাব

অ্যাক্সেস এবং পৌঁছানো

এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।

খরচ ও বাজেট

মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।

গতি এবং স্কেল

গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।

জুকবক্সের ভবিষ্যত

জুকবক্স নিজেই এখন মূলত একটি ঐতিহাসিক মাইলফলক, সুনো এবং ইউডিওর মতো দ্রুত বিস্তৃতি এবং সুপ্ত-অডিও মডেলগুলি যা সেকেন্ডের মধ্যে কাছাকাছি-সিডি-মানের গান তৈরি করে। এর মূল ধারনাগুলি — বিচ্ছিন্ন অডিও টোকেন এবং লিরিক্সের কন্ডিশনিং — আধুনিক সিস্টেমে লাইভ। ভবিষ্যত কাঁচা-অডিও মডেলগুলি প্রজন্মের সময় সঙ্কুচিত রাখতে, কণ্ঠস্বরকে তীক্ষ্ণ করতে এবং সূক্ষ্ম নিয়ন্ত্রণগুলি যোগ করার আশা করুন, যখন কপিরাইটযুক্ত রেকর্ডিংগুলির প্রশিক্ষণ সম্পর্কে জুকবক্স প্রথম উত্থাপিত কপিরাইট প্রশ্নগুলি কেবল জোরে বাড়তে থাকে৷

বাস্তব-বিশ্ব বাস্তবায়ন

গবেষকরা অধ্যয়ন করছেন কিভাবে নিউরাল নেটওয়ার্কগুলি দীর্ঘ-ফর্মের কাঁচা অডিও এবং গানের কণ্ঠের মডেল করতে পারে, একটি রেফারেন্স আর্কিটেকচার হিসাবে Jukebox ব্যবহার করে৷

মিউজিশিয়ান এবং শৌখিন ব্যক্তিরা উদ্ভট, লো-ফাই 'এআই কভার' তৈরি করছেন যা একজন নির্বাচিত শিল্পীর রুক্ষ শৈলীতে নতুন গান গায়।

MIDI-শৈলী নোট জেনারেশন থেকে কণ্ঠের সাথে সম্পূর্ণ কাঁচা-অডিও সংশ্লেষণে লাফ দেখান শিক্ষকরা।

সাউন্ড ডিজাইনার এবং পরীক্ষামূলক শিল্পীরা রিমিক্সিং এবং কোলাজের কাঁচামাল হিসেবে জুকবক্সের ঝাপসা, স্বপ্নের মতো টেক্সচার সংগ্রহ করছেন।

ঝুঁকি এবং প্রহরী

সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।

উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।

সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।

2

বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।

3

কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।

4

সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

প্রতীকী সঙ্গীত প্রজন্ম

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Jukebox?

Jukebox হল OpenAI-এর 2020 নিউরাল নেটওয়ার্ক যা কাঁচা মিউজিক অডিও তৈরি করে — গানের কণ্ঠ, যন্ত্র এবং এমনকি নির্দিষ্ট শিল্পীদের শৈলীতে গানের সাথে সম্পূর্ণ। এটি একটি যুগান্তকারী প্রমাণ ছিল যে AI গান-দৈর্ঘ্য সঙ্গীতের প্রকৃত তরঙ্গরূপ মডেল করতে পারে, শুধু নোট নয়।

কি জুকবক্সকে আগের সিম্বলিক মিউজিক এআই থেকে আলাদা করে তোলে যেমন সিস্টেম যা MIDI আউটপুট করে?

জুকবক্স মিউজিকের প্রকৃত শব্দকে কাঁচা অডিও হিসাবে মডেল করে, তাই এটি কণ্ঠ এবং যন্ত্রের টিমব্রেস তৈরি করতে পারে, প্রতীকী সিস্টেমের বিপরীতে যা শুধুমাত্র ডেটা নোট করে।

জুকবক্স কে মুক্তি দিয়েছে এবং মোটামুটি কখন?

OpenAI ভোকাল সহ সঙ্গীত তৈরির জন্য একটি গবেষণা মডেল হিসাবে 2020 সালের এপ্রিলে Jukebox প্রকাশ করেছে।

Jukebox এর একটি প্রধান ব্যবহারিক সীমাবদ্ধতা কি ছিল?

যেহেতু এটি নমুনা দ্বারা কাঁচা অডিও নমুনাকে ডিকোড করে, জুকবক্স এক মিনিটের সঙ্গীত তৈরি করতে নয় ঘন্টার অর্ডার নেয়, এটিকে রিয়েল-টাইম ব্যবহারের জন্য অবাস্তব করে তোলে।

জুকবক্স তার ট্রান্সফরমারগুলির জন্য দীর্ঘ কাঁচা অডিও পরিচালনাযোগ্য করতে কোন মূল কৌশল ব্যবহার করে?

জুকবক্স ওয়েভফর্মকে আলাদা টোকেনে সংকুচিত করতে VQ-VAE অটোএনকোডার ব্যবহার করে, যা ট্রান্সফরমার অডিওতে ফিরে আসার আগে অটোরিগ্রেসিভভাবে মডেল করে।

আপনি Jukebox এর আউটপুট কি শর্ত দিতে পারেন?

জুকবক্স একটি ধারা, অনুকরণ করার জন্য একজন শিল্পী এবং গান গ্রহণ করে এবং সেই শৈলীতে সেই শব্দগুলি গাওয়ার চেষ্টা করবে।