সোর্স-ফিল্টার ভোকোডিং এবং ওয়ার্ল্ড
একটি ভোকোডার হল এমন একটি টুল যা বক্তৃতাকে এর বিল্ডিং ব্লকগুলিতে আলাদা করে নিয়ে যায় এবং এটি পুনর্নির্মাণ করে।
ওভারভিউ
The source-filter model and the WORLD vocoder are classic methods that power text-to-speech and voice conversion by separating what your vocal cords do from what your mouth shapes.
গভীর ডুব
সোর্স-ফিল্টার মডেলটি বক্তৃতাকে দুটি টুকরো একসাথে কাজ করে বলে বর্ণনা করে: একটি উত্স (কণ্ঠস্বরের জন্য আপনার কম্পিত ভোকাল কর্ডের গুঞ্জন, বা ফিসফিস এবং ব্যঞ্জনধ্বনির জন্য সশব্দ বাতাস) একটি ফিল্টার (আপনার গলা, মুখ এবং নাকের অনুরণিত আকার) এর মধ্য দিয়ে যায়। একটি ভোকোডার এই টুকরোগুলি অনুমান করার জন্য রেকর্ড করা অডিও বিশ্লেষণ করে, তারপর সেগুলি থেকে নতুন অডিও সংশ্লেষ করে। 2016 সালের দিকে Masanori Morise দ্বারা প্রকাশিত WORLD হল একটি উচ্চ-মানের ভোকোডার যা তিনটি পরামিতি বের করে: F0 (উৎসটির পিচ কনট্যুর), বর্ণালী খাম (ফিল্টার, এর CheapTrick অ্যালগরিদমের মাধ্যমে), এবং অ্যাপিরিওডিসিটি (কতটা শব্দ বনাম PLATINUM, টোন)। এই তিনটি স্ট্রীম স্বাধীনভাবে পরিবর্তিত হতে পারে তারপর পুনরায় সংশ্লেষিত হতে পারে, বিশ্বকে প্যারামেট্রিক টিটিএস এবং গানের ভয়েস সিস্টেমের জন্য একটি ওয়ার্কহরস করে তোলে।
প্রযুক্তিগত অন্তর্দৃষ্টি
বিশ্বের শক্তি পরিষ্কার বিচ্ছেদ থেকে আসে. CheapTrick একটি মসৃণ বর্ণালী খামের অনুমান করে যা ছোট F0 ত্রুটিগুলির জন্য শক্তিশালী, যখন DIO/Harvest ট্র্যাক পিচ এবং D4C ব্যান্ড অ্যাপিরিওডিসিটি পরিমাপ করে৷ যেহেতু পিচ, টিমব্রে, এবং কোলাহল পৃথক প্যারামিটার স্ট্রীমে বাস করে, আপনি কার ভয়েসের মতো শোনাচ্ছে তা পরিবর্তন না করেই F0 কে একটি অষ্টভের উপরে স্থানান্তর করতে পারেন বা পিচ পরিবর্তন না করে সময়কাল প্রসারিত করতে পারেন। WaveNet-এর মতো নিউরাল ভোকোডারগুলি পরে তরঙ্গরূপকে সরাসরি মডেল করেছিল, কিন্তু বিশ্ব দ্রুত, ব্যাখ্যাযোগ্য এবং লাইসেন্স-মুক্ত থাকে।
কৌশলগত প্রভাব
অ্যাক্সেস এবং পৌঁছানো
এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।
খরচ ও বাজেট
মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।
গতি এবং স্কেল
গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।
সোর্স-ফিল্টার ভোকোডিং এবং ওয়ার্ল্ডের ভবিষ্যত
বিশুদ্ধ সিগন্যাল-প্রসেসিং ভোকোডারগুলি স্নায়বিক ভোকোডার (HiFi-GAN, WaveRNN) দ্বারা টপ-এন্ড স্বাভাবিকতার জন্য অনেকাংশে ছাড়িয়ে গেছে, কিন্তু ওয়ার্ল্ড অদৃশ্য হয়ে যায়নি। এটি ভয়েস-কনভার্সন পাইপলাইন, সিঙ্গিং সিন্থেসাইজার এবং রিসার্চ বেসলাইনের ভিতরে একটি দ্রুত, CPU-বান্ধব ফ্রন্ট এন্ড হিসাবে টিকে আছে এবং এর F0-প্লাস-স্পেকট্রাল-এনভেলপ বৈশিষ্ট্যগুলি এখনও অনেক নিউরাল মডেলকে খাওয়ায়। হাইব্রিড সিস্টেমগুলি আশা করুন যেখানে বিশ্ব-শৈলীর ব্যাখ্যাযোগ্য প্যারামিটারগুলি নিউরাল ডিকোডারগুলিকে গাইড করে, বাস্তববাদকে বলিদান ছাড়াই স্রষ্টাদের পিচ এবং কাঠের উপর সুনির্দিষ্ট নিয়ন্ত্রণ দেয়৷
বাস্তব-বিশ্ব বাস্তবায়ন
ভয়েস কনভার্সন টুল যা বক্তৃতাকে বোধগম্য রাখার সময় স্পিকারের পিচ এবং টিম্বার পরিবর্তন করে
গানের ভয়েস সিন্থেসাইজার (যেমন UTAU/NNSVS ইকোসিস্টেম) যা নতুন পিচে নোটগুলিকে পুনরায় সংশ্লেষিত করে
প্যারামেট্রিক টেক্সট-টু-স্পিচ সিস্টেম যা ভোকোডিংয়ের আগে F0, বর্ণালী এবং অ্যাপিরিওডিসিটি স্ট্রিম তৈরি করে
পিচ শিফটিং, টাইম স্ট্রেচিং, এবং প্রসোডি এডিটিং এর জন্য স্পিচ রিসার্চ বেসলাইন
ঝুঁকি এবং প্রহরী
সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।
উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।
সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।
বাস্তবায়ন রোডম্যাপ
ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।
বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।
কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।
সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Source-Filter Vocoding and WORLD quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
Demucs সঙ্গীত উৎস বিচ্ছেদ
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Source-Filter Vocoding and WORLD?
একটি ভোকোডার হল এমন একটি টুল যা বক্তৃতাকে এর বিল্ডিং ব্লকগুলিতে আলাদা করে নিয়ে যায় এবং এটি পুনর্নির্মাণ করে। সোর্স-ফিল্টার মডেল এবং ওয়ার্ল্ড ভোকোডার হল ক্লাসিক পদ্ধতি যা আপনার মুখের আকৃতি থেকে আপনার ভোকাল কর্ডগুলি যা করে তা আলাদা করে টেক্সট-টু-স্পিচ এবং ভয়েস রূপান্তরকে শক্তি দেয়।
বক্তৃতার উৎস-ফিল্টার মডেলে, 'ফিল্টার' কী প্রতিনিধিত্ব করে?
ফিল্টার হল ভোকাল ট্র্যাক্টের অনুরণন — গলা, মুখ এবং নাকের আকৃতি যা শব্দকে রঙিন করে। উৎস হল ভোকাল-কর্ড বাজ বা সশব্দ বায়ুপ্রবাহ।
ওয়ার্ল্ড ভোকোডার স্পিচ থেকে কোন তিনটি প্যারামিটার বের করে?
ওয়ার্ল্ড বক্তৃতাকে ফান্ডামেন্টাল ফ্রিকোয়েন্সি (F0), বর্ণালী খাম (টিমব্রে/ফিল্টার) এবং অ্যাপিরিওডিসিটি (গোলমাল বনাম টোন ভারসাম্য) এ বিভক্ত করে।
বর্ণালী খামের অনুমান করার জন্য ওয়ার্ল্ডের অ্যালগরিদমের নাম কী?
CheapTrick একটি মসৃণ বর্ণালী খামের অনুমান করে যা পিচ অনুমানের ছোট ত্রুটির জন্য শক্তিশালী।
বর্ণালী খাম থেকে পিচ আলাদা করা কেন দরকারী?
যেহেতু পিচ (F0) এবং টিমব্রে (বর্ণালী খাম) স্বাধীন স্ট্রীম, আপনি স্পিকারের পরিচয় সংরক্ষণ করার সময় পিচ বাড়াতে বা কম করতে পারেন।
হাইফাই-জিএএন-এর মতো নিউরাল ভোকোডারের সাথে বিশ্ব কীভাবে তুলনা করে?
ওয়ার্ল্ড একটি সিগন্যাল-প্রসেসিং ভোকোডার: দ্রুত, ব্যাখ্যাযোগ্য এবং CPU-বান্ধব। নিউরাল ভোকোডারগুলি সাধারণত উচ্চতর স্বাভাবিকতা অর্জন করে তবে ভারী হয়।