অডিও এআই গাইড

HiFi-GAN এবং GAN Vocoders

HiFi-GAN হল একটি জেনারেটিভ-অ্যাডভারসারিয়াল ভোকোডার যা একটি মেল-স্পেকট্রোগ্রামকে প্রায় সঙ্গে সঙ্গে একটি কাঁচা অডিও ওয়েভফর্মে পরিণত করে, স্টুডিও-মানের স্পিচ রিয়েল টাইমের চেয়ে অনেক দ্রুত তৈরি করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It became the standard final stage of modern text-to-speech because it is fast, lightweight, and hard to distinguish from real recordings.

গভীর ডুব

একটি ভোকোডার হল বেশিরভাগ TTS পাইপলাইনের শেষ ধাপ: Tacotron বা FastSpeech এর মত একটি মডেল একটি mel-spectrogram (সময়ের সাথে সাথে ফ্রিকোয়েন্সির একটি কম্প্যাক্ট ছবি) ভবিষ্যদ্বাণী করে এবং ভোকোডার প্রকৃত তরঙ্গরূপের নমুনাগুলি পূরণ করে। WaveNet-এর মতো প্রারম্ভিক নিউরাল ভোকোডারগুলি দুর্দান্ত শোনাত কিন্তু অডিও নমুনা-বাই-নমুনা তৈরি করে, যা তাদের বেদনাদায়কভাবে ধীর করে তোলে। HiFi-GAN, 2020 সালে Kong, Kim, এবং Bae দ্বারা প্রকাশিত, সেই অটোরিগ্রেসিভ লুপটিকে প্রতিপক্ষভাবে প্রশিক্ষিত একটি একক ফিড-ফরোয়ার্ড জেনারেটর দিয়ে প্রতিস্থাপন করেছে। এর মূল কৌশলটি একাধিক বৈষম্যকারী ব্যবহার করছে যা অডিওকে বিভিন্ন স্কেলে এবং বিভিন্ন পর্যায়ক্রমিক প্যাটার্নে বিচার করে, জেনারেটরকে সূক্ষ্ম টেক্সচার এবং পিচ পর্যায়ক্রম উভয়ই সঠিক পেতে বাধ্য করে। ফলাফল হল 22 kHz স্পিচ সংশ্লেষিত একটি GPU-তে রিয়েল টাইমের চেয়ে শতগুণ দ্রুত, গুণমানের প্রতিদ্বন্দ্বী গ্রাউন্ড-ট্রুথ অডিও সহ।

প্রযুক্তিগত অন্তর্দৃষ্টি

HiFi-GAN-এর জেনারেটর ট্রান্সপোজড কনভোলিউশনের মাধ্যমে মেল-স্পেকট্রোগ্রামের নমুনা তৈরি করে, স্ট্যাক করা মাল্টি-রিসেপ্টিভ ফিল্ড ব্লকের সাথে যা বিভিন্ন কার্নেলের আকার এবং বিস্তৃতি মিশ্রিত করে বৈচিত্র্যময় তরঙ্গের ধরণগুলি ক্যাপচার করতে। দুটি বৈষম্যকারী পরিবার পুলিশিং করে: একটি মাল্টি-পিরিয়ড ডিসক্রিমিনেটর পিচ পিরিয়ডিসিটি ধরার জন্য 2, 3, 5, 7, 11-এর মতো প্রাইমগুলিতে 1D সিগন্যালকে 2D গ্রিডে পরিবর্তন করে এবং একটি মাল্টি-স্কেল ডিসক্রিমিনেটর বেশ কয়েকটি নিম্ন নমুনা রেজোলিউশনে তরঙ্গরূপ পরীক্ষা করে। মেল-স্পেকট্রোগ্রাম এবং বৈশিষ্ট্য-ম্যাচিং ক্ষতি প্রশিক্ষণকে স্থিতিশীল রাখে।

কৌশলগত প্রভাব

অ্যাক্সেস এবং পৌঁছানো

এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।

খরচ ও বাজেট

মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।

গতি এবং স্কেল

গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।

HiFi-GAN এবং GAN Vocoders এর ভবিষ্যত

GAN ভোকোডারগুলি ক্রমাগত ছোট এবং দ্রুততর হচ্ছে: BigVGAN-এর মতো বংশধররা অদেখা গায়ক, যন্ত্র এবং ভাষা জুড়ে সাধারণীকরণের জন্য অ্যান্টি-অ্যালাইজড অ্যাক্টিভেশন যোগ করে, যখন UnivNet এবং Vocos সর্বজনীন, অল-ব্যান্ড সংশ্লেষণের দিকে ঠেলে দেয়। স্ট্রিমিং এবং অন-ডিভাইস ভেরিয়েন্টগুলি এখন কম লেটেন্সি সহকারীর জন্য ফোন এবং ইয়ারবাডের ভিতরে ভোকোডিং চালায়। ক্রমবর্ধমানভাবে, ডিফিউশন এবং ফ্লো-ম্যাচিং অডিও মডেলগুলিকে GAN-স্টাইলের একক-পাস জেনারেটরে পাতিত করা হচ্ছে, যা GAN গতির সাথে ডিফিউশনের বিশ্বস্ততাকে মিশ্রিত করছে। ভোকোডারগুলি সাধারণ-উদ্দেশ্যের নিউরাল অডিও কোডেকগুলিতে বিবর্ণ হয়ে যাবে যা বক্তৃতা এবং সঙ্গীত উভয়কেই শক্তি দেয়।

বাস্তব-বিশ্ব বাস্তবায়ন

ভার্চুয়াল সহকারী এবং নেভিগেশন অ্যাপগুলির কথ্য আউটপুট তৈরি করা যা কোনও শ্রবণযোগ্য বিলম্ব ছাড়াই প্রতিক্রিয়াগুলির প্রয়োজন৷

রিয়েল-টাইম ভয়েস ক্লোনিং এবং ডাবিং সরঞ্জামগুলিকে শক্তিশালী করা যেখানে একটি ক্লোন করা মেল-স্পেকট্রোগ্রাম প্রাকৃতিক-শব্দযুক্ত অডিওতে রেন্ডার করা হয়।

অডিওবুক এবং পডকাস্ট বর্ণনার প্ল্যাটফর্ম ড্রাইভ করা যা দ্রুত এবং সস্তায় ঘন্টার ভাষণের সংশ্লেষ করে।

বিগভিজিএএন-স্টাইল ইউনিভার্সাল ভোকোডারের মাধ্যমে গান-ভয়েস সিন্থেসাইজার এবং মিউজিক ডেমোর অভ্যন্তরে ওয়েভফর্ম স্টেজ হিসাবে পরিবেশন করা।

ঝুঁকি এবং প্রহরী

সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।

উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।

সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।

2

বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।

3

কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।

4

সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the HiFi-GAN and GAN Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

সমান্তরাল ওয়েভগান ভোকোডার

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is HiFi-GAN and GAN Vocoders?

HiFi-GAN হল একটি জেনারেটিভ-অ্যাডভারসারিয়াল ভোকোডার যা একটি মেল-স্পেকট্রোগ্রামকে প্রায় সঙ্গে সঙ্গে একটি কাঁচা অডিও ওয়েভফর্মে পরিণত করে, স্টুডিও-মানের স্পিচ রিয়েল টাইমের চেয়ে অনেক দ্রুত তৈরি করে। এটি আধুনিক টেক্সট-টু-স্পিচের আদর্শ চূড়ান্ত পর্যায়ে পরিণত হয়েছে কারণ এটি দ্রুত, হালকা এবং বাস্তব রেকর্ডিং থেকে আলাদা করা কঠিন।

টেক্সট-টু-স্পিচ পাইপলাইনে হাইফাই-জিএএন-এর মতো ভোকোডারের প্রাথমিক কাজ কী?

একটি ভোকোডার হল চূড়ান্ত পর্যায় যা একটি অ্যাকোস্টিক মডেল দ্বারা উত্পাদিত মেল-স্পেকট্রোগ্রাম থেকে প্রকৃত তরঙ্গরূপের নমুনাগুলিকে সংশ্লেষ করে।

কেন HiFi-GAN আগের WaveNet ভোকোডারের চেয়ে অনেক দ্রুত?

WaveNet অডিও নমুনা-বাই-নমুনা তৈরি করেছে (স্বয়ংক্রিয়ভাবে), যখন HiFi-GAN-এর ফিড-ফরোয়ার্ড জেনারেটর একটি শটে তরঙ্গরূপ আউটপুট করে, বাস্তব সময়ের চেয়ে অনেক দ্রুত গতি অর্জন করে।

HiFi-GAN এর মাল্টি-পিরিয়ড ডিসক্রিমিনেটর বিশেষভাবে কী ক্যাপচার করতে সাহায্য করে?

মাল্টি-পিরিয়ড ডিসক্রিমিনেটর পিচের সাথে বাঁধা পর্যায়ক্রমিক কাঠামো সনাক্ত করতে প্রাইম-সংখ্যাযুক্ত পিরিয়ডগুলি ব্যবহার করে 1D তরঙ্গরূপকে 2D তে পুনরায় আকার দেয়।

GAN ভোকোডারদের 'প্রতিপক্ষভাবে' প্রশিক্ষণ দেওয়া হয়। যে এখানে মানে কি?

একটি GAN সেটআপে, জেনারেটর সিন্থেটিক অডিও থেকে বাস্তব বলার জন্য প্রশিক্ষিত বৈষম্যকারী নেটওয়ার্কগুলিকে বোকা বানানোর জন্য যথেষ্ট বাস্তবসম্মত তরঙ্গরূপ তৈরি করতে শেখে।

পরবর্তীতে কোন ভোকোডার HiFi-GAN কে অদেখা কণ্ঠ, গান এবং যন্ত্রের জন্য সাধারণীকরণের জন্য প্রসারিত করে?

BigVGAN HiFi-GAN স্কেল আপ করে এবং অ্যান্টি-অ্যালাইজড পর্যায়ক্রমিক অ্যাক্টিভেশন যোগ করে, গান এবং যন্ত্রের মতো বিতরণের বাইরের অডিওতে সাধারণীকরণ উন্নত করে।