অডিও এআই গাইড

VALL-E এবং কোডেক ভাষার মডেল

VALL-E অডিও কোডেক টোকেনগুলির উপর একটি ভাষা মডেলিং সমস্যা হিসাবে টেক্সট-টু-স্পীচ রিফ্রেম করেছে, একটি নমুনার মাত্র তিন সেকেন্ড থেকে ভয়েস ক্লোনিং সক্ষম করে৷

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

গভীর ডুব

2023 সালের গোড়ার দিকে Microsoft দ্বারা ঘোষিত, VALL-E ভাষা মডেলিংয়ের মতো বক্তৃতা সংশ্লেষণকে বিবেচনা করে। একটি স্পেকট্রোগ্রাম ভবিষ্যদ্বাণী করার পরিবর্তে, এটি একটি নিউরাল কোডেক (এনকোডেক) এর বিচ্ছিন্ন অ্যাকোস্টিক টোকেনগুলির ভবিষ্যদ্বাণী করে, তাই প্রজন্ম একটি অডিও শব্দভান্ডারের পরবর্তী টোকেন ভবিষ্যদ্বাণীতে পরিণত হয়। একটি অদেখা স্পিকার প্লাস টার্গেট টেক্সটের একটি 3-সেকেন্ডের রেকর্ডিং দেওয়া, VALL-E সেই স্পিকারের কণ্ঠে চলতে থাকে, কাঠ এবং এমনকি অ্যাকোস্টিক পরিবেশ সংরক্ষণ করে। এটিকে প্রায় 60,000 ঘন্টার বক্তৃতায় প্রশিক্ষণ দেওয়া হয়েছিল, যা সাধারণ TTS ডেটাসেটের চেয়ে অনেক বেশি, যা এটিকে শক্তিশালী শূন্য-শট ক্লোনিং দিয়েছে। যেহেতু কোডেক টোকেনগুলি স্তরযুক্ত (RVQ এর মাধ্যমে), VALL-E দুটি পর্যায় ব্যবহার করে: একটি অটোরিগ্রেসিভ মডেল প্রথমটি ভবিষ্যদ্বাণী করে, প্রম্পটে শর্তযুক্ত মোটা টোকেন স্ট্রিম, এবং একটি নন-অটোরিগ্রেসিভ মডেল অবশিষ্ট বিশদ টোকেনগুলিতে পূরণ করে। এই কোডেক-এলএম রেসিপিটি VALL-E 2 এবং অনেক স্পিচ ফাউন্ডেশন মডেলের মতো উত্তরসূরিদের অনুপ্রাণিত করেছে।

প্রযুক্তিগত অন্তর্দৃষ্টি

কৌশলটি হল হায়ারার্কিক্যাল কোডেক টোকেনগুলির উপর হাইব্রিড ডিকোডিং৷ অটোরিগ্রেসিভ স্টেজ এক সময়ে সবচেয়ে গুরুত্বপূর্ণ প্রথম-কোডবুক টোকেনগুলির পূর্বাভাস দেয়, প্রসোডি এবং বিষয়বস্তু ক্যাপচার করে। অবশিষ্ট কোডবুকগুলি, যা সূক্ষ্ম অ্যাকোস্টিক বিশদ যোগ করে, প্রথম স্ট্রীম এবং স্পিকার প্রম্পটে শর্তযুক্ত একটি নন-অটোরিগ্রেসিভ মডেল দ্বারা সমান্তরালভাবে পূর্বাভাস দেওয়া হয়। প্রতিটি টোকেন ক্রমাগতভাবে তৈরি করার খরচ এড়িয়ে এই বিভাজন গুণমানকে উচ্চ রাখে, এবং কোডেক ব্যবহার করে মানে বক্তৃতা এবং পাঠ্য একই ট্রান্সফরমার মেশিনের সাথে মডেল করা যেতে পারে।

কৌশলগত প্রভাব

অ্যাক্সেস এবং পৌঁছানো

এটি ট্রান্সক্রিপশন, বর্ণনা এবং ভয়েস ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্যতা উন্নত করে।

খরচ ও বাজেট

মিডিয়া দলগুলি ছোট বাজেটের সাথে পালিশ করা অডিও দ্রুত পাঠাতে পারে।

গতি এবং স্কেল

গ্রাহক-মুখী সিস্টেমগুলি বৃহত্তর স্কেলে কথ্য মিথস্ক্রিয়া প্রক্রিয়া করতে পারে।

VALL-E এবং কোডেক ভাষার মডেলের ভবিষ্যত

কোডেক ভাষার মডেলগুলি বৃহৎ ভাষার মডেলগুলির সাথে বক্তৃতাকে একত্রিত করছে, একীভূত সিস্টেমের দিকে নির্দেশ করে যা একটি মডেলে শোনে, যুক্তি দেয় এবং কথা বলে৷ আরও ভাল স্থিতিশীলতা এবং কম শিল্পকর্ম, রিয়েল-টাইম স্ট্রিমিং জেনারেশন এবং আবেগ এবং শৈলীর উপর কঠোর নিয়ন্ত্রণ আশা করুন। একই শক্তিশালী ক্লোনিং যা VALL-E-কে অ্যাক্সেসযোগ্যতা এবং ডাবিংয়ের জন্য উপযোগী করে তোলে তাও গভীর নকল এবং সম্মতির উদ্বেগ উত্থাপন করে, তাই ওয়াটারমার্কিং, ভয়েস-ভেরিফিকেশন সেফগার্ডস, এবং পলিসি গার্ডেলগুলি কীভাবে এই সিস্টেমগুলি স্থাপন করা হয় তার একটি কেন্দ্রীয় অংশ হয়ে উঠছে।

বাস্তব-বিশ্ব বাস্তবায়ন

ব্যক্তিগতকৃত সহকারী বা অ্যাক্সেসিবিলিটি সরঞ্জামগুলির জন্য কয়েক সেকেন্ডের অডিও থেকে একটি ভয়েস ক্লোন করা যা হারানো ভয়েস পুনরুদ্ধার করে

মূল স্পিকারের টিমব্রে রেখে অন্য ভাষায় ভিডিও স্থানীয়করণ এবং ডাবিং করা

অভিব্যক্তিপূর্ণ, প্রসঙ্গ-মিলিত বর্ণনা তৈরি করা যা রেকর্ডিংয়ের শাব্দিক পরিবেশ সংরক্ষণ করে

মাল্টিমোডাল অ্যাসিস্ট্যান্টগুলিতে বক্তৃতা মেরুদণ্ড হিসাবে পরিবেশন করা যা উভয়ই বোঝে এবং কথ্য অডিও তৈরি করে

ঝুঁকি এবং প্রহরী

সম্মতি অনুপস্থিত হলে ভয়েস অপব্যবহার এবং ছদ্মবেশের ঝুঁকি বেড়ে যায়।

উচ্চারণ, উপভাষা বা কোলাহলপূর্ণ পরিবেশে যথার্থতা হ্রাস পেতে পারে।

সিন্থেটিক অডিও পরিষ্কার লেবেল ছাড়া খাঁটি বক্তৃতা হিসাবে ভুল হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

ভয়েস ক্যাপচার, ক্লোনিং এবং পুনঃব্যবহারের জন্য সুস্পষ্ট সম্মতি পান।

2

বিভিন্ন স্পিকার এবং ব্যাকগ্রাউন্ড কন্ডিশন জুড়ে মান পরীক্ষা করুন।

3

কখন একজন মানুষকে আউটপুট পর্যালোচনা বা অনুমোদন করতে হবে তা নির্ধারণ করুন।

4

সিন্থেটিক অডিও লেবেল করুন এবং দায়বদ্ধতার জন্য মূল রেকর্ড রাখুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

বড় ভাষার মডেলের জরুরী ক্ষমতা

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is VALL-E and Codec Language Models?

VALL-E অডিও কোডেক টোকেনগুলির উপর একটি ভাষা মডেলিং সমস্যা হিসাবে টেক্সট-টু-স্পীচ রিফ্রেম করেছে, একটি নমুনার মাত্র তিন সেকেন্ড থেকে ভয়েস ক্লোনিং সক্ষম করে৷ এটি দেখিয়েছে যে একই পরবর্তী টোকেন ভবিষ্যদ্বাণী শক্তি প্রদানকারী পাঠ্য এলএলএমগুলি উল্লেখযোগ্যভাবে প্রাকৃতিক, অভিব্যক্তিপূর্ণ বক্তৃতা তৈরি করতে পারে।

কোন মূল ধারণাটি VALL-E কে আগের টেক্সট-টু-স্পীচ সিস্টেম থেকে আলাদা করে?

VALL-E বিচ্ছিন্ন অডিও কোডেক টোকেনগুলির উপর পরবর্তী-টোকেন ভবিষ্যদ্বাণী হিসাবে TTS পুনরায় ফ্রেম করে, একটি ভাষা মডেলের মতো বক্তৃতা তৈরি করে।

একটি নতুন স্পিকারের ভয়েস ক্লোন করতে VALL-E-এর কত রেফারেন্স অডিও প্রয়োজন?

VALL-E একটি অদেখা স্পিকারের প্রায় 3-সেকেন্ডের নমুনা থেকে জিরো-শট ভয়েস ক্লোনিং করতে পারে।

VALL-E তার অডিও টোকেন তৈরি করতে কোন নিউরাল কোডেক ব্যবহার করে?

VALL-E Meta-এর EnCodec-এর উপর তৈরি করে, বক্তৃতা সংশ্লেষিত করার জন্য এর বিচ্ছিন্ন অ্যাকোস্টিক টোকেনগুলির পূর্বাভাস দেয়।

কেন VALL-E একটি অটোরিগ্রেসিভ এবং নন-অটোরিগ্রেসিভ স্টেজ উভয়ই ব্যবহার করে?

কোডেক টোকেনগুলি RVQ এর মাধ্যমে ক্রমানুসারে হয়; VALL-E প্রথম মোটা স্ট্রীম স্বয়ংক্রিয়ভাবে ভবিষ্যদ্বাণী করে এবং দক্ষতার জন্য সমান্তরালভাবে অবশিষ্ট বিশদ টোকেনগুলি।

মোটামুটিভাবে VALL-E-কে কতটা স্পিচ ডেটা প্রশিক্ষিত করা হয়েছিল, শক্তিশালী জিরো-শট ক্লোনিং সক্ষম করে?

VALL-E-কে প্রায় 60,000 ঘন্টার বক্তৃতায় প্রশিক্ষণ দেওয়া হয়েছিল, যা সাধারণ TTS ডেটাসেটের চেয়ে অনেক বেশি, যা এর শূন্য-শট সাধারণীকরণকে বাড়িয়ে তুলেছিল।