آڈیو AI گائیڈ

VALL-E اور کوڈیک زبان کے ماڈلز

VALL-E نے آڈیو کوڈیک ٹوکنز پر زبان کی ماڈلنگ کے مسئلے کے طور پر ٹیکسٹ ٹو اسپیچ کو ری فریم کیا، جس سے نمونے کے صرف تین سیکنڈز سے صوتی کلوننگ کو فعال کیا جا سکتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

گہرا غوطہ

2023 کے اوائل میں Microsoft کے ذریعہ اعلان کیا گیا، VALL-E زبان کی ماڈلنگ کی طرح تقریر کی ترکیب کا علاج کرتا ہے۔ سپیکٹروگرام کی پیشن گوئی کرنے کے بجائے، یہ نیورل کوڈیک (EnCodec) کے مجرد صوتی ٹوکن کی پیشین گوئی کرتا ہے، لہذا نسل آڈیو الفاظ پر اگلی ٹوکن پیشن گوئی بن جاتی ہے۔ غیر دیکھے ہوئے اسپیکر کے علاوہ ٹارگٹ ٹیکسٹ کی 3 سیکنڈ کی ریکارڈنگ کو دیکھتے ہوئے، VALL-E اس اسپیکر کی آواز میں جاری رہتا ہے، ٹمبر اور یہاں تک کہ صوتی ماحول کو بھی محفوظ رکھتا ہے۔ اسے تقریباً 60,000 گھنٹے کی تقریر پر تربیت دی گئی، جو کہ عام TTS ڈیٹاسیٹس سے کہیں زیادہ ہے، جس نے اسے مضبوط صفر شاٹ کلوننگ دی۔ چونکہ کوڈیک ٹوکن تہہ دار ہوتے ہیں (RVQ کے ذریعے)، VALL-E دو مراحل کا استعمال کرتا ہے: ایک خودکار ماڈل پہلے، موٹے ٹوکن سٹریم کی پیش گوئی کرتا ہے جو پرامپٹ پر ہے، اور ایک غیر خودکار ماڈل بقیہ تفصیلی ٹوکن میں بھرتا ہے۔ اس کوڈیک-ایل ایم نسخے نے VALL-E 2 جیسے جانشینوں اور بہت سے اسپیچ فاؤنڈیشن ماڈلز کو متاثر کیا۔

تکنیکی بصیرت

چال درجہ بندی کوڈیک ٹوکنز پر ہائبرڈ ڈی کوڈنگ ہے۔ خود بخود مرحلہ ایک وقت میں سب سے اہم فرسٹ کوڈ بک ٹوکنز کی پیشین گوئی کرتا ہے، جس میں پراسڈی اور مواد کی گرفت ہوتی ہے۔ بقیہ کوڈ بکس، جو کہ عمدہ صوتی تفصیل شامل کرتی ہیں، متوازی طور پر پہلے اسٹریم اور اسپیکر پرامپٹ پر مشروط ایک غیر خودکار ماڈل کے ذریعہ پیش گوئی کی جاتی ہیں۔ یہ تقسیم ہر ٹوکن کو ترتیب وار بنانے کی لاگت سے گریز کرتے ہوئے معیار کو بلند رکھتی ہے، اور کوڈیک کا استعمال کرتے ہوئے اسپیچ اور ٹیکسٹ کو ایک ہی ٹرانسفارمر مشینری سے ماڈل بنایا جا سکتا ہے۔

اسٹریٹجک اثر

رسائی اور رسائی

یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔

لاگت اور بجٹ

میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔

رفتار اور پیمانہ

کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔

VALL-E اور کوڈیک لینگویج ماڈلز کا مستقبل

کوڈیک لینگویج ماڈلز اسپیچ کو بڑے لینگویج ماڈلز کے ساتھ ضم کر رہے ہیں، جو ان متحد سسٹمز کی طرف اشارہ کر رہے ہیں جو ایک ماڈل میں سنتے، استدلال کرتے اور بولتے ہیں۔ بہتر استحکام اور کم نمونے، ریئل ٹائم اسٹریمنگ جنریشن، اور جذبات اور انداز پر سخت کنٹرول کی توقع کریں۔ وہی طاقتور کلوننگ جو VALL-E کو رسائی اور ڈبنگ کے لیے کارآمد بناتی ہے، گہرے جعلی اور رضامندی کے خدشات کو بھی جنم دیتی ہے، اس لیے واٹر مارکنگ، صوتی تصدیق کے تحفظات، اور پالیسی گارڈریلز اس بات کا مرکزی حصہ بن رہے ہیں کہ ان سسٹمز کو کیسے تعینات کیا جاتا ہے۔

حقیقی دنیا کا نفاذ

ذاتی معاونین یا رسائی کے ٹولز کے لیے چند سیکنڈ کے آڈیو سے آواز کی کلوننگ جو کھوئی ہوئی آواز کو بحال کرتی ہے۔

اصل اسپیکر کے ٹمبر کو برقرار رکھتے ہوئے ویڈیو کو دوسری زبانوں میں مقامی بنانا اور ڈب کرنا

تاثراتی، سیاق و سباق سے مماثل بیانیہ تخلیق کرنا جو ریکارڈنگ کے صوتی ماحول کو محفوظ رکھتا ہے

ملٹی موڈل اسسٹنٹس میں اسپیچ بیک بون کے طور پر کام کرنا جو بولی جانے والی آڈیو کو سمجھتے اور تیار کرتے ہیں۔

خطرات اور گارڈریلز

رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔

درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔

واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔

2

متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔

3

وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔

4

مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

بڑی زبان کے ماڈلز کی ہنگامی صلاحیتیں۔

اکثر پوچھے گئے سوالات

What is VALL-E and Codec Language Models?

VALL-E نے آڈیو کوڈیک ٹوکنز پر زبان کی ماڈلنگ کے مسئلے کے طور پر ٹیکسٹ ٹو اسپیچ کو ری فریم کیا، جس سے نمونے کے صرف تین سیکنڈز سے صوتی کلوننگ کو فعال کیا جا سکتا ہے۔ اس نے ظاہر کیا کہ وہی اگلی ٹوکن پیشن گوئی کو طاقت بخشنے والا متن LLMs نمایاں طور پر قدرتی، تاثراتی تقریر پیدا کر سکتا ہے۔

کون سا بنیادی خیال VALL-E کو پہلے کے ٹیکسٹ ٹو اسپیچ سسٹمز سے ممتاز کرتا ہے؟

VALL-E نے TTS کو مجرد آڈیو کوڈیک ٹوکنز پر اگلی ٹوکن پیشین گوئی کے طور پر ری فریم کیا، تقریر کی تخلیق کو زبان کے ماڈل کی طرح برتا۔

VALL-E کو نئے اسپیکر کی آواز کو کلون کرنے کے لیے کتنے حوالہ آڈیو کی ضرورت ہے؟

VALL-E غیر دیکھے ہوئے اسپیکر کے تقریباً 3 سیکنڈ کے نمونے سے زیرو شاٹ وائس کلوننگ انجام دے سکتا ہے۔

VALL-E اپنے آڈیو ٹوکن بنانے کے لیے کون سا نیورل کوڈیک استعمال کرتا ہے؟

VALL-E Meta کے EnCodec پر بناتا ہے، تقریر کی ترکیب کے لیے اس کے مجرد صوتی ٹوکن کی پیش گوئی کرتا ہے۔

VALL-E خود بخود اور خود بخود دونوں مرحلے کیوں استعمال کرتا ہے؟

کوڈیک ٹوکن RVQ کے ذریعے درجہ بندی کے مطابق ہوتے ہیں۔ VALL-E پہلے موٹے دھارے کی خود بخود پیش گوئی کرتا ہے اور کارکردگی کے لیے متوازی طور پر بقیہ تفصیلی ٹوکنز۔

VALL-E کو تقریباً کتنے اسپیچ ڈیٹا پر تربیت دی گئی تھی، جس سے مضبوط صفر شاٹ کلوننگ ممکن ہو؟

VALL-E کو تقریباً 60,000 گھنٹے کی تقریر پر تربیت دی گئی تھی، جو کہ عام TTS ڈیٹاسیٹس سے کہیں زیادہ تھی، جس نے اس کے زیرو شاٹ جنرلائزیشن کو بڑھایا۔