EnCodec آڈیو کمپریشن
EnCodec Meta کا ہائی فیڈیلیٹی نیورل آڈیو کوڈیک ہے جو اسپیچ اور میوزک کو بہت کم بٹ ریٹ پر کمپریس کرتا ہے اور اس سے کہیں زیادہ بھاری فارمیٹس کا مقابلہ کرتا ہے۔
جائزہ
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
گہرا غوطہ
2022 میں Meta AI کے ذریعہ جاری کیا گیا، EnCodec ایک انکوڈر، ایک بقایا ویکٹر کوانٹائزر (RVQ) کے ساؤنڈ اسٹریم بلیو پرنٹ کی پیروی کرتا ہے، اور ایک ڈیکوڈر تربیت یافتہ اینڈ ٹو اینڈ، لیکن اس میں کئی اصلاحات شامل کرتا ہے۔ یہ ایک سٹریمنگ کے قابل convolutional encoder، کثیر پیمانے پر سپیکٹروگرام اور ٹائم ڈومین کی تعمیر نو کے نقصانات، اور ادراک کے معیار کے لیے مخالفانہ امتیازی سلوک کا استعمال کرتا ہے۔ ایک قابل ذکر شراکت ایک چھوٹا ٹرانسفارمر پر مبنی اینٹروپی ماڈل ہے جو کوانٹائزڈ کوڈز کو بغیر کسی نقصان کے مزید کمپریس کرتا ہے، بغیر معیار کے نقصان کے اضافی بٹس کو نچوڑتا ہے۔ EnCodec ایک بیلنسر بھی متعارف کراتا ہے جو خود بخود مسابقتی تربیت کے بہت سے نقصانات کی پیمائش کرتا ہے تاکہ وہ مستحکم رہیں۔ یہ 24 kHz monophonic اور 48 kHz سٹیریو آڈیو کو ہینڈل کرتا ہے، 1.5، 3، 6، اور 12 kbps جیسے بٹ ریٹ پر کام کرتا ہے، اور 6 kbps پر MP3 کے مقابلے 64 kbps پر معیار تک پہنچ جاتا ہے۔ اس کے ٹوکنز پاور Meta کی MusicGen اور AudioGen۔
تکنیکی بصیرت
EnCodec کا انکوڈر سٹرائیڈ کنولوشنز کے ساتھ ویوفارم کو ایک اویکت ترتیب میں اتارتا ہے، جسے RVQ اسٹیکڈ کوڈ بک انڈیکس میں تبدیل کرتا ہے۔ ایک ہلکا پھلکا ٹرانسفارمر لینگویج ماڈل ان ٹوکنز کے امکانات کی پیشین گوئی کرتا ہے اور ریاضی کوڈ کرتا ہے، مزید کمپریشن کو مفت میں بحال کرتا ہے۔ ٹریننگ بیلنس ری کنسٹرکشن، اسپیکٹرل، اور مخالف نقصانات سے گراڈینٹ کنٹریبیوشن کو ری اسکیل کرتا ہے تاکہ کوئی ایک اصطلاح غالب نہ ہو، جس سے کثیر مقصدی ٹریننگ مکمل بٹریٹ رینج میں مستحکم رہتی ہے۔
اسٹریٹجک اثر
رسائی اور رسائی
یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔
لاگت اور بجٹ
میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔
رفتار اور پیمانہ
کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔
EnCodec آڈیو کمپریشن کا مستقبل
EnCodec پہلے سے ہی کئی کھلے جنریٹیو آڈیو ماڈلز کے لیے ڈیفالٹ ٹوکنائزر ہے، اور اس کی اولادیں کم بٹ ریٹ، مکمل سٹیریو اور میوزک گریڈ ری کنسٹرکشن، اور ٹیکسٹ ٹو آڈیو اور ٹیکسٹ ٹو میوزک جنریٹرز کے ساتھ سخت انضمام کو آگے بڑھا رہی ہیں۔ کم بینڈوڈتھ کمیونیکیشن، ریئل ٹائم اسٹریمنگ، اور معیاری 'آڈیو ٹوکن' پرت کے طور پر وسیع تر اپنانے کی توقع ہے جو بڑی زبان کے ماڈل طرز کے فن تعمیر کو آواز پڑھنے اور لکھنے دیتی ہے۔
حقیقی دنیا کا نفاذ
Meta کے MusicGen اور AudioGen ٹیکسٹ ٹو آڈیو جنریٹرز کے لیے ٹوکنائزنگ آڈیو
بینڈوڈتھ محدود ٹرانسمیشن کے لیے 24 kHz اسپیچ کو 1.5-6 kbps پر کمپریس کرنا
MP3 کے قریب معیار کے ساتھ 48 kHz سٹیریو میوزک کو انکوڈنگ کرنا بہت زیادہ بٹ ریٹ پر
جاری کردہ چیک پوائنٹس کے ذریعے تحقیق اور آڈیو ML پائپ لائنز کے لیے اوپن سورس ڈراپ ان کوڈیک کے طور پر کام کرنا
خطرات اور گارڈریلز
رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔
درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔
واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔
نفاذ کا روڈ میپ
آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔
متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔
وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔
مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
آڈیو ایمبیڈنگز اور نمائندگی کی تعلیم
اکثر پوچھے گئے سوالات
What is EnCodec Audio Compression?
EnCodec Meta کا ہائی فیڈیلیٹی نیورل آڈیو کوڈیک ہے جو اسپیچ اور میوزک کو بہت کم بٹ ریٹ پر کمپریس کرتا ہے اور اس سے کہیں زیادہ بھاری فارمیٹس کا مقابلہ کرتا ہے۔ یہ اہمیت رکھتا ہے کیونکہ یہ جدید جنریٹیو آڈیو سسٹمز اور جہازوں کو اوپن سورس کی شکل میں کسی کے بھی استعمال کرنے کے لیے تیار کرتا ہے۔
کس تنظیم نے EnCodec جاری کیا؟
EnCodec کو Meta AI (FAIR) نے 2022 میں ایک ہائی فیڈیلیٹی نیورل آڈیو کوڈیک کے طور پر متعارف کرایا تھا۔
EnCodec اپنے ٹوکنز سے زیادہ کمپریشن کو بغیر کسی نقصان کے نچوڑنے کے لیے کون سا اضافی جز شامل کرتا ہے؟
EnCodec ایک چھوٹے ٹرانسفارمر کو ٹوکن کے امکانات کی پیشین گوئی کرنے اور ریاضی کے کوڈز کی تربیت دیتا ہے، جس سے RVQ کے اوپر اضافی نقصان کے بغیر کمپریشن حاصل ہوتا ہے۔
تقریباً 6 kbps پر، EnCodec کی کوالٹی MP3 کے مقابلے میں بتائی گئی تھی کہ کس بٹریٹ پر؟
EnCodec 6 kbps پر 64 kbps پر MP3 کی طرح ساپیکش معیار تک پہنچتا ہے، ایک بڑا کارکردگی کا فائدہ۔
تربیت کے دوران EnCodec کا 'balancer' کون سا مسئلہ حل کرتا ہے؟
بہت سے نقصانات (تعمیر نو، اسپیکٹرل، مخالف) کے ساتھ، بیلنسر اپنے گریڈینٹ کو دوبارہ اسکیل کرتا ہے تاکہ کوئی ایک مقصد غالب نہ ہو، تربیت کو مستحکم کرتا ہے۔
کوانٹائزیشن کا کون سا بنیادی طریقہ EnCodec SoundStream کے ساتھ شیئر کرتا ہے؟
SoundStream کی طرح، EnCodec بقایا ویکٹر کوانٹائزیشن کا استعمال کرتا ہے تاکہ انکوڈر ایمبیڈنگز کو اسٹیک شدہ کوڈ بک انڈیکس میں ڈسکریٹائز کیا جا سکے۔