آڈیو AI گائیڈ

ساؤنڈ اسٹریم نیورل کوڈیک

ساؤنڈ اسٹریم Google کا اینڈ ٹو اینڈ نیورل آڈیو کوڈیک ہے جو کوالٹی کو محفوظ رکھتے ہوئے اسپیچ اور میوزک کو انتہائی کم بٹریٹس پر کمپریس کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

گہرا غوطہ

2021 میں Google کے ذریعے متعارف کرایا گیا، SoundStream ایک مکمل نیورل کوڈیک ہے جو ایک ساتھ تربیت یافتہ تین ٹکڑوں سے بنایا گیا ہے: ایک convolutional encoder جو خام ویوفارم کو ویکٹرز کی ایک کمپیکٹ ترتیب میں بدل دیتا ہے، ایک بقایا ویکٹر کوانٹائزر (RVQ) جو کہ ویکٹر کو الگ کرتا ہے، لہر کی شکل کو دوبارہ تشکیل دیتا ہے۔ اسے تعمیر نو کے نقصانات اور GAN طرز کے مخالف امتیازی سلوک دونوں کے ساتھ تربیت دی جاتی ہے، لہذا آؤٹ پٹ صرف عددی طور پر قریب ہونے کی بجائے قدرتی لگتا ہے۔ اسٹینڈ آؤٹ فیچر 'اسکیل ایبل' یا کوانٹائزر ڈراپ آؤٹ ٹریننگ ہے: ایک ماڈل تقریباً 3 سے 18 کے بی پی ایس تک بِٹ ریٹ پر کام کر سکتا ہے محض تخمینہ کے لحاظ سے کم یا زیادہ کوانٹائزر پرتوں کا استعمال کر کے، بغیر کسی تربیت کے۔ 3 kbps پر یہ مبینہ طور پر ایک ماڈل میں سننے کے ٹیسٹ، اسپیچ، میوزک اور عام آڈیو کو سنبھالنے میں 12 kbps پر Opus کو پیچھے چھوڑ دیتا ہے جو اسمارٹ فون CPU پر ریئل ٹائم میں چل سکتا ہے۔

تکنیکی بصیرت

ویوفارم سٹرائیڈ کنوولوشنز سے گزرتا ہے جو بہت زیادہ نمونے کو کم کرتا ہے، فی فریم میں ایک سرایت پیدا کرتا ہے (جیسے 75 فریم/سیکنڈ)۔ RVQ پھر ہر ایمبیڈنگ کو کوڈ بک انڈیکس کے اسٹیک کے طور پر انکوڈ کرتا ہے۔ بٹریٹ فی کوڈ بک کے فعال کوانٹائزرز گنا بٹس کی تعداد کے فریم ریٹ کے برابر ہے۔ کوانٹائزر ڈراپ آؤٹ تصادفی طور پر تربیت کے دوران RVQ اسٹیک کو چھوٹا کرتا ہے، جس سے پہلے کی کوڈ بکس کو انتہائی اہم معلومات لے جانے پر مجبور کیا جاتا ہے تاکہ کوڈیک کم شرحوں پر خوبصورتی سے گر جائے۔

اسٹریٹجک اثر

رسائی اور رسائی

یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔

لاگت اور بجٹ

میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔

رفتار اور پیمانہ

کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔

ساؤنڈ اسٹریم نیورل کوڈیک کا مستقبل

ساؤنڈ اسٹریم نے وہ ٹیمپلیٹ قائم کیا جسے بعد میں EnCodec اور DAC جیسے کوڈیکس نے بہتر کیا، اور اس کے مجرد ٹوکن آڈیو ایل ایم اور میوزک ایل ایم جیسے جنریٹیو سسٹمز کے لیے سبسٹریٹ بن گئے۔ توقع کریں کہ اولادیں اور بھی کم بٹریٹس کی طرف دھکیلیں، لفظی طور پر ساختی ٹوکن جو زبان کے ماڈل کے طرز کے آڈیو جنریٹرز کے ان پٹ کے طور پر دگنا ہوں، اور لائیو کالز، ہیئرنگ ایڈز، اور اسٹریمنگ کے لیے سخت آن ڈیوائس تعیناتی جہاں بینڈوتھ اور لیٹنسی کو سختی سے روکا گیا ہو۔

حقیقی دنیا کا نفاذ

صوتی کالوں کو ~3 kbps تک کمپریس کرنا جب کہ زیادہ بٹ ریٹ پر لیگیسی کوڈیکس سے زیادہ صاف آواز آتی ہے۔

مجرد آڈیو ٹوکن تیار کرنا جو Google کے AudioLM اور MusicLM جنریٹیو ماڈلز کو فیڈ کرتے ہیں

آن-سی پی یو انکوڈنگ اور ڈی کوڈنگ کے ساتھ موبائل آلات پر ریئل ٹائم کم بینڈوتھ آڈیو سٹریمنگ

موسیقی اور محیطی آواز کو ایک ہی ماڈل میں محفوظ کرنا یا منتقل کرنا جو مواد کی تمام اقسام کو ہینڈل کرتا ہے۔

خطرات اور گارڈریلز

رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔

درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔

واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔

2

متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔

3

وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔

4

مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is SoundStream Neural Codec?

ساؤنڈ اسٹریم Google کا اینڈ ٹو اینڈ نیورل آڈیو کوڈیک ہے جو کوالٹی کو محفوظ رکھتے ہوئے اسپیچ اور میوزک کو انتہائی کم بٹریٹس پر کمپریس کرتا ہے۔ یہ اہمیت رکھتا ہے کیونکہ یہ روایتی کوڈیکس جیسے Opus کو ایک ہی بٹ ریٹ پر مات دیتا ہے اور جدید جنریٹیو آڈیو ماڈلز کو طاقت دیتا ہے۔

کون سے تین اجزاء ساؤنڈ اسٹریم فن تعمیر کو بناتے ہیں؟

ساؤنڈ اسٹریم کو ایک کنوولیشنل انکوڈر، ایک بقایا ویکٹر کوانٹائزر سے بنایا گیا ہے جو سرایت کو الگ کرتا ہے، اور ایک کنوولیشنل ڈیکوڈر، تمام تربیت یافتہ اینڈ ٹو اینڈ۔

کون سی تکنیک ایک واحد ساؤنڈ اسٹریم ماڈل کو دوبارہ تربیت کے بغیر بہت سے مختلف بٹریٹس پیش کرنے دیتی ہے؟

ٹریننگ کے دوران، ساؤنڈ اسٹریم تصادفی طور پر کوانٹائزر لیئرز کو گرا دیتا ہے تاکہ اندازہ کے مطابق آپ ایک ماڈل سے مختلف بٹ ریٹ کو مارنے کے لیے زیادہ یا کم RVQ لیولز استعمال کر سکیں۔

Google کے سننے کے ٹیسٹوں میں، 3 kbps پر SoundStream کو 12 kbps پر کس کوڈیک کو پیچھے چھوڑنے کی اطلاع دی گئی؟

ساؤنڈ سٹریم صرف 3 kbps میں 12 kbps پر چلنے والے وسیع پیمانے پر استعمال ہونے والے Opus کوڈیک کو موضوعی معیار کی جانچ میں مماثل یا ہرا دیتا ہے۔

آؤٹ پٹ آواز کو قدرتی بنانے کے لیے ساؤنڈ اسٹریم کس قسم کا اضافی تربیتی سگنل استعمال کرتا ہے؟

تعمیر نو کے نقصانات کے علاوہ، ساؤنڈ اسٹریم مخالفانہ (GAN) امتیازی سلوک کا استعمال کرتا ہے لہذا تعمیر نو محض عددی طور پر قریب ہونے کی بجائے ادراک کے اعتبار سے حقیقت پسندانہ لگتی ہے۔

ساؤنڈ اسٹریم کا بٹریٹ اس کے کوانٹائزرز سے کیسے متعلق ہے؟

فعال RVQ تہوں کی تعداد کے ساتھ بٹریٹ اسکیل (ٹائمز فریم ریٹ اوقات بٹس فی کوڈ بک)، لہذا کوانٹائزرز کو شامل کرنے سے بٹریٹ اور معیار میں اضافہ ہوتا ہے۔