آڈیو AI گائیڈ

گہرا شور دبانے کا چیلنج

ڈیپ نوائس سپریشن (DNS) چیلنج ایک Microsoft سے چلنے والا مقابلہ ہے جو محققین کو اعصابی نیٹ ورک بنانے پر مجبور کرتا ہے جو حقیقی وقت میں پس منظر کے شور کو تقریر سے دور کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It set the modern benchmarks that power features like Teams and Zoom noise removal.

گہرا غوطہ

2020 میں Microsoft کے ذریعہ شروع کیا گیا اور کئی سالوں تک دہرایا گیا (اکثر INTERSPEECH اور ICASSP پر)، DNS چیلنج نے ٹیموں کو صاف تقریر، شور کے کلپس، اور مصنوعی طور پر مخلوط شور کی ریکارڈنگ کا ایک بڑا، معیاری ڈیٹا سیٹ دیا۔ اہم طور پر، اس نے تشخیص کو پرانے سگنل ریاضی جیسے PESQ سے ہٹ کر انسانی سننے کے اسکور کی طرف منتقل کر دیا اور سمجھے جانے والے معیار کی پیشن گوئی کرنے والوں کو سیکھا۔ اس نے حقیقی دنیا کے سخت حالات کو بھی شامل کیا: ریبربرنٹ کمرے، غیر سٹیشنری شور (ٹائپنگ، کتے، سائرن)، ٹونل شور، اور ذاتی نوعیت کے منظر نامے جہاں ایک ماڈل کو اندراج شدہ ٹارگٹ اسپیکر کے علاوہ سب کو دبانا چاہیے۔ ڈیٹا، بیس لائنز، اور ایک عام ٹیسٹ سیٹ جاری کر کے، اس نے لیبز کو سیب سے سیب کا موازنہ کرنے دیا اور تقریر کو بڑھانے کے لیے فلٹرنگ کی چالوں سے آخر سے آخر تک گہری سیکھنے تک کی رفتار کو تیز کیا۔

تکنیکی بصیرت

اندراجات عام طور پر شور مچانے والی لہر کے مختصر وقت کے فوئیر کو ایک بار بار چلنے والے یا کنوولوشنل نیٹ ورک میں تبدیل کرتے ہیں جو وقت کی تعدد ماسک کی پیش گوئی کرتا ہے۔ شور مچانے والے اسپیکٹرم کے ذریعہ ماسک کو ضرب دینے سے آواز کے غلبہ والے ڈبوں کو کم کیا جاتا ہے جبکہ تقریر کے غلبہ والے کو محفوظ رکھتے ہیں، پھر ایک الٹا STFT لہر کی شکل کو دوبارہ بناتا ہے۔ ریئل ٹائم رولز الگورتھمک لیٹنسی (تقریباً 40 ایم ایس) کو کیپ کرتے ہیں اور اس کے لیے کازل پروسیسنگ کی ضرورت ہوتی ہے، اس لیے ماڈلز موجودہ فریم کو صاف کرتے وقت مستقبل کے آڈیو پر جھانک نہیں سکتے۔

اسٹریٹجک اثر

رسائی اور رسائی

یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔

لاگت اور بجٹ

میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔

رفتار اور پیمانہ

کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔

گہرے شور دبانے والے چیلنج کا مستقبل

توقع کریں کہ فریم ورک پرسنلائزڈ اور ملٹی موڈل دبانے کی طرف بڑھے گا، جہاں ہونٹوں کی حرکت یا اسپیکر کا وائس پرنٹ رہنمائی کرتا ہے کہ کیا رکھنا ہے۔ ماڈلز ائربڈز اور ہیئرنگ ایڈز کے لیے آن ڈیوائس چلانے کے لیے سکڑ رہے ہیں، اور فل بینڈ 48 kHz پروسیسنگ معیاری ہوتی جا رہی ہے اس لیے موسیقی اور اعلی تعدد زندہ رہتے ہیں۔ تخلیقی نقطہ نظر جو صرف شور مچانے کے بجائے صاف ستھرا تقریر کی دوبارہ ترکیب کرتے ہیں، ایک فعال اور بعض اوقات متنازعہ محاذ ہیں۔

حقیقی دنیا کا نفاذ

Microsoft ٹیموں اور دیگر ویڈیو کال ایپس میں ریئل ٹائم بیک گراؤنڈ شور ہٹانا

سفر یا مصروف کیفے کے دوران ایئر بڈز اور ہیڈ سیٹس میں کلینر اسپیچ کیپچر

خودکار ٹرانسکرپشن یا کیپشننگ سے پہلے شور والی فیلڈ ریکارڈنگ کو پہلے سے پروسیس کرنا

سماعت ایڈز اور معاون سننے والے آلات میں سمجھ بوجھ کو بہتر بنانا

خطرات اور گارڈریلز

رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔

درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔

واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔

2

متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔

3

وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔

4

مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Deep Noise Suppression Challenge quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Deep Noise Suppression Challenge?

ڈیپ نوائس سپریشن (DNS) چیلنج ایک Microsoft سے چلنے والا مقابلہ ہے جو محققین کو اعصابی نیٹ ورک بنانے پر مجبور کرتا ہے جو حقیقی وقت میں پس منظر کے شور کو تقریر سے دور کرتا ہے۔ اس نے جدید معیارات مرتب کیے جن میں طاقت کی خصوصیات جیسے ٹیمیں اور زوم شور ہٹانا۔

کس تنظیم نے ڈیپ نوائس سپریشن (DNS) چیلنج شروع کیا؟

Microsoft نے 2020 میں DNS چیلنج کا آغاز کیا اور اسے INTERSPEECH اور ICASSP جیسے مقامات پر چلایا۔

DNS چیلنج کے لیے بنائے گئے سسٹمز کا بنیادی مقصد کیا ہے؟

چیلنج ریئل ٹائم اسپیچ میں اضافہ کو نشانہ بناتا ہے، اسپیکر کی آواز کو محفوظ رکھتے ہوئے شور کو دباتا ہے۔

ریئل ٹائم ڈی این ایس پروسیسنگ ماڈلز کو مستقبل کے آڈیو فریم استعمال کرنے سے کیوں منع کرتی ہے؟

لائیو گفتگو کے لیے کارآمد، کم لیٹنسی پروسیسنگ کی ضرورت ہوتی ہے، لہذا ماڈل صرف ماضی اور موجودہ آڈیو استعمال کر سکتا ہے۔

DNS اندراجات میں ایک عام تکنیک 'ماسک' کی پیشن گوئی کرنا ہے۔ ماسک کیا کرتا ہے؟

شور کے غلبہ والے ڈبوں کو دبانے اور تقریر کو برقرار رکھنے کے لیے ایک ٹائم فریکوئنسی ماسک کو شور والے سپیکٹرم کے ساتھ ضرب دیا جاتا ہے۔

ڈی این ایس چیلنج نے اسپیچ بڑھانے کا اندازہ کیسے بدلا؟

چیلنج انسانی سننے کے ٹیسٹوں کی طرف بڑھا اور اکیلے سگنل ریاضی کے بجائے ادراک کے معیار کے پیشن گو سیکھے۔