آڈیو AI گائیڈ

سرگوشی کی تقریر کی پہچان

Whisper OpenAI کا اوپن سورس خودکار اسپیچ ریکگنیشن سسٹم ہے جو آڈیو کو 90+ زبانوں میں متن میں بدل دیتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

گہرا غوطہ

ستمبر 2022 میں OpenAI کے ذریعہ جاری کیا گیا، Whisper ایک ٹرانسفارمر پر مبنی انکوڈر-ڈیکوڈر ماڈل ہے جو ویب سے 680,000 گھنٹے کی کثیر لسانی، ملٹی ٹاسک آڈیو پر تربیت یافتہ ہے۔ پہلے والے سسٹمز کے برعکس جن کو صاف، لیبل والے ڈیٹا کی ضرورت ہوتی ہے، Whisper نے گندی حقیقی دنیا کی ریکارڈنگز سے سیکھا، جس سے اسے لہجے، شور اور کراس اسٹالک کے لیے قابل ذکر حد تک لچکدار بنایا گیا۔ ایک واحد ماڈل نقل، انگریزی میں ترجمہ، زبان کی شناخت، اور ٹائم اسٹیمپنگ کو ہینڈل کرتا ہے۔ یہ 'چھوٹے' (39M پیرامیٹرز) سے 'بڑے' (1.55B) تک سائز میں بھیجتا ہے، جس سے صارفین کو درستگی کے لیے رفتار کی تجارت ہوتی ہے۔ چونکہ وزن MIT کے تحت کھلے عام لائسنس یافتہ ہیں، Whisper لاتعداد پوڈ کاسٹ ٹرانسکرائبرز، کیپشننگ ٹولز، اور وائس ایپس کے لیے تقریباً راتوں رات ڈیفالٹ بیک بون بن گیا۔

تکنیکی بصیرت

وسپر آڈیو کو 30 سیکنڈ کے ٹکڑوں میں تقسیم کرتا ہے، ہر ایک کو لاگ میل سپیکٹروگرام (80 فریکوئنسی چینلز) میں تبدیل کرتا ہے، اور اسے ٹرانسفارمر انکوڈر میں فیڈ کرتا ہے۔ ڈیکوڈر پھر ٹیکسٹ ٹوکنز کی خود بخود پیشین گوئی کرتا ہے، خاص ٹوکنز کے ذریعے رہنمائی کرتا ہے جو ٹاسک (ٹرانسکرائب بمقابلہ ترجمہ)، زبان، اور آیا ٹائم اسٹیمپ کو خارج کرنا ہے۔ یہ ملٹی ٹاسک ٹوکن کنڈیشننگ ایک ہوشیار چال ہے: وزن کا ایک سیٹ ضابطہ کشائی کے آغاز پر فراہم کیے جانے والے پرامپٹ ٹوکنز کے لحاظ سے بہت سے کام انجام دیتا ہے۔

اسٹریٹجک اثر

رسائی اور رسائی

یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔

لاگت اور بجٹ

میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔

رفتار اور پیمانہ

کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔

سرگوشی کی تقریر کی شناخت کا مستقبل

Whisper نے تیز تر مشتقات جیسے Whisper.cpp، تیز سرگوشی، اور ڈسٹل ورژنز کی ایک لہر کو جنم دیا جو فون اور لیپ ٹاپ پر حقیقی وقت میں چلتے ہیں۔ سخت سٹریمنگ (کم لیٹنسی) کی مختلف حالتوں، اس کے ساتھ ساتھ بہتر اسپیکر ڈائیرائزیشن، اور کم وسائل والی زبانوں پر مضبوط کارکردگی کی توقع کریں۔ جیسا کہ ڈیوائس پر آڈیو AI بڑھتا ہے، ہلکے وزن کے وسپر طرز کے ماڈل ممکنہ طور پر لائیو کیپشنز، میٹنگ نوٹس، اور رسائی کے ٹولز کو مکمل طور پر آف لائن، کلاؤڈ گریڈ کی درستگی سے مماثل پرائیویسی کو محفوظ رکھتے ہوئے پاور کریں گے۔

حقیقی دنیا کا نفاذ

پوڈکاسٹس اور یوٹیوب ویڈیوز کے لیے خود کار طریقے سے تلاش کے قابل نقلیں اور کیپشن تیار کرنا

لائیو میٹنگ نوٹس ایپس کو طاقت دینا جو زوم یا ٹیمز آڈیو سے خلاصے تیار کرتی ہیں۔

صحافیوں کے لیے غیر ملکی زبان کے انٹرویوز کا براہ راست انگریزی متن میں ترجمہ کرنا

ایسے صارفین کے لیے آواز پر قابو پانے والے قابل رسائی ٹولز اور ڈکٹیشن بنانا جو ٹائپ نہیں کر سکتے

خطرات اور گارڈریلز

رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔

درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔

واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔

2

متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔

3

وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔

4

مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

تقریر جذبات کی پہچان

اکثر پوچھے گئے سوالات

What is Whisper Speech Recognition?

Whisper OpenAI کا اوپن سورس خودکار اسپیچ ریکگنیشن سسٹم ہے جو آڈیو کو 90+ زبانوں میں متن میں بدل دیتا ہے۔ یہ اس لیے اہمیت رکھتا ہے کیونکہ اس نے ہر ایک کے لیے قریب ترین انسانی ٹرانسکرپشن کا معیار مفت میں لایا، لہجوں، پس منظر کے شور اور تکنیکی اصطلاح پر مضبوطی سے کام کرنا۔

وسپر کو تقریباً کتنے گھنٹے کی آڈیو تربیت دی گئی تھی؟

Whisper کو تقریباً 680,000 گھنٹے کی کثیر لسانی، ملٹی ٹاسک آڈیو پر تربیت دی گئی جو ویب سے اکٹھا کیا گیا، ایک غیر معمولی طور پر بڑا اور متنوع ڈیٹا سیٹ۔

وسپر انکوڈر سے پہلے خام آڈیو سے کس درمیانی نمائندگی کا حساب لگاتا ہے؟

Whisper ہر 30 سیکنڈ کے آڈیو حصے کو 80 چینل لاگ میل سپیکٹروگرام میں تبدیل کرتا ہے، جسے ٹرانسفارمر انکوڈر پروسیس کرتا ہے۔

ایک واحد Whisper ماڈل نقل اور ترجمہ جیسے متعدد کام کیسے انجام دیتا ہے؟

ضابطہ کشائی کے آغاز پر خصوصی ٹوکنز پر سرگوشی کی شرائط جو اسے زبان، کام، اور ٹائم اسٹیمپ کے اخراج کے بارے میں بتاتی ہیں۔

وسپر کس مجموعی عصبی فن تعمیر کا استعمال کرتا ہے؟

وسپر ایک انکوڈر-ڈیکوڈر ٹرانسفارمر ہے: انکوڈر سپیکٹروگرام کو پڑھتا ہے اور ڈیکوڈر خود بخود ٹیکسٹ ٹوکن تیار کرتا ہے۔

پہلے ASR سسٹمز کے مقابلے Whisper کو خاص طور پر مضبوط کیوں سمجھا جاتا ہے؟

متنوع، حقیقی دنیا کے آڈیو (لہجے، شور، کراس اسٹالک) کی بڑی مقدار پر تربیت نے فی ڈومین ٹیوننگ کے بغیر وسپر کو باکس سے باہر مضبوطی فراہم کی۔