کیا ہوا؟
محققین نے VocalAffectBench متعارف کرایا، جو صرف عوامی ٹیسٹ کے لیے بینچ مارک ہے اس بات کا جائزہ لینے کے لیے کہ آیا AI آڈیو ماڈل خام تقریر سے براہ راست اظہار کردہ جذبات کی شناخت کر سکتے ہیں۔ چھ جاری کردہ بیس لائنوں میں، اوسط سات طرفہ درستگی 35.5% تھی؛ مضبوط ترین بیس لائن 46.5% تک پہنچ گئی، بے ترتیب اندازے سے کافی اوپر لیکن مضبوط شناخت سے کم۔
arXiv پیپر، 1 ستمبر کو نظر ثانی شدہ، VocalAffectBench کو AI آڈیو ماڈلز کے لیے ایک عوامی، صرف ٹیسٹ تشخیص سیٹ کے طور پر متعارف کرایا گیا ہے۔ یہ 51 اسپیکر اکاؤنٹس سے 273 انسانی ریکارڈ شدہ انگریزی WAV کلپس پر مشتمل ہے، کل 1.95 گھنٹے۔ کلپس کو سات لیبلز میں یکساں طور پر تقسیم کیا گیا ہے: ناراض، ناگوار، خوف زدہ، خوش، غیر جانبدار، غمگین اور حیران، ہر کلاس میں 39 کلپس کے ساتھ۔ ٹرانسکرپٹس یا سیاق و سباق کے میٹا ڈیٹا کے بغیر ماڈلز کی جانچ صرف آڈیو سے کی جاتی ہے۔ یہ ڈیزائن اس سوال کو الگ کرتا ہے جس کا مقصد بینچ مارک کی جانچ کرنا ہے: آیا کوئی ماڈل خود تقریر کی آواز سے اظہار شدہ آوازی جذبات کی شناخت کرسکتا ہے۔
مصنفین کی رپورٹ ہے کہ چھ جاری کردہ بیس لائنز نے سات طرفہ کام پر 35.5٪ کی اوسط درستگی حاصل کی۔ سب سے مضبوط درج شدہ بیس لائن، جس کی شناخت gemini_3_5_flash کے طور پر ہوئی، 46.5% تک پہنچ گئی۔ مقالہ 14.3% سات مساوی طور پر نمائندگی کرنے والی کلاسوں کے لیے بے ترتیب اندازے کی بنیاد کے طور پر دیتا ہے۔ مصنفین ایک ثانوی تجزیہ کی بھی اطلاع دیتے ہیں جو گروپوں کو مثبت، غیر جانبدار اور منفی توازن میں لیبل کرتا ہے، حیران رہ جاتا ہے کیونکہ اس کا توازن مبہم ہے۔ اس موٹے درجہ بندی کے تحت، مجموعی درستگی 50.9% تھی۔ یہ اعداد و شمار بینچ مارک تشخیص کے دعوے ہیں، اس بات کا ثبوت نہیں کہ ماڈلز ہر آواز کی ایپلی کیشن میں اسی طرح کی کارکردگی کا مظاہرہ کریں گے۔
جذبات کے لحاظ سے نتائج کافی مختلف ہوتے ہیں۔ تمام بنیادی خطوط پر اوسط، نیوٹرل میں سب سے زیادہ 75.6% پر واپسی تھی۔ 10.7% پر، اور خوفزدہ، 15.4% پر حیرانی کے لیے یاد بہت کم تھا۔ کاغذ یہ نتیجہ اخذ کرتا ہے کہ آزمائشی نظام تقریر سے کچھ جذباتی سگنل نکالتے ہیں، لیکن وہ مجرد اظہار جذبات کی پہچان نازک رہتی ہے۔ ماخذ کے مطابق بینچ مارک، بنیادی پیشین گوئیاں اور مجموعی نتائج عوامی طور پر دستیاب ہیں۔ ماخذ کسی تعیناتی پروڈکٹ، طبی یا ملازمت کے استعمال، یا بینچ مارک کے انگریزی آڈیو کلپس کے باہر جانچ کی وضاحت نہیں کرتا ہے۔
یہ کیوں اہمیت رکھتا ہے۔
صوتی نظاموں کو متاثر کن معلومات کی ضرورت ہو سکتی ہے جو ٹرانسکرپٹس کو چھوڑ دیتے ہیں، لیکن نتائج بتاتے ہیں کہ موجودہ ماڈل جذباتی اشارے کو غلط پڑھ سکتے ہیں، خاص طور پر خوف اور حیرت۔ یہ حد صوتی ایجنٹ کے ورک فلو کے لیے اہمیت رکھتی ہے جہاں صارف کی جذباتی حالت کو پہچاننا سسٹم کے ردعمل پر اثر انداز ہو سکتا ہے۔
کاغذ ایک ایسی صلاحیت کو مخاطب کرتا ہے جو نقل سے الگ ہے۔ ایک ٹرانسکرپٹ ان الفاظ کو محفوظ رکھ سکتا ہے جو ایک شخص کہتا ہے جبکہ آواز کی خصوصیات کو چھوڑ کر جو اثرانداز ہو سکتے ہیں، جیسے غصہ، خوف یا خوشی سے وابستہ اظہار۔ ذریعہ کا کہنا ہے کہ صوتی مصنوعات کو تیزی سے ان متاثر کن اشاروں کی ضرورت ہے۔ VocalAffectBench اس لیے آڈیو کے قابل AI کا جائزہ لینے میں ایک عملی خلا کو نشانہ بناتا ہے: ایک نظام بولی جانے والی زبان پر کارروائی کر سکتا ہے جب کہ ڈیلیوری کے ذریعے ظاہر کیے گئے جذبات کی شناخت کرنے میں ناکام رہتا ہے۔
نتائج جذباتی لیبلز کو ایک قابل اعتماد پرت کے طور پر علاج کرنے کے خلاف احتیاط کرتے ہیں جسے آسانی سے وائس ایجنٹ میں شامل کیا جاسکتا ہے۔ سات طرفہ کام پر نصف سے نیچے مجموعی طور پر درستگی، خاص طور پر خوف اور حیرت کے لیے کمزور یاد کے ساتھ، اس کا مطلب ہے کہ ایک سسٹم ان سگنلز کو یاد کر سکتا ہے یا الجھ سکتا ہے جنہیں ڈیزائنرز اہم سمجھتے ہیں۔ مصنفین خاص طور پر نوٹ کرتے ہیں کہ صوتی ایجنٹ کے کام کے بہاؤ میں غیر جانبدار جذبات اکثر سب سے اہم ہوتے ہیں۔ اس سے یہ ثابت نہیں ہوتا کہ کوئی خاص پروڈکٹ غیر محفوظ یا غیر موثر ہے، لیکن یہ ظاہر کرتا ہے کہ کیوں دعوی کردہ جذباتی بیداری کے لیے عام آڈیو یا زبان کی کارکردگی سے اندازہ لگانے کے بجائے براہ راست جانچ کی ضرورت ہے۔
بینچ مارک محققین اور ڈویلپرز کے لیے ایک مشترکہ پیمائش کا ہدف بھی پیش کرتا ہے۔ چونکہ تشخیص اکیلے آڈیو کا استعمال کرتا ہے اور کلاس کی سطح کے نتائج کی اطلاع دیتا ہے، یہ ان کمزوریوں کو بے نقاب کر سکتا ہے جو ایک مجموعی اسکور چھپائے گا۔ غیر مساوی یادیں خاص طور پر متعلقہ ہیں: ایک ایسا ماڈل جو غیر جانبدار تقریر پر نسبتاً بہتر کارکردگی کا مظاہرہ کرتا ہے وہ اب بھی کم بار بار یا زیادہ جذباتی طور پر نمایاں زمروں کو پہچاننے میں ناقص ہو سکتا ہے۔ ماخذ یہ قائم نہیں کرتا ہے کہ بینچ مارک کس حد تک صارف کے اطمینان، بحران کا پتہ لگانے، رسائی کے نتائج یا حقیقی دنیا کے دیگر اثرات کی پیش گوئی کرتا ہے۔ اس کا صرف عوامی ٹیسٹ فارمیٹ موازنہ کے لیے مفید ہے، لیکن یہ خود تعیناتی کی توثیق نہیں ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
آگے کیا دیکھنا ہے۔
بینچ مارک کی اگلی قیمت اس کے 273 انگریزی کلپس کے علاوہ وسیع تر جانچ پر منحصر ہوگی۔ اہم نامعلوم میں زبانوں، بولنے والوں، ریکارڈنگ کے حالات اور حقیقی دنیا کی بات چیت میں کارکردگی شامل ہے، نیز یہ کہ آیا مستقبل کے نظام نتیجہ خیز استعمال کے لیے کافی حد تک جذبات کا پتہ لگا سکتے ہیں۔
ایک مرکزی سوال یہ ہے کہ آیا رپورٹ شدہ پیٹرن اس ڈیٹاسیٹ سے باہر ہے۔ بینچ مارک 51 اسپیکر اکاؤنٹس سے انگریزی کلپس اور دو گھنٹے سے کم آڈیو پر مشتمل ہے، لہذا ذریعہ زبانوں، لہجوں، عمروں، ثقافتوں، مائیکروفون، پس منظر کے شور یا بے ساختہ گفتگو میں عمومیت قائم نہیں کرتا ہے۔ مستقبل کے جائزوں کو ان حالات کو ظاہر کرنا چاہئے اور رپورٹ کرنا چاہئے کہ آیا جذباتی کلاسوں میں کارکردگی غیر مساوی رہتی ہے۔ ماخذ ان وسیع تر ترتیبات پر کوئی ثبوت فراہم نہیں کرتا ہے۔
یہ بھی معلوم نہیں ہے کہ ماڈلز کی غلطیاں ایک مکمل آواز کے ورک فلو کو کیسے متاثر کرتی ہیں۔ کاغذ خام آڈیو سے شناخت کا اندازہ کرتا ہے، لیکن یہ رپورٹ نہیں کرتا ہے کہ نیچے کا ایجنٹ لیبلز کو کس طرح استعمال کرے گا، آیا لیبل کیلیبریٹ کیے گئے ہیں، سسٹم کو کتنی بار پرہیز کرنا چاہیے، یا آیا انسان اعلیٰ داؤ پر لگائے گئے فیصلوں پر نظرثانی کرے گا۔ ماخذ اسی طرح اعتماد کے وقفوں، اسپیکر کے ذریعے غلطی کے تجزیوں، یا انسانی سننے والوں کے ساتھ موازنہ کی اطلاع نہیں دیتا ہے۔ وہ کوتاہیاں بینچ مارک کے نتائج کو باطل نہیں کرتی ہیں، لیکن وہ اس بات کو محدود کرتی ہیں کہ آپریشنل وشوسنییتا کے بارے میں کیا نتیجہ اخذ کیا جا سکتا ہے۔
بینچ مارک کی عوامی ریلیز، بنیادی پیشین گوئیاں اور مجموعی نتائج نقل اور توسیع کو دیکھنے کے لیے سب سے فوری پیش رفت بناتا ہے۔ مفید فالو اپ کام زیادہ متنوع تقریر اور ریکارڈنگ کے حالات کی جانچ کرے گا، جانچ کرے گا کہ آیا ماڈل خوف اور حیرت میں بہتری لاتے ہیں، اور اس بات کا تعین کریں گے کہ آیا موٹے والینس کے زمرے حقیقی طور پر مجرد جذباتی لیبلز سے زیادہ قابل اعتماد ہیں۔ جب تک ایسے شواہد موجود نہ ہوں، قابلِ دفاع نتیجہ تنگ ہے: تشخیص شدہ AI آڈیو ماڈلز اس بینچ مارک میں کچھ صوتی-اثر سگنل کا پتہ لگاتے ہیں، لیکن ماخذ حقیقی دنیا کے صوتی ایجنٹ کے استعمال میں مضبوط جذبات کی پہچان نہیں دکھاتا ہے۔