خبروں پر واپس جائیں۔
اختراعAI Understanding بریفنگ

بینچ مارک کا کہنا ہے کہ سرفہرست ملٹی موڈل ماڈلز قلم کی آوازوں اور ہاتھ کی حرکت سے الفاظ پڑھنے پر 10 فیصد سے کم اسکور حاصل کرتے ہیں۔

ایک نیا arXiv پیپر ایک ایسا ٹیسٹ متعارف کرایا ہے جس میں ماڈلز کو قلم سے اسکریچ آڈیو اور ہاتھ سے چلنے والی ویڈیو سے تحریری لفظ کا اندازہ لگانا چاہیے، جس میں سیاہی نظر نہیں آتی۔ مصنفین 80% سے اوپر والے انسانوں کو خط کی درستگی اور 10% سے نیچے معروف ماڈلز کی اطلاع دیتے ہیں - اور یہ کہ دونوں طریقوں کو دینے سے اکثر نتائج خراب ہوتے ہیں۔

7 min readRead the primary source
Source-provided image accompanying Benchmark Says Top Multimodal Models Score Under 10% at Reading Words From Pen Sounds and Hand Motion
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
arxiv.org
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2608.14558
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

بینچ مارک
ایک معیاری ٹیسٹ یا ڈیٹا سیٹ جو ماڈل کی کارکردگی کی پیمائش اور موازنہ کرنے کے لیے استعمال ہوتا ہے۔
مصنوعی ذہانت (AI)
عمارت کے نظاموں کا وسیع میدان جو کاموں کو انجام دیتا ہے جس میں پیٹرن کی شناخت، استدلال، زبان، یا فیصلہ سازی کی ضرورت ہوتی ہے۔
مشین لرننگ (ML)
ایسے طریقے جو سسٹمز کو ڈیٹا سے پیٹرن سیکھنے اور وقت کے ساتھ ساتھ بہتر کرنے کی اجازت دیتے ہیں۔
اپنے آپ کو جانچیں۔AI ماڈلز نے کوئز کی وضاحت کی۔

کیا ہوا؟

محققین نے غیر تحریری بینچ مارک کی وضاحت کرنے والا ایک مقالہ شائع کیا، جس میں ملٹی موڈل ماڈلز سے کہا گیا ہے کہ وہ صرف قلم کی آواز اور حرکت پذیر ہاتھ کی ویڈیو کا استعمال کرتے ہوئے لکھے جانے والے الفاظ کی شناخت کریں، جس میں سیاہی نظر نہیں آتی۔ خلاصہ انسانی ترتیب شدہ خط کی درستگی کو 80% سے اوپر اور GPT-4o اور Gemini 2.5-Pro ​​سمیت، 10% سے نیچے کی رپورٹ کرتا ہے، اور کہتا ہے کہ دونوں طریقوں کو ملانے سے ماڈل کی کارکردگی کو بہتر بنانے کے بجائے اکثر تنزلی ہوتی ہے۔

تین محققین – گریما آریا یادیو، نیلے یلماز اور یژو یانگ – نے ایک مقالہ شائع کیا ہے جس میں وہ غیر تحریری بینچ مارک کو متعارف کرایا گیا ہے، جو اس بات کا امتحان ہے کہ آیا ملٹی موڈل مشین لرننگ ماڈل اس بات کا تعین کر سکتے ہیں کہ کوئی شخص تحریر کو دیکھے بغیر کیا لکھ رہا ہے۔ یہ کاغذ arXiv پر 2608.14558 کے طور پر درج ہے، جسے مصنوعی ذہانت کے تحت کمپیوٹر وژن اور پیٹرن کی شناخت کے لیے کراس لسٹنگ کے ساتھ فائل کیا گیا ہے۔ مصنفین نے بنیادی کام کو "اکوسٹو-کائنیمیٹک ورڈ انفرنس" کے طور پر بیان کیا ہے: ایک ماڈل کو صرف قلم کی کھرچوں کی آڈیو اور ہاتھ کی حرکت کی ویڈیو دی جاتی ہے، جس میں سیاہی کا کوئی نشان نظر نہیں آتا ہے، اور اسے لکھے جانے والے لفظ کو سمجھنا ضروری ہے۔ خلاصہ کہتا ہے کہ یہ کام تین مختلف تحریری انداز پر محیط ہے۔ arXiv فہرست جمع کرانے کی تاریخ 15 مئی 2026 دیتی ہے اور اس میں ایک تبصرہ ہوتا ہے جس میں کہا جاتا ہے کہ کام CVPR فائنڈنگز 2026 میں شائع کیا جانا ہے۔

سرخی کا نتیجہ ایک خلا ہے۔ خلاصہ کے مطابق، انسانی شرکاء اعلیٰ ترتیب شدہ حروف کی درستگی حاصل کرتے ہیں - مصنفین کا کہنا ہے کہ 80% سے زیادہ - جبکہ معروف ملٹی موڈل ماڈلز 10% سے تجاوز کرنے میں ناکام رہتے ہیں۔ خلاصہ میں نامزد کردہ دو ماڈل GPT-4o اور Gemini 2.5-Pro ​​ہیں۔ کاغذ اس کو ایک تنگ شناختی ناکامی کے طور پر نہیں بلکہ کراس موڈل کازل استدلال میں حدود کے ثبوت کے طور پر اور جس کو مصنفین تحریر کی مائیکرو کائینیٹکس کہتے ہیں: ہاتھ اور قلم کی عمدہ حرکت جو یہ معلومات لے کر جاتی ہے کہ کون سا خط بن رہا ہے۔

دوسری رپورٹ شدہ تلاش کی توقع کم ہے۔ مصنفین ایک "متضاد فیوژن اثر" کی وضاحت کرتے ہیں، جس میں ایک ماڈل کو آڈیو اور ویڈیو دونوں کی فراہمی اکثر اس کی کارکردگی کو ایک ہی طریقہ فراہم کرنے کے مقابلے میں کم کر دیتی ہے۔ انہوں نے اسے ماڈلز کی تکمیلی ادراک کے اشارے کی ترکیب کرنے کی صلاحیت میں خرابی کے طور پر پڑھا۔ خلاصہ فی موڈلٹی اسکورز کی اطلاع نہیں دیتا، اس لیے اس انحطاط کا سائز، اور آیا یہ جانچے گئے ہر ماڈل کے لیے ظاہر ہوا، یہاں پر نظرثانی شدہ مواد سے قائم نہیں ہوتا ہے۔

یہ اکاؤنٹ صرف arXiv خلاصہ صفحہ سے لیا گیا ہے۔ مکمل کاغذ، اس کے ضمیمہ اور کسی بھی جاری کردہ مواد کی جانچ نہیں کی گئی۔ کئی تفصیلات جو نتیجہ پر فیصلہ کرنے کے لیے اہم ہوں گی وہاں بیان نہیں کی گئی ہیں۔ خلاصہ ڈیٹاسیٹ میں الفاظ یا کلپس کی تعداد، انسانی شرکت کنندگان کی تعداد یا جن حالات کے تحت ان کا تجربہ کیا گیا، زبان یا اسکرپٹ شامل، ترتیب شدہ حرف کی درستگی کی صحیح تعریف، ماڈلز کو کیسے اشارہ کیا گیا، ویڈیو اور آڈیو کے نمونے کیسے لیے گئے اور پاس کیے گئے، یا کیا ڈیٹا اور کوڈ شائع کیا جائے گا یہ نہیں بتاتا۔ اس مقالے کو ایک مکمل ہم مرتبہ کی نظرثانی شدہ اشاعت کے بجائے کانفرنس کے نتائج کے ٹریک میں آنے والے کے طور پر بھی درج کیا گیا ہے، اور اس مقام پر کوئی آزاد نقل معلوم نہیں ہے۔

ماخذ کی تفصیلات: arxiv.org

یہ کیوں اہمیت رکھتا ہے۔

زیادہ تر ملٹی موڈل تشخیصات اس بات کی شناخت کی جانچ کرتے ہیں جو براہ راست نظر آتی ہے یا سنائی دیتی ہے۔ یہ کسی ایسی چیز کے تخمینے کی جانچ کرتا ہے جو کبھی دکھائی نہیں دیتی ہے، اور رپورٹ کرتی ہے کہ دوسرا طریقہ شامل کرنے سے نقصان پہنچ سکتا ہے - ایسا نتیجہ جو عام مفروضے کے خلاف چلتا ہے کہ آڈیو اور ویڈیو کو فیوز کرنا اضافی ہے۔ اگر یہ برقرار رہتا ہے، تو یہ اس کمزوری کی طرف اشارہ کرتا ہے کہ کس طرح موجودہ نظام ادراک کے چینلز کو یکجا کرتے ہیں، نہ صرف ایک مشکل کام پر۔

سب سے زیادہ استعمال ہونے والے ملٹی موڈل بینچ مارکس جانچتے ہیں کہ آیا کوئی سسٹم تصویر، ویڈیو یا آڈیو کلپ میں موجود چیز کا نام دے سکتا ہے۔ یہ جان بوجھ کر جواب کو ان پٹ سے ہٹاتا ہے۔ لفظ کبھی نہیں دکھایا جاتا ہے۔ اسے اس جسمانی عمل سے دوبارہ تشکیل دینا ہوگا جس نے اسے پیدا کیا۔ یہ ڈیزائن ایک قابلیت کو نشانہ بناتا ہے - متحرک ثبوت سے ایک اندیکھی وجہ کا اندازہ لگاتا ہے - جو کہ جامد مواد پر پیٹرن کے ملاپ کے مقابلے میں لوگ کسی منظر کو کس طرح پڑھتے ہیں اس کے قریب ہے، اور یہ ایک ایسی صلاحیت ہے جو موجودہ تشخیصی سوٹ زیادہ تر الگ تھلگ نہیں ہوتے ہیں۔

فیوژن کا نتیجہ ان دونوں دعووں سے زیادہ نتیجہ خیز ہے۔ پروڈکٹ انجینئرنگ کا ایک بہت بڑا سودا یہ مانتا ہے کہ ماڈل کو مزید ادراک چینل دینے سے ہی مدد مل سکتی ہے: میٹنگ اسسٹنٹ تقریر کو اسکرین ویڈیو کے ساتھ جوڑتے ہیں، ایکسیسبیلٹی ٹولز کیمرہ اور مائیکروفون ان پٹ کو یکجا کرتے ہیں، اور روبوٹکس اسٹیک اس مفروضے پر کئی سینسرز کو فیوز کرتے ہیں کہ فالتو پن حفاظتی ہے۔ اگر دوسرا طریقہ قابل اعتماد طریقے سے کسی ماڈل کو کسی ایسے کام پر بدتر بنا سکتا ہے جہاں دونوں چینلز حقیقی سگنل رکھتے ہیں، تو اس مفروضے کو بھروسہ کرنے کی بجائے جانچ کی ضرورت ہے۔ کاغذ یہ ثابت نہیں کرتا ہے کہ یہ عام طور پر ہوتا ہے - یہ ایک کام پر اس کی اطلاع دیتا ہے، نامزد ماڈلز کے ایک چھوٹے سیٹ کے ساتھ - لیکن یہ ایک ٹھوس معاملہ ہے جہاں زیادہ ان پٹ نے بدتر جواب دیا ہے۔

کام بھی دو عملی علاقوں کے قریب بیٹھتا ہے۔ ایک ہے رسائی اور ڈیجیٹائزیشن: سمارٹ قلم یا اسکینر کے بغیر آواز اور حرکت سے لکھاوٹ کو کیپچر کرنا نوٹ کیپچر اور عام کاغذ پر لکھنے والوں کے لیے مفید ہوگا۔ دوسرا رازداری ہے۔ واقعاتی صوتی اور بصری اشاروں سے تحریری مواد کا اندازہ لگانا، اصولی طور پر، ایک سائیڈ چینل کا مسئلہ ہے، اور آڈیو سے کی بورڈز پر سائیڈ چینل کے حملوں کا برسوں سے مطالعہ کیا جا رہا ہے۔ اس خلاصہ میں موجود شواہد پر، موجودہ عام مقصد کے ماڈل ایسا کرنے کے قابل نہیں ہیں - 10٪ سے کم ناقابل استعمال کے قریب ہے - جب کہ مبینہ طور پر انسان کر سکتے ہیں۔ یہ آج کے ماڈل کی صلاحیتوں کے بارے میں تلاش ہے، پائیدار گارنٹی نہیں۔

حدود دونوں سمتوں میں چلتی ہیں اور واضح طور پر بیان کرنے کے قابل ہیں۔ نئے متعارف کرائے گئے بینچ مارک پر بہت کم اسکور عام ہیں، اور خود ہی وہ حقیقی استدلال کے خسارے، ٹاسک فارمیٹ اور یہ ماڈلز ویڈیو اور آڈیو کیسے کھاتے ہیں کے درمیان مماثلت نہیں رکھتے، اور ایک تشخیصی استعمال جو کام کے لیے نہیں بنایا گیا تھا۔ جن دو ماڈلز کا نام دیا گیا ہے وہ عمومی مقصد کے تجارتی نظام ہیں، نہ کہ ایسے نظام بنائے گئے ہیں اور نہ ہی عمدہ حرکت کے تجزیہ کے لیے بنائے گئے ہیں، اور ہو سکتا ہے کہ مضبوط یا زیادہ حالیہ ماڈلز کا تجربہ نہ کیا گیا ہو۔ انسانی بیس لائن کو بیان کردہ شرائط کے بغیر ایک واحد نمبر کے طور پر رپورٹ کیا جاتا ہے۔ اور اسی ٹیم کے ذریعہ تصنیف کردہ ایک بینچ مارک جو خلا کی اطلاع دیتا ہے ابھی تک کسی اور کے ذریعہ تناؤ کا تجربہ نہیں کیا گیا ہے۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
انٹرایکٹو تصور چیک+10 Points
AI Models Explained Quiz

What is the best response when AI Models Explained makes a mistake in production?

آگے کیا دیکھنا ہے۔

آیا ڈیٹاسیٹ، کوڈ اور ہیومن بیس لائن پروٹوکول جاری کیے گئے ہیں اور آزادانہ طور پر دوبارہ تیار کیے گئے ہیں۔ چاہے نئے ماڈلز ہوں یا مختلف پرامپٹنگ اس فرق کو بند کریں۔ اور آیا رپورٹ شدہ فیوژن انحطاط دیگر آڈیو-ویڈیو کاموں پر ظاہر ہوتا ہے یا اس بینچ مارک کے لیے مخصوص ہوتا ہے۔

دیکھنے کی پہلی چیز رہائی اور تولیدی صلاحیت ہے۔ آیا مصنفین ڈیٹاسیٹ شائع کرتے ہیں، تشخیصی کوڈ اور انسانی مطالعہ کا درست پروٹوکول اس بات کا تعین کرے گا کہ ہیڈ لائن نمبرز کو کتنی جلدی چیک کیا جا سکتا ہے۔ یہاں پر نظرثانی شدہ arXiv اندراج کسی کوڈ یا ڈیٹا لنک کی نشاندہی نہیں کرتا ہے۔ ایک بینچ مارک جو 70 نکاتی انسانی مشین کے فرق کی اطلاع دیتا ہے آزاد نقل کی دعوت دیتا ہے، اور دعوے کی قدر اس بات پر بہت زیادہ انحصار کرتی ہے کہ آیا دوسرے گروپ ماڈل اسکور اور انسانی بنیادی لائن دونوں کو دوبارہ پیش کر سکتے ہیں۔

دوسرا یہ ہے کہ کیا فرق بہتر سیٹ اپ کے ساتھ رابطے میں رہتا ہے۔ نئے ملٹی موڈل ٹاسک کے اسکور اکثر ان تبدیلیوں کے ساتھ کافی حد تک آگے بڑھتے ہیں جن کا استدلال سے کوئی تعلق نہیں ہوتا ہے — فریم ریٹ، آڈیو سیمپلنگ اور پری پروسیسنگ، ایک ماڈل کی حقیقت میں کتنے فریم نظر آتے ہیں، فوری ڈھانچہ، یا کام کے لیے مخصوص فائن ٹیوننگ کی معمولی مقدار۔ اگر ایک چھوٹی انجینئرنگ تبدیلی ماڈلز کو 10% سے اوپر لے جاتی ہے، تو نتیجہ بنیادی طور پر ان پٹ پائپ لائن کے مسئلے کے طور پر پڑھتا ہے۔ اگر محتاط ٹیوننگ انہیں فرش کے قریب چھوڑ دیتی ہے، تو کراس موڈل کازل استدلال کے بارے میں مصنفین کے مضبوط دعوے کو مسترد کرنا مشکل ہو جاتا ہے۔

تیسرا فیوژن اثر ہے۔ دلچسپ سوال یہ ہے کہ کیا طریقہ کار کو شامل کرنے سے انحطاط دیگر آڈیو-ویڈیو کاموں پر ظاہر ہوتا ہے، یا آیا یہ اس کے لیے مخصوص ہے۔ اگر دوسرے گروہوں کو کہیں اور بھی یہی نمونہ ملتا ہے، تو یہ کسی ایسی ساختی چیز کی طرف اشارہ کرے گا جس میں موجودہ ماڈلز کس طرح وزن اور چینلز کو یکجا کرتے ہیں بجائے کہ قلم کی کھرچوں اور ہاتھ کی حرکت کے۔ مکمل کاغذ میں فی موڈلٹی ایبلیشنز، اور ان کو دوبارہ پیش کرنے کی کوششیں، وہ جگہ ہیں جو طے پا جاتی ہیں۔

آخر میں، اپنانے کے لئے دیکھیں. بینچ مارکس اس وقت اہمیت رکھتے ہیں جب دیگر لیبز ان پر اسکور رپورٹ کرتی ہیں اور جب نمبر مسلسل ماڈل نسلوں میں منتقل ہوتے ہیں۔ آیا یہ سی وی پی آر 2026 کے فائنڈنگ ٹریک میں جیسا کہ بتایا گیا ہے، آیا فرنٹیئر لیبز نے اسے تشخیصی رپورٹس میں شامل کیا ہے، اور آیا پرائیویسی اور سیکیورٹی کے محققین سائیڈ چینل فریمنگ کو اٹھاتے ہیں یہ سب آنے والے مہینوں میں نظر آئیں گے۔ یہ بات بھی قابل توجہ ہے کہ سنترپتی سے بہت دور ایک بینچ مارک تھوڑی دیر کے لیے ایک واضح سگنل دیتا ہے — جب تک کہ ایسا نہیں ہوتا، اس وقت یہ سوال بنتا ہے کہ آیا ماڈلز نے صلاحیت سیکھی ہے یا ڈیٹا سیٹ۔

متعلقہ گائیڈز اور کوئزز

AI ماڈلز کی وضاحتاے آئی ٹریننگAI کیا ہے؟آپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیں
یہ مفید پایا؟