خبروں پر واپس جائیں۔
اختراعAI Understanding بریفنگ

PhysElite پیپر رپورٹ کرتا ہے کہ معروف ملٹی موڈل LLM نے اولمپیاڈ کی سطح کے طبیعیات کے 33.7 فیصد مسائل حل کیے

11,586 دو لسانی، ڈایاگرام پر مبنی طبیعیات کے مسائل کا ایک نیا بینچ مارک رپورٹ کرتا ہے کہ 18 آزمائشی ملٹی موڈل لینگویج ماڈلز میں سے سب سے مضبوط نے صرف 33.7 فیصد جوابات کی درستگی حاصل کی۔

5 min readRead the primary source
Primary-source image accompanying PhysElite paper reports that leading multimodal LLM solved 33.7% of Olympiad-level physics problems
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
arxiv.org
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2608.25097
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

بڑی زبان کا ماڈل (LLM)
متن کی تخلیق اور تجزیہ کرنے کے لیے بڑے پیمانے پر ٹیکسٹ کارپورا پر تربیت یافتہ زبان کا ماڈل۔
بینچ مارک
ایک معیاری ٹیسٹ یا ڈیٹا سیٹ جو ماڈل کی کارکردگی کی پیمائش اور موازنہ کرنے کے لیے استعمال ہوتا ہے۔
ڈیٹا سیٹ
تربیت، توثیق، یا جانچ کے لیے استعمال ہونے والی منظم یا غیر ساختہ مثالوں کا مجموعہ۔
اپنے آپ کو جانچیں۔AI ماڈلز نے کوئز کی وضاحت کی۔

کیا ہوا؟

محققین نے PhysElite متعارف کرایا، ایک دو لسانی ملٹی موڈل بینچ مارک جو اولمپیاڈ کی سطح کے طبیعیات کے مسائل پر بڑی زبان کے ماڈلز کو جانچنے کے لیے ڈیزائن کیا گیا ہے۔ ڈیٹاسیٹ میں 11,586 مسائل، بصری خاکے، چینی-انگریزی حل اخذ، اور حتمی جوابات شامل ہیں۔ یہ مقالہ 18 اوپن سورس اور کلوزڈ سورس ملٹی موڈل لینگویج ماڈلز کے جائزوں سے نتائج کی رپورٹ کرتا ہے، جس میں مضبوط ترین ماڈل 33.7 فیصد جواب کی درستگی تک پہنچتا ہے۔

یہ مقالہ PhysElite کو کثیر موڈل بڑے لینگویج ماڈلز کے ذریعے اولمپیاڈ کی سطح کی فزکس استدلال کے لیے ایک معیار کے طور پر پیش کرتا ہے۔ یہ 25 اگست 2026 کو arXiv کو جمع کرایا گیا تھا۔ مصنفین کا استدلال ہے کہ طبیعیات کے موجودہ معیارات محدود ہیں کیونکہ ان میں کافی زیادہ مشکل مسائل نہیں ہیں اور وہ بصری معلومات، طبیعیات کے علم کے شعبوں اور مرحلہ وار حل کے عمل کا جامع طور پر احاطہ نہیں کرتے ہیں۔

مقالے کے خلاصہ کے مطابق، PhysElite میں چینی اور انگریزی دونوں میں اولمپیاڈ کے 11,586 درجے کے مسائل ہیں۔ ہر مسئلہ کو ایک بصری خاکہ کے ساتھ جوڑا جاتا ہے، ایک دو لسانی اخذ کو مراحل میں تقسیم کیا جاتا ہے، اور ایک حتمی جواب ہوتا ہے۔ ذریعہ کا کہنا ہے کہ ڈیٹاسیٹ جاری کر دیا گیا ہے، حالانکہ فراہم کردہ متن میں منزل کا لنک شامل نہیں ہے یا اس کے لائسنس، فارمیٹ، یا رسائی کی ضروریات کو بیان نہیں کیا گیا ہے۔

مصنفین نے 18 ملٹی موڈل لینگویج ماڈلز کا جائزہ لیا، بشمول اوپن سورس اور کلوز سورس سسٹم۔ سب سے مضبوط ماڈل 33.7% جواب کی درستگی تک پہنچ گیا۔ محققین نے اس بات کی نشاندہی کرنے کے لیے مرحلہ وار عمل کا جائزہ بھی لیا کہ استدلال کی زنجیر میں ماڈل کہاں ناکام ہوئے۔ ماخذ ماڈلز کے نام، فی مسئلہ کوششوں کی تعداد، اسکورنگ کے قواعد، یا مسئلہ کی قسم کے لحاظ سے تفصیلی نتائج فراہم نہیں کرتا ہے۔

ماخذ کی تفصیلات: arxiv.org ↗

یہ کیوں اہمیت رکھتا ہے۔

نتیجہ یہ بتاتا ہے کہ موجودہ طبیعیات یا عمومی استدلال کے ٹیسٹ پر مضبوط کارکردگی مشکل، ڈایاگرام پر منحصر، کثیر مرحلہ طبیعیات کے مسائل کے قابل اعتماد حل کا ترجمہ نہیں کر سکتی۔ PhysElite کا مقصد حتمی جوابات اور ماڈل کے استدلال کے عمل کے انفرادی مراحل دونوں کا جائزہ لے کر ان کمزوریوں کو مزید واضح کرنا ہے۔

بینچ مارک ایک عملی کمزوری کو دور کرتا ہے جس میں AI استدلال کے نظام کا اکثر اندازہ کیا جاتا ہے۔ ایک ماڈل روانی سے وضاحتیں پیش کر سکتا ہے یا چھوٹے سوالوں پر اچھی کارکردگی کا مظاہرہ کر سکتا ہے جب کہ اسے کسی خاکے کی تشریح کرنا، متعلقہ جسمانی اصولوں کو منتخب کرنا، متعدد منسلک کٹوتیوں کو انجام دینا، اور درست جواب پر پہنچنا ضروری ہے۔ PhysElite اس مشترکہ چیلنج کے ارد گرد ڈیزائن کیا گیا ہے بجائے اس کے کہ فزکس کو صرف متن کے سوال کے جواب کے طور پر سمجھا جائے۔

رپورٹ کردہ 33.7% نتیجہ نتیجہ خیز ہے کیونکہ یہ اس بات کی واضح حد رکھتا ہے کہ اس خاص اعلی مشکل کام پر آزمائشی نظاموں نے کیا مظاہرہ کیا۔ اس سے یہ ظاہر نہیں ہوتا کہ ملٹی موڈل لینگویج ماڈل اولمپیاڈ فزکس کو حل کرنے سے قاصر ہیں، اور یہ ثابت نہیں کرتا کہ ہر ماڈل ایک ہی سطح پر کارکردگی کا مظاہرہ کرتا ہے۔ کاغذ کے مطابق، یہ ظاہر کرتا ہے کہ سب سے مضبوط تشخیصی نظام نے بھی زیادہ تر بینچ مارک کے مسائل کو صحیح طریقے سے حل نہیں کیا۔

مرحلہ وار تشخیص محققین اور صارفین کے لیے ایک حتمی اسکور سے زیادہ مفید ہو سکتا ہے۔ اگر بنیادی طور پر خاکوں کی ترجمانی کرتے ہوئے، مساوات کا انتخاب کرتے ہوئے، حسابات کو انجام دیتے ہوئے، یا درمیانی نتائج کو جوڑتے ہوئے ناکامیاں ہوتی ہیں، تو ڈویلپرز ان کمزوریوں کو زیادہ درست طریقے سے نشانہ بنانے کے قابل ہو سکتے ہیں۔ فراہم کردہ ذریعہ یہ نہیں بتاتا کہ کن مراحل میں سب سے زیادہ خرابیاں پیدا ہوئیں، اس لیے بینچ مارک کی تشخیصی قدر کا ابھی تک تفصیل سے اندازہ نہیں لگایا جا سکتا۔

عوام کے لیے، نتائج عام مقصد کے AI نظاموں کو ماہر طبیعیات کے استدلال کے قابل اعتماد متبادل کے طور پر علاج کرنے کے خلاف احتیاط پیش کرتے ہیں۔ ایک ایسا نظام جو قابل فہم لیکن غلط ملٹی سٹیپ حل دیتا ہے کسی غیر ماہر کے لیے جانچنا مشکل ہو سکتا ہے۔ بینچ مارک کا دو لسانی اور بصری ڈیزائن ان حدود کو بے نقاب کرنے میں بھی مدد کر سکتا ہے جو انگریزی متن یا مختصر حتمی جواب کے فارمیٹس پر مرکوز تشخیصات سے پوشیدہ ہیں۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
انٹرایکٹو تصور چیک+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

آگے کیا دیکھنا ہے۔

اہم سوالات یہ ہیں کہ آیا ڈیٹاسیٹ اور ایویلیویشن کوڈ آزاد نقل کے لیے کافی حد تک قابل رسائی ہیں، فزکس کے موضوعات اور بصری فارمیٹس میں کارکردگی کس طرح مختلف ہوتی ہے، اور کیا مستقبل کے ماڈلز یادگار حلوں پر انحصار کیے بغیر بینچ مارک پر بہتر ہوتے ہیں۔ ماخذ ٹیسٹ شدہ ماڈلز کی شناخت نہیں کرتا ہے یا تشخیص کی خرابی فراہم نہیں کرتا ہے، لہذا رپورٹ کردہ 33.7% کو مخصوص سسٹمز کی درجہ بندی کے لیے استعمال نہیں کیا جانا چاہیے۔

آزاد نقل فوری امتحان ہے۔ محققین کو جاری کردہ مسائل، خاکوں، حلوں، اور اسکورنگ کے طریقہ کار کا معائنہ کرنے کی ضرورت ہوگی تاکہ یہ تعین کیا جا سکے کہ آیا بینچ مارک ابہام، نقل شدہ اشیاء، یا دیگر عوامل سے پاک ہے جو نتائج کو متاثر کر سکتے ہیں۔ ماخذ ڈیٹاسیٹ کے اجراء کی تصدیق کرتا ہے لیکن اس کی رسائی یا تولیدی صلاحیت کا جائزہ لینے کے لیے کافی معلومات فراہم نہیں کرتا ہے۔

مستقبل کی کوریج کو یہ دکھانا چاہیے کہ 33.7% فگر کس طرح فزکس کے مضامین، مشکل کی سطح، ڈایاگرام کی اقسام، زبانوں اور جوابی فارمیٹس میں ٹوٹ جاتا ہے۔ یہ جاننا بھی ضروری ہے کہ آیا ماڈلز ایک جیسے اشارے وصول کرتے ہیں، کیا کیلکولیٹر جیسے ٹولز کی اجازت ہے، اور جزوی کریڈٹ کیسے ہینڈل کیا جاتا ہے۔ ان تفصیلات میں سے کوئی بھی فراہم کردہ ذریعہ میں ظاہر نہیں ہوتا ہے۔

بینچ مارک زیادہ معلوماتی ہو سکتا ہے اگر بعد کے جائزوں میں وقت کے ساتھ ماڈل ورژن کا موازنہ کیا جائے اور حتمی جواب کی درستگی اور مرحلہ وار وشوسنییتا دونوں کی اطلاع دی جائے۔ محققین کو یہ بھی جانچنا چاہئے کہ آیا ماڈل غیر یقینی صورتحال کو پہچان سکتے ہیں، غلط درمیانی مراحل کی نشاندہی کر سکتے ہیں، یا خاکہ مبہم ہونے پر وضاحت کی درخواست کر سکتے ہیں۔ کاغذ کا خلاصہ ان طرز عمل کی اطلاع نہیں دیتا ہے۔

سب سے اہم نامعلوم یہ ہے کہ حقیقی طبیعیات کا نمائندہ PhysElite کس طرح کام کرتا ہے۔ اولمپیاڈ کے مسائل جان بوجھ کر مشکل ہوتے ہیں اور یہ کلاس روم کی مشقوں، لیبارٹری کے تجزیہ، انجینئرنگ ڈیزائن، یا تحقیقی مشق کی عکاسی نہیں کرسکتے ہیں۔ ذریعہ بینچ مارک کے دائرہ کار کو قائم کرتا ہے اور نتیجہ کی اطلاع دیتا ہے، لیکن یہ اس بات کا تعین نہیں کرتا ہے کہ PhysElite پر کارکردگی ان دیگر ترتیبات میں کارکردگی کی پیش گوئی کیسے کرتی ہے۔

ایک ساتھ لے کر، دستیاب تفصیل نتیجہ کی محدود تشریح کی حمایت کرتی ہے۔ 33.7% اعداد و شمار اس بینچ مارک پر 18 آزمائے گئے ملٹی موڈل لینگویج ماڈلز کے جواب کی درستگی کی جانچ سے متعلق ہیں۔ اسے ڈیٹاسیٹ کے دو لسانی مسائل، بصری خاکے، اخذ، اور حتمی جوابات کے ساتھ ساتھ الگ الگ مرحلہ وار عمل کی تشخیص کے ساتھ پڑھنا چاہیے۔ چونکہ فراہم کردہ ماخذ میں ماڈل کے نام، اسکورنگ کے اصول، کوششوں کی گنتی، موضوع کی خرابی، یا تشخیصی کوڈ شامل نہیں ہے، اس لیے قارئین موازنہ کو دوبارہ تشکیل دینے یا اس بات کا تعین کرنے کے لیے اکیلے خلاصہ کا استعمال نہیں کر سکتے کہ ٹاسک کے کن حصوں نے نتیجہ نکالا۔ لہٰذا وہ گمشدہ تفصیلات PhysElite کے بارے میں بعد کی رپورٹس کو سمجھنے کے لیے مرکزی حیثیت رکھتی ہیں۔

متعلقہ گائیڈز اور کوئزز

AI ماڈلز کی وضاحتٹرانسفارمرزاے آئی ٹریننگاے آئی اخلاقیاتآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیںاے آئی ماڈل ریلیز ٹریکر پر عمل کریں۔
یہ مفید پایا؟