خبروں پر واپس جائیں۔
اختراعAI Understanding بریفنگ

ایک OpenAI AI سے تیار کردہ ثبوت کا آڈٹ ایک الٹی حالت تلاش کرتا ہے، اور ایک مرمت شائع کرتا ہے

دو محققین کا کہنا ہے کہ OpenAI کی ریاضی کی دستاویز کے باب 6 میں ایک لیما ثبوت میں قطبیت کی خرابی ہے: اوسط کامیابی کے لحاظ سے ایک امتحان جہاں اگلے مرحلے میں بڑی مشروط ناکامی کی ضرورت ہے۔ وہ ایک جوابی مثال اور ایک درست ثبوت دیتے ہیں، اور احتیاط کرتے ہیں کہ یہ باب کے مرکزی نظریہ کی تصدیق نہیں ہے۔

7 min readRead the primary source
Source-page capture accompanying Audit of an OpenAI AI-Generated Proof Finds a Reversed Condition, and Publishes a Repair
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
arxiv.org
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2608.14673
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

مصنوعی ذہانت (AI)
عمارت کے نظاموں کا وسیع میدان جو کاموں کو انجام دیتا ہے جس میں پیٹرن کی شناخت، استدلال، زبان، یا فیصلہ سازی کی ضرورت ہوتی ہے۔
الگورتھم
قواعد یا اقدامات کا ایک متعین سیٹ جس کی پیروی کمپیوٹر کسی مسئلے کو حل کرنے یا کسی کام کو مکمل کرنے کے لیے کرتا ہے۔
حوالہ جات
ماخذ کے حوالہ جات یا دستاویزات جو ماڈل کے جواب میں اس کے دعووں کی حمایت میں شامل ہیں۔
اپنے آپ کو جانچیں۔AI ماڈلز نے کوئز کی وضاحت کی۔

کیا ہوا؟

3 اگست 2026 کو arXiv پر پوسٹ کیا گیا ایک آٹھ صفحات کا نوٹ رپورٹ کرتا ہے کہ OpenAI کی ریاضی اور نظریاتی کمپیوٹر سائنس میں دس پیشرفت کے باب 6 میں لالچی کنڈیشنگ لیما کا پرنٹ شدہ ثبوت تکمیلی واقعات کے درمیان ایک شرط کو تبدیل کرتا ہے۔ مصنفین کا کہنا ہے کہ لیما کا بیان درست ہے، پرنٹ شدہ طریقہ کار کے لیے ایک جوابی مثال فراہم کریں، اور ایک درست ثبوت دیں جسے وہ مقامی مرمت کے طور پر بیان کرتے ہیں۔

Mikołaj Sienicki اور Krzysztof Sienicki کے ذریعہ 3 اگست 2026 کو arXiv پر پوسٹ کیا گیا ایک مختصر نوٹ OpenAI دستاویز کے باب 6 کے اندر لیما کے پرنٹ شدہ ثبوت میں غلطی کی اطلاع دیتا ہے جس کا عنوان ہے ریاضی اور نظریاتی سائنس میں دس پیشرفت۔ arXiv لسٹنگ (2608.14673) مصنوعی ذہانت کے تحت دائر کی گئی ہے اور کوانٹم فزکس میں کراس لسٹڈ ہے، اور اس کا میٹا ڈیٹا پانچ حوالوں کے ساتھ آٹھ صفحات پر مشتمل کاغذ کی وضاحت کرتا ہے۔ نوٹ کے مطابق، باب میں تمام محدود دو کھلاڑیوں، ایک گول میں الجھے ہوئے کھیلوں کا احاطہ کرنے والے ایک متوازی متوازی تکرار تھیوریم کا دعویٰ کیا گیا ہے - موٹے طور پر، یہ بیان کہ اس طرح کے کھیل کو شکست دینے کا موقع اس وقت تیزی سے ختم ہو جاتا ہے جب کوانٹم اینگلمنٹ کا اشتراک کرنے والے کھلاڑی ایک ساتھ کئی کاپیاں کھیلتے ہیں۔

متنازعہ مرحلہ وہ ہے جسے نوٹ ایک مقداری لالچی کنڈیشنگ لیما کہتا ہے، جو باب کی دلیل میں ابتدائی طور پر استعمال ہوا ہے۔ اس کا کام کوآرڈینیٹ، D کا ایک چھوٹا سیٹ منتخب کرنا ہے، اس طرح کہ D میں ہر کوآرڈینیٹ جیتنے والے کھلاڑیوں پر کنڈیشنگ کرنے کے بعد، تصادفی طور پر منتخب کردہ بقیہ کوآرڈینیٹ کم از کم 1−δ اوسط امکان کے ساتھ جیتا جاتا ہے۔ مصنفین اس بیان پر اختلاف نہیں کرتے؛ وہ کہتے ہیں کہ یہ صحیح ہے. ان کا اعتراض اس کے نیچے چھپی دلیل پر ہے۔ جیسا کہ لکھا گیا ہے، طریقہ کار کے تسلسل کے امتحان کا اظہار اوسط کامیابی کے لحاظ سے کیا جاتا ہے، جبکہ اگلے مرحلے میں ایک مخصوص کوآرڈینیٹ کی موجودگی کی ضرورت ہوتی ہے جس میں ایک بڑی مشروط ناکامی کا امکان ہوتا ہے۔ نوٹ میں کہا گیا ہے کہ مطلب غلط ہے۔

دعوے کی پشت پناہی کرنے کے لیے، مصنفین ایک واضح جوابی مثال دیتے ہیں، اور کہتے ہیں کہ سادہ سی مثالیں بھی پرنٹ شدہ طریقہ کار کو بغیر کسی درست اگلی حرکت کے چھوڑ سکتی ہیں - یعنی، لکھا ہوا لوپ اپنی ضرورت کوآرڈینیٹ پیدا کرنے کے بجائے رک سکتا ہے۔ اس کے بعد وہ اس بات کی نشاندہی کرتے ہیں کہ وہ کس چیز کو جاری رکھنے کی مطلوبہ شرط سمجھتے ہیں، جو کامیابی کے بجائے ناکامی کے لحاظ سے بیان کی گئی ہے، اور ایک مکمل درست ثبوت فراہم کرتے ہیں۔ وہ مرمت کو مقامی کے طور پر نمایاں کرتے ہیں: لیمما کا بیان غیر تبدیل شدہ ہے، اور اسی طرح وہ پیرامیٹرز ہیں جو باقی باب اس سے اخذ کرتے ہیں، لہذا نیچے کی طرف جانے والے اقدامات جو لیما کا حوالہ دیتے ہیں انہیں دوبارہ لکھنے کی ضرورت نہیں ہے۔

نوٹ غیر معمولی طور پر اس کے بارے میں واضح ہے جو یہ قائم نہیں کرتا ہے۔ مصنفین لکھتے ہیں کہ ان کی تصحیح کو مرکزی متوازی تکرار نظریہ کی آزادانہ تصدیق کے طور پر نہیں پڑھنا چاہیے۔ انہوں نے ایک ابتدائی لیمہ طے کیا، باب نہیں۔ کئی چیزیں ماخذ سے ہی نامعلوم ہیں۔ اس میں یہ نام نہیں ہے کہ کس ماڈل نے باب تیار کیا، یہ بیان نہیں کیا کہ متن کیسے تیار ہوا، یا یہ نہیں بتاتا کہ اشاعت سے پہلے اسے کتنی انسانی ترمیم ملی۔ یہ ناقص یا درست شدہ ثبوت کے کسی مشین سے چیک شدہ فارملائزیشن کی اطلاع نہیں دیتا، اس میں OpenAI کی طرف سے کوئی جواب شامل نہیں ہے، اور — بطور arXiv پری پرنٹ — ہم مرتبہ کے جائزے کا کوئی اشارہ نہیں دیتا ہے۔ دعویٰ کہ مطبوعہ ثبوت ٹوٹ گیا ہے اور مرمت درست ہے، اس مرحلے پر، مصنفین کا دعوی، اسی جانچ کے لیے کھلا ہے جس کا انھوں نے اطلاق کیا تھا۔

ماخذ کی تفصیلات: arxiv.org

یہ کیوں اہمیت رکھتا ہے۔

اطلاع دی گئی ناکامی ایک فریب شدہ حوالہ یا ایجاد کردہ نمبر نہیں ہے بلکہ ایک واحد معکوس عدم مساوات کو کسی دوسری صورت میں قابل فہم دلیل میں دفن کیا گیا ہے - اس قسم کی خرابی جو سکم سے بچ جاتی ہے اور صرف لائن بہ لائن پڑھنے سے پکڑی جاتی ہے۔ یہ ایک غیر حل شدہ سوال میں ایک ٹھوس ڈیٹا پوائنٹ ہے: AI سے تیار کردہ ریاضی پر انحصار کرنے سے پہلے اس کی جانچ کیسے کی جانی چاہئے۔

واضح ناکامیوں پر تکنیکی تحریری مراکز میں AI کی غلطیوں کے بارے میں زیادہ تر عوامی بحث: من گھڑت حوالہ جات، ایجاد کردہ نمبر، ریاضی جو معائنہ پر الگ ہو جاتے ہیں۔ یہاں بیان کردہ عیب ایک مختلف نوع کا ہے۔ ایک واقعہ پر بیان کردہ شرط اس کی تکمیل پر لکھی گئی تھی - کامیابی جہاں ناکامی کی ضرورت تھی۔ ارد گرد کا نثر صحیح طور پر پڑھتا ہے، ثابت کیا جا رہا لیمہ سچ ہے، اور تمام پیرامیٹرز ایک ساتھ ہیں۔ یہی امتزاج اسے مشکل بناتا ہے: دلیل ہر سطح پر قابل فہم ہے سوائے اس کے جو فیصلہ کرتا ہے کہ آیا یہ کام کرتا ہے۔ جائزہ لینے والے جو بیان، مستقل، اور مجموعی شکل کو چیک کرتے ہیں وہ اسے پاس کر سکتے ہیں اور پھر بھی وقفے سے محروم رہ جاتے ہیں۔

اس کا عملی نتیجہ اخذ کرنے، الگورتھم کی درستگی کے دلائل، یا پروٹوکول کے تجزیوں کے لیے ماڈل استعمال کرنے والے ہر شخص کے لیے ہوتا ہے۔ اس بات کی تصدیق کرنا کہ نتیجہ درست ہے، اس بات کی تصدیق کرنے کے مترادف نہیں ہے کہ فراہم کردہ ثبوت اسے ثابت کرتا ہے۔ اس صورت میں دونوں چیزیں الگ ہونے کے قابل ہوئیں: دعویٰ بچ گیا، استدلال نہیں ہوا۔ دوسری صورتوں میں پرچی کا ایک ہی طبقہ کسی ایسے نتیجے کی حمایت کر سکتا ہے جو محض غلط ہے، اسے پکڑنے کے لیے کوئی بیرونی جانچ نہیں ہے۔ AI سے تیار کردہ ریاضی کے لیے قابل عمل نظرثانی کی اکائی انفرادی غیر معمولی قدم معلوم ہوتی ہے، نظریہ نہیں، اور یہ مہنگا انسانی کام ہے۔

یہ واقعہ ایک امتیازی ٹول کے طور پر رسمی تصدیق کی طرف بھی اشارہ کرتا ہے۔ تکمیلی واقعات کے درمیان قطبی تبدیلی بالکل اسی قسم کی خرابی ہے جو ایک پروف اسسٹنٹ میکانکی طور پر پکڑتا ہے، کیونکہ پیدا کردہ شے کی قسم اگلے مرحلے کے لیے درکار قسم سے مماثل نہیں ہوگی۔ یہ باب، جیسا کہ بیان کیا گیا ہے، نثری ریاضی تھا، جس طرح سے قارئین کی طرف سے نثری ریاضی کی ہمیشہ جانچ پڑتال کی گئی ہے۔ چونکہ AI سسٹمز امیدواروں کے زیادہ ثبوت تیار کرتے ہیں جتنا کہ ماہرین پڑھ سکتے ہیں، اس لیے کیا پیدا کیا جا سکتا ہے اور کیا آڈٹ کیا جا سکتا ہے کے درمیان فرق بڑھ جاتا ہے، اور مشین چیکنگ اسے بند کرنے کا واضح امیدوار ہے۔

اس کو کہاں تک پڑھنا ہے اس بارے میں کچھ احتیاط کی ضرورت ہے۔ یہ ایک دستاویز کے ایک باب میں ایک لیما ہے، جس کی اطلاع دو مصنفین نے آٹھ صفحات کے نوٹ میں دی ہے۔ یہ غلطی کی کوئی شرح فراہم نہیں کرتا، اسی طرح کی لمبائی میں انسانی تحریری ثبوتوں سے کوئی موازنہ نہیں، اور اس بارے میں کوئی ثبوت نہیں ہے کہ آیا AI سے تیار کردہ ریاضی میں اس قسم کی غلطی نایاب ہے یا عام۔ انسانی تصنیف میں بھی قابل اصلاح غلطیاں ہوتی ہیں، اور ادب میں اصلاحی نوٹ کی بالکل اسی صنف کی ایک طویل روایت ہے۔ نیا کیا ہے موضوع: ناقص متن ایک سسٹم سے آیا ہے، جسے ایک کمپنی کے ذریعہ شائع کیا گیا ہے جس میں اس کی ریاضیاتی پیداوار کو کس طرح پرکھا جاتا ہے۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
انٹرایکٹو تصور چیک+10 Points
AI Models Explained Quiz

What is the best response when AI Models Explained makes a mistake in production?

آگے کیا دیکھنا ہے۔

آیا OpenAI باب کو تسلیم کرتا ہے یا درست کرتا ہے، کیا دوسرے ابواب اسی طرح کے آڈٹ کراتے ہیں، اور کیا کوئی آزادانہ طور پر متوازی تکرار کے مرکزی نظریہ کی تصدیق کرتا ہے جس میں تصحیح شدہ لیما فیڈ کرتا ہے۔ یہ بھی دیکھنے کے قابل ہے کہ آیا مشین سے چیک شدہ فارملائزیشن AI سے تیار کردہ ثبوتوں کا معمول بن جاتا ہے۔

دیکھنے کے لیے پہلی چیز یہ ہے کہ آیا OpenAI جواب دیتا ہے — ایک خطا کے ساتھ، ایک نظر ثانی شدہ باب، یا ایک اہم اختلاف کے ساتھ۔ ایک نظر آنے والی تصحیح تجویز کرے گی کہ دستاویز کو مظاہرے کی بجائے تکنیکی نمونے کی طرح برقرار رکھا جا رہا ہے۔ خاموشی قارئین کو تیسرے فریق کے نوٹ کے خلاف شائع شدہ متن کو ملانے پر چھوڑ دے گی۔ آیا تصحیح، اگر کی گئی ہے، یہاں تجویز کردہ سے مماثل ہے، یہ ایک الگ سوال ہے جس سے باخبر رہنا ضروری ہے، کیونکہ ایک مختلف مرمت ان پیرامیٹرز کو محفوظ نہیں رکھ سکتی جن پر بعد میں باب انحصار کرتا ہے۔

دوسرا، کیا ایک ہی دستاویز کے دوسرے ابواب تقابلی جانچ پڑتال کرتے ہیں۔ ایک ہی آڈٹ قصہ ہے؛ دس دعوے کیے گئے ایڈوانسز میں آزاد آڈٹ کا ایک سیٹ اس بات کی نشاندہی کرنا شروع کر دے گا کہ مجموعہ کتنا قابل اعتماد ہے اور ناکامی کے طریقوں کا کلسٹر کہاں ہے۔ رکاوٹ یہ ہے کہ اس قسم کے جائزے کے لیے ڈومین کے ماہرین کی ضرورت ہوتی ہے جو کسی اور کے آؤٹ پٹ پر سنجیدہ وقت گزارنے کے لیے تیار ہوں، اس کے کرنے کے لیے روایتی تعلیمی انعام بہت کم ہے۔

تیسرا، چاہے کوئی بھی آزادانہ طور پر مرکزی متوازی تکرار نظریہ کی توثیق کرتا ہے جو درست شدہ لیما کی حمایت کرتا ہے۔ مصنفین واضح تھے کہ انہوں نے ایسا نہیں کیا۔ جب تک ایسا نہیں ہوتا، شواہد کی حالت یہ ہے کہ ایک ابتدائی قدم میں اب ایک ثبوت موجود ہے جس کے مصنفین کا خیال ہے کہ وہ درست ہے، اور بڑے دعوے کی عوام میں جانچ نہیں کی گئی۔ باب کی مشین کے ذریعے جانچ کی گئی رسمی شکل — یا یہاں تک کہ اکیلے لیما کی — تیزی سے بدل جائے گی کہ نتیجہ کتنا وزن برداشت کر سکتا ہے۔

چوتھا، چاہے اصول AI سے تیار کردہ ریاضی کے انکشاف اور آڈٹ کے ارد گرد بنتے ہیں: لیبل لگانا کہ کون سے دلائل ماڈل کے ذریعے تیار کیے گئے تھے، یہ بتاتے ہوئے کہ کیا انسانی یا خودکار جانچ پڑتال کا اطلاق کیا گیا تھا، اور غیر تصدیق شدہ ثبوتوں کو نتائج کے بجائے ڈرافٹ کے طور پر سمجھا جاتا ہے۔ اسی طرح کے سوالات پر جرائد اور پری پرنٹ سرورز آہستہ آہستہ آگے بڑھ رہے ہیں۔ یہ نوٹ بھی ایک پری پرنٹ ہے اور خود اس کا ہم مرتبہ جائزہ نہیں لیا گیا ہے، لہذا اس کا اپنا استقبال - چاہے کوانٹم متوازی تکرار کے ماہرین جوابی مثال کی تصدیق کریں اور مرمت کو قبول کریں - اس کا حصہ ہے جس کی پیروی کی جائے۔

متعلقہ گائیڈز اور کوئزز

AI ماڈلز کی وضاحتChatGPT اور ایل ایل ایماے آئی کا مستقبلآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیں
یہ مفید پایا؟