خبروں پر واپس جائیں۔
اختراعAI Understanding بریفنگ

AI کی مدد سے ریاضی کا مطالعہ ایک طویل مدتی مستقل پر پابندیوں کو سخت کرتا ہے۔

ایک کیس اسٹڈی رپورٹ کرتی ہے کہ اے آئی ریسرچ سسٹم نے گروتھنڈیک کنسٹنٹ پر حد کو بہتر بنانے میں مدد کی، جب کہ مصنفین اس بات پر زور دیتے ہیں کہ انسانی محققین نے کلیدی محور کا انتخاب کیا اور آزادانہ طور پر صرف تھیوریم لیول کے نتائج کی تصدیق کی۔

6 min readRead the primary source
بنیادی ماخذ دستاویزماخذ ریکارڈ شدہ
پبلشر
Long-horizon AI mathematics case study on arXiv
ماخذ لنک
arxiv.orghttps://arxiv.org/abs/2608.11195
ماخذ کی قسم
بنیادی دستاویز — ایک سرکاری اعلان، کاغذ، فائلنگ، یا فریق اول کا صفحہ جسے ہم براہ راست پڑھتے ہیں۔
سیاق و سباقاسے 60 سیکنڈ میں سمجھیں۔

یہاں سے شروع کریں۔

کلیدی شرائط

API (ایپلی کیشن پروگرامنگ انٹرفیس)
ایک سافٹ ویئر سسٹم کے لیے دوسرے سسٹم کو درخواستیں بھیجنے اور اس سے جواب موصول کرنے کا ایک منظم طریقہ۔
میموری (ایجنٹ میموری)
ذخیرہ شدہ سیاق و سباق ایک AI ایجنٹ تسلسل کو بہتر بنانے کے لیے تمام مراحل یا سیشنز میں استعمال کرتا ہے۔
بینچ مارک
ایک معیاری ٹیسٹ یا ڈیٹا سیٹ جو ماڈل کی کارکردگی کی پیمائش اور موازنہ کرنے کے لیے استعمال ہوتا ہے۔
اپنے آپ کو جانچیں۔اے آئی ایجنٹس کوئز

کیا ہوا؟

ایک نیا arXiv کیس اسٹڈی یہ بتاتا ہے کہ کس طرح ایک AI ریسرچ سسٹم نے ریاضی دانوں کو گروتھنڈیک کنسٹنٹ پر معلوم حدوں کو بہتر بنانے میں مدد کی، یہ 1953 کا ایک کھلا مسئلہ ہے۔ اس مقالے میں ریاضی کے نتائج اور اس بات کا تفصیلی ریکارڈ موجود ہے کہ سسٹم نے کہاں اچھی طرح سے کام کیا، جہاں لوگوں کو اسے چلانا پڑا، اور کون سا دعویٰ کرتا ہے کہ انسانوں کے مقابلے میں مشینوں کے بارے میں بات کی گئی۔

Grothendieck مسلسل ایک مشکل امتزاج اصلاح کے مسئلے اور ایک زیادہ قابل تعدد سیمی ڈیفینیٹ نرمی کے درمیان فرق کو ماپتا ہے۔ مصنفین 6pi/11 کی نچلی حد، تقریباً 1.7135، اور تقریباً 1.7818 کے اوپری باؤنڈ کے ساتھ ایک نئے وقفے کی اطلاع دیتے ہیں۔ ساتھی ریاضی کا پیپر ثبوت فراہم کرتا ہے۔ کم حد کا نتیجہ قابل ذکر ہے کیونکہ یہ ایک مشکل مثال نہیں بناتا ہے۔ اس کے بجائے یہ ایک رکاوٹ حاصل کرتا ہے جو متعلقہ راؤنڈنگ اسکیموں پر لاگو ہوتا ہے۔

تحقیقی نظام نے کوڈنگ ایجنٹ کے ساتھ استدلال کے ماڈل کو جوڑا۔ کاغذ کا کہنا ہے کہ رن نے GPT-5.5-Pro ​​اور بعد میں GPT-5.6-Sol کو استدلال کے لیے استعمال کیا، Claude Code کے ساتھ Opus اور بعد میں Fable 5، اور عددی تلاش کے لیے ایک چار GPU نوڈ۔ سیشن فائلوں، ٹرانسکرپٹس، تجرباتی نوشتہ جات، اور ایک خلاصہ کے ذریعے تسلسل رکھتے ہیں جس میں دعوؤں کو ایک بلاتعطل سیاق و سباق پر انحصار کرنے کی بجائے ثابت، عددی طور پر تائید شدہ، قیاس، یا ہورسٹک کے طور پر ریکارڈ کیا جاتا ہے۔

اس دوڑ میں 16 جون سے 24 جولائی تک تقریباً 240 تحقیقی سیشنز کا احاطہ کیا گیا، جس میں 2,091 ریجننگ ماڈل کالز اور تخمینی $5,400 API لاگت پر 152 ملین ٹوکنز شامل تھے۔ تقریباً 40 تاریخ انسانی ہدایات نے کام کو آگے بڑھایا۔ جب اوپری باؤنڈ تلاش کی سطح مرتفع ہوتی ہے، تو آپریٹرز نے تسلیم کیا کہ بار بار ناکامی ایک عام رکاوٹ کی نشاندہی کر سکتی ہے اور سسٹم کو نچلے درجے کی دلیل کی طرف ری ڈائریکٹ کر دیا۔ مقالے میں تحقیق کی سمت میں تبدیلی کو انسانی مداخلت کے طور پر بیان کیا گیا ہے، نہ کہ خود مختار فیصلہ۔

اس نظام نے 6pi/11 لوئر باؤنڈ کے لیے ایک مرکزی ریفریم اور ایک مکمل ثبوت تیار کیا، جسے مصنفین نے پھر نظر ثانی کی اور آزادانہ طور پر تصدیق کی۔ اس نے مضبوط عددی اوپری اور نچلے امیدوار بھی پیدا کیے جنہوں نے اندرونی جانچ پڑتال کے پروٹوکول کو پاس کیا، لیکن مصنفین نے ان سرٹیفیکیٹس کی آزادانہ طور پر تصدیق نہیں کی ہے اور انہیں تھیومز کے طور پر بیان نہیں کیا ہے۔ لہذا کاغذ تصدیق شدہ ریاضی کے نتائج کو سسٹم کے زیادہ قیاس آرائی یا مشین سے ٹیسٹ شدہ نتائج سے الگ کرتا ہے۔

ماخذ کی تفصیلات: Long-horizon AI mathematics case study on arXiv ↗

یہ کیوں اہمیت رکھتا ہے۔

یہ مطالعہ کسی ایک بینچ مارک کام کے بجائے تحقیقی پروگرام میں استعمال ہونے والے AI کے بارے میں غیر معمولی طور پر ٹھوس ثبوت پیش کرتا ہے۔ اس کی سب سے اہم تلاش محنت کی تقسیم ہے: نظام تکنیکی عمل میں مضبوط تھا، جبکہ انسانی محققین ایجنڈا کی ترتیب، فیصلے، اور حتمی تصدیق کے ذمہ دار رہے۔

AI سسٹم کے لیے طویل افق کی تحقیق مشکل ہے کیونکہ ناکام نقطہ نظر کے جمع ہونے کے ساتھ ہی مقصد بدل سکتا ہے۔ ایک کارآمد ساتھی کو جو کوشش کی گئی تھی اسے برقرار رکھنا چاہیے، ایک غیر حل شدہ آئیڈیا سے ڈیڈ اینڈ کو الگ کرنا چاہیے، اور فیصلہ کرنا چاہیے کہ کب کوئی نیا سوال دوسرے مقامی اصلاح سے زیادہ قیمتی ہے۔ مصنفین کی فائل پر مبنی میموری اور کلیم لیبل اس تحقیق کی حالت کو مرئی اور قابل سماعت بنانے کی کوشش ہیں بجائے اس کے کہ روانی سے جواب کو پیشرفت کے لیے کھڑا کیا جائے۔

نچلے درجے کی دریافت سے پتہ چلتا ہے کہ انسانی فیصلہ اب بھی کیوں اہمیت رکھتا ہے یہاں تک کہ جب کوئی ایجنٹ ریاضی کو انجام دے سکتا ہے۔ آپریٹرز نے دیکھا کہ بہت سی کوششیں کی گئی تعمیرات اسی طرح ناکام ہو رہی تھیں اور انہوں نے تصوراتی محور فراہم کیا: خود بار بار رکاوٹ کو ثابت کریں۔ اس کے بعد سسٹم نے دلیل کو باقاعدہ بنانے اور تصدیق کرنے میں مدد کی۔ یہ ترتیب ایک آزاد مشین ریاضی دان کے مقابلے میں زیر نگرانی ایکسپلوریشن کے زیادہ قریب ہے، اور یہ بیان کرتے وقت امتیاز اہمیت رکھتا ہے کہ شواہد کس چیز کی تائید کرتے ہیں۔

آزاد تصدیق نتیجہ کے لیے ریلیز گیٹ ہے۔ کیس اسٹڈی کا کہنا ہے کہ مصنفین کے ذریعہ نچلے حصے کی جانچ پڑتال کی گئی تھی اور یہ کہ مکمل ثبوت ایک ساتھی کاغذ میں ظاہر ہوتے ہیں۔ یہ نہیں کہتا کہ رن کے دوران پیدا ہونے والا ہر نمبر درست ہے۔ تھیوریم کی سطح کے دعووں، مشین کے ذریعے ٹیسٹ کیے گئے امیدواروں، اور مفروضوں کو الگ رکھنا قارئین کو AI سسٹم کے اندرونی اعتماد کو ریاضیاتی ثبوت کے طور پر قبول کیے بغیر شراکت کا جائزہ لینے کا ایک طریقہ فراہم کرتا ہے۔

تحقیقی تنظیموں کے لیے، عملی سبق فعال ہے۔ ایک AI سسٹم لٹریچر کو تلاش کر سکتا ہے، کوڈ لکھ سکتا ہے، تجربات چلا سکتا ہے، ناکام کوششوں کو محفوظ کر سکتا ہے، اور تبدیلیاں تجویز کر سکتا ہے، لیکن ارد گرد کے ورک فلو کو پرویننس، دوبارہ پیدا کرنے کے قابل کمپیوٹیشنز، واضح انسانی چیک پوائنٹس، اور ٹیم کی سمت کیوں بدلی اس کی تشکیل نو کا طریقہ درکار ہے۔ رپورٹ کردہ لاگت اور حساب سے یہ بھی واضح ہوتا ہے کہ طویل افق کی صلاحیت صرف ماڈل کی ذہانت کا سوال نہیں ہے۔ یہ سہاروں، وقت، اور مسلسل نگرانی پر منحصر ہے۔

Interactive Mechanism

انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔

اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
انٹرایکٹو تصور چیک+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

آگے کیا دیکھنا ہے۔

اگلا سوال یہ ہے کہ کیا یہ تعاون کا نمونہ ایک مسئلہ اور ٹیم سے آگے بڑھتا ہے، اور کیا آزاد محققین ہر انسان اور AI شراکت کی لاگت اور وشوسنییتا کی پیمائش کرتے ہوئے تصدیق شدہ نتیجہ کو دوبارہ پیش کر سکتے ہیں۔

نقل کو دوسرے ریاضی کے ڈومینز، مسئلہ کی اقسام، اور تحقیقی نظام کو مختلف میموری اور ٹول ڈیزائن کے ساتھ جانچنا چاہیے۔ Grothendieck مسئلہ پہلے سے ہی کافی انسانی ساختہ فریم ورک، جمع شدہ نوٹ، سرٹیفیکیشن مشینری، اور امیدواروں کی ہدایات کے ساتھ آیا ہے۔ اس سابقہ ​​ڈھانچے کو چلانے میں مدد ملی، لہذا مستقبل کے مطالعے کو یہ رپورٹ کرنا چاہیے کہ تحقیق کی کتنی حالت پہلے سے فراہم کی گئی تھی اور جب نظام کو خود مسئلہ کی وضاحت کرنی چاہیے تو نتائج کیسے بدلتے ہیں۔

محققین کو ممکنہ اقدامات کا استعمال کرتے ہوئے تحقیقی فیصلے کے ساتھ تکنیکی عمل درآمد کا موازنہ بھی کرنا چاہئے۔ مفید میٹرکس میں منتخب کردہ سمتوں کا معیار، ناکام راستے کو چھوڑنے کا وقت، غیر تعاون یافتہ دعووں کی شرح، انسانی مداخلتوں کی تعداد، اور آزادانہ جانچ سے بچنے والے نتائج کا حصہ شامل ہو سکتا ہے۔ ایک پالش کیس اسٹڈی دکھا سکتا ہے کہ کیا ہوا، لیکن یہ اندازہ لگانے کے لیے کنٹرولڈ موازنے کی ضرورت ہوتی ہے کہ جب کوئی AI ساتھی جائزہ کی ایک اور پرت شامل کرنے کے بجائے عمل کو بہتر بناتا ہے۔

مشین کی توثیق اور انسانی تصدیق کے درمیان حد مسلسل توجہ کا مستحق ہے۔ وقفہ ریاضی، ثبوت کے معاونین، ٹیسٹ، اور مخالفانہ آڈٹ بہت سی غلطیاں پکڑ سکتے ہیں، پھر بھی ایک سرٹیفکیٹ غلط ہدف کو انکوڈ کر سکتا ہے یا ان مفروضوں پر منحصر ہو سکتا ہے جنہیں کبھی چیلنج نہیں کیا گیا۔ فالو اپ کام کو مکمل نمونے شائع کرنے چاہئیں، مضبوط ترین غیر تصدیق شدہ حدود کو دوبارہ چلائیں، اور ناکام یا واپس لیے گئے نتائج کو کامیاب نتائج کی طرح دکھائی دیں۔

آخر میں، ماڈل ورژن، پرامپٹس، اسٹیئرنگ ہدایات، کوڈ، کمپیوٹ، اور ٹرانسکرپٹس کو محفوظ کیا جانا چاہیے جہاں لائسنسنگ اور رازداری کی اجازت ہو۔ موجودہ کاغذ جزوی طور پر قیمتی ہے کیونکہ یہ ان حالات کی اطلاع دیتا ہے اور نظام کی کمزوریوں کو بیان کرتا ہے، بشمول نازک تحقیقی ریاست کی نمائندگی اور فیصلے میں محدود خودمختاری۔ جب تک کہ دوسری ٹیمیں پیٹرن کو دوبارہ نہیں بناتی، یہ AI کی مدد سے ریاضیاتی پیشرفت کا مضبوط ثبوت ہے، اس بات کا ثبوت نہیں کہ AI سسٹم آزادانہ طور پر کھلی تحقیق کر سکتے ہیں۔

متعلقہ گائیڈز اور کوئزز

اے آئی ایجنٹسAI ماڈلز کی وضاحتاے آئی ٹریننگایل ایل ایم کی تشخیصآپ جو جانتے ہیں اس کی جانچ کریں - ایک مفت AI کوئز آزمائیں۔ہماری لغت میں AI کی اصطلاح دیکھیںاے آئی ماڈل ریلیز ٹریکر پر عمل کریں۔
یہ مفید پایا؟