সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

এআই-সহায়তা গণিত অধ্যয়ন একটি দীর্ঘস্থায়ী ধ্রুবকের উপর সীমাবদ্ধতা শক্ত করে

একটি কেস স্টাডি রিপোর্ট করে যে একটি এআই গবেষণা সিস্টেম গ্রোথেনডিক ধ্রুবকের সীমানা উন্নত করতে সাহায্য করেছে, যখন লেখক জোর দিয়েছেন যে মানব গবেষকরা মূল পিভট বেছে নিয়েছেন এবং স্বাধীনভাবে শুধুমাত্র উপপাদ্য-স্তরের ফলাফল যাচাই করেছেন।

6 min readRead the primary source
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
Long-horizon AI mathematics case study on arXiv
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.11195
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

API (অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস)
একটি সফ্টওয়্যার সিস্টেমের জন্য একটি কাঠামোগত উপায় অন্য সিস্টেমে অনুরোধ পাঠাতে এবং প্রতিক্রিয়াগুলি গ্রহণ করার জন্য।
মেমরি (এজেন্ট মেমরি)
সঞ্চিত প্রসঙ্গ একটি এআই এজেন্ট ধারাবাহিকতা উন্নত করতে বিভিন্ন ধাপ বা সেশন জুড়ে ব্যবহার করে।
বেঞ্চমার্ক
মডেলের কর্মক্ষমতা পরিমাপ এবং তুলনা করার জন্য ব্যবহৃত একটি প্রমিত পরীক্ষা বা ডেটাসেট।
নিজেকে পরীক্ষা করুনএআই এজেন্ট কুইজ

কি হয়েছে

একটি নতুন arXiv কেস স্টাডি বর্ণনা করে যে কীভাবে একটি AI গবেষণা সিস্টেম গণিতবিদদের গ্রোথেনডিক ধ্রুবকের পরিচিত সীমার উন্নতি করতে সাহায্য করেছিল, এটি 1953 সালের একটি উন্মুক্ত সমস্যা। এই গবেষণাপত্রটি গাণিতিক ফলাফল এবং সিস্টেমটি কোথায় ভালভাবে কার্যকর হয়েছে, যেখানে মানুষকে এটিকে পরিচালনা করতে হয়েছিল, এবং কোনটি যন্ত্রের চেয়ে মানব-মানুষের দাবি করা হয়েছে তার একটি বিস্তারিত রেকর্ড উভয়ই উপস্থাপন করে।

গ্রোথেনডিক ধ্রুবক একটি কঠিন সংমিশ্রণমূলক অপ্টিমাইজেশান সমস্যা এবং আরও ট্র্যাক্টেবল আধা-নির্দিষ্ট শিথিলতার মধ্যে ব্যবধান পরিমাপ করে। লেখকরা 6pi/11-এর নিম্ন সীমা, প্রায় 1.7135, এবং প্রায় 1.7818-এর ঊর্ধ্ব সীমার সাথে একটি নতুন ব্যবধানের রিপোর্ট করেছেন। সঙ্গী গণিতের কাগজ প্রমাণ সরবরাহ করে। নিম্ন-বাউন্ড ফলাফল উল্লেখযোগ্য কারণ এটি একটি কঠিন উদাহরণ তৈরি করে না; এটি পরিবর্তে একটি বাধা তৈরি করে যা প্রাসঙ্গিক রাউন্ডিং স্কিম জুড়ে প্রযোজ্য।

গবেষণা সিস্টেমটি একটি কোডিং এজেন্টের সাথে একটি যুক্তি মডেল যুক্ত করেছে। কাগজটি বলেছে যে রানটি যুক্তির জন্য GPT-5.5-Pro ​​এবং পরে GPT-5.6-Sol, Opus সহ Claude Code এবং পরে সম্পাদনের জন্য Fable 5, এবং সংখ্যাসূচক অনুসন্ধানের জন্য একটি চার-GPU নোড ব্যবহার করেছে। সেশনগুলি ফাইল, প্রতিলিপি, পরীক্ষার লগ এবং একটি সারাংশের মাধ্যমে ধারাবাহিকতা বহন করে যা একটি নিরবচ্ছিন্ন প্রসঙ্গে নির্ভর না করে প্রমাণিত, সংখ্যাগতভাবে সমর্থিত, অনুমানমূলক বা হিউরিস্টিক হিসাবে দাবিগুলি রেকর্ড করে।

এই রানটি 16 জুন থেকে 24 জুলাই পর্যন্ত প্রায় 240টি গবেষণা সেশন কভার করেছে, যার মধ্যে 2,091টি যুক্তি-মডেল কল এবং আনুমানিক $5,400 API খরচে আনুমানিক 152 মিলিয়ন টোকেন রয়েছে। প্রায় 40 তারিখের মানব নির্দেশনা কাজটি পরিচালনা করে। যখন একটি ঊর্ধ্ব-বাউন্ড অনুসন্ধান মালভূমি হয়, তখন অপারেটররা স্বীকার করে যে বারবার ব্যর্থতা একটি সাধারণ বাধা নির্দেশ করতে পারে এবং সিস্টেমটিকে একটি নিম্ন-বাউন্ড আর্গুমেন্টের দিকে পুনঃনির্দেশিত করে। গবেষণার দিক পরিবর্তনকে একটি স্বায়ত্তশাসিত সিদ্ধান্ত নয়, একটি মানব হস্তক্ষেপ হিসাবে পেপারটি বর্ণনা করে।

সিস্টেমটি একটি কেন্দ্রীয় রিফ্রেম এবং 6pi/11 লোয়ার বাউন্ডের জন্য একটি সম্পূর্ণ প্রমাণ তৈরি করেছিল, যা লেখকরা তারপরে সংশোধিত এবং স্বাধীনভাবে যাচাই করেছিলেন। এটি অভ্যন্তরীণ চেকিং প্রোটোকল পাস করেছে এমন শক্তিশালী সংখ্যাসূচক উচ্চ এবং নিম্ন প্রার্থীদেরও তৈরি করেছে, কিন্তু লেখকরা স্বাধীনভাবে সেই শংসাপত্রগুলি যাচাই করেননি এবং তাদের উপপাদ্য হিসাবে উল্লেখ করেননি। কাগজটি তাই যাচাইকৃত গাণিতিক ফলাফলকে সিস্টেমের আরও অনুমানমূলক বা মেশিন-পরীক্ষিত আউটপুট থেকে আলাদা করে।

উত্স বিবরণ: Long-horizon AI mathematics case study on arXiv ↗

কেন এটা গুরুত্বপূর্ণ

গবেষণাটি একটি একক বেঞ্চমার্ক টাস্কের পরিবর্তে একটি গবেষণা প্রোগ্রাম জুড়ে ব্যবহৃত AI সম্পর্কে অস্বাভাবিকভাবে দৃঢ় প্রমাণ সরবরাহ করে। এর সবচেয়ে গুরুত্বপূর্ণ অনুসন্ধান হল শ্রমের একটি বিভাজন: সিস্টেমটি প্রযুক্তিগতভাবে কার্যকর করার ক্ষেত্রে শক্তিশালী ছিল, যখন মানব গবেষকরা এজেন্ডা-সেটিং, রায় এবং চূড়ান্ত যাচাইয়ের জন্য দায়ী ছিলেন।

দীর্ঘ-দিগন্ত গবেষণা একটি AI সিস্টেমের জন্য কঠিন কারণ ব্যর্থ পন্থা জমা হওয়ার সাথে সাথে উদ্দেশ্য পরিবর্তন হতে পারে। একজন দরকারী সহযোগীকে অবশ্যই যা চেষ্টা করা হয়েছিল তা ধরে রাখতে হবে, একটি অমীমাংসিত ধারণা থেকে একটি শেষ প্রান্তকে আলাদা করতে হবে এবং সিদ্ধান্ত নিতে হবে যখন একটি নতুন প্রশ্ন অন্য স্থানীয় অপ্টিমাইজেশনের চেয়ে বেশি মূল্যবান হবে। লেখকের ফাইল-ভিত্তিক মেমরি এবং দাবির লেবেলগুলি একটি সাবলীল প্রতিক্রিয়াকে অগ্রগতির জন্য দাঁড়ানোর অনুমতি দেওয়ার পরিবর্তে সেই গবেষণা অবস্থাটিকে দৃশ্যমান এবং নিরীক্ষাযোগ্য করার একটি প্রচেষ্টা।

নিম্ন-বাউন্ড আবিষ্কার দেখায় কেন মানুষের বিচার এখনও গুরুত্বপূর্ণ, এমনকি যখন একজন এজেন্ট গণিত চালাতে পারে। অপারেটররা লক্ষ্য করেছেন যে অনেক চেষ্টা করা নির্মাণ একইভাবে ব্যর্থ হচ্ছে এবং ধারণাগত পিভট সরবরাহ করেছে: বারবার বাধা নিজেই প্রমাণ করুন। সিস্টেমটি তখন আর্গুমেন্টটিকে আনুষ্ঠানিক ও প্রত্যয়িত করতে সাহায্য করেছিল। সেই ক্রমটি একটি স্বাধীন মেশিন গণিতবিদদের চেয়ে তত্ত্বাবধানে অনুসন্ধানের কাছাকাছি, এবং প্রমাণগুলি কী সমর্থন করে তা বর্ণনা করার সময় পার্থক্যটি গুরুত্বপূর্ণ।

স্বাধীন যাচাই হল ফলাফলের মুক্তির দরজা। কেস স্টাডি বলে যে নীচের সীমাটি লেখকরা পরীক্ষা করেছেন এবং সম্পূর্ণ প্রমাণগুলি একটি সহচর কাগজে উপস্থিত হয়েছে৷ এটা বলে না যে রানের সময় উত্পাদিত প্রতিটি সংখ্যা সঠিক। উপপাদ্য-স্তরের দাবি, মেশিন-পরীক্ষিত প্রার্থী এবং হাইপোথিসিস আলাদা রাখা পাঠকদের AI সিস্টেমের অভ্যন্তরীণ আত্মবিশ্বাসকে গাণিতিক প্রমাণ হিসাবে গ্রহণ না করে অবদানের মূল্যায়ন করার একটি উপায় দেয়।

গবেষণা প্রতিষ্ঠানের জন্য, ব্যবহারিক পাঠ চালু আছে। একটি AI সিস্টেম সাহিত্য অনুসন্ধান করতে পারে, কোড লিখতে পারে, পরীক্ষা চালাতে পারে, ব্যর্থ প্রচেষ্টা সংরক্ষণ করতে পারে এবং রূপান্তর প্রস্তাব করতে পারে, কিন্তু আশেপাশের কর্মপ্রবাহের জন্য প্রয়োজন প্রমাণ, পুনরুত্পাদনযোগ্য গণনা, সুস্পষ্ট মানব চেকপয়েন্ট এবং দলটি কেন দিক পরিবর্তন করেছে তা পুনর্গঠনের একটি উপায়। রিপোর্ট করা খরচ এবং গণনা আরও স্পষ্ট করে যে দীর্ঘ-দিগন্তের ক্ষমতা শুধুমাত্র মডেল বুদ্ধিমত্তার প্রশ্ন নয়; এটা ভারা, সময়, এবং টেকসই তদারকির উপর নির্ভর করে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

পরবর্তী কি দেখতে

পরবর্তী প্রশ্ন হল এই সহযোগিতার প্যাটার্নটি একটি সমস্যা এবং দলের বাইরে সাধারণীকরণ করে এবং প্রতিটি মানুষের এবং AI অবদানের খরচ এবং নির্ভরযোগ্যতা পরিমাপ করার সময় স্বাধীন গবেষকরা যাচাইকৃত ফলাফল পুনরুত্পাদন করতে পারে কিনা।

প্রতিলিপির অন্যান্য গাণিতিক ডোমেন, সমস্যার ধরন এবং বিভিন্ন মেমরি এবং টুল ডিজাইন সহ গবেষণা সিস্টেম পরীক্ষা করা উচিত। Grothendieck সমস্যা ইতিমধ্যে একটি যথেষ্ট মানব-নির্মিত কাঠামো, জমা নোট, সার্টিফিকেশন যন্ত্রপাতি, এবং প্রার্থীর দিকনির্দেশ নিয়ে এসেছে। সেই পূর্বের কাঠামোটি চলতে সাহায্য করেছিল, তাই ভবিষ্যতের অধ্যয়নগুলিকে রিপোর্ট করা উচিত যে গবেষণার অবস্থার কতটা আগে থেকে সরবরাহ করা হয়েছিল এবং কীভাবে ফলাফলগুলি পরিবর্তিত হয় যখন সিস্টেমটিকে নিজেই সমস্যাটি সংজ্ঞায়িত করতে হবে।

গবেষকদের সম্ভাব্য ব্যবস্থা ব্যবহার করে গবেষণা রায়ের সাথে প্রযুক্তিগত নির্বাহের তুলনা করা উচিত। দরকারী মেট্রিক্সের মধ্যে নির্বাচিত দিকনির্দেশের গুণমান, একটি ব্যর্থ পথ পরিত্যাগ করার সময়, অসমর্থিত দাবির হার, মানুষের হস্তক্ষেপের সংখ্যা এবং স্বাধীন পরীক্ষায় টিকে থাকা আউটপুটগুলির ভগ্নাংশ অন্তর্ভুক্ত থাকতে পারে। একটি পালিশ কেস স্টাডি দেখাতে পারে কি ঘটেছে, কিন্তু একটি AI সহযোগী যখন পর্যালোচনার অন্য স্তর যোগ করার পরিবর্তে প্রক্রিয়াটিকে উন্নত করে তখন অনুমান করার জন্য নিয়ন্ত্রিত তুলনা প্রয়োজন।

মেশিন যাচাইকরণ এবং মানুষের যাচাইকরণের মধ্যে সীমানা ক্রমাগত মনোযোগের দাবি রাখে। ব্যবধান পাটিগণিত, প্রমাণ সহকারী, পরীক্ষা, এবং প্রতিপক্ষের অডিট অনেক ত্রুটি ধরতে পারে, তবুও একটি শংসাপত্র এখনও ভুল লক্ষ্য এনকোড করতে পারে বা এমন অনুমানের উপর নির্ভর করে যা কখনও চ্যালেঞ্জ করা হয়নি। ফলো-আপ কাজের সম্পূর্ণ আর্টিফ্যাক্ট প্রকাশ করা উচিত, শক্তিশালী অযাচাই করা সীমানাগুলি পুনরায় চালানো উচিত এবং ব্যর্থ বা প্রত্যাহার করা ফলাফলগুলিকে সফল হিসাবে দৃশ্যমান করা উচিত।

অবশেষে, মডেল সংস্করণ, প্রম্পট, স্টিয়ারিং নির্দেশিকা, কোড, গণনা এবং প্রতিলিপিগুলি সংরক্ষণ করা উচিত যেখানে লাইসেন্সিং এবং গোপনীয়তার অনুমতি রয়েছে৷ বর্তমান কাগজটি আংশিকভাবে মূল্যবান কারণ এটি সেই শর্তগুলির প্রতিবেদন করে এবং ভঙ্গুর গবেষণা-রাষ্ট্রের প্রতিনিধিত্ব এবং বিচারে সীমিত স্বায়ত্তশাসন সহ সিস্টেমের দুর্বলতাগুলি বর্ণনা করে। অন্যান্য দলগুলি প্যাটার্নটি পুনরুত্পাদন না করা পর্যন্ত, এটি এআই-সহায়ক গাণিতিক অগ্রগতির শক্তিশালী প্রমাণ, প্রমাণ নয় যে এআই সিস্টেমগুলি স্বাধীনভাবে ওপেন-এন্ডেড গবেষণা পরিচালনা করতে পারে।

সম্পর্কিত গাইড এবং কুইজ

এআই এজেন্টএআই মডেল ব্যাখ্যা করা হয়েছেএআই প্রশিক্ষণএলএলএম মূল্যায়নআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?