কি হয়েছে
একটি নতুন arXiv কেস স্টাডি বর্ণনা করে যে কীভাবে একটি AI গবেষণা সিস্টেম গণিতবিদদের গ্রোথেনডিক ধ্রুবকের পরিচিত সীমার উন্নতি করতে সাহায্য করেছিল, এটি 1953 সালের একটি উন্মুক্ত সমস্যা। এই গবেষণাপত্রটি গাণিতিক ফলাফল এবং সিস্টেমটি কোথায় ভালভাবে কার্যকর হয়েছে, যেখানে মানুষকে এটিকে পরিচালনা করতে হয়েছিল, এবং কোনটি যন্ত্রের চেয়ে মানব-মানুষের দাবি করা হয়েছে তার একটি বিস্তারিত রেকর্ড উভয়ই উপস্থাপন করে।
গ্রোথেনডিক ধ্রুবক একটি কঠিন সংমিশ্রণমূলক অপ্টিমাইজেশান সমস্যা এবং আরও ট্র্যাক্টেবল আধা-নির্দিষ্ট শিথিলতার মধ্যে ব্যবধান পরিমাপ করে। লেখকরা 6pi/11-এর নিম্ন সীমা, প্রায় 1.7135, এবং প্রায় 1.7818-এর ঊর্ধ্ব সীমার সাথে একটি নতুন ব্যবধানের রিপোর্ট করেছেন। সঙ্গী গণিতের কাগজ প্রমাণ সরবরাহ করে। নিম্ন-বাউন্ড ফলাফল উল্লেখযোগ্য কারণ এটি একটি কঠিন উদাহরণ তৈরি করে না; এটি পরিবর্তে একটি বাধা তৈরি করে যা প্রাসঙ্গিক রাউন্ডিং স্কিম জুড়ে প্রযোজ্য।
গবেষণা সিস্টেমটি একটি কোডিং এজেন্টের সাথে একটি যুক্তি মডেল যুক্ত করেছে। কাগজটি বলেছে যে রানটি যুক্তির জন্য GPT-5.5-Pro এবং পরে GPT-5.6-Sol, Opus সহ Claude Code এবং পরে সম্পাদনের জন্য Fable 5, এবং সংখ্যাসূচক অনুসন্ধানের জন্য একটি চার-GPU নোড ব্যবহার করেছে। সেশনগুলি ফাইল, প্রতিলিপি, পরীক্ষার লগ এবং একটি সারাংশের মাধ্যমে ধারাবাহিকতা বহন করে যা একটি নিরবচ্ছিন্ন প্রসঙ্গে নির্ভর না করে প্রমাণিত, সংখ্যাগতভাবে সমর্থিত, অনুমানমূলক বা হিউরিস্টিক হিসাবে দাবিগুলি রেকর্ড করে।
এই রানটি 16 জুন থেকে 24 জুলাই পর্যন্ত প্রায় 240টি গবেষণা সেশন কভার করেছে, যার মধ্যে 2,091টি যুক্তি-মডেল কল এবং আনুমানিক $5,400 API খরচে আনুমানিক 152 মিলিয়ন টোকেন রয়েছে। প্রায় 40 তারিখের মানব নির্দেশনা কাজটি পরিচালনা করে। যখন একটি ঊর্ধ্ব-বাউন্ড অনুসন্ধান মালভূমি হয়, তখন অপারেটররা স্বীকার করে যে বারবার ব্যর্থতা একটি সাধারণ বাধা নির্দেশ করতে পারে এবং সিস্টেমটিকে একটি নিম্ন-বাউন্ড আর্গুমেন্টের দিকে পুনঃনির্দেশিত করে। গবেষণার দিক পরিবর্তনকে একটি স্বায়ত্তশাসিত সিদ্ধান্ত নয়, একটি মানব হস্তক্ষেপ হিসাবে পেপারটি বর্ণনা করে।
সিস্টেমটি একটি কেন্দ্রীয় রিফ্রেম এবং 6pi/11 লোয়ার বাউন্ডের জন্য একটি সম্পূর্ণ প্রমাণ তৈরি করেছিল, যা লেখকরা তারপরে সংশোধিত এবং স্বাধীনভাবে যাচাই করেছিলেন। এটি অভ্যন্তরীণ চেকিং প্রোটোকল পাস করেছে এমন শক্তিশালী সংখ্যাসূচক উচ্চ এবং নিম্ন প্রার্থীদেরও তৈরি করেছে, কিন্তু লেখকরা স্বাধীনভাবে সেই শংসাপত্রগুলি যাচাই করেননি এবং তাদের উপপাদ্য হিসাবে উল্লেখ করেননি। কাগজটি তাই যাচাইকৃত গাণিতিক ফলাফলকে সিস্টেমের আরও অনুমানমূলক বা মেশিন-পরীক্ষিত আউটপুট থেকে আলাদা করে।
উত্স বিবরণ: Long-horizon AI mathematics case study on arXiv ↗
কেন এটা গুরুত্বপূর্ণ
গবেষণাটি একটি একক বেঞ্চমার্ক টাস্কের পরিবর্তে একটি গবেষণা প্রোগ্রাম জুড়ে ব্যবহৃত AI সম্পর্কে অস্বাভাবিকভাবে দৃঢ় প্রমাণ সরবরাহ করে। এর সবচেয়ে গুরুত্বপূর্ণ অনুসন্ধান হল শ্রমের একটি বিভাজন: সিস্টেমটি প্রযুক্তিগতভাবে কার্যকর করার ক্ষেত্রে শক্তিশালী ছিল, যখন মানব গবেষকরা এজেন্ডা-সেটিং, রায় এবং চূড়ান্ত যাচাইয়ের জন্য দায়ী ছিলেন।
দীর্ঘ-দিগন্ত গবেষণা একটি AI সিস্টেমের জন্য কঠিন কারণ ব্যর্থ পন্থা জমা হওয়ার সাথে সাথে উদ্দেশ্য পরিবর্তন হতে পারে। একজন দরকারী সহযোগীকে অবশ্যই যা চেষ্টা করা হয়েছিল তা ধরে রাখতে হবে, একটি অমীমাংসিত ধারণা থেকে একটি শেষ প্রান্তকে আলাদা করতে হবে এবং সিদ্ধান্ত নিতে হবে যখন একটি নতুন প্রশ্ন অন্য স্থানীয় অপ্টিমাইজেশনের চেয়ে বেশি মূল্যবান হবে। লেখকের ফাইল-ভিত্তিক মেমরি এবং দাবির লেবেলগুলি একটি সাবলীল প্রতিক্রিয়াকে অগ্রগতির জন্য দাঁড়ানোর অনুমতি দেওয়ার পরিবর্তে সেই গবেষণা অবস্থাটিকে দৃশ্যমান এবং নিরীক্ষাযোগ্য করার একটি প্রচেষ্টা।
নিম্ন-বাউন্ড আবিষ্কার দেখায় কেন মানুষের বিচার এখনও গুরুত্বপূর্ণ, এমনকি যখন একজন এজেন্ট গণিত চালাতে পারে। অপারেটররা লক্ষ্য করেছেন যে অনেক চেষ্টা করা নির্মাণ একইভাবে ব্যর্থ হচ্ছে এবং ধারণাগত পিভট সরবরাহ করেছে: বারবার বাধা নিজেই প্রমাণ করুন। সিস্টেমটি তখন আর্গুমেন্টটিকে আনুষ্ঠানিক ও প্রত্যয়িত করতে সাহায্য করেছিল। সেই ক্রমটি একটি স্বাধীন মেশিন গণিতবিদদের চেয়ে তত্ত্বাবধানে অনুসন্ধানের কাছাকাছি, এবং প্রমাণগুলি কী সমর্থন করে তা বর্ণনা করার সময় পার্থক্যটি গুরুত্বপূর্ণ।
স্বাধীন যাচাই হল ফলাফলের মুক্তির দরজা। কেস স্টাডি বলে যে নীচের সীমাটি লেখকরা পরীক্ষা করেছেন এবং সম্পূর্ণ প্রমাণগুলি একটি সহচর কাগজে উপস্থিত হয়েছে৷ এটা বলে না যে রানের সময় উত্পাদিত প্রতিটি সংখ্যা সঠিক। উপপাদ্য-স্তরের দাবি, মেশিন-পরীক্ষিত প্রার্থী এবং হাইপোথিসিস আলাদা রাখা পাঠকদের AI সিস্টেমের অভ্যন্তরীণ আত্মবিশ্বাসকে গাণিতিক প্রমাণ হিসাবে গ্রহণ না করে অবদানের মূল্যায়ন করার একটি উপায় দেয়।
গবেষণা প্রতিষ্ঠানের জন্য, ব্যবহারিক পাঠ চালু আছে। একটি AI সিস্টেম সাহিত্য অনুসন্ধান করতে পারে, কোড লিখতে পারে, পরীক্ষা চালাতে পারে, ব্যর্থ প্রচেষ্টা সংরক্ষণ করতে পারে এবং রূপান্তর প্রস্তাব করতে পারে, কিন্তু আশেপাশের কর্মপ্রবাহের জন্য প্রয়োজন প্রমাণ, পুনরুত্পাদনযোগ্য গণনা, সুস্পষ্ট মানব চেকপয়েন্ট এবং দলটি কেন দিক পরিবর্তন করেছে তা পুনর্গঠনের একটি উপায়। রিপোর্ট করা খরচ এবং গণনা আরও স্পষ্ট করে যে দীর্ঘ-দিগন্তের ক্ষমতা শুধুমাত্র মডেল বুদ্ধিমত্তার প্রশ্ন নয়; এটা ভারা, সময়, এবং টেকসই তদারকির উপর নির্ভর করে।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
What most distinguishes an AI agent from a basic chatbot?
পরবর্তী কি দেখতে
পরবর্তী প্রশ্ন হল এই সহযোগিতার প্যাটার্নটি একটি সমস্যা এবং দলের বাইরে সাধারণীকরণ করে এবং প্রতিটি মানুষের এবং AI অবদানের খরচ এবং নির্ভরযোগ্যতা পরিমাপ করার সময় স্বাধীন গবেষকরা যাচাইকৃত ফলাফল পুনরুত্পাদন করতে পারে কিনা।
প্রতিলিপির অন্যান্য গাণিতিক ডোমেন, সমস্যার ধরন এবং বিভিন্ন মেমরি এবং টুল ডিজাইন সহ গবেষণা সিস্টেম পরীক্ষা করা উচিত। Grothendieck সমস্যা ইতিমধ্যে একটি যথেষ্ট মানব-নির্মিত কাঠামো, জমা নোট, সার্টিফিকেশন যন্ত্রপাতি, এবং প্রার্থীর দিকনির্দেশ নিয়ে এসেছে। সেই পূর্বের কাঠামোটি চলতে সাহায্য করেছিল, তাই ভবিষ্যতের অধ্যয়নগুলিকে রিপোর্ট করা উচিত যে গবেষণার অবস্থার কতটা আগে থেকে সরবরাহ করা হয়েছিল এবং কীভাবে ফলাফলগুলি পরিবর্তিত হয় যখন সিস্টেমটিকে নিজেই সমস্যাটি সংজ্ঞায়িত করতে হবে।
গবেষকদের সম্ভাব্য ব্যবস্থা ব্যবহার করে গবেষণা রায়ের সাথে প্রযুক্তিগত নির্বাহের তুলনা করা উচিত। দরকারী মেট্রিক্সের মধ্যে নির্বাচিত দিকনির্দেশের গুণমান, একটি ব্যর্থ পথ পরিত্যাগ করার সময়, অসমর্থিত দাবির হার, মানুষের হস্তক্ষেপের সংখ্যা এবং স্বাধীন পরীক্ষায় টিকে থাকা আউটপুটগুলির ভগ্নাংশ অন্তর্ভুক্ত থাকতে পারে। একটি পালিশ কেস স্টাডি দেখাতে পারে কি ঘটেছে, কিন্তু একটি AI সহযোগী যখন পর্যালোচনার অন্য স্তর যোগ করার পরিবর্তে প্রক্রিয়াটিকে উন্নত করে তখন অনুমান করার জন্য নিয়ন্ত্রিত তুলনা প্রয়োজন।
মেশিন যাচাইকরণ এবং মানুষের যাচাইকরণের মধ্যে সীমানা ক্রমাগত মনোযোগের দাবি রাখে। ব্যবধান পাটিগণিত, প্রমাণ সহকারী, পরীক্ষা, এবং প্রতিপক্ষের অডিট অনেক ত্রুটি ধরতে পারে, তবুও একটি শংসাপত্র এখনও ভুল লক্ষ্য এনকোড করতে পারে বা এমন অনুমানের উপর নির্ভর করে যা কখনও চ্যালেঞ্জ করা হয়নি। ফলো-আপ কাজের সম্পূর্ণ আর্টিফ্যাক্ট প্রকাশ করা উচিত, শক্তিশালী অযাচাই করা সীমানাগুলি পুনরায় চালানো উচিত এবং ব্যর্থ বা প্রত্যাহার করা ফলাফলগুলিকে সফল হিসাবে দৃশ্যমান করা উচিত।
অবশেষে, মডেল সংস্করণ, প্রম্পট, স্টিয়ারিং নির্দেশিকা, কোড, গণনা এবং প্রতিলিপিগুলি সংরক্ষণ করা উচিত যেখানে লাইসেন্সিং এবং গোপনীয়তার অনুমতি রয়েছে৷ বর্তমান কাগজটি আংশিকভাবে মূল্যবান কারণ এটি সেই শর্তগুলির প্রতিবেদন করে এবং ভঙ্গুর গবেষণা-রাষ্ট্রের প্রতিনিধিত্ব এবং বিচারে সীমিত স্বায়ত্তশাসন সহ সিস্টেমের দুর্বলতাগুলি বর্ণনা করে। অন্যান্য দলগুলি প্যাটার্নটি পুনরুত্পাদন না করা পর্যন্ত, এটি এআই-সহায়ক গাণিতিক অগ্রগতির শক্তিশালী প্রমাণ, প্রমাণ নয় যে এআই সিস্টেমগুলি স্বাধীনভাবে ওপেন-এন্ডেড গবেষণা পরিচালনা করতে পারে।