কি হয়েছে
Anthropic বলেছেন যে Claude লীন প্রুফ সহকারীতে ফার্মাটের শেষ উপপাদ্যের এন্ড-টু-এন্ড, কম্পিউটার-চেক ফর্মালাইজেশন তৈরি করতে 11 দিনের জন্য মূলত স্বায়ত্তশাসিতভাবে কাজ করেছে। কোম্পানি বলেছে যে প্রমাণটি Lean দ্বারা পরীক্ষা করা হয়েছে, শুধুমাত্র Lean-এর তিনটি স্ট্যান্ডার্ড স্বতঃসিদ্ধ ব্যবহার করা হয়েছে এবং গণিতবিদ কেভিন বুজার্ড দ্বারা পর্যালোচনা করা হয়েছে।
Anthropic রিপোর্ট করে যে Claude ফর্ম্যাটের শেষ উপপাদ্যকে আনুষ্ঠানিকভাবে রূপান্তরিত করেছে, এই বিবৃতি যে কোন ধনাত্মক পূর্ণসংখ্যা aⁿ + bⁿ = cⁿ n এর চেয়ে বেশি n সন্তুষ্ট করে না। উপপাদ্যটি প্রথম 1995 সালে অ্যান্ড্রু ওয়াইলস দ্বারা প্রমাণিত হয়েছিল। একটি নতুন প্রমাণ আবিষ্কারের পরিবর্তে বিদ্যমান গাণিতিক ফলাফল।
Anthropic অনুসারে, Claude লিন কোডের 13 মিলিয়ন লাইন তৈরি করেছে, 30,300টি মধ্যবর্তী উপপাদ্য প্রমাণ করেছে এবং চূড়ান্ত প্রমাণে তাদের মধ্যে 29,500টি ব্যবহার করেছে। কয়েক ডজন Claude এজেন্ট Prove2Me এর মাধ্যমে সহযোগিতা করেছে, একটি উন্মুক্ত প্ল্যাটফর্ম যা উপপাদ্য বিবৃতির মধ্যে নির্ভরতা ট্র্যাক করে এবং এজেন্টদের সমান্তরালভাবে কাজ করতে সহায়তা করে।
Anthropic বলে যে সমাপ্ত প্রমাণটি Lean দ্বারা পরীক্ষা করা হয়েছে এবং শুধুমাত্র Lean-এর তিনটি স্ট্যান্ডার্ড স্বতঃসিদ্ধ ব্যবহার করে। কোম্পানিটি আরও বলেছে যে একজন তুলনাকারী নিশ্চিত করেছেন যে তত্ত্বের বিবৃতিটি ম্যাথলিবের ফার্মাটের শেষ উপপাদ্যের বিবৃতির সাথে মিলেছে। কেভিন বুজার্ড প্রমাণটি পর্যালোচনা করেছেন এবং কৃতিত্বকে তাৎপর্যপূর্ণ বলে বর্ণনা করেছেন, যখন Anthropic নোট করেছেন যে ফলাফলটি পুনরায় পরীক্ষা করা হবে।
কোম্পানি বলেছে যে প্রাথমিক প্রচেষ্টা ব্যর্থ হয়েছে কারণ এজেন্টরা প্রকল্পের অবস্থার ট্র্যাক হারিয়েছে। গবেষকরা Prove2Me এবং একটি Claude Code-ভিত্তিক মাল্টি-এজেন্ট জোতা গ্রহণ করার পরে প্রচেষ্টাটি সফল হয়েছে। Anthropic অনুমান করে যে প্রকল্পটি Claude Fable 5.1 এর সাথে মোটামুটি তুলনীয় একটি অভ্যন্তরীণ গবেষণা মডেল থেকে প্রায় ছয় বিলিয়ন আউটপুট টোকেন গ্রহণ করেছে। উত্সটি সম্পূর্ণ প্রচেষ্টার পুনরুত্পাদনের জন্য একটি সর্বজনীন মূল্য প্রদান করে না বা এটি প্রতিষ্ঠিত করে না যে একই ফলাফল বর্তমানে সাধারণ Claude ব্যবহারকারীদের জন্য ব্যবহারিক৷
কেন এটা গুরুত্বপূর্ণ
কাজটি ফার্ম্যাটের শেষ উপপাদ্যের একটি নতুন প্রমাণ আবিষ্কার করার পরিবর্তে যাচাইকরণের ঠিকানা দেয়। যদি স্বাধীনভাবে পুনরুত্পাদন করা হয়, তাহলে এটি দেখাবে যে AI সিস্টেমগুলি অত্যন্ত জটিল মানব গণিতকে মেশিন-চেকযোগ্য ফর্মে অনুবাদ করতে সাহায্য করতে পারে, সম্ভাব্য ভবিষ্যতের প্রমাণ এবং AI-উত্পন্ন গাণিতিক দাবিগুলি যাচাই করার জন্য প্রয়োজনীয় সময় কমিয়ে দেয়। ফলাফল আরও হাইলাইট করে যে দরকারী স্বায়ত্তশাসন অন্তর্নিহিত মডেলের মতো প্রকল্প-ব্যবস্থাপনা সরঞ্জাম এবং আনুষ্ঠানিক ভারার উপর নির্ভর করতে পারে।
ফর্মাল প্রুফ অ্যাসিস্ট্যান্ট যেমন লীন চেক করে যে প্রতিটি যৌক্তিক ধাপ পূর্বের সংজ্ঞা, উপপাদ্য এবং স্বতঃসিদ্ধ থেকে অনুসরণ করে কিনা। এটি সাধারণ সমকক্ষ পর্যালোচনার চেয়ে একটি শক্তিশালী সঠিকতা পরীক্ষা প্রদান করতে পারে, যদিও এটি নিজেই একটি প্রমাণ অ-বিশেষজ্ঞদের কাছে বোধগম্য করে না বা প্রতিষ্ঠিত করে না যে আনুষ্ঠানিক বিবৃতি প্রতিটি অভিপ্রেত গাণিতিক সূক্ষ্মতাকে ধরে রাখে।
দাবিকৃত অগ্রিম স্কেল এবং গতিতে। Anthropic বলেছেন যে সম্প্রদায়ের বিদ্যমান ব্লুপ্রিন্টের উপর ভিত্তি করে আনুষ্ঠানিকীকরণের জন্য কয়েক বছর সময় লাগবে বলে আশা করা হয়েছিল, যখন Claude এটি 11 দিনের মধ্যে সম্পন্ন করেছে। যদি পাবলিক কোড স্বাধীনভাবে যাচাই-বাছাই করে বেঁচে থাকে, তবে পদ্ধতিটি গণিতবিদদের দীর্ঘ প্রমাণ পরীক্ষা করতে এবং এআই-উত্পন্ন গণিতকে আরও দক্ষতার সাথে পরিদর্শন করতে সহায়তা করতে পারে।
ফলাফল এছাড়াও একটি সিস্টেম প্রদর্শনী হয়. Anthropic সাফল্যকে শুধুমাত্র Claude নয় বরং নির্ভরতা ট্র্যাকিং, উপপাদ্য অনুসন্ধান, সমান্তরাল সহযোগিতা, দ্রুত সংকলন, এবং একটি মাল্টি-এজেন্ট ওয়ার্কফ্লোকে দায়ী করে। এটি পরামর্শ দেয় যে ভবিষ্যতের গাণিতিক অটোমেশন শুধুমাত্র অপারেটিং মডেলের উপর নির্ভর না করে বিশেষায়িত অবকাঠামোর উপর নির্ভর করতে পারে।
গুরুত্বপূর্ণ সীমাবদ্ধতা রয়ে গেছে। উত্সটি হল Anthropic এর সিস্টেমের নিজস্ব অ্যাকাউন্ট, এবং নিবন্ধটি সম্পূর্ণ স্বাধীন অডিট, বাহ্যিক প্রতিলিপি, তুলনামূলক খরচ, বা সমগ্র শিল্পকর্মের সমকক্ষ-পর্যালোচিত মূল্যায়নের প্রতিবেদন করে না। Buzzard এর পর্যালোচনা হল বিশেষজ্ঞদের অংশগ্রহণের অর্থপূর্ণ প্রমাণ, কিন্তু এটি বিস্তৃত স্বাধীন বৈধতার সমতুল্য নয়।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
স্বাধীন গণিতবিদদের সর্বজনীনভাবে উপলব্ধ লীন কোডের পুনরায় পরীক্ষা করা গুরুত্বপূর্ণ হবে, যেমন প্রমাণ হবে যে পদ্ধতিটি একটি বিদ্যমান প্রমাণ নীলনকশা সহ একটি উপপাদ্যের বাইরে সাধারণীকরণ করে। ব্যবহারিক খরচ, বাহ্যিক সিস্টেমে প্রজননযোগ্যতা, এবং মানব গণিতবিদদের জন্য ফলস্বরূপ প্রমাণের ব্যবহারযোগ্যতা অস্পষ্ট রয়ে গেছে।
GitHub প্রমাণের স্বাধীন চেকগুলির জন্য দেখুন, এতে এটি প্রকাশিত সামগ্রী থেকে সংকলন করা হয়েছে কিনা এবং বাইরের লীন ব্যবহারকারীরা ঘোষণায় বর্ণিত ত্রুটি, লুকানো অনুমান বা নির্ভরতা সনাক্ত করে কিনা তা সহ।
একই ওয়ার্কফ্লো অস্বাভাবিকভাবে বিশদ মানব-উন্নত নীলনকশা ছাড়া অন্যান্য প্রধান উপপাদ্যগুলিকে আনুষ্ঠানিক করতে পারে কিনা তা দেখুন। Anthropic তিনটি ব্যক্তিগত Claude ম্যাক্স প্ল্যান ব্যবহার করে তিন দিনের মধ্যে Vinogradov-এর থ্রি প্রাইমস থিওরেমকে আনুষ্ঠানিক করার একটি ছোট পরীক্ষার রিপোর্ট করেছে, কিন্তু উৎসটি সেই ফলাফলের কোনো স্বাধীন মূল্যায়ন করেনি।
খরচ এবং অ্যাক্সেস মডেল অমীমাংসিত হয়. Anthropic বলে যে এটি বিনামূল্যে বা ছাড়যুক্ত সাবস্ক্রিপশন, গবেষণা ক্রেডিট, এবং বৃহত্তর প্রকল্পগুলির জন্য উত্সর্গীকৃত অনুদান প্রদান করে, কিন্তু এটি বলে না যে সম্পূর্ণ ফার্ম্যাট আনুষ্ঠানিককরণ একটি ভোক্তা সাবস্ক্রিপশনের মাধ্যমে পুনরুত্পাদন করা যেতে পারে বা রিপোর্ট করা ছয় বিলিয়ন আউটপুট টোকেনের আর্থিক খরচ প্রকাশ করতে পারে।
বিস্তৃত পরীক্ষা হবে আনুষ্ঠানিকীকরণ মানুষের-পাঠযোগ্য গাণিতিক কাগজপত্রের একটি নিয়মিত সঙ্গী হয়ে ওঠে কিনা। Anthropic যুক্তি দেয় যে মেশিন-পরীক্ষাযোগ্য প্রমাণ রেফারিদের এআই-উত্পাদিত কাজের সাথে তাল মিলিয়ে চলতে সাহায্য করতে পারে, পাশাপাশি স্বীকার করে যে আনুষ্ঠানিক প্রমাণগুলি মানব পাঠকদের জন্য লেখা ব্যাখ্যাগুলিকে প্রতিস্থাপন করা উচিত নয়।