সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

FLARE অপ্টিমাইজেশান সংস্কার যাচাই করতে একটি LLM এবং Lean ব্যবহার করে৷

গবেষকরা ফ্লেয়ার প্রবর্তন করেন, এমন একটি সিস্টেম যা একটি এলএলএম-ভিত্তিক এজেন্টকে লিন প্রুফ সহকারীর সাথে যুক্ত করে তা পরীক্ষা করার জন্য প্রস্তাবিত মিশ্র-পূর্ণসংখ্যা রৈখিক প্রোগ্রামিং সংস্কারগুলি মূল সমস্যাটি সংরক্ষণ করে কিনা। কাগজের 20-সমস্যা, 109-প্রণয়ন বেঞ্চমার্কে, লেখকরা NP-হার্ড উপসেটে 100% নির্ভুলতা রিপোর্ট করেছেন এবং…

6 min readRead the primary source
Source-page capture accompanying FLARE uses an LLM and Lean to verify optimization reformulations
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.25220
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
বেঞ্চমার্ক
মডেলের কর্মক্ষমতা পরিমাপ এবং তুলনা করার জন্য ব্যবহৃত একটি প্রমিত পরীক্ষা বা ডেটাসেট।
ডেটাসেট
প্রশিক্ষণ, বৈধতা বা পরীক্ষার জন্য ব্যবহৃত কাঠামোগত বা অসংগঠিত উদাহরণগুলির একটি সংগ্রহ।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

একটি arXiv কাগজ ফ্লেয়ার, বা ফর্মুলেশন-লেভেল অটোমেটেড রিফরমুলেশন ইভালুয়েশন প্রবর্তন করে, প্রস্তাবিত মিশ্র-পূর্ণসংখ্যা লিনিয়ার প্রোগ্রামিং রিফর্মুলেশনগুলি যাচাই করার জন্য একটি পদ্ধতি। এটি লিনে সংস্কারের একটি গঠনমূলক সংজ্ঞাকে আনুষ্ঠানিক করে এবং একটি রেফারেন্স ফর্মুলেশনের বিরুদ্ধে মেশিন-চেক করা যেতে পারে এমন প্রমাণ তৈরি করতে একটি এলএলএম-ভিত্তিক এজেন্ট ব্যবহার করে।

মিশ্র-পূর্ণসংখ্যার রৈখিক প্রোগ্রামিং হল কম্বিনেটরিয়াল অপ্টিমাইজেশানের একটি কেন্দ্রীয় হাতিয়ার, এবং কাগজটি বলে যে এটি বাস্তব-বিশ্বের অ্যাপ্লিকেশনগুলির একটি বিস্তৃত পরিসরে ব্যবহৃত হয়। গণনাগতভাবে দক্ষ ফর্মুলেশন ডিজাইন করা কঠিন। বৃহৎ ভাষার মডেলগুলি এই ফর্মুলেশনগুলিকে আহরণ বা শক্তিশালী করতে সাহায্য করতে পারে, কিন্তু একটি আপাতদৃষ্টিতে যুক্তিযুক্ত ফর্মুলেশন অন্তর্নিহিত অপ্টিমাইজেশান সমস্যাটি সংরক্ষণ করতে ব্যর্থ হতে পারে। সেই সেটিংয়ে, উদ্বেগটি কেবলমাত্র প্রস্তাবিত মডেল চালানো যায় কিনা তা নয়, তবে এটি বিবেচনাধীন দৃষ্টান্ত জুড়ে একই অপ্টিমাইজেশন টাস্ককে প্রতিনিধিত্ব করে কিনা। কাগজটি এটিকে ফর্মুলেশন স্তরে অর্থ সংরক্ষণের প্রশ্ন হিসাবে ফ্রেম করে।

লেখক নির্ভরযোগ্য স্বয়ংক্রিয়করণের জন্য কেন্দ্রীয় প্রয়োজনীয়তা হিসাবে একা ফর্মুলেশন জেনারেশনের পরিবর্তে যাচাইকরণকে চিহ্নিত করেছেন। FLARE একটি মিশ্র-পূর্ণসংখ্যার রৈখিক প্রোগ্রামিং সংস্কারের একটি গঠনমূলক সংজ্ঞা প্রবর্তনের মাধ্যমে সেই সমস্যার সমাধান করে যা লীন, একজন প্রমাণ সহকারীতে আনুষ্ঠানিক করা যেতে পারে। একটি রেফারেন্স ফর্মুলেশনের বিপরীতে একটি প্রস্তাবিত সংস্কার যাচাই করতে সিস্টেমটি লিনের সাথে একটি এলএলএম-ভিত্তিক এজেন্টকে একত্রিত করে। যখন FLARE একটি সংস্কার গ্রহণ করে, কাগজটি বলে যে এটি একটি মেশিন-চেকযোগ্য শংসাপত্র তৈরি করে। এই শংসাপত্রটি শুধুমাত্র সংখ্যাসূচক পরীক্ষা বা LLM-এর ব্যাখ্যার উপর নির্ভর না করে একটি আনুষ্ঠানিক সিস্টেম দ্বারা যাচাইকরণের ফলাফলকে পরিদর্শনযোগ্য করে তোলার উদ্দেশ্যে করা হয়েছে। আনুষ্ঠানিককরণ তাই সেটিং সরবরাহ করে যেখানে প্রস্তাবিত চিঠিপত্র বিবৃত এবং পরীক্ষা করা যেতে পারে। বর্ণিত কর্মপ্রবাহে এর উদ্দেশ্য হল দুটি সূত্রের মধ্যে একটি যাচাইযোগ্য সম্পর্ক প্রকাশ করা।

লেখকরা ফর্মুলেশন বেঞ্চে ফ্লেয়ার মূল্যায়ন করেন, একটি ডেটাসেট যেখানে 20টি সমস্যা এবং 109টি ফর্মুলেশন রয়েছে। তারা রিপোর্ট করে যে FLARE বেঞ্চমার্কের NP-হার্ড উপসেটে 100% নির্ভুলতা অর্জন করে। কাগজটি FLARE-NL এর সাথে পরিচয় করিয়ে দেয়, যেখানে আনুষ্ঠানিক গ্যারান্টির প্রয়োজন হয় না এমন পরিস্থিতিতে দ্রুত এবং সস্তা LLM প্রক্সি হিসাবে বর্ণনা করা হয়েছে। বেঞ্চমার্ক হল রিপোর্ট করা পরিমাপের সেটিং, তাই ফলাফলটি ডেটাসেটের বিবরণ এবং মূল্যায়নের সুযোগের সাথে একসাথে পড়া উচিত। কাগজটি পদ্ধতির উদ্দেশ্যমূলক ব্যবহার চিত্রিত করার জন্য মূল্যায়ন ব্যবহার করে।

উত্স অনুসারে, ফ্লেয়ার-এনএল মূল্যায়নে ফ্ল্যারের নির্ভুলতার সাথে মেলে তবে কোনও শংসাপত্র তৈরি করে না। উৎসটি এনপি-হার্ড সাবসেটের অন্তর্গত কতগুলি সমস্যা, সঠিক বেসলাইনগুলি চিহ্নিত করে, বা কোনও উত্পাদন স্থাপনার বর্ণনা দেয় না। এই যোগ্যতাগুলি রিপোর্ট করা প্রদর্শনের সীমানা উন্মুক্ত করে দেয়। ফলাফল ব্যাখ্যা করার সময় তারা আনুষ্ঠানিক সিস্টেম এবং প্রক্সির মধ্যে পার্থক্যকে গুরুত্বপূর্ণ করে তোলে।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

কাজটি ভাষা মডেলের সাথে অপ্টিমাইজেশান মডেলিং স্বয়ংক্রিয় করার প্রচেষ্টায় একটি নির্ভরযোগ্যতার সমস্যার সমাধান করে। সংখ্যাসূচক পরীক্ষাগুলি প্রতিষ্ঠিত নাও হতে পারে যে একটি সূত্র সাধারণ সমস্যার উদাহরণের জন্য কাজ করে; FLARE-এর আনুষ্ঠানিক শংসাপত্রগুলি যখন সঠিকতা বিষয়টির নিশ্চয়তা দেয় তখন শক্তিশালী প্রমাণ প্রদানের উদ্দেশ্যে করা হয়।

কাগজের কেন্দ্রীয় অবদান হল একটি AI-উত্পাদিত অপ্টিমাইজেশান ফর্মুলেশন যে সমস্যাটিকে উপস্থাপন করার জন্য তা সংরক্ষণ করে কিনা তা পরীক্ষা করার একটি উপায়। লেখক বলেছেন যে বিদ্যমান পন্থাগুলি সংখ্যাগতভাবে ফর্মুলেশনগুলিকে মূল্যায়ন করে এবং সাধারণ সমস্যার উদাহরণগুলির জন্য যুক্তি দেয় না। এই পার্থক্যটি গুরুত্বপূর্ণ কারণ নির্বাচিত সংখ্যাসূচক পরীক্ষায় উত্তীর্ণ হওয়া নিজেই, প্রতিটি প্রাসঙ্গিক উদাহরণের জন্য সঠিকতা প্রতিষ্ঠা করে না। লীন দ্বারা গৃহীত একটি আনুষ্ঠানিক প্রমাণ বিশ্বাসের জন্য একটি শক্তিশালী ভিত্তি প্রদান করতে পারে যখন একটি অপ্টিমাইজেশান মডেল ফলাফলগত সিদ্ধান্তগুলিকে গাইড করতে ব্যবহৃত হয়। সেই পার্থক্যের ব্যবহারিক মূল্য নির্ভর করে কী অপ্টিমাইজ করা হচ্ছে এবং ফলাফলের মডেলে কতটা আস্থা প্রয়োজন তার উপর। প্রতিটি মডেলিং কাজের জন্য একজন প্রমাণ সহকারীর প্রয়োজন এমন দাবির পরিবর্তে উৎসের যুক্তিটি একটি সূত্রের প্রমাণের মান সম্পর্কে।

শংসাপত্রটি কর্মপ্রবাহে LLM যে ভূমিকা পালন করতে পারে তা পরিবর্তন করে। মডেলের প্রস্তাবিত প্রণয়ন বা এর সাথে থাকা ব্যাখ্যাকে চূড়ান্ত প্রমাণ হিসাবে বিবেচনা করার পরিবর্তে, একজন ব্যবহারকারীর প্রস্তাবটিকে একটি বিবৃতিতে অনুবাদ করার প্রয়োজন হতে পারে যা একজন প্রমাণ সহকারী পরীক্ষা করতে পারে। এটি প্রজন্ম এবং যাচাইয়ের মধ্যে একটি স্পষ্ট বিচ্ছেদ তৈরি করে: এলএলএম একটি সংস্কারের জন্য অনুসন্ধান বা নির্মাণ করতে পারে, যখন লীন আনুষ্ঠানিক দাবি অনুসরণ করে কিনা তা পরীক্ষা করে। শ্রমের এই বিভাজন দাবিটিকে সুনির্দিষ্টভাবে সংজ্ঞায়িত করার বা একটি উপযুক্ত রেফারেন্স ফর্মুলেশন সরবরাহ করার প্রয়োজনীয়তা দূর করে না। তবে, এটি সনাক্ত করে যে কাগজ দ্বারা বর্ণিত প্রক্রিয়ায় একটি আনুষ্ঠানিক চেক কোথায় বসার উদ্দেশ্যে।

উত্সটি এটিকে নির্ভরযোগ্য অটোমেশনের জন্য একটি সক্ষমকারী হিসাবে উপস্থাপন করে, প্রমাণ হিসাবে নয় যে ভাষা মডেলগুলি স্বাধীনভাবে গাণিতিক সঠিকতার গ্যারান্টি দেয়। ফলাফল আশাব্যঞ্জক কিন্তু সংকীর্ণভাবে প্রমাণিত. 100% চিত্র হল FormulationBench-এ লেখকদের ফলাফল, LLM যুক্তি বা অপ্টিমাইজেশান জুড়ে প্রমাণ নির্ভরযোগ্যতার সাধারণ পরিমাপ নয়। বেঞ্চমার্ক প্রসঙ্গ তাই শতাংশ ব্যাখ্যা করার জন্য অপরিহার্য। এটি নির্দেশ করে যেখানে লেখকরা কর্মক্ষমতা পরিমাপ করেছেন, যেখানে অনুপস্থিত বিবরণ তুলনা এবং বৃহত্তর এক্সট্রাপোলেশনকে সীমাবদ্ধ করে।

বেঞ্চমার্কে 20টি সমস্যা এবং 109টি ফর্মুলেশন রয়েছে এবং সেই কেসগুলি কতটা প্রতিনিধিত্বশীল, নন-এনপি-হার্ড কেসগুলি কতটা কঠিন ছিল, বা কী ত্রুটি ঘটেছে সে সম্পর্কে উত্সটি কোনও তথ্য সরবরাহ করে না। কাগজটি একটি arXiv দাখিল, এবং উত্সটি পিয়ার পর্যালোচনা, বাহ্যিক প্রতিলিপি, ব্যবহারকারী গ্রহণ, বা অপারেশনাল অপ্টিমাইজেশান সেটিংয়ে উন্নত ফলাফলের কোন প্রমাণ দেয় না। এই ফাঁকগুলি প্রমাণের শক্তি এবং সুযোগ নিয়ে উদ্বিগ্ন, কাগজ দ্বারা বর্ণিত সংখ্যাসূচক পরীক্ষা এবং আনুষ্ঠানিক যাচাইয়ের মধ্যে মৌলিক পার্থক্য নয়। রুটিন ব্যবহার সম্পর্কে উপসংহার আঁকার আগে আরও প্রমাণের প্রয়োজন হবে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

রিপোর্ট করা ফলাফলগুলি 20টি সমস্যা এবং 109টি ফর্মুলেশনের একটি ছোট বেঞ্চমার্ক থেকে আসে এবং উত্সটি এনপি-হার্ড উপসেটের আকার দেয় না বা প্রতিযোগী পদ্ধতিগুলির বিশদ বিবরণ দেয় না। বৃহত্তর এবং আরও বৈচিত্র্যময় অপ্টিমাইজেশন সমস্যার প্রতিলিপি, বাস্তব মডেলিং ওয়ার্কফ্লোতে খরচ, গতি এবং একীকরণ সম্পর্কে প্রমাণ সহ, পদ্ধতিটি কতটা ব্যাপকভাবে কার্যকর তা নির্ধারণ করবে।

প্রথম প্রশ্ন হল রিপোর্ট করা নির্ভুলতা ফর্মুলেশন বেঞ্চের বাইরে আছে কিনা। দরকারী ফলো-আপ মূল্যায়নের জন্য যথেষ্ট বেশি সমস্যা, বিভিন্ন ফর্মুলেশন শৈলী এবং মিশ্র-পূর্ণসংখ্যার রৈখিক প্রোগ্রামগুলির বিস্তৃত শ্রেণী পরীক্ষা করতে হবে। তাদের NP-হার্ড উপসেটের আকার এবং গঠন, সঠিক তুলনা পদ্ধতি, ব্যর্থতার ঘটনা এবং প্রয়োজনীয় মানব হস্তক্ষেপের পরিমাণও রিপোর্ট করা উচিত। এই বিবরণগুলি ছাড়া, বেঞ্চমার্ক ফলাফল একটি প্রতিশ্রুতিবদ্ধ প্রদর্শন প্রতিষ্ঠা করে তবে বিস্তৃত নির্ভরযোগ্যতা নয়। এই ধরনের পরীক্ষা কাজকে অনুপ্রাণিত করে এমন বিস্তৃত মডেলিং পরিস্থিতিতে পারফরম্যান্স থেকে রিপোর্ট করা সংগ্রহের পারফরম্যান্সকে আলাদা করা সহজ করে তুলবে। এটি রিপোর্ট করা নির্ভুলতাকে ব্যাখ্যা করা সহজ করে তুলবে।

FLARE-NL আলাদা তদন্তের পরোয়ানা দেয় কারণ এটি এমন ক্ষেত্রে ডিজাইন করা হয়েছে যেখানে আনুষ্ঠানিক গ্যারান্টি অপ্রয়োজনীয়। উত্সটি এটিকে FLARE এর চেয়ে দ্রুত এবং সস্তা হিসাবে বর্ণনা করে এবং বলে যে এটি FLARE এর বেঞ্চমার্ক নির্ভুলতার সাথে মেলে, তবে এটি স্পষ্টভাবে বলে যে এটি কোনও শংসাপত্র তৈরি করে না। ব্যবহারকারীদের গতি এবং খরচের পার্থক্য সম্পর্কে প্রমাণের প্রয়োজন হবে, কত ঘন ঘন প্রক্সি কঠিন বা অপরিচিত ক্ষেত্রে আনুষ্ঠানিক যাচাইকরণের সাথে একমত নয় এবং যখন একটি শংসাপত্রের অনুপস্থিতি একটি গ্রহণযোগ্য ট্রেড-অফ হয়। উৎস সেই পরিমাপ বা সিদ্ধান্তের নিয়ম প্রদান করে না। প্রাসঙ্গিক তুলনা তাই শুধুমাত্র দুটি গতি বা দামের মধ্যে নয়, প্রতিটি মোড ব্যবহারকারীর কাছে উপলব্ধ প্রমাণের মধ্যে। উৎস সেই কর্মক্ষম পছন্দকে অমীমাংসিত রাখে।

ব্যবহারিক স্থাপনাও প্রমাণ চেকিংয়ের চেয়ে বেশি নির্ভর করবে। কাগজের বিমূর্তটি কীভাবে রেফারেন্স ফর্মুলেশন নির্বাচন করা হয়, কীভাবে অসম্পূর্ণ বা ব্যর্থ প্রমাণগুলি পরিচালনা করা হয়, কী কম্পিউটিং সংস্থান প্রয়োজন, বা পদ্ধতিটি বিদ্যমান অপ্টিমাইজেশান সফ্টওয়্যারের সাথে কাজ করে কিনা তা বলে না। এই প্রশ্নগুলি বিশেষ করে যে কোনও কর্মপ্রবাহের সাথে প্রাসঙ্গিক যেখানে একটি সূত্র সম্পাদনা, অনুবাদ বা বারবার চেক করা হয়। উপলব্ধ বিবরণ সেই পরিস্থিতিতে পদ্ধতিটি কীভাবে আচরণ করবে তা প্রতিষ্ঠিত করে না।

ফর্মুলেশনগুলি আরও জটিল হওয়ার ফলে শংসাপত্রগুলি পরিচালনাযোগ্য থাকবে কিনা এবং সিস্টেমটি আনুষ্ঠানিককরণের আগে উদ্ভূত ত্রুটিগুলি সনাক্ত করতে পারে কিনা তা ভবিষ্যতের কাজকে স্পষ্ট করা উচিত। ততক্ষণ পর্যন্ত, FLARE-কে AI-সহায়তা যাচাইয়ের জন্য একটি গবেষণা পদ্ধতি হিসেবে সবচেয়ে ভালোভাবে বোঝা যায়, যার মধ্যে উত্সাহজনক বেঞ্চমার্ক ফলাফল রয়েছে কিন্তু বাস্তব-বিশ্ব ব্যবহার সম্পর্কে কী অনুমান করা যেতে পারে তার অর্থপূর্ণ সীমা। বর্তমান প্রমাণগুলি পরবর্তী মূল্যায়নের জন্য স্থাপনার প্রশ্নগুলি রেখে যাওয়ার সময়, পদ্ধতি এবং এর যাচাইকরণ লক্ষ্যের প্রতি মনোযোগ সমর্থন করে। এটি উৎস দ্বারা সমর্থিত উপসংহারের সীমা যেমন বর্ণনা করা হয়েছে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই প্রশিক্ষণএআই নীতিশাস্ত্রএআই-এর ভবিষ্যৎআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?