সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

LURE পেপার টাস্ক ডেটা ছাড়াই এলএলএম যুক্তি প্রশিক্ষণের জন্য সাধনা-চঞ্চল স্ব-খেলার প্রস্তাব দেয়

একটি নতুন arXiv পেপার LURE উপস্থাপন করে, একটি শূন্য-ডেটা সেল্ফ-প্লে পদ্ধতি যেখানে একটি ভাষা মডেল কাজের অসুবিধা সেট করে যখন অন্যটি যাচাইযোগ্য যুক্তি চ্যালেঞ্জগুলি সমাধান করে। লেখকরা নয়টি হোল্ড-আউট বেঞ্চমার্ক জুড়ে প্রশিক্ষিত বেসলাইনের তুলনায় বিতরণের বাইরে শূন্য-শট নির্ভুলতার বেশি শক্তিশালী রিপোর্ট করেছেন, তবে বিমূর্তটি তা করে না...

5 min readRead the primary source
Primary-source image accompanying LURE paper proposes pursuit-evasion self-play to train LLM reasoning without task data
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.21871
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
স্ব-খেলন
একটি প্রশিক্ষণ সেটআপ যেখানে একটি মডেল নিজের প্রতিলিপিগুলির সাথে মিথস্ক্রিয়া বা প্রতিযোগিতার মাধ্যমে ডেটা তৈরি করে উন্নত করে।
শক্তিবৃদ্ধি শিক্ষা
পুরষ্কার সংকেত দ্বারা প্রশিক্ষণ যেখানে একজন এজেন্ট দীর্ঘমেয়াদী রিটার্ন সর্বাধিক করে এমন ক্রিয়াগুলি শিখে।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

একটি arXiv পেপার LURE প্রবর্তন করে, একটি শক্তিবৃদ্ধি-শিক্ষার পদ্ধতি যা বৃহৎ মানব-নিয়োজিত টাস্ক সংগ্রহের উপর নির্ভর না করে বৃহৎ ভাষার মডেল যুক্তিকে উন্নত করার উদ্দেশ্যে। এটি প্রশিক্ষণকে একটি সাধনা-চঞ্চলতা খেলা হিসাবে ফ্রেম করে: একজন এড়ানোর কাজগুলিকে একটি অসুবিধা স্কেল বরাবর স্থাপন করে, যখন একজন পরিকল্পনাকারী-নির্বাহক অনুসরণকারী যাচাইযোগ্য মিথস্ক্রিয়া দ্বারা সেগুলি সমাধান করার চেষ্টা করে।

22 অগাস্ট, 2026 তারিখে arXiv-এ জমা দেওয়া কাগজটি LURE-কে বৃহৎ ভাষার মডেল যুক্তিতে শূন্য-ডেটা স্ব-খেলার একটি পদ্ধতি হিসাবে বর্ণনা করে। লেখক বলেছেন যে যাচাইযোগ্য পুরষ্কার সহ প্রচলিত শক্তিবৃদ্ধি শিক্ষা সাধারণত মানব-নিয়োজিত কাজের বৃহৎ সংগ্রহগুলিতে অ্যাক্সেস অনুমান করে। তাদের উল্লিখিত উদ্দেশ্য হল প্রস্তুত করা টাস্ক পুলের উপর সম্পূর্ণ নির্ভর না করে প্রশিক্ষণের সময় মডেলগুলি তৈরি বা অবস্থানের কাজগুলি করে সেই নির্ভরতা দূর করা। উত্সটি এটিকে কাগজের গবেষণা সমস্যা এবং প্রস্তাব হিসাবে প্রতিষ্ঠা করে; এটি প্রতিষ্ঠিত করে না যে LURE একটি স্থাপন করা সিস্টেম বা একটি উত্পাদন-প্রস্তুত প্রশিক্ষণ পদ্ধতি।

LURE প্রশিক্ষণ প্রক্রিয়াটিকে দুটি ভূমিকায় ভাগ করে। একজন এলএলএম এড়ানোর কাজগুলি পরিবেশের অসুবিধা অক্ষ বরাবর স্থাপন করে, যখন একজন পরিকল্পনাকারী-নির্বাহক অনুসরণকারী মিথস্ক্রিয়াগুলির মাধ্যমে সেই কাজগুলি সমাধান করার চেষ্টা করেন যার ফলাফলগুলি যাচাই করা যেতে পারে। কাগজটি বলেছে যে ছিনতাইকারী একটি ক্যাপচার-ফ্রন্টিয়ার পুরষ্কার পায় যা সবচেয়ে বেশি হয় যখন সমাধানকারী তার রোলআউটের ঠিক অর্ধেকে এটি ক্যাপচার করে। লেখকের ফ্রেমিং-এ, সেই পুরস্কারটি "সত্যিই ধরা যোগ্য" টাস্ক প্লেসমেন্টকে ম্যানুয়ালি নির্বাচিত প্রত্যাখ্যান থ্রেশহোল্ড দ্বারা প্রয়োগ করার পরিবর্তে শেখা কিছুতে পরিণত করে। বিমূর্তটি সুনির্দিষ্ট পরিবেশ, টাস্ক ফরম্যাট বা যাচাইকারী বাস্তবায়ন ব্যাখ্যা করে না।

পদ্ধতিটি পরিবর্তন করে যে কীভাবে সমাধানকারী মডেল প্রশিক্ষণ ক্রেডিট পায়। শুধুমাত্র একটি স্পার্স টার্মিনাল পুরষ্কারের উপর নির্ভর করার পরিবর্তে, LURE ব্যবহার করে যা কাগজটি ক্যাপচার-অ্যাঙ্করড ঘন প্রক্রিয়া ক্রেডিট বলে। বিমূর্তটি বলে যে টাস্ক-সেটিং এবং টাস্ক-সমাধান ভূমিকাগুলির মধ্যে সহ-বিবর্তনকে স্থিতিশীল করার উদ্দেশ্যে একটি রাউন্ড-অ্যাঙ্করড কেএল সীমাবদ্ধতার অধীনে টার্মিনাল ক্যাপচারের সাথে একঘেয়ে যাচাইকারী অগ্রগতি গ্রুপ-স্বাভাবিক করা হয়েছে। লেখকরা ইউনিফাইড এবং বিশেষজ্ঞ সেটিংসের তুলনা করে তিনটি যাচাইযোগ্য যুক্তি পরিবেশ এবং তিনটি মেরুদণ্ডের পরিবার জুড়ে পরীক্ষার রিপোর্ট করেছেন। উত্সটি মেরুদণ্ডের নাম, প্রশিক্ষণ বাজেট, অ্যাবলেশন বা সঠিক বেসলাইন কনফিগারেশন সনাক্ত করে না।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

যদি রিপোর্ট করা ফলাফলগুলি ধরে থাকে, তাহলে LURE গবেষকদেরকে বিস্তৃত লেবেলযুক্ত ডেটাসেটগুলি একত্রিত না করে দরকারী যুক্তি চ্যালেঞ্জগুলি তৈরি এবং নির্বাচন করার একটি উপায় অফার করতে পারে। এর পদ্ধতিটি একই সাথে দুটি অবিরাম প্রশিক্ষণ সমস্যাকে লক্ষ্য করে: কঠিন কিন্তু শেখার মতো কাজগুলি বেছে নেওয়া এবং শুধুমাত্র চূড়ান্ত উত্তরগুলির পরিবর্তে মধ্যবর্তী ধাপগুলিতে ক্রেডিট বরাদ্দ করা৷

প্রস্তাবটির ব্যবহারিক তাৎপর্য হ'ল মানব-সৃষ্ট যুক্তি অনুশীলনের উপর নির্ভরতা হ্রাস করার প্রচেষ্টা। বড়, উচ্চ-মানের টাস্ক সংগ্রহগুলি তৈরি করা ব্যয়বহুল, এবং নির্দিষ্ট সংগ্রহগুলি প্রশিক্ষণের চ্যালেঞ্জগুলিকে উপযুক্ত স্তরে রাখা কঠিন করে তুলতে পারে। LURE-এর evader-pursuer সেটআপটি সমাধানকারীর উন্নতির সাথে সাথে অসুবিধা সামঞ্জস্য করার জন্য ডিজাইন করা হয়েছে। যদি সেই প্রক্রিয়াটি নির্ভরযোগ্যভাবে কাজ করে, তবে এটি স্ব-খেলার প্রশিক্ষণকে আরও অভিযোজিত করে তুলতে পারে এবং কিছু যাচাইযোগ্য যুক্তিযুক্ত ডোমেনের জন্য প্রয়োজনীয় ম্যানুয়াল টাস্ক কিউরেশনের পরিমাণ কমিয়ে দিতে পারে। এটি ডিজাইনের একটি সম্ভাব্য প্রভাব, একটি স্বাধীনভাবে প্রতিষ্ঠিত ফলাফল নয়।

কাগজটি ক্রেডিট অ্যাসাইনমেন্টকেও সম্বোধন করে, বহু-পদক্ষেপের যুক্তি প্রশিক্ষণের একটি কেন্দ্রীয় সমস্যা। একটি সমাধানকারী দরকারী এবং অসহায় সিদ্ধান্ত সমন্বিত একটি অনুক্রমের পরে একটি সঠিক চূড়ান্ত ফলাফলে পৌঁছাতে পারে, যখন শুধুমাত্র একটি টার্মিনাল পুরস্কার কোন পদক্ষেপগুলি গুরুত্বপূর্ণ সে সম্পর্কে সামান্য তথ্য দেয়। চূড়ান্ত ক্যাপচার ইভেন্টে মধ্যবর্তী যাচাইকারী অগ্রগতি বেঁধে, LURE এর লক্ষ্য যাচাইকৃত ফলাফলের গুরুত্বকে পরিত্যাগ না করে একটি ঘন শেখার সংকেত প্রদান করা। বিমূর্ত প্রতিবেদন করে যে এই সংমিশ্রণটি লেখকদের পরীক্ষায় উন্নত বেসলাইনগুলিকে ছাড়িয়ে গেছে, তবে এটি দেখায় না যে উন্নতিটি মূলত অভিযোজিত টাস্ক নির্বাচন, ঘন ক্রেডিট, কেএল স্থিতিশীলতা শব্দ, বা তাদের মিথস্ক্রিয়া থেকে এসেছে কিনা।

সবথেকে শক্তিশালী রিপোর্ট করা ফলাফল হল যে ইউনিফাইড মডেল তিনটি টাস্ক ফ্যামিলিতে বিস্তৃত নয়টি হোল্ড-আউট বেঞ্চমার্ক জুড়ে সমস্ত প্রশিক্ষিত বেসলাইনের চেয়ে উচ্চতর সামগ্রিক বিতরণের বাইরে শূন্য-শট নির্ভুলতা অর্জন করেছে। এই দাবি, যদি পুনরুত্পাদন করা যায়, তবে পদ্ধতিটি প্রশিক্ষণের সময় ব্যবহৃত পরিবেশগুলিকে নিছক অপ্টিমাইজ করার পরিবর্তে স্থানান্তর উন্নত করতে পারে। তবুও, ব্যবহারিক গুরুত্ব নির্ধারণের জন্য "শক্তিশালী সমষ্টি" যথেষ্ট নয়: বিমূর্তটি কোন স্কোর, আত্মবিশ্বাসের ব্যবধান, প্রতি-বেঞ্চমার্ক ফলাফল, বৃহত্তর বা আরও বেশি গণনা-নিবিড় সিস্টেমের সাথে তুলনা, বা কীভাবে অনুষ্ঠিত কাজগুলি নির্বাচন করা হয়েছিল সে সম্পর্কে তথ্য দেয় না। কাজেই গবেষণার ফলাফল হিসেবে কাজটিকে আরও ভালোভাবে বোঝা যায় যাতে আরও পরীক্ষার প্রয়োজন হয়, প্রমাণ হিসেবে নয় যে জিরো-ডেটা সেলফ-প্লে সাধারণ-উদ্দেশ্যের যুক্তি প্রশিক্ষণের সমাধান করেছে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

কাগজটি একটি নয় পৃষ্ঠার arXiv প্রিপ্রিন্ট, এবং উত্সটি শুধুমাত্র একটি বিমূর্ত প্রদান করে। গুরুত্বপূর্ণ প্রশ্নগুলি রিপোর্ট করা লাভের সংখ্যাসূচক আকার, গণনামূলক খরচ, টাস্ক নির্মাণ, মডেলের আকার, বেঞ্চমার্ক রচনা, পুনরুত্পাদনযোগ্যতা, এবং পদ্ধতিটি তিনটি পরিবেশ এবং তিনটি টাস্ক ফ্যামিলির বাইরে স্থানান্তরিত হয় কিনা তা নিয়ে রয়ে গেছে।

প্রথম যাচাইকরণের ধাপটি সম্পূর্ণ কাগজ এবং এর পরীক্ষামূলক টেবিল। পাঠকদের তিনটি মেরুদণ্ডের পরিবারের পরিচয় এবং আকার, তিনটি পরিবেশের সঠিক সংজ্ঞা, প্রশিক্ষণের কাজগুলির সংখ্যা এবং প্রকার, বেসলাইন পদ্ধতি এবং ব্যবহৃত গণনাগুলি সন্ধান করা উচিত। এই বিবরণগুলি নির্ধারণ করবে যে LURE-এর লাভগুলি একটি বিস্তৃতভাবে দরকারী প্রশিক্ষণের রেসিপি প্রতিফলিত করে বা একটি নির্দিষ্ট বেঞ্চমার্ক ডিজাইনের সাথে শক্তভাবে আবদ্ধ ফলাফল। উত্স উদ্ধৃতি নিশ্চিত করে যে কাগজটিতে পাঁচটি টেবিল এবং পাঁচটি পরিসংখ্যান রয়েছে, তবে এটি তাদের বিষয়বস্তু প্রদান করে না।

প্রজননযোগ্যতা আরেকটি উন্মুক্ত সমস্যা। সরবরাহকৃত উত্সটি কোড, টাস্ক জেনারেটর, যাচাইকারী বাস্তবায়ন, চেকপয়েন্ট বা প্রশিক্ষণ ডেটা উপলব্ধ কিনা তা বলে না। যেহেতু পদ্ধতিটি একটি সহ-বিবর্তনকারী এবং অনুসরণকারীর উপর নির্ভর করে, তাই পুরষ্কার স্কেলিং, রোলআউট স্যাম্পলিং, স্বাভাবিককরণ বা স্থিতিশীলকরণের ক্ষেত্রে ছোট পছন্দগুলি ফলাফলকে প্রভাবিত করতে পারে। বিভিন্ন মডেল পরিবার এবং যাচাইযোগ্য পরিবেশ জুড়ে স্বাধীন প্রতিলিপিগুলি রিপোর্ট করা আচরণ শক্তিশালী কিনা বা লেখকের বাস্তবায়নের উপর নির্ভর করে তা প্রতিষ্ঠিত করতে সাহায্য করবে।

অবশেষে, পদ্ধতির সুযোগের জন্য কাগজের উল্লিখিত নয়টি হোল্ড-আউট বেঞ্চমার্ক এবং তিনটি টাস্ক ফ্যামিলির বাইরে পরীক্ষার প্রয়োজন। যাচাইযোগ্য পরিবেশগুলি কার্যকর কারণ তারা উদ্দেশ্যমূলক প্রতিক্রিয়া প্রদান করে, তবে অনেক বাস্তব-বিশ্বের যুক্তিমূলক কাজগুলির একটি স্বয়ংক্রিয় যাচাইকারীর অভাব রয়েছে বা অস্পষ্ট সাফল্যের মানদণ্ড রয়েছে। এটা অজানা রয়ে গেছে যে LURE সেই সেটিংসে দরকারী অসুবিধা পাঠ্যক্রম তৈরি করতে পারে, কতটা মানুষের তদারকির এখনও প্রয়োজন হবে, এবং এড়িয়ে যাওয়া সত্যিকারের মূল্যবান চ্যালেঞ্জগুলি তৈরি করার পরিবর্তে একটি যাচাইকারীর দুর্বলতাগুলিকে কাজে লাগাতে শিখতে পারে কিনা। বিমূর্তটি পদ্ধতির প্রশিক্ষণের খরচ, লেটেন্সি, ব্যর্থতার মোড এবং দীর্ঘ বা কম কাঠামোগত কাজগুলিতে কর্মক্ষমতা সম্পর্কেও অজানা রাখে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই প্রশিক্ষণট্রান্সফরমারএআই এজেন্টআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?