RLHF-এ গোষ্ঠীবদ্ধ পুরস্কার স্বাভাবিককরণ
গোষ্ঠীবদ্ধ পুরষ্কার স্বাভাবিককরণ একই প্রম্পটের প্রতিক্রিয়াগুলির একটি ব্যাচের মধ্যে একটি মডেলের পুরষ্কারকে মানক করে তোলে, গোলমাল স্কোরগুলিকে একটি স্থিতিশীল প্রশিক্ষণ সংকেতে পরিণত করে।
ওভারভিউ
এটি GRPO-এর পিছনে মূল কৌশল, অ্যালগরিদম যা অনেক আধুনিক যুক্তি মডেলকে শক্তি দেয়।
গভীর ডুব
হিউম্যান ফিডব্যাক (RLHF) থেকে রিইনফোর্সমেন্ট শেখার ক্ষেত্রে, একটি মডেল প্রতিক্রিয়া তৈরি করে এবং একটি পুরষ্কার মডেল সেগুলিকে স্কোর করে, কিন্তু অশোধিত পুরষ্কারগুলি শোরগোলপূর্ণ এবং প্রম্পট জুড়ে ব্যাপকভাবে পরিবর্তিত হয়। গোষ্ঠীবদ্ধ পুরষ্কার স্বাভাবিককরণ একই প্রম্পটে একাধিক প্রতিক্রিয়ার একটি গোষ্ঠীর নমুনা তৈরি করে এটিকে ঠিক করে, তারপর গ্রুপ গড় বিয়োগ করে এবং গ্রুপের মানক বিচ্যুতি দ্বারা ভাগ করে প্রতিটি পুরস্কারকে স্বাভাবিক করে। এই জেড-স্কোর সুবিধা হয়ে যায়। ডিপসিক দ্বারা প্রবর্তিত গ্রুপ রিলেটিভ পলিসি অপ্টিমাইজেশান (জিআরপিও) এর জন্য এই পদ্ধতির কেন্দ্রবিন্দু, যা ডিপসিক-আর1 এর যুক্তিকে বিখ্যাতভাবে চালিত করে। গুরুত্বপূর্ণভাবে, GRPO PPO দ্বারা ব্যবহৃত পৃথক মান নেটওয়ার্ক (সমালোচক) বাদ দেয়, যেহেতু গ্রুপ গড় বেসলাইন হিসাবে কাজ করে। এটি গ্রেডিয়েন্ট সিগন্যালকে ভাল-স্কেল রাখার সময় প্রশিক্ষণকে সহজ, সস্তা এবং আরও মেমরি-দক্ষ করে তোলে।
প্রযুক্তিগত অন্তর্দৃষ্টি
পুরস্কার r_1...r_G সহ আউটপুটগুলির একটি গ্রুপের জন্য, সুবিধা হল A_i = (r_i − মানে(r)) / std(r)। তাদের গ্রুপের গড় থেকে ভাল প্রতিক্রিয়া ইতিবাচক সুবিধা পায় এবং শক্তিশালী হয়; গড়পড়তার চেয়ে খারাপকে নিচে ঠেলে দেওয়া হয়। কারণ তুলনা একটি প্রম্পটের মধ্যে আপেক্ষিক, পরম পুরষ্কার স্কেল এবং প্রতি-প্রম্পট অসুবিধা বাতিল করে, ভিন্নতা হ্রাস করে। GRPO PPO-এর ক্লিপ করা উদ্দেশ্য এবং কেএল পেনাল্টি একটি রেফারেন্স নীতির বিরুদ্ধে রাখে যাতে মডেলটিকে খুব বেশি দূরে না যেতে দেওয়া হয়।
কৌশলগত প্রভাব
সুস্পষ্ট সিদ্ধান্ত
এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।
খরচ ও বাজেট
অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।
টিম এবং ওয়ার্কফ্লো
ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।
RLHF-এ দলবদ্ধ পুরষ্কার স্বাভাবিককরণের ভবিষ্যত
দলবদ্ধ স্বাভাবিকীকরণ যুক্তি-মডেল বুমকে ইন্ধন জোগাচ্ছে, যেখানে মডেলরা যাচাইযোগ্য পুরষ্কার থেকে শেখে যেমন সঠিক গণিতের উত্তরগুলি একজন বিজ্ঞ সমালোচক ছাড়াই। গবেষণা এটিকে পরিমার্জিত করছে: স্ট্যান্ডার্ড বিচ্যুতি দ্বারা বিভক্ত করা হবে কিনা তা নিয়ে বিতর্ক, সমস্ত-সঠিক বা সমস্ত-ভুল গোষ্ঠীগুলি পরিচালনা করা যা শূন্য সুবিধা তৈরি করে এবং গোষ্ঠীর আকার স্কেলিং। গোষ্ঠীবদ্ধ, সমালোচক-মুক্ত পদ্ধতিগুলি এজেন্টিক টুল ব্যবহার এবং কোড জেনারেশনে ছড়িয়ে দেওয়ার আশা করুন, যেখানে স্বয়ংক্রিয় যাচাইকারী সস্তা, প্রচুর পুরষ্কার সংকেত সরবরাহ করে।
বাস্তব-বিশ্ব বাস্তবায়ন
প্রতি সমস্যার 16টি সমাধানের নমুনা নিয়ে একটি গণিত-যুক্তিমূলক মডেলকে প্রশিক্ষণ দেওয়া এবং গোষ্ঠীর গড় সঠিকতার উপরে পুরস্কৃত করা।
প্রতিটি ব্যবহারকারীর প্রম্পটে একাধিক প্রার্থীর উত্তর জুড়ে পুরষ্কার-মডেল স্কোর স্বাভাবিক করার মাধ্যমে একটি চ্যাটবটের সহায়কতাকে ফাইন-টিউনিং করা।
একটি কোডিং সহকারীকে উন্নত করা যেখানে প্রতিটি স্যাম্পলড সল্যুশন ইউনিট পরীক্ষায় উত্তীর্ণ হয়েছে কিনা তা দ্বারা স্কোর করা হয়, তারপর গ্রুপের মধ্যে স্বাভাবিক করা হয়।
একটি RLHF পাইপলাইনে GPU মেমরি হ্রাস করা PPO ক্রিটিক নেটওয়ার্ককে বাদ দিয়ে এবং এর পরিবর্তে বেসলাইন হিসাবে গ্রুপ গড় ব্যবহার করে।
ঝুঁকি এবং প্রহরী
বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।
বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।
ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।
বাস্তবায়ন রোডম্যাপ
আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।
পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।
একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷
নথি যেখানে RLHF-এ গোষ্ঠীবদ্ধ পুরস্কার স্বাভাবিককরণ সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
পছন্দ অপ্টিমাইজেশানে দৈর্ঘ্য স্বাভাবিককরণ
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
RLHF-এ গোষ্ঠীবদ্ধ পুরস্কার স্বাভাবিককরণ কী?
গোষ্ঠীবদ্ধ পুরষ্কার স্বাভাবিককরণ একই প্রম্পটের প্রতিক্রিয়াগুলির একটি ব্যাচের মধ্যে একটি মডেলের পুরষ্কারকে মানক করে তোলে, গোলমাল স্কোরগুলিকে একটি স্থিতিশীল প্রশিক্ষণ সংকেতে পরিণত করে। এটি GRPO-এর পিছনে মূল কৌশল, অ্যালগরিদম যা অনেক আধুনিক যুক্তি মডেলকে শক্তি দেয়।
দলবদ্ধ পুরষ্কার স্বাভাবিককরণে, প্রতিটি প্রতিক্রিয়ার পুরষ্কার কিসের সাথে তুলনা করা হয়?
প্রতিটি পুরস্কার একই প্রম্পটে প্রতিক্রিয়াগুলির গ্রুপের গড় এবং মানক বিচ্যুতি ব্যবহার করে একটি z-স্কোরে রূপান্তরিত হয়।
কোন অ্যালগরিদম দলবদ্ধ পুরষ্কার স্বাভাবিককরণের সাথে সবচেয়ে বেশি যুক্ত?
GRPO, DeepSeek দ্বারা প্রবর্তিত এবং DeepSeek-R1-এ ব্যবহৃত, একটি গ্রুপের মধ্যে পুরস্কারগুলিকে স্বাভাবিক করার জন্য তৈরি করা হয়েছে।
স্ট্যান্ডার্ড পিপিওর কোন উপাদানটি জিআরপিও উল্লেখযোগ্যভাবে বাদ দেয়?
গোষ্ঠী গড়কে বেসলাইন হিসাবে ব্যবহার করে, GRPO শেখা সমালোচককে বাদ দেয়, মেমরি এবং গণনা সংরক্ষণ করে।
একটি প্রতিক্রিয়ার কী হবে যার পুরষ্কার তার দলের গড় থেকে কম?
গোষ্ঠীকে বিয়োগ করার মানে হল নিম্ন-গড় প্রতিক্রিয়াগুলির নেতিবাচক সুবিধা রয়েছে, নীতিটিকে তাদের থেকে দূরে ঠেলে দেয়৷
কেন একটি গোষ্ঠীর মধ্যে স্বাভাবিককরণ প্রশিক্ষণ বৈচিত্র্য হ্রাস করে?
যেহেতু তুলনা প্রতিটি প্রম্পটের মধ্যে আপেক্ষিক, পরম স্কেলে পার্থক্য এবং প্রম্পট অসুবিধা ধুয়ে যায়।