মৌলিক নির্দেশিকা

পছন্দ অপ্টিমাইজেশানে দৈর্ঘ্য স্বাভাবিককরণ

দৈর্ঘ্য স্বাভাবিককরণ পছন্দ-টিউনিং উদ্দেশ্যগুলিকে সামঞ্জস্য করে যাতে মডেলগুলি কেবল দীর্ঘ উত্তর লিখে অনুমোদন পাওয়া বন্ধ করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

এটি গুরুত্বপূর্ণ কারণ অসংশোধন করা পুরষ্কার সংকেতগুলি চ্যাটবটগুলিকে সত্যিকারের আরও ভাল প্রতিক্রিয়ার পরিবর্তে শব্দ, প্যাডেড প্রতিক্রিয়াগুলির দিকে ঠেলে দেয়।

গভীর ডুব

যখন মডেলগুলিকে RLHF বা DPO-এর মতো পদ্ধতির সাথে সারিবদ্ধ করা হয়, তখন তারা সেই তুলনা থেকে শিখে যেখানে মানুষ (বা একটি পুরষ্কার মডেল) দুটি উত্তরের 'ভালো' বেছে নিয়েছে। একটি ক্রমাগত বাগ হল যে দীর্ঘ উত্তরগুলি পছন্দ করা হয় এমনকি যখন সেগুলি আসলে ভাল না হয়, তাই মডেলটি শর্টকাটটি শিখেছে: শব্দযুক্ত হন৷ দৈর্ঘ্য স্বাভাবিককরণ এটি প্রতিহত করে। DPO-তে অন্তর্নিহিত পুরস্কার হল প্রতি-টোকেন লগ-সম্ভাব্যতার পার্থক্যের সমষ্টি, যা যান্ত্রিকভাবে দৈর্ঘ্যের সাথে বৃদ্ধি পায়। দৈর্ঘ্য-স্বাভাবিক ডিপিও এবং সিমপিও-এর মতো রূপগুলি টোকেনের সংখ্যা দ্বারা সেই পুরস্কারকে ভাগ করে, পরিবর্তে প্রতি-টোকেন গড়ে স্কোর করে। ফলাফল হল মডেল যা উদ্দেশ্য খেলার জন্য প্রতিক্রিয়া বৃদ্ধি করার পরিবর্তে সংক্ষিপ্ত এবং অন-পয়েন্ট থাকে।

প্রযুক্তিগত অন্তর্দৃষ্টি

DPO-এর অন্তর্নিহিত পুরস্কার হল টিউন করা এবং রেফারেন্স নীতির মধ্যে লগ-অনুপাত, প্রতিক্রিয়ার প্রতিটি টোকেনের উপর সমষ্টি। কারণ প্রতিটি টোকেন আরেকটি (সাধারণত ইতিবাচক) শব্দ যোগ করে, ক্রম দৈর্ঘ্যের সাথে অপরিশোধিত পুরষ্কার স্কেল, দীর্ঘ সমাপ্তির দিকে পক্ষপাতমূলক অপ্টিমাইজেশন। SimPO রেফারেন্স মডেল ড্রপ করে এবং প্রতি টোকেন হিসাবে গড় লগ-সম্ভাব্যতা ব্যবহার করে, সাথে একটি লক্ষ্য পুরস্কার মার্জিন। দৈর্ঘ্য দ্বারা ভাগ করা যান্ত্রিক দৈর্ঘ্যের সুবিধাকে সরিয়ে দেয়, তাই পছন্দের গ্রেডিয়েন্টগুলি শব্দ সংখ্যার পরিবর্তে গুণমানকে প্রতিফলিত করে।

কৌশলগত প্রভাব

সুস্পষ্ট সিদ্ধান্ত

এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।

খরচ ও বাজেট

অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।

টিম এবং ওয়ার্কফ্লো

ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।

অগ্রাধিকার অপ্টিমাইজেশানে দৈর্ঘ্য স্বাভাবিককরণের ভবিষ্যত

দৈর্ঘ্য নিয়ন্ত্রণ একটি আদর্শ গাঁটের পরিবর্তে একটি আফটারথট হয়ে উঠতে আশা করুন। গবেষকরা দৈর্ঘ্যের স্বাভাবিককরণকে সুস্পষ্ট দৈর্ঘ্যের জরিমানা, দৈর্ঘ্য-কন্ডিশনযুক্ত পুরস্কার, এবং মূল্যায়ন স্যুটগুলির সাথে একত্রিত করছেন যা সঠিক মানের লাভ পরিমাপ করতে উত্তরের দৈর্ঘ্য ধ্রুবক ধরে রাখে। যেহেতু পুরষ্কার মডেলগুলি ভার্বোসিটি পক্ষপাতিত্ব চিহ্নিত করার ক্ষেত্রে আরও ভাল হয়, সারিবদ্ধ পাইপলাইনগুলি সম্ভবত ডিফল্টরূপে দৈর্ঘ্য-অবশ্যক জয়ের হার রিপোর্ট করবে এবং ব্যবহারকারীরা একটি মডেলের উত্তরগুলি কতটা সংক্ষিপ্ত বা বিশদ হওয়া উচিত তার উপর আরও সূক্ষ্ম নিয়ন্ত্রণ অর্জন করবে৷

বাস্তব-বিশ্ব বাস্তবায়ন

SimPO এর সাথে একজন গ্রাহক-সমর্থন সহকারীকে টিউন করা যাতে এটি প্যাডেড অনুচ্ছেদের পরিবর্তে খাস্তা, সঠিক উত্তর দেয় যা কেবল পুঙ্খানুপুঙ্খভাবে দেখায়।

AlpacaEval 2-এ 'দৈর্ঘ্য-নিয়ন্ত্রিত জয়ের হার' রিপোর্ট করা একটি মডেল দেখানোর জন্য যা সত্যিকারের উন্নত হয়েছে তার চেয়ে বরং আরও উন্নত।

একটি কোডিং মডেল ফাইন-টিউন করার সময় DPO-তে দৈর্ঘ্য স্বাভাবিককরণ যোগ করা যাতে এটি ন্যূনতম সঠিক স্নিপেট প্রদান করে, ফোলা বয়লারপ্লেট নয়।

একটি পুরষ্কার মডেল নির্ণয় করা যা পদ্ধতিগতভাবে দীর্ঘ প্রবন্ধগুলিকে উচ্চতর করে, তারপর এটিকে ব্যবহার করার আগে একটি রাইটিং সহকারীকে সারিবদ্ধ করতে এটিকে ডিবিয়াস করে৷

ঝুঁকি এবং প্রহরী

বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।

বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।

ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।

বাস্তবায়ন রোডম্যাপ

1

আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।

2

পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।

3

একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷

4

নথি যেখানে পছন্দ অপ্টিমাইজেশানে দৈর্ঘ্য স্বাভাবিককরণ সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

অডস রেশিও প্রেফারেন্স অপ্টিমাইজেশান

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

পছন্দসই অপ্টিমাইজেশনে দৈর্ঘ্য নরমালাইজেশন কী?

দৈর্ঘ্য স্বাভাবিককরণ পছন্দ-টিউনিং উদ্দেশ্যগুলিকে সামঞ্জস্য করে যাতে মডেলগুলি কেবল দীর্ঘ উত্তর লিখে অনুমোদন পাওয়া বন্ধ করে। এটি গুরুত্বপূর্ণ কারণ অসংশোধিত পুরষ্কার সংকেত চ্যাটবটগুলিকে সত্যিকারের ভালগুলির পরিবর্তে ভার্বোস, প্যাডেড প্রতিক্রিয়াগুলির দিকে ঠেলে দেয়৷

DPO-তে দৈর্ঘ্যের স্বাভাবিকীকরণ প্রাথমিকভাবে প্রতিরোধ করার লক্ষ্যে কোন অবাঞ্ছিত আচরণ করে?

DPO-এর অন্তর্নিহিত পুরষ্কার টোকেন গণনার সাথে বৃদ্ধি পায়, তাই স্বাভাবিকীকরণ ছাড়া মডেলগুলি শিখেছে যে কেবলমাত্র বেশি শব্দযুক্ত হওয়া পছন্দের তুলনা জয়ের প্রবণতা রাখে।

কেন স্ট্যান্ডার্ড ডিপিও-এর অন্তর্নিহিত পুরস্কার প্রতিক্রিয়ার দৈর্ঘ্যের সাথে বাড়তে থাকে?

অন্তর্নিহিত পুরষ্কার প্রতিটি টোকেন জুড়ে লগ-সম্ভাব্যতার অনুপাত যোগ করে, তাই আরও টোকেন সাধারণত একটি বৃহত্তর মোট পুরস্কারকে বোঝায়।

কিভাবে SimPO দৈর্ঘ্যের পক্ষপাতের সমাধান করে?

SimPO তাদের গড় (দৈর্ঘ্য-স্বাভাবিক) লগ-সম্ভাব্যতা দ্বারা প্রতিক্রিয়া স্কোর করে এবং যান্ত্রিক দৈর্ঘ্যের সুবিধা সরিয়ে একটি লক্ষ্য পুরস্কার মার্জিন যোগ করে।

কোন মূল্যায়ন অনুশীলন শুধুমাত্র দৈর্ঘ্যের পরিবর্তে গুণমান উন্নত একটি মডেল নিশ্চিত করতে সাহায্য করে?

দৈর্ঘ্য-নিয়ন্ত্রিত জয়ের হার (AlpacaEval 2 এর মতো) উত্তরের দৈর্ঘ্যের জন্য সামঞ্জস্য করে যাতে লাভ গুণমানকে প্রতিফলিত করে, শব্দচয়ন নয়।