সরাসরি পছন্দ অপ্টিমাইজেশান
ডাইরেক্ট প্রেফারেন্স অপ্টিমাইজেশান (ডিপিও) হল ভাষা মডেলগুলিকে মানুষের পছন্দের সাথে সারিবদ্ধ করার একটি উপায় একটি পৃথক পুরস্কার মডেলের প্রশিক্ষণ না দিয়ে বা রিইনফোর্সমেন্ট লার্নিং চালানো ছাড়া।
ওভারভিউ
It collapses a complex multi-stage pipeline into a single, stable training loss.
গভীর ডুব
2023 সালে স্ট্যানফোর্ডে রাফাইলভ এবং সহকর্মীদের দ্বারা প্রবর্তিত DPO, লোকেরা যা পছন্দ করে তা আমরা কীভাবে একটি মডেল শেখাই তা পুনর্বিবেচনা করে। ঐতিহ্যগত পদ্ধতি (RLHF) মানুষের তুলনার উপর একটি পুরষ্কার মডেল প্রশিক্ষণ দেয়, তারপর সেই পুরষ্কারকে সর্বাধিক করার জন্য শক্তিবৃদ্ধি শিক্ষা ব্যবহার করে। ডিপিও-এর মূল অন্তর্দৃষ্টি হল গাণিতিক: সেই RLHF উদ্দেশ্যের অধীনে সর্বোত্তম নীতির পুরষ্কারের সাথে একটি বন্ধ-ফর্ম সম্পর্ক রয়েছে, তাই আপনি সমীকরণগুলিকে পুনর্বিন্যাস করতে পারেন এবং সরাসরি পছন্দের জোড়ায় ভাষার মডেলটিকে অপ্টিমাইজ করতে পারেন৷ আপনি এটিকে একটি প্রম্পট দেন, একটি 'নির্বাচিত' (পছন্দের) প্রতিক্রিয়া, এবং একটি 'প্রত্যাখ্যান' প্রতিক্রিয়া, এবং একটি সাধারণ শ্রেণিবিন্যাস-শৈলী ক্ষতি মডেলটিকে বেছে নেওয়া উত্তরটিকে তুলনামূলকভাবে আরও বেশি সম্ভাবনাময় করে তোলে। কোন পুরষ্কার মডেল নেই, কোন নমুনা লুপ নেই, কোন পুরস্কার হ্যাকিং নেই। এটি চালানোর জন্য অনেক সহজ এবং আরো স্থিতিশীল।
প্রযুক্তিগত অন্তর্দৃষ্টি
ডিপিও পছন্দের জোড়ার তুলনায় বাইনারি ক্রস-এনট্রপি লস ব্যবহার করে। এটি প্রত্যাখ্যানকৃত প্রতিক্রিয়ার সাপেক্ষে নির্বাচিত প্রতিক্রিয়ার লগ-সম্ভাব্যতা অনুপাত বৃদ্ধি করে, প্রতিটি হিমায়িত রেফারেন্স মডেলের (সাধারণত তত্ত্বাবধানে-সূক্ষ্ম-টিউনড প্রারম্ভিক পয়েন্ট) এর বিপরীতে পরিমাপ করা হয়। একটি তাপমাত্রা পরামিতি বিটা নিয়ন্ত্রণ করে যে নীতিটি সেই রেফারেন্স থেকে কতদূর সরে যেতে পারে, RLHF স্পষ্টভাবে প্রযোজ্য KL সীমাবদ্ধতাকে স্পষ্টভাবে প্রয়োগ করে। পুরস্কার কখনো বাস্তবায়িত হয় না; এটি নীতির নিজস্ব লগ-সম্ভাবনার মধ্যে নিহিত।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
প্রত্যক্ষ পছন্দ অপ্টিমাইজেশানের ভবিষ্যত
DPO একটি ডিফল্ট অ্যালাইনমেন্ট পদ্ধতিতে পরিণত হয়েছে কারণ এটি সস্তা এবং পুনরুত্পাদনযোগ্য, এবং এটি একটি বৈকল্পিক পরিবার তৈরি করেছে: আইপিও কাছাকাছি-নির্ধারক পছন্দগুলির উপর ওভারফিটিং সংশোধন করে, KTO জোড়ার পরিবর্তে একক ভাল-মন্দ লেবেল থেকে শেখে, এবং ORPO কোন রেফারেন্স মডেল ছাড়াই ফাইন-টিউনিংয়ে পছন্দ শেখার ভাঁজ করে। সম্পূর্ণ অনলাইন RLHF এর সাথে অবশিষ্ট ব্যবধানকে সংকুচিত করে, অন-পলিসি ডেটা এবং দৈর্ঘ্য/গুণমানের সাথে ডিপিওকে একত্রিত করার জন্য অবিরত কাজ আশা করুন।
বাস্তব-বিশ্ব বাস্তবায়ন
ফাইন-টিউনিং ওপেন-ওয়েট চ্যাট মডেল যেমন Zephyr এবং অনেক Llama এবং Mistral ডেরিভেটিভস, যা পছন্দের ডেটাসেটে DPO এর সাথে সংযুক্ত ছিল
জোড়া ব্যবহার করে ক্ষতিকারক বা অসহায় আউটপুট হ্রাস করা যেখানে একটি সমস্যাযুক্ত উত্তরের জন্য নিরাপদ, সহায়ক উত্তর 'নির্বাচিত' হয়
ডেভেলপার-রেট তুলনা ব্যবহার করে বগির চেয়ে সঠিক, ভাল-ডকুমেন্টেড সমাধান পছন্দ করতে একজন কোডিং সহকারীকে শেখানো
সংক্ষিপ্তকরণের শৈলী টিউন করা যাতে মডেলগুলি ভার্বস বা হ্যালুসিনেটেডগুলির চেয়ে সংক্ষিপ্ত, বিশ্বস্ত সারাংশ পছন্দ করে
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
অডস রেশিও প্রেফারেন্স অপ্টিমাইজেশান
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Direct Preference Optimization?
ডাইরেক্ট প্রেফারেন্স অপ্টিমাইজেশান (ডিপিও) হল ভাষা মডেলগুলিকে মানুষের পছন্দের সাথে সারিবদ্ধ করার একটি উপায় একটি পৃথক পুরস্কার মডেলের প্রশিক্ষণ না দিয়ে বা রিইনফোর্সমেন্ট লার্নিং চালানো ছাড়া। এটি একটি জটিল বহু-পর্যায়ের পাইপলাইনকে একটি একক, স্থিতিশীল প্রশিক্ষণ ক্ষতিতে ভেঙে দেয়।
প্রথাগত RLHF-এর তুলনায় DPO কী নির্মূল করে?
ডিপিও-এর প্রধান সুবিধা হল সুস্পষ্ট পুরস্কার মডেল এবং RL স্যাম্পলিং লুপ সরিয়ে দেওয়া, পরিবর্তে পছন্দের জোড়ায় সরাসরি নীতিকে অপ্টিমাইজ করা।
একটি একক ডিপিও প্রশিক্ষণ উদাহরণে কোন ডেটা থাকে?
ডিপিও পছন্দের জোড়ার উপর প্রশিক্ষণ দেয়: একটি প্রম্পট প্লাস একটি পছন্দের ('নির্বাচিত') এবং একটি অপছন্দিত ('প্রত্যাখ্যান') প্রতিক্রিয়া।
ডিপিও-তে রেফারেন্স মডেল কী ভূমিকা পালন করে?
একটি হিমায়িত রেফারেন্স (সাধারণত SFT মডেল) ক্ষতিকে অ্যাঙ্কর করে; বিটা প্যারামিটার নিয়ন্ত্রণ করে যে প্রশিক্ষিত নীতি এটি থেকে কতদূর যেতে পারে।
ডিপিওতে 'পুরস্কার' কোথায় উপস্থাপন করা হয়?
ডিপিও-এর ডেরিভেশন দেখায় যে পুরষ্কারটি নীতি এবং রেফারেন্সের মধ্যে লগ-সম্ভাব্যতার অনুপাতের মধ্যে নিহিত, তাই কোনও স্পষ্ট পুরস্কার মডেলের প্রয়োজন নেই।
ডিপিও-তে বিটা (তাপমাত্রা) প্যারামিটার কী নিয়ন্ত্রণ করে?
বিটা অন্তর্নিহিত KL সীমাবদ্ধতা নিয়ন্ত্রণ করে: উচ্চতর বিটা নীতিকে রেফারেন্সের কাছাকাছি রাখে, নিম্ন বিটা আরও বিচ্যুতির অনুমতি দেয়।