ভাষা এআই গাইড

সরাসরি পছন্দ অপ্টিমাইজেশান

ডাইরেক্ট প্রেফারেন্স অপ্টিমাইজেশান (ডিপিও) হল ভাষা মডেলগুলিকে মানুষের পছন্দের সাথে সারিবদ্ধ করার একটি উপায় একটি পৃথক পুরস্কার মডেলের প্রশিক্ষণ না দিয়ে বা রিইনফোর্সমেন্ট লার্নিং চালানো ছাড়া।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It collapses a complex multi-stage pipeline into a single, stable training loss.

গভীর ডুব

2023 সালে স্ট্যানফোর্ডে রাফাইলভ এবং সহকর্মীদের দ্বারা প্রবর্তিত DPO, লোকেরা যা পছন্দ করে তা আমরা কীভাবে একটি মডেল শেখাই তা পুনর্বিবেচনা করে। ঐতিহ্যগত পদ্ধতি (RLHF) মানুষের তুলনার উপর একটি পুরষ্কার মডেল প্রশিক্ষণ দেয়, তারপর সেই পুরষ্কারকে সর্বাধিক করার জন্য শক্তিবৃদ্ধি শিক্ষা ব্যবহার করে। ডিপিও-এর মূল অন্তর্দৃষ্টি হল গাণিতিক: সেই RLHF উদ্দেশ্যের অধীনে সর্বোত্তম নীতির পুরষ্কারের সাথে একটি বন্ধ-ফর্ম সম্পর্ক রয়েছে, তাই আপনি সমীকরণগুলিকে পুনর্বিন্যাস করতে পারেন এবং সরাসরি পছন্দের জোড়ায় ভাষার মডেলটিকে অপ্টিমাইজ করতে পারেন৷ আপনি এটিকে একটি প্রম্পট দেন, একটি 'নির্বাচিত' (পছন্দের) প্রতিক্রিয়া, এবং একটি 'প্রত্যাখ্যান' প্রতিক্রিয়া, এবং একটি সাধারণ শ্রেণিবিন্যাস-শৈলী ক্ষতি মডেলটিকে বেছে নেওয়া উত্তরটিকে তুলনামূলকভাবে আরও বেশি সম্ভাবনাময় করে তোলে। কোন পুরষ্কার মডেল নেই, কোন নমুনা লুপ নেই, কোন পুরস্কার হ্যাকিং নেই। এটি চালানোর জন্য অনেক সহজ এবং আরো স্থিতিশীল।

প্রযুক্তিগত অন্তর্দৃষ্টি

ডিপিও পছন্দের জোড়ার তুলনায় বাইনারি ক্রস-এনট্রপি লস ব্যবহার করে। এটি প্রত্যাখ্যানকৃত প্রতিক্রিয়ার সাপেক্ষে নির্বাচিত প্রতিক্রিয়ার লগ-সম্ভাব্যতা অনুপাত বৃদ্ধি করে, প্রতিটি হিমায়িত রেফারেন্স মডেলের (সাধারণত তত্ত্বাবধানে-সূক্ষ্ম-টিউনড প্রারম্ভিক পয়েন্ট) এর বিপরীতে পরিমাপ করা হয়। একটি তাপমাত্রা পরামিতি বিটা নিয়ন্ত্রণ করে যে নীতিটি সেই রেফারেন্স থেকে কতদূর সরে যেতে পারে, RLHF স্পষ্টভাবে প্রযোজ্য KL সীমাবদ্ধতাকে স্পষ্টভাবে প্রয়োগ করে। পুরস্কার কখনো বাস্তবায়িত হয় না; এটি নীতির নিজস্ব লগ-সম্ভাবনার মধ্যে নিহিত।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

প্রত্যক্ষ পছন্দ অপ্টিমাইজেশানের ভবিষ্যত

DPO একটি ডিফল্ট অ্যালাইনমেন্ট পদ্ধতিতে পরিণত হয়েছে কারণ এটি সস্তা এবং পুনরুত্পাদনযোগ্য, এবং এটি একটি বৈকল্পিক পরিবার তৈরি করেছে: আইপিও কাছাকাছি-নির্ধারক পছন্দগুলির উপর ওভারফিটিং সংশোধন করে, KTO জোড়ার পরিবর্তে একক ভাল-মন্দ লেবেল থেকে শেখে, এবং ORPO কোন রেফারেন্স মডেল ছাড়াই ফাইন-টিউনিংয়ে পছন্দ শেখার ভাঁজ করে। সম্পূর্ণ অনলাইন RLHF এর সাথে অবশিষ্ট ব্যবধানকে সংকুচিত করে, অন-পলিসি ডেটা এবং দৈর্ঘ্য/গুণমানের সাথে ডিপিওকে একত্রিত করার জন্য অবিরত কাজ আশা করুন।

বাস্তব-বিশ্ব বাস্তবায়ন

ফাইন-টিউনিং ওপেন-ওয়েট চ্যাট মডেল যেমন Zephyr এবং অনেক Llama এবং Mistral ডেরিভেটিভস, যা পছন্দের ডেটাসেটে DPO এর সাথে সংযুক্ত ছিল

জোড়া ব্যবহার করে ক্ষতিকারক বা অসহায় আউটপুট হ্রাস করা যেখানে একটি সমস্যাযুক্ত উত্তরের জন্য নিরাপদ, সহায়ক উত্তর 'নির্বাচিত' হয়

ডেভেলপার-রেট তুলনা ব্যবহার করে বগির চেয়ে সঠিক, ভাল-ডকুমেন্টেড সমাধান পছন্দ করতে একজন কোডিং সহকারীকে শেখানো

সংক্ষিপ্তকরণের শৈলী টিউন করা যাতে মডেলগুলি ভার্বস বা হ্যালুসিনেটেডগুলির চেয়ে সংক্ষিপ্ত, বিশ্বস্ত সারাংশ পছন্দ করে

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

অডস রেশিও প্রেফারেন্স অপ্টিমাইজেশান

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Direct Preference Optimization?

ডাইরেক্ট প্রেফারেন্স অপ্টিমাইজেশান (ডিপিও) হল ভাষা মডেলগুলিকে মানুষের পছন্দের সাথে সারিবদ্ধ করার একটি উপায় একটি পৃথক পুরস্কার মডেলের প্রশিক্ষণ না দিয়ে বা রিইনফোর্সমেন্ট লার্নিং চালানো ছাড়া। এটি একটি জটিল বহু-পর্যায়ের পাইপলাইনকে একটি একক, স্থিতিশীল প্রশিক্ষণ ক্ষতিতে ভেঙে দেয়।

প্রথাগত RLHF-এর তুলনায় DPO কী নির্মূল করে?

ডিপিও-এর প্রধান সুবিধা হল সুস্পষ্ট পুরস্কার মডেল এবং RL স্যাম্পলিং লুপ সরিয়ে দেওয়া, পরিবর্তে পছন্দের জোড়ায় সরাসরি নীতিকে অপ্টিমাইজ করা।

একটি একক ডিপিও প্রশিক্ষণ উদাহরণে কোন ডেটা থাকে?

ডিপিও পছন্দের জোড়ার উপর প্রশিক্ষণ দেয়: একটি প্রম্পট প্লাস একটি পছন্দের ('নির্বাচিত') এবং একটি অপছন্দিত ('প্রত্যাখ্যান') প্রতিক্রিয়া।

ডিপিও-তে রেফারেন্স মডেল কী ভূমিকা পালন করে?

একটি হিমায়িত রেফারেন্স (সাধারণত SFT মডেল) ক্ষতিকে অ্যাঙ্কর করে; বিটা প্যারামিটার নিয়ন্ত্রণ করে যে প্রশিক্ষিত নীতি এটি থেকে কতদূর যেতে পারে।

ডিপিওতে 'পুরস্কার' কোথায় উপস্থাপন করা হয়?

ডিপিও-এর ডেরিভেশন দেখায় যে পুরষ্কারটি নীতি এবং রেফারেন্সের মধ্যে লগ-সম্ভাব্যতার অনুপাতের মধ্যে নিহিত, তাই কোনও স্পষ্ট পুরস্কার মডেলের প্রয়োজন নেই।

ডিপিও-তে বিটা (তাপমাত্রা) প্যারামিটার কী নিয়ন্ত্রণ করে?

বিটা অন্তর্নিহিত KL সীমাবদ্ধতা নিয়ন্ত্রণ করে: উচ্চতর বিটা নীতিকে রেফারেন্সের কাছাকাছি রাখে, নিম্ন বিটা আরও বিচ্যুতির অনুমতি দেয়।