ভাষা এআই গাইড

প্রক্সিমাল পলিসি অপ্টিমাইজেশান

প্রক্সিমাল পলিসি অপ্টিমাইজেশান (PPO) হল রিইনফোর্সমেন্ট লার্নিং অ্যালগরিদম যা মানুষের ফিডব্যাক থেকে ফাইন-টিউনিং ল্যাঙ্গুয়েজ মডেলের সাথে যুক্ত।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

গভীর ডুব

PPO 2017 সালে OpenAI দ্বারা প্রবর্তন করা হয়েছিল এবং InstructGPT এবং ChatGPT এর মতো সিস্টেমের জন্য RLHF এর পিছনে ওয়ার্কহরস হয়ে উঠেছে। পলিসি-গ্রেডিয়েন্ট RL-এর মূল চ্যালেঞ্জ হল একটি একক অত্যধিক বড় আপডেট কর্মক্ষমতা ভেঙে দিতে পারে। PPO এটিকে একটি 'ক্লিপড সারোগেট উদ্দেশ্য' দিয়ে সম্বোধন করে: এটি পরিমাপ করে যে কত বেশি (বা কম) একটি অ্যাকশন পুরানো নীতির বিপরীতে পরিণত হয়েছে, সেই অনুপাতটিকে সুবিধা দিয়ে গুণ করে (অ্যাকশনটি প্রত্যাশার চেয়ে কতটা ভাল ছিল), এবং অনুপাতটিকে 0.8 থেকে 1.2-এর মতো একটি ছোট পরিসরে ক্লিপ করে৷ এটি স্থিতিশীল উন্নতির অনুমতি দিয়ে শেখার স্থিতিশীল রেখে প্রতি আপডেটে নীতি কতদূর যেতে পারে তা নির্ধারণ করে। ভাষা-মডেল RLHF-এ, 'অ্যাকশন' একটি টোকেন বা প্রতিক্রিয়া তৈরি করছে, পুরষ্কারটি একটি পুরষ্কার মডেল থেকে আসে এবং একটি কেএল-ডাইভারজেন্স পেনাল্টি মডেলটিকে তার আসল আচরণ থেকে অনেক দূরে সরে যাওয়া থেকে বিরত রাখে।

প্রযুক্তিগত অন্তর্দৃষ্টি

PPO একটি ক্লিপ করা উদ্দেশ্যকে সর্বোচ্চ করে: মিনিট(অনুপাত * সুবিধা, ক্লিপ(অনুপাত, 1-ইপিএস, 1+ইপিএস) * সুবিধা), যেখানে অনুপাত হল নতুন-ওভার-পুরানো অ্যাকশন সম্ভাবনা। সুবিধাগুলি সাধারণত জেনারেলাইজড অ্যাডভান্টেজ এস্টিমেশন এবং একটি শেখা মান (সমালোচক) নেটওয়ার্কের সাহায্যে অনুমান করা হয়। RLHF-এ, মোট পুরস্কার রেফারেন্স নীতির বিরুদ্ধে প্রতি-টোকেন KL পেনাল্টির সাথে পুরস্কার-মডেল স্কোরকে একত্রিত করে, মূল মডেলের কাছাকাছি থাকার বিরুদ্ধে পুরস্কার লাভের ভারসাম্য বজায় রাখে।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

প্রক্সিমাল পলিসি অপ্টিমাইজেশানের ভবিষ্যত

PPO শক্তিশালী রয়ে গেছে কিন্তু কুখ্যাতভাবে ফিডলি: এর জন্য একটি পৃথক মান নেটওয়ার্ক, সতর্ক হাইপারপ্যারামিটার টিউনিং এবং প্রচুর গণনা প্রয়োজন। DPO (কোনও RL নেই) এবং GRPO সহ সহজ বিকল্পগুলি গ্রাউন্ড লাভ করছে, যা নমুনাকৃত প্রতিক্রিয়াগুলির গোষ্ঠীগুলি থেকে সুবিধাগুলি অনুমান করে মান নেটওয়ার্ককে হ্রাস করে এবং সাম্প্রতিক যুক্তি মডেলগুলিকে চালিত করেছে৷ PPO টিকে থাকবে যেখানে অন-পলিসি অন্বেষণ সত্যিকার অর্থে সাহায্য করে, কিন্তু ক্ষেত্রটি সস্তা পদ্ধতির জন্য সক্রিয়ভাবে এর কিছু জটিলতার ব্যবসা করছে।

বাস্তব-বিশ্ব বাস্তবায়ন

ফাইন-টিউনিং InstructGPT এবং ChatGPT নির্দেশাবলী এবং RLHF এর মাধ্যমে মানুষের পছন্দ অনুসরণ করতে

গেম-প্লেয়িং এবং রোবোটিক্স কন্ট্রোল এজেন্টদের প্রশিক্ষণ দেওয়া, ভাষা মডেলের আগে PPO-এর আসল ডোমেন

কেএল সীমাবদ্ধতার অধীনে একটি পুরস্কার-মডেল স্কোর সর্বাধিক করে বিষাক্ততা হ্রাস করা বা সহায়কতা উন্নত করা

টুল-ব্যবহার অপ্টিমাইজ করা বা মাল্টি-স্টেপ এজেন্ট আচরণ যেখানে একটি মডেল সঠিকভাবে কাজগুলি সম্পূর্ণ করার জন্য পুরস্কৃত হয়

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

গ্রুপ রিলেটিভ পলিসি অপ্টিমাইজেশান

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Proximal Policy Optimization?

প্রক্সিমাল পলিসি অপ্টিমাইজেশান (PPO) হল রিইনফোর্সমেন্ট লার্নিং অ্যালগরিদম যা মানুষের ফিডব্যাক থেকে ফাইন-টিউনিং ল্যাঙ্গুয়েজ মডেলের সাথে যুক্ত। এটি অস্থিরতা এড়াতে সাবধানে, ছোট পদক্ষেপে একটি নীতি উন্নত করে যা নিষ্পাপ নীতি গ্রেডিয়েন্ট পদ্ধতিগুলিকে আঘাত করে।

PPO এর 'ক্লিপিং' প্রাথমিকভাবে কোন সমস্যাটির সমাধান করে?

সম্ভাবনার অনুপাত ক্লিপ করা যেকোন একক আপডেটকে নীতিকে অনেক দূরে সরাতে বাধা দেয়, যা নীতি-গ্রেডিয়েন্ট পদ্ধতিতে অস্থিরতার প্রধান উৎস।

PPO সহ ভাষা-মডেল RLHF-এ, পুরস্কারের সংকেত সাধারণত কোথা থেকে আসে?

একটি পুরষ্কার মডেল জেনারেট করা প্রতিক্রিয়াগুলির জন্য স্কেলার পুরষ্কার প্রদান করে, যেহেতু মানুষের RL চলাকালীন প্রতিটি আউটপুট স্কোর করা অসম্ভব হবে।

PPO-ভিত্তিক RLHF-এ কেএল-ডাইভারজেন্স পেনাল্টি কী করে?

মূল (রেফারেন্স) নীতির বিরুদ্ধে প্রতি-টোকেন KL জরিমানা পুরস্কারের পিছনে যাওয়ার সময় মডেলটিকে তার আচরণকে খুব বেশি পরিবর্তন করতে নিরুৎসাহিত করে।

পিপিওতে মান (সমালোচক) নেটওয়ার্কের ভূমিকা কী?

PPO একটি অভিনেতা-সমালোচক পদ্ধতি; মান নেটওয়ার্ক প্রত্যাশিত পুরষ্কার অনুমান করে, সুবিধা অনুমান সক্ষম করে (প্রায়শই GAE এর মাধ্যমে) যা বৈচিত্র্য হ্রাস করে।

PPO-তে 'সুবিধা' কী উপস্থাপন করে?

সুবিধাটি পরিমাপ করে যে কোন ক্রিয়াগুলিকে শক্তিশালী করতে হবে তা নীতিকে বলে মূল্য অনুমানের তুলনায় একটি নির্বাচিত ক্রিয়া কতটা ভাল (বা খারাপ) ছিল।