ভাষা এআই গাইড

সেরা-অফ-এন স্যাম্পলিং এবং পুনঃর্যাঙ্কিং

সেরা-অফ-এন স্যাম্পলিং একটি মডেল থেকে একাধিক প্রার্থীর উত্তর তৈরি করে এবং তারপর একটি পৃথক স্কোরিং ধাপ ব্যবহার করে সেরাটি বেছে নেয়।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It is one of the simplest, most reliable ways to trade extra compute at inference time for higher answer quality.

গভীর ডুব

স্যাম্পলিং সহ একটি ভাষা মডেল যখন আপনি এটি চালান তখন বিভিন্ন আউটপুট তৈরি করে। সর্বোত্তম-অফ-এন এটিকে কাজে লাগায়: আপনি N প্রার্থীর প্রতিক্রিয়াগুলি আঁকেন, তারপরে সেগুলিকে পুনরায় র‍্যাঙ্ক করুন এবং শীর্ষটিকে ফিরিয়ে দিন৷ পুনঃরাঙ্কার একটি শেখা পুরস্কার মডেল হতে পারে (মানুষের প্রতিক্রিয়া থেকে শক্তিবৃদ্ধি শেখার ক্ষেত্রে সাধারণ), একটি যাচাইকারী যা সঠিকতা পরীক্ষা করে বা সংখ্যাগরিষ্ঠ ভোটের মাধ্যমে উত্তর চুক্তির মতো একটি সাধারণ হিউরিস্টিক হতে পারে। যেহেতু মডেলটির জন্য অনেকগুলির মধ্যে শুধুমাত্র একটি ভাল প্রচেষ্টার প্রয়োজন, N বৃদ্ধির সাথে সাথে গুণমান প্রায়শই দ্রুত বৃদ্ধি পায়, বিশেষ করে যুক্তি এবং কোডের কাজগুলিতে যেখানে একটি সঠিক পথ বিদ্যমান কিন্তু সর্বদা প্রথম নমুনা নয়। খরচ N-এ রৈখিক, এবং শেষ পর্যন্ত লাভ হয় মালভূমি বা এমনকি যদি স্কোরার অসম্পূর্ণ হয়, একটি ব্যর্থতার মোড যাকে বলা হয় পুরস্কার হ্যাকিং বা পুরস্কার ওভার-অপ্টিমাইজেশন।

প্রযুক্তিগত অন্তর্দৃষ্টি

সেরা-অফ-এন-এর গুণমান সম্পূর্ণরূপে স্কোরারের উপর নির্ভর করে। একটি নিখুঁত যাচাইকারীর সাহায্যে, নির্ভুলতা সেই সুযোগের কাছে পৌঁছায় যে N নমুনাগুলির মধ্যে অন্তত একটি সঠিক, যেটি N এর সাথে দ্রুত বৃদ্ধি পায়। একটি শোরগোলপূর্ণ পুরষ্কার মডেলের সাথে, নির্বাচনকে বোকা বানানো যেতে পারে: Nকে খুব বেশি ঠেলে আউটপুটগুলিকে প্রশস্ত করে যেগুলি উচ্চ স্কোর করে কিন্তু প্রকৃতপক্ষে ভুল, যেহেতু আপনি স্কোরকারীর অন্ধ দাগের বিরুদ্ধে অপ্টিমাইজ করছেন। এই কারণেই ক্রমাঙ্কিত, শক্তিশালী পুরষ্কার মডেলগুলি অর্থ প্রদান চালিয়ে যাওয়ার কৌশলটির জন্য গুরুত্বপূর্ণ।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

দ্য ফিউচার অফ বেস্ট-অফ-এন স্যাম্পলিং এবং রির্যাঙ্কিং

চেইন-অফ-থট এবং ট্রি অনুসন্ধানের পাশাপাশি বেস্ট-অফ-এন ইনফারেন্স-টাইম স্কেলিং-এর একটি মূল বিল্ডিং ব্লক হয়ে উঠছে। আরও স্মার্ট বৈকল্পিক আশা করুন: ওজনযুক্ত সংখ্যাগরিষ্ঠ ভোটিং, প্রক্রিয়া পুরষ্কার মডেল যা প্রতিটি যুক্তির ধাপে স্কোর করে এবং অভিযোজিত N যা আত্মবিশ্বাস বেশি হলে নমুনা নেওয়া বন্ধ করে। যেহেতু যাচাইকারীর উন্নতি হয়, বিশেষ করে কোড এবং গণিতের জন্য যেখানে সঠিকতা যাচাই করা যায়, অনেক নমুনাকে পুনরায় র‌্যাঙ্ক করা হবে বেস মডেলকে পুনরায় প্রশিক্ষণ না দিয়ে অতিরিক্ত কম্পিউটকে নির্ভরযোগ্যতায় রূপান্তর করার একটি আদর্শ উপায়।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি গণিত সমস্যার 64টি সমাধানের নমুনা তৈরি করা এবং সবচেয়ে নমুনা যে উত্তরে একমত তা নির্বাচন করা (স্ব-সংগতি / সংখ্যাগরিষ্ঠ ভোটিং)।

একাধিক কোড সমাপ্তি তৈরি করা এবং একটি স্বয়ংক্রিয় যাচাইকারী হিসাবে সর্বাধিক ইউনিট পরীক্ষায় উত্তীর্ণ হওয়াকে রাখা।

একটি RLHF পাইপলাইনে বেশ কয়েকটি প্রতিক্রিয়া আঁকা এবং ব্যবহারকারীদের পরিবেশন করার জন্য সর্বোচ্চ-পুরস্কার-মডেল-স্কোর করা উত্তর বেছে নেওয়া।

অনেকগুলি খসড়া সারাংশ তৈরি করা এবং সবচেয়ে বিশ্বস্ত, সংক্ষিপ্ত একটি ফেরত দেওয়ার জন্য একটি মানসম্পন্ন মডেলের সাথে সেগুলিকে পুনরায় র‌্যাঙ্ক করা।

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Best-of-N Sampling and Reranking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

তাপমাত্রা এবং নমুনা

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Best-of-N Sampling and Reranking?

সেরা-অফ-এন স্যাম্পলিং একটি মডেল থেকে একাধিক প্রার্থীর উত্তর তৈরি করে এবং তারপর একটি পৃথক স্কোরিং ধাপ ব্যবহার করে সেরাটি বেছে নেয়। এটি উচ্চতর উত্তর মানের জন্য অনুমান সময়ে অতিরিক্ত গণনা ট্রেড করার সহজতম, সবচেয়ে নির্ভরযোগ্য উপায়গুলির মধ্যে একটি।

সেরা-অফ-এন স্যাম্পলিংয়ের মূল ধারণা কী?

বেস্ট-অফ-এন একাধিক প্রার্থীর প্রতিক্রিয়া আঁকে এবং তারপরে সেগুলিকে পুনরায় র‌্যাঙ্ক করে, সর্বোচ্চ স্কোরিং ফিরিয়ে দেয়।

কোন ধরনের কাজগুলিতে সেরা-অফ-এন সবচেয়ে বেশি সাহায্য করে?

যখন একটি যাচাইযোগ্য সঠিক উত্তর পাওয়া যায় যা মডেলটি শুধুমাত্র মাঝে মাঝেই খুঁজে পায়, তখন আরও প্রার্থীর নমুনা নেওয়া একজনের সঠিক হওয়ার সম্ভাবনা বাড়ায়।

সেরা-অফ-এন আসলে ফলাফলের উন্নতি করে কিনা তা মূলত কী নির্ধারণ করে?

নির্বাচন শুধুমাত্র reranker হিসাবে ভাল হিসাবে; একজন দুর্বল বা পক্ষপাতদুষ্ট স্কোরার ভুল উত্তর বাছাই করতে পারে।

কোন ব্যর্থতা মোড প্রদর্শিত হতে পারে যখন একটি অপূর্ণ পুরষ্কার মডেলের সাথে N কে খুব বেশি ধাক্কা দেওয়া হয়?

একটি ত্রুটিপূর্ণ স্কোরারের বিরুদ্ধে কঠোরভাবে অপ্টিমাইজ করা আউটপুটগুলিকে প্রশস্ত করে যা তার অন্ধ দাগগুলিকে কাজে লাগায়, তাই নির্ভুলতা মালভূমি বা ড্রপ হতে পারে।

কোন সহজ পুনঃর্যাঙ্কিং কৌশলটি স্ব-সংগতি হিসাবেও পরিচিত?

স্ব-সংগতি নমুনা অনেক যুক্তি শৃঙ্খল এবং চূড়ান্ত উত্তর নির্বাচন করে যে অধিকাংশ চেইন একমত।