دليل اللغة AI

أفضل أخذ العينات وإعادة الترتيب

يقوم أخذ العينات الأفضل من N بإنشاء العديد من الإجابات المرشحة من النموذج ثم يختار أفضلها باستخدام خطوة تسجيل منفصلة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is one of the simplest, most reliable ways to trade extra compute at inference time for higher answer quality.

الغوص العميق

يُنتج نموذج اللغة مع أخذ العينات مخرجات مختلفة في كل مرة تقوم بتشغيله. يستغل خيار Best-of-N هذا الأمر: حيث تقوم برسم عدد N من الإجابات المرشحة، ثم تعيد ترتيبها وتعيد الإجابة الأولى. يمكن أن يكون مُعاد الترتيب نموذجًا للمكافأة المستفادة (شائعًا في التعلم المعزز من ردود الفعل البشرية)، أو أداة تحقق تتحقق من الصحة، أو إرشادي بسيط مثل اتفاقية الإجابة عبر تصويت الأغلبية. نظرًا لأن النموذج يحتاج فقط إلى محاولة واحدة جيدة من بين العديد من المحاولات، غالبًا ما ترتفع الجودة بشكل حاد مع نمو N، خاصة في مهام الاستدلال والتعليمات البرمجية حيث يوجد مسار صحيح ولكنه لا يكون دائمًا العينة الأولى. التكلفة خطية في N، وتستقر المكاسب في نهاية المطاف أو حتى تنعكس إذا كان المسجل غير كامل، وهو وضع فشل يسمى اختراق المكافأة أو الإفراط في تحسين المكافأة.

البصيرة الفنية

جودة أفضل ما في N تتوقف بالكامل على المسجل. باستخدام أداة التحقق المثالية، تقترب الدقة من احتمال أن تكون عينة واحدة على الأقل من N صحيحة، والتي ترتفع بسرعة مع N. مع نموذج المكافأة الصاخب، يمكن خداع الاختيار: دفع N عاليًا جدًا يؤدي إلى تضخيم المخرجات التي تسجل درجات عالية ولكنها خاطئة بالفعل، نظرًا لأنك تقوم بالتحسين ضد النقاط العمياء للمسجل. وهذا هو السبب وراء أهمية نماذج المكافآت القوية والمعايرة لكي تستمر التقنية في تحقيق النتائج.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل أفضل أخذ العينات وإعادة التصنيف

أصبح Best-of-N لبنة أساسية في قياس وقت الاستدلال، جنبًا إلى جنب مع سلسلة الأفكار والبحث الشجري. توقع متغيرات أكثر ذكاءً: التصويت بالأغلبية المرجحة، ونماذج مكافأة العمليات التي تسجل كل خطوة تفكير، والتكيف N الذي يتوقف عن أخذ العينات بمجرد ارتفاع الثقة. مع تحسن أدوات التحقق، خاصة بالنسبة للتعليمات البرمجية والرياضيات حيث يمكن التحقق من الصحة، ستكون إعادة ترتيب العديد من العينات طريقة قياسية لتحويل الحوسبة الاحتياطية إلى موثوقية دون إعادة تدريب النموذج الأساسي.

التنفيذ في العالم الحقيقي

أخذ عينات من 64 حلاً لمسألة رياضية واختيار الإجابة التي تتفق عليها معظم العينات (الاتساق الذاتي / تصويت الأغلبية).

إنشاء العديد من عمليات إكمال التعليمات البرمجية والاحتفاظ بالكود الذي يجتاز معظم اختبارات الوحدات كمدقق تلقائي.

رسم عدة استجابات في مسار RLHF واختيار الرد الحاصل على أعلى نقاط لنموذج المكافأة لعرضه على المستخدمين.

إنتاج العديد من مسودات الملخصات وإعادة ترتيبها بنموذج الجودة لتقديم الملخص الأكثر إخلاصًا وإيجازًا.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Best-of-N Sampling and Reranking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

درجة الحرارة وأخذ العينات

الأسئلة المتداولة

What is Best-of-N Sampling and Reranking?

يقوم أخذ العينات الأفضل من N بإنشاء العديد من الإجابات المرشحة من النموذج ثم يختار أفضلها باستخدام خطوة تسجيل منفصلة. إنها واحدة من أبسط الطرق وأكثرها موثوقية لتداول الحوسبة الإضافية في وقت الاستدلال للحصول على جودة إجابة أعلى.

ما هي الفكرة الأساسية لأخذ العينات الأفضل من N؟

يقوم الخيار Best of-N بسحب استجابات متعددة للمرشحين ثم يعيد ترتيبها، مما يؤدي إلى إرجاع الإجابة ذات أعلى الدرجات.

ما هي أنواع المهام التي يميل أفضل ما في N إلى تقديم المساعدة فيها أكثر؟

عندما تكون هناك إجابة صحيحة يمكن التحقق منها ولا يجدها النموذج إلا في بعض الأحيان، فإن أخذ عينات أكثر من المرشحين يزيد من فرصة أن يكون أحدهم على صواب.

ما الذي يحدد إلى حد كبير ما إذا كان الأفضل من بين N يحسن النتائج بالفعل؟

الاختيار جيد فقط مثل مُعاد الترتيب؛ يمكن للهداف الضعيف أو المتحيز اختيار إجابات خاطئة.

ما هو وضع الفشل الذي يمكن أن يظهر عندما يتم دفع N إلى أعلى مستوى باستخدام نموذج مكافأة غير كامل؟

يؤدي التحسين الصارم ضد مسجل معيب إلى تضخيم المخرجات التي تستغل نقاطه العمياء، لذلك يمكن أن تصل الدقة إلى مستوى ثابت أو تنخفض.

ما هي استراتيجية إعادة الترتيب البسيطة التي تُعرف أيضًا باسم الاتساق الذاتي؟

يختبر الاتساق الذاتي العديد من سلاسل الاستدلال ويختار الإجابة النهائية التي تتفق عليها معظم السلاسل.