دليل الأساسيات

تطبيع الطول في تحسين التفضيلات

تعمل تسوية الطول على ضبط أهداف ضبط التفضيلات بحيث تتوقف النماذج عن الحصول على الموافقة بمجرد كتابة إجابات أطول.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because uncorrected reward signals push chatbots toward verbose, padded responses instead of genuinely better ones.

الغوص العميق

عندما تتماشى النماذج مع أساليب مثل RLHF أو DPO، فإنها تتعلم من المقارنات التي يختار فيها البشر (أو نموذج المكافأة) "الأفضل" من إجابتين. الخطأ المستمر هو أن الإجابات الأطول تميل إلى أن تكون مفضلة حتى عندما لا تكون أفضل في الواقع، لذلك يتعلم النموذج الاختصار: كن كثير الكلام. تطبيع الطول يتعارض مع هذا. في DPO، تكون المكافأة الضمنية عبارة عن مجموع فروق احتمالية السجل لكل رمز، والتي تنمو تلقائيًا مع الطول. تقوم المتغيرات مثل DPO وSimPO المقيسة للطول بتقسيم تلك المكافأة على عدد الرموز المميزة، ويتم التسجيل على متوسط ​​لكل رمز مميز بدلاً من ذلك. والنتيجة هي نماذج تظل موجزة ومباشرة بدلاً من تضخيم الاستجابات لتحقيق الهدف.

البصيرة الفنية

المكافأة الضمنية لـ DPO هي نسبة السجل بين السياسات المضبوطة والمرجعية، ويتم جمعها على كل رمز مميز في الاستجابة. نظرًا لأن كل رمز مميز يضيف مصطلحًا آخر (إيجابيًا عادةً)، فإن المكافأة الأولية تتدرج مع طول التسلسل، مما يؤدي إلى انحياز التحسين نحو عمليات إكمال أطول. يقوم SimPO بإسقاط النموذج المرجعي ويستخدم متوسط ​​احتمالية السجل لكل رمز كمكافأة، بالإضافة إلى هامش المكافأة المستهدف. يؤدي القسمة على الطول إلى إزالة ميزة الطول الميكانيكي، لذا فإن تدرجات التفضيل تعكس الجودة بدلاً من عدد الكلمات.

التأثير الاستراتيجي

قرارات أوضح

يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.

التكلفة والميزانية

يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.

الفريق وسير العمل

تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.

مستقبل تطبيع الطول في تحسين التفضيلات

توقع أن يصبح التحكم في الطول مقبضًا قياسيًا وليس فكرة لاحقة. يجمع الباحثون بين تطبيع الطول وعقوبات الطول الصريحة، والمكافآت المشروطة بالطول، ومجموعات التقييم التي تحافظ على ثبات طول الإجابة لقياس مكاسب الجودة الحقيقية. مع تحسن نماذج المكافأة في اكتشاف انحياز الإسهاب، من المحتمل أن تبلغ خطوط أنابيب المحاذاة عن معدلات فوز متحيزة للطول افتراضيًا، وسيكتسب المستخدمون تحكمًا أفضل في مدى دقة إجابات النموذج أو تفصيلها.

التنفيذ في العالم الحقيقي

ضبط مساعد دعم العملاء باستخدام SimPO بحيث يقدم ردودًا واضحة ودقيقة بدلاً من الفقرات المبطنة التي تبدو شاملة فقط.

الإبلاغ عن "معدل الفوز الذي يتم التحكم فيه بالطول" على AlpacaEval 2 لإظهار نموذج محسّن حقًا بدلاً من أن يصبح أكثر ثرثرة.

إضافة تطبيع الطول إلى DPO عند ضبط نموذج الترميز بحيث يُرجع الحد الأدنى من المقتطفات الصحيحة، وليس النموذج النمطي المتضخم.

تشخيص نموذج المكافأة الذي يسجل درجات أعلى للمقالات الأطول بشكل منهجي، ثم تقليل انحيازه قبل استخدامه لمواءمة مساعد الكتابة.

المخاطر والدرابزين

قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.

يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.

غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.

خارطة طريق التنفيذ

1

ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.

2

اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.

3

قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.

4

قم بالتوثيق حيث تساعد تسوية الطول في تحسين التفضيلات وحيث تكون الطرق الأبسط أفضل.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تحسين تفضيلات نسبة الأرجحية

الأسئلة المتداولة

What is Length Normalization in Preference Optimization?

تعمل تسوية الطول على ضبط أهداف ضبط التفضيلات بحيث تتوقف النماذج عن الحصول على الموافقة بمجرد كتابة إجابات أطول. وهذا مهم لأن إشارات المكافأة غير المصححة تدفع روبوتات الدردشة نحو استجابات مطولة ومبطنة بدلاً من استجابات أفضل حقًا.

ما هو السلوك غير المرغوب فيه الذي يهدف تطبيع الطول في DPO في المقام الأول إلى منعه؟

تنمو المكافأة الضمنية لـ DPO مع عدد الرموز المميزة، لذلك بدون التطبيع تتعلم النماذج أن مجرد كونك أكثر إسهابًا يميل إلى الفوز بمقارنات التفضيلات.

لماذا تميل المكافأة الضمنية القياسية لـ DPO إلى الزيادة مع طول الاستجابة؟

تقوم المكافأة الضمنية بجمع نسب احتمالية السجل عبر كل رمز مميز، وبالتالي فإن المزيد من الرموز المميزة يعني عمومًا مكافأة إجمالية أكبر.

كيف يعالج SimPO انحياز الطول؟

يسجل SimPO الإجابات من خلال متوسط ​​احتمالية السجل (الطول الطبيعي) ويضيف هامش مكافأة مستهدف، مما يزيل ميزة الطول الميكانيكي.

ما هي ممارسة التقييم التي تساعد في تأكيد تحسين النموذج من حيث الجودة بدلاً من مجرد الطول؟

يتم ضبط معدل الفوز الذي يتم التحكم فيه بالطول (كما هو الحال في AlpacaEval 2) لطول الإجابة بحيث تعكس المكاسب الجودة وليس الإسهاب.