تحسين كانيمان-تفرسكي
إن تحسين Kahneman-Tversky (KTO) هو أسلوب محاذاة يتعلم من التسميات البسيطة التي تشير إلى الإعجاب أو الإعجاب إلى الأسفل بدلاً من المقارنات المقترنة.
نظرة عامة
It matters because binary feedback is far easier and cheaper to collect than the ranked pairs most methods demand.
الغوص العميق
KTO، التي قدمها إيثاياراج وزملاؤه في جامعة ستانفورد والذكاء الاصطناعي السياقي في عام 2024، تستعير من نظرية الاحتمال، العمل الحائز على جائزة نوبل لدانييل كانيمان وآموس تفيرسكي حول كيفية تقييم البشر للمكاسب والخسائر. تحتاج الطرق القياسية مثل DPO إلى أزواج تفضيلية: إجابة مختارة وإجابة مرفوضة لنفس الموجه. تعمل KTO بدلاً من ذلك مع البيانات غير المقترنة حيث يتم ببساطة تمييز كل مخرجات فردية بأنها مرغوبة أو غير مرغوب فيها. إنه يبني خسارة مدركة للإنسان والتي تتعامل مع تحسين النموذج على عينة على أنه مكسب أو خسارة بالنسبة إلى نقطة مرجعية، مع تطبيق تجنب الخسارة بحيث تتم معاقبة المخرجات غير المرغوب فيها بشكل أكثر حدة من مكافأة المخرجات المرغوبة. يتيح ذلك للفرق استخدام إشارات الإعجاب/الرفض الوفيرة التي تم جمعها بالفعل في تطبيقات الإنتاج.
البصيرة الفنية
تحدد KTO دالة القيمة المصممة على أساس نظرية الاحتمال، حيث تقيس مدى تواجد المكافأة الضمنية للاستجابة أعلى أو أسفل خط الأساس المرجعي (غالبًا ما يكون متوسط انحراف KL عن السياسة المرجعية). الأمثلة المرغوبة تدفع القيمة للأعلى، والأمثلة غير المرغوب فيها تدفعها للأسفل، ومعامل النفور من الخسارة يجعل الانحرافات السلبية أثقل. والأهم من ذلك أنه يحتاج فقط إلى تسمية لكل مثال، وليس أزواجًا متطابقة.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل تحسين كانيمان-تفرسكي
تعتبر KTO مناسبة تمامًا للمنتجات الحقيقية، حيث ينقر المستخدمون بشكل طبيعي على "أعجبني" أو "لم يعجبني" ولكن نادرًا ما يرتبون إجابتين جنبًا إلى جنب. توقع اعتمادًا أوسع لحلقات التحسين المستمر التي تعيد تدوير تعليقات الإنتاج، بالإضافة إلى البحث في ضبط نسبة البيانات المرغوبة إلى غير المرغوب فيها ووزن تجنب الخسارة. يعد الجمع بين إطار الاقتصاد السلوكي لـ KTO والأهداف الأخرى، وتطبيقه على ردود الفعل متعددة الوسائط، بمثابة اتجاهات نشطة حيث تسعى الفرق إلى التوافق مع إشارات العالم الحقيقي الفوضوية.
التنفيذ في العالم الحقيقي
استخدام نقرات الإبهام لأعلى/الإبهام للأسفل من برنامج الدردشة المنتشر لضبطه دون إنشاء أزواج تفضيلات على الإطلاق
محاذاة النموذج عندما يكون لديك كومة من الإجابات "الجيدة" و"السيئة" ولكن لا توجد مقارنات متطابقة لنفس المطالبات
يقوم فريق المنتج بإعادة تدوير إشارات الاعتدال (غير المرغوب فيها) والاستجابات المحفوظة (مرغوب فيه) في تدريب KTO
التعامل مع التعليقات غير المتوازنة حيث تكون عدم الإعجاب أكثر ندرة من الإعجابات من خلال ضبط النفور من الخسارة وأوزان الفئة في KTO
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Kahneman-Tversky Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تحسين التفضيل المباشر
الأسئلة المتداولة
What is Kahneman-Tversky Optimization?
إن تحسين Kahneman-Tversky (KTO) هو أسلوب محاذاة يتعلم من التسميات البسيطة التي تشير إلى الإعجاب أو الإعجاب إلى الأسفل بدلاً من المقارنات المقترنة. هذا مهم لأن جمع التعليقات الثنائية أسهل بكثير وأرخص من الأزواج المرتبة التي تتطلبها معظم الطرق.
ما نوع البيانات التي تتطلبها KTO؟
تتعلم KTO من التسميات البسيطة لكل مثال، بدلاً من أزواج التفضيلات المتطابقة.
KTO مستوحاة من أي مجموعة من الأعمال؟
تستعير KTO فكرة نظرية الاحتمالية لتقييم المكاسب والخسائر بشكل غير متماثل، ومن هنا جاء الاسم.
ما هو "النفور من الخسارة" كما هو مستخدم في KTO؟
تقول نظرية الاحتمال أن الخسائر تلوح في الأفق أكبر من المكاسب، لذا فإن KTO تزن الانحرافات السلبية بشكل أكبر.
بالمقارنة مع DPO، فإن KTO مفيد بشكل خاص عندما يكون لديك ماذا؟
يتألق KTO عندما تكون ردود الفعل عبارة عن إشارات ثنائية غير مقترنة، والتي تجمعها المنتجات بسهولة أكبر بكثير من الأزواج المرتبة.
في KTO، يتم قياس الانحرافات بالنسبة إلى ماذا؟
تحدد دالة القيمة في KTO ما إذا كانت الاستجابة أعلى أو أسفل خط الأساس المرجعي، وتعامل ذلك على أنه مكسب أو خسارة.