भाषा एआई गाइड

कन्नमैन-टवरस्की अनुकूलन

कन्नमैन-टावर्सकी ऑप्टिमाइज़ेशन (केटीओ) एक संरेखण विधि है जो युग्मित तुलनाओं के बजाय सरल थम्स-अप या थम्स-डाउन लेबल से सीखती है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because binary feedback is far easier and cheaper to collect than the ranked pairs most methods demand.

गहरा गोता

2024 में स्टैनफोर्ड और कॉन्टेक्स्टुअल एआई में एथयाराज़ और उनके सहयोगियों द्वारा पेश किया गया केटीओ, संभावना सिद्धांत से उधार लिया गया है, डैनियल काह्नमैन और अमोस टावर्सकी के नोबेल विजेता काम कि मनुष्य कैसे लाभ और हानि को महत्व देते हैं। डीपीओ जैसे मानक तरीकों को वरीयता जोड़े की आवश्यकता होती है: एक ही संकेत के लिए एक चुना हुआ और एक अस्वीकृत उत्तर। इसके बजाय केटीओ अयुग्मित डेटा के साथ काम करता है जहां प्रत्येक व्यक्तिगत आउटपुट को केवल वांछनीय या अवांछनीय के रूप में चिह्नित किया जाता है। यह एक मानव-जागरूक हानि का निर्माण करता है जो एक नमूने पर मॉडल के सुधार को संदर्भ बिंदु के सापेक्ष लाभ या हानि के रूप में मानता है, हानि से बचने के लिए लागू करता है ताकि अवांछित आउटपुट को वांछनीय लोगों को पुरस्कृत करने की तुलना में अधिक तेजी से दंडित किया जाए। यह टीमों को उत्पादन ऐप्स में पहले से ही एकत्र किए गए प्रचुर थम्स-अप/डाउन सिग्नल का उपयोग करने देता है।

तकनीकी अंतर्दृष्टि

केटीओ संभावना सिद्धांत पर आधारित एक मूल्य फ़ंक्शन को परिभाषित करता है, यह मापता है कि किसी प्रतिक्रिया का निहित इनाम संदर्भ आधार रेखा से कितनी दूर या नीचे बैठता है (अक्सर संदर्भ नीति से औसत केएल-विचलन)। वांछनीय उदाहरण मूल्य को ऊपर की ओर धकेलते हैं, अवांछनीय उदाहरण इसे नीचे की ओर धकेलते हैं, और हानि-विपरीत गुणांक नकारात्मक विचलन को भारी बनाता है। महत्वपूर्ण बात यह है कि इसे प्रति उदाहरण केवल एक लेबल की आवश्यकता है, सुमेलित जोड़ियों की नहीं।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

कन्नमन-टवरस्की अनुकूलन का भविष्य

केटीओ वास्तविक उत्पादों के लिए उपयुक्त है, जहां उपयोगकर्ता स्वाभाविक रूप से पसंद या नापसंद पर क्लिक करते हैं लेकिन शायद ही कभी दो उत्तरों को एक साथ रैंक करते हैं। निरंतर सुधार लूप के लिए व्यापक रूप से अपनाने की अपेक्षा करें जो उत्पादन प्रतिक्रिया को रीसायकल करता है, साथ ही वांछनीय-से-अवांछनीय डेटा अनुपात और हानि-विपरीत वजन को समायोजित करने के लिए अनुसंधान करता है। केटीओ के व्यवहार-अर्थशास्त्र को अन्य उद्देश्यों के साथ जोड़ना, और इसे मल्टीमॉडल फीडबैक पर लागू करना, सक्रिय दिशा-निर्देश हैं क्योंकि टीमें गड़बड़ वास्तविक दुनिया के संकेतों से संरेखण की तलाश करती हैं।

वास्तविक विश्व कार्यान्वयन

प्राथमिकता जोड़े बनाए बिना इसे ठीक करने के लिए तैनात चैटबॉट से थम्स-अप/थम्स-डाउन क्लिक का उपयोग करना

एक मॉडल को संरेखित करना जब आपके पास 'अच्छे' और 'बुरे' उत्तरों का ढेर हो लेकिन समान संकेतों के लिए कोई मिलान वाली तुलना न हो

एक उत्पाद टीम केटीओ प्रशिक्षण में मॉडरेशन फ़्लैग (अवांछनीय) और सहेजी गई प्रतिक्रियाओं (वांछनीय) का पुनर्चक्रण कर रही है

केटीओ की हानि-विपरीतता और वर्ग भार को समायोजित करके असंतुलित प्रतिक्रिया को संभालना जहां पसंद की तुलना में नापसंद दुर्लभ हैं

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Kahneman-Tversky Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

प्रत्यक्ष वरीयता अनुकूलन

अक्सर पूछे जाने वाले प्रश्नों

What is Kahneman-Tversky Optimization?

कन्नमैन-टावर्सकी ऑप्टिमाइज़ेशन (केटीओ) एक संरेखण विधि है जो युग्मित तुलनाओं के बजाय सरल थम्स-अप या थम्स-डाउन लेबल से सीखती है। यह मायने रखता है क्योंकि अधिकांश तरीकों की मांग वाले रैंक वाले जोड़े की तुलना में बाइनरी फीडबैक एकत्र करना कहीं अधिक आसान और सस्ता है।

KTO को किस प्रकार के डेटा की आवश्यकता है?

केटीओ मिलान किए गए प्राथमिकता जोड़े के बजाय सरल प्रति-उदाहरण अंगूठे-ऊपर/नीचे लेबल से सीखता है।

KTO किस निकाय के कार्य से प्रेरित है?

केटीओ ने लाभ और हानि का असमान रूप से मूल्यांकन करने के संभावना सिद्धांत के विचार को उधार लिया है, इसलिए इसे यह नाम दिया गया है।

केटीओ में प्रयुक्त 'नुकसान से बचाव' क्या है?

संभावना सिद्धांत कहता है कि लाभ की तुलना में हानि अधिक है, इसलिए केटीओ नकारात्मक विचलन को अधिक महत्व देता है।

डीपीओ की तुलना में, केटीओ विशेष रूप से तब उपयोगी होता है जब आपके पास क्या हो?

केटीओ तब चमकता है जब फीडबैक अयुग्मित बाइनरी सिग्नल होता है, जो उत्पाद रैंक किए गए जोड़े की तुलना में कहीं अधिक आसानी से एकत्र करते हैं।

KTO में विचलन किसके सापेक्ष मापा जाता है?

केटीओ का मूल्य फ़ंक्शन यह निर्धारित करता है कि प्रतिक्रिया संदर्भ आधार रेखा के ऊपर या नीचे बैठती है या नहीं, इसे लाभ या हानि के रूप में माना जाता है।