एआई शब्दावली शब्द

क्या है? डीपीओ (प्रत्यक्ष वरीयता अनुकूलन)?

परिभाषा

एक प्रशिक्षण पद्धति जो अलग-अलग पुरस्कार मॉडल की आवश्यकता के बिना सीधे वरीयता जोड़े पर मॉडल को ठीक करती है।

संबंधित शर्तें

मानव प्रतिक्रिया से सुदृढीकरण सीखना (आरएलएचएफ)
एक प्रशिक्षण पद्धति जो मॉडल व्यवहार को आकार देने के लिए मानव प्राथमिकता संकेतों का उपयोग करती है।
प्रशिक्षण के बाद
प्रशिक्षण चरण पूर्व-प्रशिक्षण के बाद लागू किए जाते हैं, जैसे अनुदेश ट्यूनिंग, वरीयता अनुकूलन और सुरक्षा ट्यूनिंग।
सतत सीखना
प्रशिक्षण दृष्टिकोण जो एक मॉडल को पूर्व ज्ञान को भूले बिना नए डेटा से सीखते रहने देते हैं।
फ़ाइन ट्यूनिंग
किसी पूर्व-प्रशिक्षित मॉडल को किसी विशिष्ट कार्य के लिए अनुकूलित करने के लिए डोमेन-विशिष्ट डेटा पर निरंतर प्रशिक्षण।
क्रमिक अवतरण
एक अनुकूलन विधि जो मापदंडों को उस दिशा में अद्यतन करती है जिससे त्रुटि कम हो जाती है।
अनुदेश ट्यूनिंग
निम्नलिखित कार्य को बेहतर बनाने के लिए निर्देश-प्रतिक्रिया युग्मों पर एक मॉडल को ठीक करना।

हमारी निःशुल्क मार्गदर्शिकाओं में और जानें

यह भी देखें