एआई शब्दावली शब्द

क्या है? मानव प्रतिक्रिया से सुदृढीकरण सीखना (आरएलएचएफ)?

परिभाषा

एक प्रशिक्षण पद्धति जो मॉडल व्यवहार को आकार देने के लिए मानव प्राथमिकता संकेतों का उपयोग करती है।

संबंधित शर्तें

सुदृढीकरण सीखना
इनाम संकेतों द्वारा प्रशिक्षण जहां एक एजेंट ऐसे कार्य सीखता है जो दीर्घकालिक रिटर्न को अधिकतम करते हैं।
इनाम मॉडल
एक मॉडल जो वरीयता संकेतों के आधार पर आउटपुट स्कोर करता है, अक्सर आरएलएचएफ पाइपलाइनों में उपयोग किया जाता है।
डीपीओ (प्रत्यक्ष वरीयता अनुकूलन)
एक प्रशिक्षण पद्धति जो अलग-अलग पुरस्कार मॉडल की आवश्यकता के बिना सीधे वरीयता जोड़े पर मॉडल को ठीक करती है।
सतत सीखना
प्रशिक्षण दृष्टिकोण जो एक मॉडल को पूर्व ज्ञान को भूले बिना नए डेटा से सीखते रहने देते हैं।
फ्यू-शॉट लर्निंग
केवल कुछ उदाहरणों से व्यवहार सीखना या अपनाना।
मॉडल बहाव
वास्तविक दुनिया की स्थितियाँ प्रशिक्षण मान्यताओं से भिन्न होने के कारण समय के साथ प्रदर्शन में गिरावट आती है।

हमारी निःशुल्क मार्गदर्शिकाओं में और जानें

यह भी देखें