एआई शब्दावली शब्द

क्या है? सुदृढीकरण सीखना?

परिभाषा

इनाम संकेतों द्वारा प्रशिक्षण जहां एक एजेंट ऐसे कार्य सीखता है जो दीर्घकालिक रिटर्न को अधिकतम करते हैं।

संबंधित शर्तें

मानव प्रतिक्रिया से सुदृढीकरण सीखना (आरएलएचएफ)
एक प्रशिक्षण पद्धति जो मॉडल व्यवहार को आकार देने के लिए मानव प्राथमिकता संकेतों का उपयोग करती है।
इनाम मॉडल
एक मॉडल जो वरीयता संकेतों के आधार पर आउटपुट स्कोर करता है, अक्सर आरएलएचएफ पाइपलाइनों में उपयोग किया जाता है।
एआई एजेंट
एक सॉफ़्टवेयर सिस्टम जो किसी लक्ष्य को प्राप्त करने के लिए अक्सर टूल और मेमोरी का उपयोग करके निरीक्षण कर सकता है, तर्क कर सकता है और कार्रवाई कर सकता है।
संवैधानिक ए.आई
एक प्रशिक्षण और व्यवहार-आकार देने वाला दृष्टिकोण जहां मॉडल आउटपुट लिखित सिद्धांतों के एक निश्चित सेट द्वारा निर्देशित होते हैं।
एजेंटिक लूप
एक पुनरावृत्त चक्र जहां एक एआई एजेंट तब तक निरीक्षण करता है, योजना बनाता है, कार्य करता है और प्रतिबिंबित करता है जब तक कि वह एक लक्ष्य पूरा नहीं कर लेता या रुकने की स्थिति में नहीं पहुंच जाता।
डीपीओ (प्रत्यक्ष वरीयता अनुकूलन)
एक प्रशिक्षण पद्धति जो अलग-अलग पुरस्कार मॉडल की आवश्यकता के बिना सीधे वरीयता जोड़े पर मॉडल को ठीक करती है।

हमारी निःशुल्क मार्गदर्शिकाओं में और जानें

यह भी देखें