एआई शब्दावली शब्द

क्या है? इनाम मॉडल?

परिभाषा

एक मॉडल जो वरीयता संकेतों के आधार पर आउटपुट स्कोर करता है, अक्सर आरएलएचएफ पाइपलाइनों में उपयोग किया जाता है।

संबंधित शर्तें

मानव प्रतिक्रिया से सुदृढीकरण सीखना (आरएलएचएफ)
एक प्रशिक्षण पद्धति जो मॉडल व्यवहार को आकार देने के लिए मानव प्राथमिकता संकेतों का उपयोग करती है।
सुदृढीकरण सीखना
इनाम संकेतों द्वारा प्रशिक्षण जहां एक एजेंट ऐसे कार्य सीखता है जो दीर्घकालिक रिटर्न को अधिकतम करते हैं।
ज़मीनी सच्चाई
मॉडल आउटपुट को प्रशिक्षित या मूल्यांकन करने के लिए विश्वसनीय संदर्भ लेबल का उपयोग किया जाता है।
डीपीओ (प्रत्यक्ष वरीयता अनुकूलन)
एक प्रशिक्षण पद्धति जो अलग-अलग पुरस्कार मॉडल की आवश्यकता के बिना सीधे वरीयता जोड़े पर मॉडल को ठीक करती है।
मध्य प्रशिक्षण
प्रीट्रेनिंग और पोस्ट-ट्रेनिंग के बीच एक मध्यवर्ती प्रशिक्षण चरण, जिसका उपयोग अक्सर क्षमता या डोमेन समायोजन के लिए किया जाता है।
एआई एजेंट
एक सॉफ़्टवेयर सिस्टम जो किसी लक्ष्य को प्राप्त करने के लिए अक्सर टूल और मेमोरी का उपयोग करके निरीक्षण कर सकता है, तर्क कर सकता है और कार्रवाई कर सकता है।

हमारी निःशुल्क मार्गदर्शिकाओं में और जानें

यह भी देखें