Ga naar de inhoud
Leren
Nieuws
Tools
Vacatures
Missie
Zoeken
⌘K
English
Doneren
Menukaart
×
Begin hier
Begin met leren
Leren
Ga naar Leren
Cursussen
Gidsen
AI-tutor
Prompt library
Quizzen
Certificaat
Woordenlijst
Nieuws
Ga naar Nieuws
Laatste AI-nieuws
Onderwerptrackers
Research & datasets
Blog
Redactionele standaarden
Correcties
Tools
Ga naar Tools
Gereedschapsmap
Best-of-lijsten
Vergelijk hulpmiddelen
Cost calculator
Snelle raffinaderij
Tool indienen
Vacatures
Ga naar Vacatures
Blader door AI-taken
Plaats een vacature
SponsorAIU
Missie
Ga naar Missie
Missie
Impact en statistieken
Auteurs
Help centre
What's new
Support
Doneren
Thuis
/
Woordenlijst
/
Beloningsmodel
AI-verklarende term
Wat is
Beloningsmodel
?
Definitie
Een model dat output scoort op basis van voorkeurssignalen, vaak gebruikt in RLHF-pijplijnen.
Gerelateerde termen
Versterkend leren van menselijke feedback (RLHF)
Een trainingsmethode die menselijke voorkeurssignalen gebruikt om modelgedrag vorm te geven.
Versterkend leren
Training door beloningssignalen waarbij een agent acties leert die het rendement op de lange termijn maximaliseren.
Grondwaarheid
Betrouwbare referentielabels die worden gebruikt om modeluitvoer te trainen of evalueren.
DPO (Directe Preferentie Optimalisatie)
Een trainingsmethode die modellen rechtstreeks op voorkeursparen afstemt zonder dat een apart beloningsmodel nodig is.
Midden in de training
Een tussenliggende trainingsfase tussen de voortraining en de post-training, vaak gebruikt voor aanpassingen van vaardigheden of domeinen.
AI-agent
Een softwaresysteem dat kan observeren, redeneren en actie kan ondernemen om een doel te bereiken, vaak met behulp van tools en geheugen.
Lees meer in onze gratis handleidingen
AI Models Explained
Model Collapse
Model Lifecycle
Model Context Protocol
See also
Retrieval
Robustness
Safety Filter
Scaling Law
Red Teaming
Semantic Search
Recommendation System
Self-Supervised Learning
Previous
Retrieval
Next
Robustness
Blader door de volledige AI-woordenlijst
Ontdek alle gratis AI-gidsen