Gå til innhold
Lær
Nyheter
Verktøy
Jobber
Oppdrag
Søk
⌘K
English
Doner
Meny
×
Start her
Begynn å lære
Lær
Gå til Lær
Kurs
Guider
AI-veileder
Prompt library
Quiz
Sertifikat
Ordliste
Nyheter
Gå til Nyheter
Siste AI-nyheter
Emnesporere
Research & datasets
Blog
Redaksjonelle standarder
Rettelser
Verktøy
Gå til Verktøy
Verktøykatalog
Best-of-lister
Sammenlign verktøy
Cost calculator
Spør Refiner
Send verktøy
Jobber
Gå til Jobber
Bla gjennom AI-jobber
Legg ut en jobb
Sponsor AIU
Oppdrag
Gå til Oppdrag
Oppdrag
Effekt og statistikk
Forfattere
Help centre
What's new
Støtte
Doner
Hjem
/
Ordliste
/
Belønningsmodell
AI Ordliste Term
Hva er
Belønningsmodell
?
Definisjon
En modell som skårer utganger basert på preferansesignaler, ofte brukt i RLHF-rørledninger.
Relaterte vilkår
Forsterkende læring fra menneskelig tilbakemelding (RLHF)
En treningsmetode som bruker menneskelige preferansesignaler for å forme modellatferd.
Forsterkende læring
Trening med belønningssignaler der en agent lærer handlinger som maksimerer langsiktig avkastning.
Grunnsannhet
Pålitelige referanseetiketter som brukes til å trene eller evaluere modellutdata.
DPO (direkte preferanseoptimalisering)
En treningsmetode som finjusterer modeller direkte på preferansepar uten å trenge en egen belønningsmodell.
Midt i trening
En mellomopplæringsfase mellom førtrening og ettertrening, ofte brukt til kapasitets- eller domenejusteringer.
AI-agent
Et programvaresystem som kan observere, resonnere og iverksette tiltak for å oppnå et mål, ofte ved hjelp av verktøy og minne.
Lær mer i våre gratis guider
AI Models Explained
Model Collapse
Model Lifecycle
Model Context Protocol
Se også
Retrieval
Robustness
Safety Filter
Scaling Law
Red Teaming
Semantic Search
Recommendation System
Self-Supervised Learning
Previous
Retrieval
Next
Robustness
Bla gjennom hele AI-ordlisten
Utforsk alle gratis AI-guider