Gå til innhold
Lær
Nyheter
Verktøy
Jobber
Oppdrag
Søk
⌘K
English
Doner
Meny
×
Start her
Begynn å lære
Lær
Gå til Lær
Kurs
Guider
AI-veileder
Prompt library
Quiz
Sertifikat
Ordliste
Nyheter
Gå til Nyheter
Siste AI-nyheter
Emnesporere
Research & datasets
Blog
Redaksjonelle standarder
Rettelser
Verktøy
Gå til Verktøy
Verktøykatalog
Best-of-lister
Sammenlign verktøy
Cost calculator
Spør Refiner
Send verktøy
Jobber
Gå til Jobber
Bla gjennom AI-jobber
Legg ut en jobb
Sponsor AIU
Oppdrag
Gå til Oppdrag
Oppdrag
Effekt og statistikk
Forfattere
Help centre
What's new
Støtte
Doner
Hjem
/
Ordliste
/
Forsterkende læring
AI Ordliste Term
Hva er
Forsterkende læring
?
Definisjon
Trening med belønningssignaler der en agent lærer handlinger som maksimerer langsiktig avkastning.
Relaterte vilkår
Forsterkende læring fra menneskelig tilbakemelding (RLHF)
En treningsmetode som bruker menneskelige preferansesignaler for å forme modellatferd.
Belønningsmodell
En modell som skårer utganger basert på preferansesignaler, ofte brukt i RLHF-rørledninger.
AI-agent
Et programvaresystem som kan observere, resonnere og iverksette tiltak for å oppnå et mål, ofte ved hjelp av verktøy og minne.
Konstitusjonell AI
En trenings- og atferdsformende tilnærming der modellutdata styres av et fast sett med skriftlige prinsipper.
Agentsløyfe
En iterativ syklus der en AI-agent observerer, planlegger, handler og reflekterer til den fullfører et mål eller treffer en stopptilstand.
DPO (direkte preferanseoptimalisering)
En treningsmetode som finjusterer modeller direkte på preferansepar uten å trenge en egen belønningsmodell.
Lær mer i våre gratis guider
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
Se også
Red Teaming
Recommendation System
Retrieval
Recall
RAG (Retrieval-Augmented Generation)
Robustness
Quantization
Safety Filter
Previous
Red Teaming
Next
Reinforcement Learning from Human Feedback (RLHF)
Bla gjennom hele AI-ordlisten
Utforsk alle gratis AI-guider