Hoppa till innehållet
Lär dig
Nyheter
Verktyg
Jobb
Uppdrag
Sök
⌘K
English
Donera
Meny
×
Börja här
Börja lära dig
Lär dig
Gå till Lär dig
Kurser
Guider
AI-handledare
Prompt library
Quiz
Certifikat
Ordlista
Nyheter
Gå till Nyheter
Senaste AI-nyheter
Ämnesspårare
Research & datasets
Blog
Redaktionella standarder
Rättelser
Verktyg
Gå till Verktyg
Verktygskatalog
Bästa listor
Jämför verktyg
Cost calculator
Snabb raffinör
Skicka verktyg
Jobb
Gå till Jobb
Bläddra bland AI-jobb
Lägg upp ett jobb
Sponsor AIU
Uppdrag
Gå till Uppdrag
Uppdrag
Effekt & statistik
Författare
Help centre
What's new
Support
Donera
Hem
/
Ordlista
/
Förstärkningsinlärning
AI Ordlista Term
Vad är
Förstärkningsinlärning
?
Definition
Träning genom belöningssignaler där en agent lär sig handlingar som maximerar långsiktig avkastning.
Relaterade termer
Reinforcement Learning from Human Feedback (RLHF)
En träningsmetod som använder signaler om mänskliga preferenser för att forma modellbeteende.
Belöningsmodell
En modell som ger utdata baserat på preferenssignaler, som ofta används i RLHF-pipelines.
AI-agent
Ett mjukvarusystem som kan observera, resonera och vidta åtgärder för att uppnå ett mål, ofta med hjälp av verktyg och minne.
Konstitutionell AI
Ett tränings- och beteendeformande tillvägagångssätt där modellens resultat styrs av en fast uppsättning skrivna principer.
Agentslinga
En iterativ cykel där en AI-agent observerar, planerar, agerar och reflekterar tills den slutför ett mål eller träffar ett stoppvillkor.
DPO (Direct Preference Optimization)
En träningsmetod som finjusterar modeller direkt på preferenspar utan att behöva en separat belöningsmodell.
Läs mer i våra kostnadsfria guider
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
See also
Red Teaming
Recommendation System
Retrieval
Recall
RAG (Retrieval-Augmented Generation)
Robustness
Quantization
Safety Filter
Previous
Red Teaming
Next
Reinforcement Learning from Human Feedback (RLHF)
Bläddra i hela AI-ordlistan
Utforska alla gratis AI-guider