Přejít na obsah
Učit se
Novinky
Nástroje
Práce
Mise
Hledat
⌘K
English
Darovat
Menu
Začněte zde
Začněte se učit
Učit se
Přejít na Učit se
Kurzy
Návody
AI tutor
Prompt knihovna
Kvízy
Certifikát
Slovník
Novinky
Přejít na Novinky
Nejnovější zprávy o AI
Sledování témat
Výzkum a datové sady
Blog
Redakční standardy
Opravy
Nástroje
Přejít na Nástroje
Adresář nástrojů
Seznamy nejlepších
Porovnejte nástroje
Kalkulačka nákladů
Prompt Refiner
Přidat nástroj
Práce
Přejít na Práce
Procházet úlohy AI
Zveřejnit práci
Sponzor AIU
Mise
Přejít na Mise
Mise
Dopad a statistiky
Autoři
Centrum nápovědy
Co je nového
Podpora
Darovat
Domů
/
Slovník
/
Posílení učení z lidské zpětné vazby (RLHF)
Termín glosář AI
co je
Posílení učení z lidské zpětné vazby (RLHF)
?
Definice
Tréninková metoda, která využívá signály lidských preferencí k formování chování modelu.
Související pojmy
Posílení učení
Trénink pomocí signálů odměn, kdy se agent učí akce, které maximalizují dlouhodobou návratnost.
Model odměny
Model, který hodnotí výstupy na základě preferenčních signálů, často používaný v potrubích RLHF.
DPO (přímá optimalizace preferencí)
Tréninková metoda, která dolaďuje modely přímo na preferenčních párech bez nutnosti samostatného modelu odměn.
Průběžné učení
Tréninkové přístupy, které umožňují modelu neustále se učit z nových dat, aniž by zapomínal na předchozí znalosti.
Učení několika výstřelů
Naučit se nebo přizpůsobit chování pouze z malého počtu příkladů.
Model Drift
Snižování výkonu v průběhu času s tím, jak se podmínky v reálném světě liší od tréninkových předpokladů.
Více se dozvíte v našich bezplatných průvodcích
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
Viz také
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
Projděte si celý glosář AI
Prozkoumejte všechny bezplatné průvodce AI