Термин от речника на AI

Какво е Модел на възнаграждение?

Определение

Модел, който оценява резултатите въз основа на сигнали за предпочитания, често използвани в RLHF тръбопроводи.

Свързани термини

Обучение за подсилване от човешка обратна връзка (RLHF)
Метод на обучение, който използва сигнали за човешки предпочитания, за да оформи поведението на модела.
Обучение с подсилване
Обучение чрез сигнали за възнаграждение, при което агент научава действия, които максимизират дългосрочната възвръщаемост.
Основна истина
Доверени референтни етикети, използвани за обучение или оценка на изходните данни на модела.
DPO (директна оптимизация на предпочитанията)
Метод на обучение, който прецизира моделите директно върху двойки предпочитания, без да е необходим отделен модел на възнаграждение.
По средата на тренировката
Междинна фаза на обучение между предварително и след обучение, често използвана за корекции на способности или домейн.
AI агент
Софтуерна система, която може да наблюдава, разсъждава и предприема действия за постигане на цел, често използвайки инструменти и памет.

Научете повече в нашите безплатни ръководства

See also