Глоссарий терминов искусственного интеллекта

Что такое Модель вознаграждения?

Определение

Модель, которая оценивает выходные данные на основе сигналов предпочтений, часто используется в конвейерах RLHF.

Связанные термины

Обучение с подкреплением на основе обратной связи с человеком (RLHF)
Метод обучения, который использует сигналы человеческих предпочтений для формирования поведения модели.
Обучение с подкреплением
Обучение с помощью сигналов вознаграждения, когда агент учится действиям, которые максимизируют долгосрочную отдачу.
Основная истина
Доверенные ссылочные метки, используемые для обучения или оценки результатов модели.
DPO (прямая оптимизация предпочтений)
Метод обучения, который настраивает модели непосредственно на парах предпочтений без необходимости использования отдельной модели вознаграждения.
Середина обучения
Промежуточный этап обучения между предварительным обучением и постобучением, часто используемый для корректировки возможностей или предметной области.
ИИ-агент
Программная система, которая может наблюдать, рассуждать и предпринимать действия для достижения цели, часто используя инструменты и память.

Узнайте больше в наших бесплатных руководствах.

См. также