Глоссарий терминов искусственного интеллекта

Что такое Обучение с подкреплением на основе обратной связи с человеком (RLHF)?

Определение

Метод обучения, который использует сигналы человеческих предпочтений для формирования поведения модели.

Связанные термины

Обучение с подкреплением
Обучение с помощью сигналов вознаграждения, когда агент учится действиям, которые максимизируют долгосрочную отдачу.
Модель вознаграждения
Модель, которая оценивает выходные данные на основе сигналов предпочтений, часто используется в конвейерах RLHF.
DPO (прямая оптимизация предпочтений)
Метод обучения, который настраивает модели непосредственно на парах предпочтений без необходимости использования отдельной модели вознаграждения.
Постоянное обучение
Подходы к обучению, которые позволяют модели продолжать обучение на новых данных, не забывая при этом предыдущие знания.
Обучение в несколько этапов
Обучение или адаптация поведения лишь на небольшом количестве примеров.
Модель Дрифта
Снижение производительности со временем, поскольку реальные условия отличаются от предположений обучения.

Узнайте больше в наших бесплатных руководствах.

См. также