Глоссарий терминов искусственного интеллекта

Что такое Обучение с подкреплением?

Определение

Обучение с помощью сигналов вознаграждения, когда агент учится действиям, которые максимизируют долгосрочную отдачу.

Связанные термины

Обучение с подкреплением на основе обратной связи с человеком (RLHF)
Метод обучения, который использует сигналы человеческих предпочтений для формирования поведения модели.
Модель вознаграждения
Модель, которая оценивает выходные данные на основе сигналов предпочтений, часто используется в конвейерах RLHF.
ИИ-агент
Программная система, которая может наблюдать, рассуждать и предпринимать действия для достижения цели, часто используя инструменты и память.
Конституционный ИИ
Подход к обучению и формированию поведения, при котором результаты модели определяются фиксированным набором письменных принципов.
Агентический цикл
Итеративный цикл, в котором агент ИИ наблюдает, планирует, действует и размышляет, пока не достигнет цели или не достигнет условия остановки.
DPO (прямая оптимизация предпочтений)
Метод обучения, который настраивает модели непосредственно на парах предпочтений без необходимости использования отдельной модели вознаграждения.

Узнайте больше в наших бесплатных руководствах.

См. также