Термін глосарію AI

Що є Модель винагороди?

Визначення

Модель, яка оцінює результати на основі сигналів переваги, часто використовується в конвеєрах RLHF.

Споріднені терміни

Навчання з підкріпленням на основі зворотного зв’язку людини (RLHF)
Метод навчання, який використовує сигнали переваг людини для формування модельної поведінки.
Навчання з підкріпленням
Навчання за сигналами винагороди, коли агент навчається діям, які максимізують довгострокову віддачу.
Основна правда
Довірені еталонні мітки, які використовуються для навчання або оцінки вихідних даних моделі.
DPO (пряма оптимізація переваг)
Метод навчання, який точно налаштовує моделі безпосередньо на пари переваг без необхідності окремої моделі винагороди.
Середина тренування
Проміжний етап навчання між попереднім навчанням і після навчанням, який часто використовується для коригування можливостей або домену.
ШІ агент
Програмна система, яка може спостерігати, міркувати та виконувати дії для досягнення мети, часто використовуючи інструменти та пам’ять.

Дізнайтеся більше в наших безкоштовних посібниках

See also