Термін глосарію AI

Що є Навчання з підкріпленням?

Визначення

Навчання за сигналами винагороди, коли агент навчається діям, які максимізують довгострокову віддачу.

Споріднені терміни

Навчання з підкріпленням на основі зворотного зв’язку людини (RLHF)
Метод навчання, який використовує сигнали переваг людини для формування модельної поведінки.
Модель винагороди
Модель, яка оцінює результати на основі сигналів переваги, часто використовується в конвеєрах RLHF.
ШІ агент
Програмна система, яка може спостерігати, міркувати та виконувати дії для досягнення мети, часто використовуючи інструменти та пам’ять.
Конституційний ШІ
Підхід до навчання та формування поведінки, коли результати моделі керуються фіксованим набором письмових принципів.
Агентська петля
Ітеративний цикл, у якому агент штучного інтелекту спостерігає, планує, діє та розмірковує, поки не досягне мети або не досягне умови зупинки.
DPO (пряма оптимізація переваг)
Метод навчання, який точно налаштовує моделі безпосередньо на пари переваг без необхідності окремої моделі винагороди.

Дізнайтеся більше в наших безкоштовних посібниках

See also