Перейти до вмісту
Навчання
Новини
Інструм.
Вакансії
Місія
Пошук
⌘K
English
Донат
Меню
Почніть тут
Почніть навчання
Навчання
Перейти до Навчання
Курси
Посібники
ШІ-репетитор
Бібліотека підказок
Тести
Сертифікат
Глосарій
Новини
Перейти до Новини
Останні новини ШІ
Трекери тем
Дослідження та набори даних
Блог
Редакційні стандарти
Виправлення
Інструм.
Перейти до Інструм.
Каталог інструментів
Списки найкращих
Порівняйте інструменти
Калькулятор вартості
Prompt Refiner
Додати інстр.
Вакансії
Перейти до Вакансії
Перегляньте вакансії AI
Опублікувати вакансію
Спонсор AIU
Місія
Перейти до Місія
Місія
Вплив і статистика
Автори
Довідковий центр
Що нового
Підтримка
Донат
додому
/
Глосарій
/
Модель винагороди
Термін глосарію AI
Що є
Модель винагороди
?
Визначення
Модель, яка оцінює результати на основі сигналів переваги, часто використовується в конвеєрах RLHF.
Споріднені терміни
Навчання з підкріпленням на основі зворотного зв’язку людини (RLHF)
Метод навчання, який використовує сигнали переваг людини для формування модельної поведінки.
Навчання з підкріпленням
Навчання за сигналами винагороди, коли агент навчається діям, які максимізують довгострокову віддачу.
Основна правда
Довірені еталонні мітки, які використовуються для навчання або оцінки вихідних даних моделі.
DPO (пряма оптимізація переваг)
Метод навчання, який точно налаштовує моделі безпосередньо на пари переваг без необхідності окремої моделі винагороди.
Середина тренування
Проміжний етап навчання між попереднім навчанням і після навчанням, який часто використовується для коригування можливостей або домену.
ШІ агент
Програмна система, яка може спостерігати, міркувати та виконувати дії для досягнення мети, часто використовуючи інструменти та пам’ять.
Дізнайтеся більше в наших безкоштовних посібниках
AI Models Explained
Model Collapse
Model Lifecycle
Model Context Protocol
See also
Retrieval
Robustness
Safety Filter
Scaling Law
Red Teaming
Semantic Search
Recommendation System
Self-Supervised Learning
Previous
Retrieval
Next
Robustness
Перегляньте повний Глосарій ШІ
Перегляньте всі безкоштовні посібники зі штучного інтелекту