Термин от речника на AI

Какво е DPO (директна оптимизация на предпочитанията)?

Определение

Метод на обучение, който прецизира моделите директно върху двойки предпочитания, без да е необходим отделен модел на възнаграждение.

Свързани термини

Обучение за подсилване от човешка обратна връзка (RLHF)
Метод на обучение, който използва сигнали за човешки предпочитания, за да оформи поведението на модела.
След тренировка
Стъпки на обучение, приложени след предварително обучение, като настройка на инструкциите, оптимизиране на предпочитанията и настройка на безопасността.
Непрекъснато обучение
Подходи за обучение, които позволяват на модела да продължи да се учи от нови данни, без да забравя предишни знания.
Фина настройка
Продължаващо обучение върху специфични за домейн данни за адаптиране на предварително обучен модел към конкретна задача.
Градиентно спускане
Метод за оптимизация, който актуализира параметрите в посока, която намалява грешката.
Инструкция за настройка
Фина настройка на модел на двойки инструкция-отговор, за да се подобри изпълнението на задачата.

Научете повече в нашите безплатни ръководства

See also