Технічний КЕРІВНИЦТВО

Навчання з підкріпленням на основі відгуків людини

RLHF — це техніка, яка перетворює сиру мовну модель на корисного, ввічливого помічника, навчаючи її на людських уподобаннях.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it aligns model behavior with what people actually want, not just what is statistically likely.

Глибоке занурення

Попередньо навчена мовна модель передбачає вірогідний текст, але правдоподібний – це не те саме, що корисний, чесний або безпечний. RLHF виправляє це поетапно. По-перше, контрольована точна настройка вчить модель слідувати інструкціям, використовуючи приклади відповідей, написаних людиною. Далі люди порівнюють пари модельних відповідей на ту саму підказку та вибирають кращу; ці порівняння тренують окрему модель винагороди, яка оцінює будь-яку відповідь. Нарешті, мовна модель оптимізована за допомогою навчання з підкріпленням для отримання відповідей, які модель винагороди високо оцінює. Покарання запобігає його відхиленню від оригінальної моделі, тому він залишається плавним і не використовує особливості моделі винагороди. RLHF відіграв ключову роль у створенні помічників у стилі ChatGPT.

Технічне розуміння

Модель винагороди зазвичай тренується на парах уподобань із втратою стилю Бредлі-Террі, навчаючись давати вищий скалярний бал відповіді, якій надає перевагу людина. Потім політика оновлюється за допомогою PPO (проксимальної оптимізації політики), яка максимізує винагороду, тоді як покарання за розбіжність KL проти еталонної моделі запобігає надмірній оптимізації та «злому винагороди». Оскільки PPO є складним, такі нові методи, як DPO (пряма оптимізація переваг), пропускають явну модель винагороди та цикл підкріплення, оптимізуючи політику безпосередньо з пар переваг.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє підкріплення, що навчається на відгуках людей

RLHF упорядковується та частково автоматизується. DPO та пов’язані з ним методи прямого пріоритету замінюють важкий конвеєр PPO для багатьох команд, а RLAIF використовує зворотній зв’язок, створений ШІ (як у Конституційному ШІ), щоб скоротити витрати на маркування. Дослідження вирішують питання хакерства винагороди, упередженості анотаторів і труднощів оцінки довгих чи експертних відповідей за допомогою таких методів, як нагляд за процесом і дебати. Очікуйте узгодження, яке поєднує відгуки людини та штучного інтелекту, більш багаті сигнали про винагороду, окрім одного підняття великого пальця вгору, і дедалі більшу увагу до того, хто надає переваги та які цінності вони кодують.

Реалізація в реальному світі

Налаштування помічника в чаті таким чином, щоб він відмовлявся від шкідливих запитів і давав корисні, добре структуровані відповіді, а не просто правдоподібний текст.

Ранжування пар резюме за перевагами людини, щоб навчити модель, яка пише резюме, які люди дійсно вважають корисними.

Зменшення токсичних або упереджених результатів шляхом винагороди за відповіді, які люди вважають шанобливими та безпечними.

Використання DPO на наборі даних бажаних і відхилених відповідей для узгодження моделі з відкритим кодом без запуску повного циклу PPO.

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reinforcement Learning From Human Feedback quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Навчання з підкріпленням

Часті запитання

What is Reinforcement Learning From Human Feedback?

RLHF — це техніка, яка перетворює сиру мовну модель на корисного, ввічливого помічника, навчаючи її на людських уподобаннях. Це важливо, тому що це узгоджує поведінку моделі з тим, чого люди насправді хочуть, а не лише зі статистично ймовірними.

Яке основне призначення RLHF для мовної моделі?

RLHF спрямовує модель на відповіді, які віддають перевагу людям, роблячи її більш корисною, чесною та безпечною, а не просто правдоподібною.

Що насправді вчиться робити модель винагороди в RLHF?

Модель винагороди навчається на основі порівняння людських уподобань для оцінки відповідей, надаючи сигнал, за яким політика оптимізується.

Чому на етапі RL використовується покарання за розбіжність KL щодо вихідної моделі?

Покарання KL зберігає оптимізовану політику наближеною до еталонної моделі, захищаючи від злому винагороди та втрати вільності.

Як зазвичай збираються дані про переваги для моделі винагороди?

Анотатори вибирають бажану відповідь у попарних порівняннях, що тренує модель винагороди за допомогою втрати у стилі Бредлі-Террі.

Які переваги пропонує DPO (пряма оптимізація переваг) перед класичним конвеєром RLHF?

DPO виводить ціль безпосередньо з уподобань, уникаючи окремої моделі винагороди та складного етапу навчання з підкріпленням.