Мова AI GUIDE

Тонка настройка вибірки відхилення

Тонке налаштування вибірки відхилень (RFT) генерує багато відповідей-кандидатів, зберігає лише ті з найкращими результатами та перенавчає модель на цих переможцях.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

Глибоке занурення

Тонке налаштування вибірки відхилення, яке іноді називають найкращим із N, є ключовим компонентом узгодження таких моделей, як Llama 2 і Llama 3 Meta. Рецепт простий: для кожного запиту вибирайте декілька відповідей (скажімо, від 4 до 64) із поточної моделі, оцінюйте кожну за допомогою моделі винагороди або автоматичної перевірки, а потім відкидайте («відхиляйте») усі результати, окрім найвищих. Збережені зразки високої якості стають свіжим набором даних контрольованого тонкого налаштування, і модель навчається на них зі звичайною втратою наступного маркера. Повторення цього циклу ітеративно підштовхує модель до генерування кращих відповідей самостійно. Оскільки модель навчається на власних відфільтрованих виходах, RFT уникає нестабільності та головного болю налаштування, пов’язаного з RL з градієнтом політики, водночас використовуючи сигнал винагороди.

Технічне розуміння

RFT використовує той факт, що вибірка багато разів і збереження відповіді максимальної винагороди наближається до вибору із гострого розподілу вищої якості. Навчання на цих переможцях за допомогою стандартної перехресної ентропії ефективно дистилює цю найкращу з N поведінку назад у вихідні дані моделі для однієї вибірки. Для перевірених областей, таких як математика чи код, «винагородою» може бути просто те, чи пройдена остаточна відповідь або модульний тест, що повністю усуває потребу в вивченій моделі винагороди.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє тонкої настройки вибірки відхилень

RFT займає центральне місце в сучасному посттренінгу, часто використовується перед або поряд із такими методами RL, як PPO та DPO. Його привабливість зростає завдяки дешевому висновку та потужним автоматичним верифікаторам: у міру того, як моделі стають кращими в самогенеруванні та самоперевірці, ітерована вибірка відхилення підтримує синтетичні дані та цикли самовдосконалення. Очікуйте тіснішої інтеграції з моделями міркування, які створюють верифіковані ланцюжки думок, і постійного вивчення того, як уникнути злому винагороди та краху різноманітності під час постійного навчання на власних результатах моделі.

Реалізація в реальному світі

Вирівнювання моделей у стилі Llama шляхом вибірки кількох відповідей на підказку, збереження найвищих оцінок моделі винагороди, а потім SFT для них

Удосконалення математичного розв’язника шляхом генерування багатьох розв’язків і збереження лише тих, які дають правильну відповідь, яку можна перевірити

Генерація коду, де кандидати зберігаються, лише якщо вони пройшли модульні тести, а потім використовуються як навчальні дані

Створення синтетичних наборів даних інструкцій шляхом фільтрації власних найкращих самогенерованих відповідей моделі для наступного раунду навчання

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

QLoRA і 4-бітне тонке налаштування

Часті запитання

What is Rejection Sampling Fine-Tuning?

Тонке налаштування вибірки відхилень (RFT) генерує багато відповідей-кандидатів, зберігає лише ті з найкращими результатами та перенавчає модель на цих переможцях. Це важливо, оскільки він пропонує багато переваг RLHF, використовуючи просте навчання під наглядом замість складного навчання з підкріпленням.

Яка основна ідея тонкої настройки вибірки відхилень?

RFT відбирає кілька відповідей, відфільтровує ті, які набрали найбільше балів, і точно налаштовує модель для цих переможців.

У сферах, які можна перевірити, як-от математика чи код, що може стати винагородою?

Для завдань, які можна перевірити, RFT може використовувати точну правильність або проходження модульних тестів, уникаючи вивченої моделі винагороди.

Яке сімейство моделей використовувало вибірку відхилення під час вирівнювання?

Meta описав використання вибірки відхилення як частини рецепту після навчання для моделей Llama 2 і Llama 3.

Чому команди можуть віддати перевагу RFT, а не RL з градієнтом політики, як PPO?

RFT перенавчається зі стандартною втратою наступного маркера на відфільтрованих зразках, уникаючи труднощів налаштування та нестабільності методів градієнта політики.

Що ефективно робить навчання за зразками максимальної винагороди?

Навчаючись на найвідфільтрованих відповідях, модель засвоює поведінку вищої якості за одне покоління.