РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Точная настройка выборки отклонения

Точная настройка выборки отклонений (RFT) генерирует множество ответов-кандидатов, сохраняет только те, которые получили самые высокие оценки, и переобучает модель на этих победителях.

2 минуты чтенияПоследнее обновление

Обзор

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

Глубокое погружение

Точная настройка выборки отбраковки, которую иногда называют точной настройкой по принципу «лучшее из N», является ключевым компонентом согласования таких моделей, как Llama 2 и Llama 3 из Meta. Рецепт прост: для каждого запроса выберите несколько ответов (скажем, от 4 до 64) из текущей модели, оцените каждый с помощью модели вознаграждения или автоматической проверки, затем отбросьте («отклоните») все результаты, кроме результатов с самым высоким рейтингом. Сохранившиеся высококачественные образцы становятся новым контролируемым набором данных для точной настройки, и модель обучается на них с обычной потерей следующего токена. Повторение этого цикла итеративно подталкивает модель к самостоятельной генерации лучших ответов. Поскольку модель учится на собственных отфильтрованных выходных данных, RFT позволяет избежать нестабильности и проблем с настройкой градиентного RL, сохраняя при этом сигнал вознаграждения.

Техническая информация

RFT использует тот факт, что многократная выборка и сохранение ответа с максимальным вознаграждением эквивалентны выбору из четкого и более качественного распределения. Обучение этих победителей с помощью стандартной перекрестной энтропии эффективно превращает поведение «лучшего из N» обратно в выходные данные модели с одной выборкой. Для проверяемых областей, таких как математика или код, «наградой» может быть просто пройден ли окончательный ответ или модульный тест, что полностью устраняет необходимость в изученной модели вознаграждения.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее тонкой настройки выборки отклонений

RFT занимает центральное место в современном пост-обучении, часто используется до или вместе с такими методами RL, как PPO и DPO. Его привлекательность растет благодаря дешевым выводам и сильным автоматическим верификаторам: по мере того, как модели совершенствуются в самогенерировании и самопроверке, повторяющаяся выборка отклонения поддерживает циклы синтетических данных и самосовершенствования. Ожидайте более тесной интеграции с моделями рассуждений, которые создают проверяемые цепочки мыслей, а также постоянного изучения того, как избежать взлома вознаграждений и краха разнообразия при многократном обучении на собственных результатах модели.

Реальная реализация

Согласование моделей в стиле «Ламы» путем выборки нескольких ответов на подсказку, сохранение наивысших оценок модели вознаграждения, а затем SFT для этих ответов.

Улучшение математического решателя путем создания множества решений и сохранения только тех, которые дают правильный, проверяемый ответ.

Генерация кода, при которой кандидаты сохраняются только в том случае, если они прошли модульные тесты, а затем используются в качестве обучающих данных.

Создание синтетических наборов данных инструкций путем фильтрации лучших собственных ответов модели для следующего раунда обучения.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

QLoRA и 4-битная точная настройка

Часто задаваемые вопросы

What is Rejection Sampling Fine-Tuning?

Точная настройка выборки отклонений (RFT) генерирует множество ответов-кандидатов, сохраняет только те, которые получили самые высокие оценки, и переобучает модель на этих победителях. Это важно, потому что он предлагает большую часть преимуществ RLHF, используя простое обучение с учителем вместо сложного обучения с подкреплением.

В чем заключается основная идея точной настройки отбраковочной выборки?

RFT выбирает несколько ответов, фильтрует ответы с наибольшим количеством баллов и настраивает модель на основе этих победителей.

Что может служить наградой в поддающихся проверке областях, таких как математика или программирование?

Для проверяемых задач RFT может использовать точную правильность или прохождение модульных тестов, избегая изученной модели вознаграждения.

В каком семействе моделей во время выравнивания использовалась бракованная выборка?

Meta описал использование выборки отклонения как часть рецепта после обучения для моделей Llama 2 и Llama 3.

Почему команды могут предпочесть RFT градиентному RL, такому как PPO?

RFT переобучается со стандартной потерей следующего токена на отфильтрованных выборках, обходя трудности настройки и нестабильность методов политического градиента.

Что эффективно дает обучение на образцах с максимальным вознаграждением?

Обучаясь на основе наиболее отфильтрованных ответов, модель интернализует более качественное поведение в одном поколении.