Фина настройка на извадката за отхвърляне
Фината настройка на извадката за отхвърляне (RFT) генерира много кандидат-отговори, запазва само тези с най-добър резултат и преобучава модела върху тези победители.
Преглед
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Дълбоко гмуркане
Фината настройка на отхвърляне на семплиране, понякога наричана фина настройка най-доброто от N, е ключова съставка в начина, по който модели като Llama 2 и Llama 3 на Meta бяха подравнени. Рецептата е проста: за всяка подкана вземете няколко отговора (да речем 4 до 64) от текущия модел, оценете всеки с модел на награда или автоматична проверка, след което отхвърлете („отхвърлете“) всички изходи освен най-високо класираните. Оцелелите висококачествени проби се превръщат в нов набор от данни за фина настройка и моделът се обучава върху тях с обикновена загуба на следващ токен. Повтарянето на този цикъл итеративно тласка модела към самостоятелно генериране на по-добри отговори. Тъй като моделът се учи от собствените си филтрирани изходи, RFT избягва нестабилността и главоболията при настройката на RL с градиент на политики, като същевременно използва сигнал за награда.
Техническа информация
RFT използва факта, че вземането на проби много пъти и запазването на реакцията за максимална награда се доближава до избирането от изострено, по-висококачествено разпределение. Обучението на тези победители чрез стандартна кръстосана ентропия ефективно дестилира това най-добро от N поведение обратно в изходните данни на модела за единична извадка. За проверими домейни като математика или код, „наградата“ може просто да бъде дали окончателният отговор или тестът на модула преминават, премахвайки изцяло необходимостта от научен модел на възнаграждение.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на фината настройка на извадката за отказ
RFT е централна за модерното след обучение, често се използва преди или заедно с RL методи като PPO и DPO. Неговата привлекателност нараства с евтини изводи и силни автоматични верификатори: тъй като моделите стават по-добри при самогенериране и самопроверка, итеративното отхвърляне на проби поддържа синтетични данни и цикли за самоусъвършенстване. Очаквайте по-тясна интеграция с разсъждаващи модели, които произвеждат проверими вериги от мисли, и текущо проучване за това как да се избегне хакването на възнаграждението и сривът на разнообразието, когато се обучавате многократно върху собствените резултати на модела.
Внедряване в реалния свят
Подравняване на модели в стил Llama чрез вземане на проби от множество отговори на подкана, запазване на най-високите резултати на модела на награда, след това SFT върху тях
Подобряване на математически решаващ инструмент чрез генериране на много решения и запазване само на тези, които достигат до правилния отговор, който може да се провери
Генериране на код, при което кандидатите се съхраняват само ако преминат единични тестове, след което се използват като данни за обучение
Изграждане на набори от синтетични инструкции чрез филтриране на собствените най-добри самостоятелно генерирани отговори на модела за следващия кръг на обучение
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
QLoRA и 4-битова фина настройка
Frequently asked questions
What is Rejection Sampling Fine-Tuning?
Фината настройка на извадката за отхвърляне (RFT) генерира много кандидат-отговори, запазва само тези с най-добър резултат и преобучава модела върху тези победители. Има значение, защото предлага голяма част от предимствата на RLHF, като използва директно контролирано обучение вместо сложно обучение с подсилване.
Каква е основната идея на фината настройка на извадката за отказ?
RFT взема проби от множество отговори, филтрира тези с най-висок резултат и фино настройва модела за тези победители.
В проверими области като математика или код, какво може да послужи като награда?
За задачи, които могат да се проверяват, RFT може да използва точна коректност или тестове за преминаване на единица, като избягва научен модел на възнаграждение.
Кое фамилия модели е използвало извадка за отхвърляне по време на подравняването?
Meta описва използването на вземане на проби за отхвърляне като част от рецептата след обучение за моделите Llama 2 и Llama 3.
Защо екипите могат да предпочетат RFT пред RL с градиент на политики като PPO?
RFT се обучава отново със стандартна загуба на следващ токен върху филтрирани проби, заобикаляйки трудността при настройка и нестабилността на методите с градиент на политиката.
Какво прави ефективно обучението по примерите за максимално възнаграждение?
Като се учи от най-добре филтрираните отговори, моделът интернализира поведение с по-високо качество в едно поколение.