РЪКОВОДСТВО по основи

Нормализация на дължината в оптимизацията на предпочитанията

Нормализирането на дължината коригира целите за настройка на предпочитанията, така че моделите да спрат да печелят одобрение само чрез писане на по-дълги отговори.

2 min readПоследна актуализация

Преглед

It matters because uncorrected reward signals push chatbots toward verbose, padded responses instead of genuinely better ones.

Дълбоко гмуркане

Когато моделите са приведени в съответствие с методи като RLHF или DPO, те се учат от сравнения, при които хората (или модел на възнаграждение) избират „по-добрия“ от два отговора. Постоянна грешка е, че по-дългите отговори обикновено се предпочитат дори когато всъщност не са по-добри, така че моделът научава прекия път: бъдете многословни. Нормализирането на дължината противодейства на това. В DPO имплицитната награда е сбор от разликите в логаритмичните вероятности за токен, които механично нарастват с дължината. Варианти като DPO с нормализирана дължина и SimPO разделят тази награда на броя токени, като вместо това оценяват средно за токен. Резултатът е модели, които остават кратки и точни, вместо да увеличават отговорите, за да играят целта.

Техническа информация

Имплицитната награда на DPO е логаритмичното съотношение между настроените и референтните политики, сумирано за всеки токен в отговора. Тъй като всеки токен добавя друг (обикновено положителен) член, необработената награда се мащабира с дължината на последователността, насочвайки оптимизацията към по-дълги завършвания. SimPO премахва референтния модел и използва средната лог-вероятност за токен като награда плюс целеви марж на награда. Разделянето по дължина премахва предимството на механичната дължина, така че градиентите на предпочитанията отразяват качеството, а не броя на думите.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на нормализирането на дължината в оптимизацията на предпочитанията

Очаквайте контролът на дължината да се превърне в стандартно копче, а не в закъснение. Изследователите комбинират нормализиране на дължината с изрични наказания за дължина, обусловени от дължината награди и пакети за оценка, които поддържат дължината на отговора постоянна, за да измерват истинските печалби на качеството. Тъй като моделите за възнаграждение стават по-добри в откриването на пристрастия към многословието, тръбопроводите за подравняване вероятно ще отчитат по подразбиране проценти на победи с отклонение от дължината и потребителите ще получат по-фин контрол върху това колко кратки или подробни трябва да бъдат отговорите на модела.

Внедряване в реалния свят

Настройване на асистент за поддръжка на клиенти със SimPO, така че да дава ясни и точни отговори вместо подплатени параграфи, които просто изглеждат задълбочени.

Отчитане на „процент на победи с контролирана дължина“ на AlpacaEval 2, за да покаже модел, който наистина е подобрен, а не просто е станал по-бъбрив.

Добавяне на нормализиране на дължината към DPO при фина настройка на модел на кодиране, така че да връща минимални правилни фрагменти, а не раздута шаблонна плоча.

Диагностициране на модел на възнаграждение, който систематично оценява по-високи резултати за по-дълги есета, след което го деактивира, преди да го използва, за да подреди асистент за писане.

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде нормализирането на дължината в оптимизацията на предпочитанията помага и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Оптимизиране на предпочитанията за съотношение на шансовете

Frequently asked questions

What is Length Normalization in Preference Optimization?

Нормализирането на дължината коригира целите за настройка на предпочитанията, така че моделите да спрат да печелят одобрение само чрез писане на по-дълги отговори. Има значение, защото некоригираните сигнали за възнаграждение тласкат чатботовете към многословни, подплатени отговори вместо към наистина по-добри.

Какво нежелано поведение основно цели да предотврати нормализирането на дължината в DPO?

Неявното възнаграждение на DPO нараства с броя на жетоните, така че без нормализиране моделите научават, че простото по-подробно изказване води до печелене на сравнения на предпочитанията.

Защо имплицитното възнаграждение на стандартния DPO има тенденция да се увеличава с дължината на отговора?

Неявното възнаграждение сумира коефициентите на логаритмична вероятност за всеки токен, така че повече токени обикновено означава по-голяма обща награда.

Как SimPO се справя с отклонението на дължината?

SimPO оценява отговорите по тяхната средна (нормализирана спрямо дължината) логаритмична вероятност и добавя целеви марж на възнаграждение, премахвайки предимството на механичната дължина.

Коя практика за оценяване помага да се потвърди модел, подобрен по отношение на качеството, а не само по дължина?

Степента на победа с контролирана дължина (както при AlpacaEval 2) се коригира за дължината на отговора, така че печалбите отразяват качеството, а не многословието.