Език AI РЪКОВОДСТВО

Интерполация на позиция за разширение на контекста

Интерполацията на позицията (PI) е техника, която разтяга прозореца на използваем контекст на езиков модел далеч отвъд продължителността на обучението му чрез премащабиране на позиционните индекси, вместо да ги екстраполира.

2 min readПоследна актуализация

Преглед

It lets a model trained on, say, 2K or 4K tokens handle 32K or more with only light fine-tuning.

Дълбоко гмуркане

Повечето съвременни LLM използват въртящи се позиционни вграждания (RoPE), които кодират позицията като ъгли на въртене, приложени към заявка и ключови вектори. Ако просто захранвате по-дълги последователности, моделът вижда позиции и ъгли на въртене, на които никога не е тренирал, и производителността се срива, защото вниманието екстраполира лошо към честоти извън обхвата. Интерполацията на позиция избягва екстраполацията: за разширяване от дължина L до дължина L', тя разделя всеки индекс на позиция на коефициента L'/L, притискайки новия диапазон обратно в обучения интервал. Сега моделът винаги вижда само ъгли на разпределение, просто разположени по-плътно. Кратка фина настройка (често няколкостотин до хиляди стъпки) му позволява да се адаптира към по-финото разстояние, което води до стабилно поведение в дълъг контекст при малка част от разходите за предварително обучение.

Техническа информация

RoPE върти двойки размери на честоти, които обхващат фини до груби. PI премащабира позицията m до m/s, където s = L'/L, така че ъглите на въртене остават в обучения диапазон, вместо да се екстраполират. Варианти, съобразени с честотата, като мащабиране с NTK и YaRN, отиват по-далеч: те мащабират по-малко ниските честоти и повече високите честоти (или интерполират по дължина на вълната), като запазват високочестотните локални детайли, като същевременно разширяват нискочестотния обхват на дълги разстояния.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на интерполацията на позиция за разширяване на контекста

Разширението на контекста се движи бързо. Методи като NTK-aware RoPE мащабиране, YaRN и dynamic/long-RoPE сега избутват прозорци до стотици хиляди или дори милиони токени, понякога с малко или никаква фина настройка. Очаквайте тези трикове за мащабиране да бъдат комбинирани с ефективно внимание и KV-кеш компресия и да станат стандартни копчета в конфигурациите на модела. Продължават изследванията за поддържане на висока точност в целия прозорец, така че дългите контексти да са наистина използваеми, а не само номинално поддържани.

Внедряване в реалния свят

Разширяване на 4K-обучен LLaMA модел до 32K контекст за обобщаване на дълги документи след кратка фина настройка.

Зареждане на цяла кодова база или голям правен договор в една подкана за отговор на въпрос между файлове.

Използване на NTK-aware или YaRN мащабиране за удължаване на контекста с минимално или никакво допълнително обучение.

Сервиране на дълги истории на чатове без съкращаване чрез повторно мащабиране на позициите на RoPE по време на извод.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Position Interpolation for Context Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

YaRN и разширение на дължината на контекста

Frequently asked questions

What is Position Interpolation for Context Extension?

Интерполацията на позицията (PI) е техника, която разтяга прозореца на използваем контекст на езиков модел далеч отвъд продължителността на обучението му чрез премащабиране на позиционните индекси, вместо да ги екстраполира. Той позволява на модел, обучен на, да речем, 2K или 4K токени, да обработва 32K или повече само с лека фина настройка.

Каква е основната идея на интерполацията на позиция?

PI разделя индексите на позицията на коефициента на разширение, картографирайки по-дългата последователност обратно в диапазона на разпространение, който моделът вече е научил.

С коя схема за позиционно кодиране се свързва най-много интерполацията на позиция?

PI беше популяризиран за модели, базирани на RoPE, премащабирайки ъглите на въртене, така че да останат в обучените честоти.

Защо наивната екстраполация към по-дълги контексти обикновено се проваля?

Захранването на по-дълги последователности излага модела на ъгли извън обхвата, на които никога не е тренирал, причинявайки рязко влошаване на вниманието и производителността.

Ако се разшири дължината на контекста от L до L', какъв коефициент на премащабиране прилага основният PI към позиция m?

PI преобразува m в m, разделено на коефициента s = L'/L, компресирайки по-дългия диапазон в първоначално обучения интервал.

Как NTK-aware мащабирането и YaRN подобряват обикновената интерполация на позиция?

Тези методи мащабират по различен начин ниските и високите честоти, като запазват фини локални позиционни детайли, като същевременно достигат по-дълги контексти.