Език AI РЪКОВОДСТВО

Мащабиране на прозореца на контекста на YaRN

YaRN (Jet another RoPE extensioN) е техника, която разширява прозореца на използваемия контекст на трансформатора далеч отвъд това, върху което е бил обучен, с минимална фина настройка.

2 min readПоследна актуализация

Преглед

It matters because it lets existing models handle much longer documents without retraining from scratch.

Дълбоко гмуркане

Повечето съвременни LLMs кодират позициите на думите с помощта на Rotary Position Embeddings (RoPE), които работят добре само до дължината, която моделът е видял по време на обучение. Подавайте в по-дълга последователност и моделът се разгражда зле. YaRN разрешава това, като премащабира честотите на въртене на RoPE по начин, съобразен с честотата: високочестотните измерения (които улавят локални, близки връзки) остават почти незасегнати, докато нискочестотните измерения (които улавят позицията на далечни разстояния) се интерполират. Той също така добавя регулиране на температурата към вниманието, за да поддържа логиката добре работеща на големи разстояния. Резултатът, демонстриран на модели на LLaMA, разширява контекста от 4K до 64K-128K токени, като използва само около 0,1% от първоначалните данни за обучение и няколкостотин стъпки за фина настройка.

Техническа информация

RoPE завърта заявката и ключовите вектори на ъгъл, пропорционален на позицията и честотата на измерение. Наивната линейна интерполация (позиционна интерполация) притиска всички честоти еднакво, вреди на локалните детайли. Вместо това YaRN прилага „NTK-by-parts“: той интерполира само нискочестотните (дълги вълнови) измерения, оставя високочестотните сами и прави рампи между тях. Мащабирането на температурата на вниманието компенсира изместването на ентропията, запазвайки точността при големи дължини.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на мащабирането на контекстни прозорци на YaRN

Разширението с честота в стил YaRN се превърна в съставка по подразбиране за доставка на модели с дълъг контекст; варианти и наследници продължават да се появяват, докато лабораториите се стремят към прозорци с милиони токени. Очаквайте по-тясна интеграция с ефективно внимание, KV-кеш компресия и динамично мащабиране, което се настройва в движение за всяка заявка. По-широката тенденция отделя „колко време е бил обучен един модел“ от „колко дълго може да чете полезно“, което прави дългия контекст евтина функция след обучение, а не скъп архитектурен ангажимент.

Внедряване в реалния свят

Разширяване на отворен модел LLaMA от 4K до 128K токени, така че да може да приеме цяла кодова база или дълъг договор с едно преминаване

Позволяване на чатбот да запази много дълги истории на разговори, без да отрязва по-ранни ходове

Обобщаване на документи с дължина на книга или многочасови преписи, които надхвърлят родния прозорец на базовия модел

Евтино адаптиране на предварително обучен модел за задачи за извличане на дълъг контекст, като се използва само малък цикъл на фина настройка

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Контекстни прозорци

Frequently asked questions

What is YaRN Context Window Scaling?

YaRN (Jet another RoPE extensioN) е техника, която разширява прозореца на използваемия контекст на трансформатора далеч отвъд това, върху което е бил обучен, с минимална фина настройка. Има значение, защото позволява на съществуващите модели да обработват много по-дълги документи без преквалификация от нулата.

Каква схема за кодиране на позиция променя YaRN, за да удължи дължината на контекста?

YaRN означава „Още едно разширение на въже“ и работи чрез премащабиране на честотите на въртене, използвани във вграждането на ротационни позиции.

Как YaRN третира високочестотните спрямо нискочестотните размери на RoPE?

Подходът „NTK-by-parts“ на YaRN запазва високочестотните (локални) измерения, като същевременно интерполира нискочестотни (далечни разстояния), за да избегне увреждане на локалните детайли.

Какво е ключовото предимство на ефективността на YaRN пред обучението на модел с дълъг контекст от нулата?

YaRN може да разшири контекста, като използва приблизително 0,1% от първоначалните данни за обучение и малък брой стъпки за фина настройка, много по-евтино от повторното обучение.

Освен пренастройване на честотите, каква допълнителна корекция прилага YaRN, за да поддържа вниманието на далечни разстояния стабилно?

YaRN променя температурата на вниманието, за да компенсира изместването на ентропия/логит, което възниква, когато последователностите станат много по-дълги.

Какъв проблем възниква, ако подадете последователности на модел на RoPE, много по-дълги, отколкото е бил обучен, без никакво мащабиране?

RoPE обобщава лошо към невидими дълги позиции, така че качеството се срива, освен ако честотите не се мащабират отново.