YaRN и разширение на дължината на контекста
YaRN (Jet another RoPE extensioN) е ефективна техника за разтягане на използваем контекстен прозорец на модел далеч отвъд това, върху което е бил обучен.
Преглед
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
Дълбоко гмуркане
Повечето съвременни LLM кодират позиции на токени с RoPE (Rotary Position Embeddings), които завъртат заявката и ключовите вектори по ъгли, свързани с позицията. Когато захранвате последователности, по-дълги от дължината на обучението, тези ротации влизат в невидими диапазони и моделът се разпада. YaRN, въведен през 2023 г. от Bowen Peng и сътрудници, коригира това с интерполация, съобразена с NTK, приложена за честота: оставя високочестотните измерения (които улавят локални, къси разстояния) предимно недокоснати, докато интерполира нискочестотни измерения (които проследяват позицията на дълги разстояния). YaRN също така добавя настройка на температурата към вниманието, за да противодейства на промените в ентропията, които идват от по-дълги контексти. Резултатът е силна производителност в дълъг контекст след фина настройка само на малка част от данните и стъпките, които наивните подходи изискват.
Техническа информация
RoPE присвоява на всяко измерение за вграждане честота на въртене. Наивната линейна интерполация компресира всички честоти еднакво, вредейки на високочестотните измерения, които кодират фини локални детайли. YaRN използва функция за нарастване, за да интерполира само нискочестотните (дълги вълнови) измерения, като същевременно запазва високочестотните, плюс 1/sqrt(t) мащабиране на температурата на вниманието, което поддържа меката максимална острота стабилна с нарастване на дължината на последователността. Този подход NTK по части разширява контекста с много по-малко влошаване.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на YaRN и разширяването на дължината на контекста
Разширението на контекста вече е стандартна практика: отворените модели рутинно доставят разширени с YaRN варианти, достигащи 128K токена или повече. Изследванията се насочват към методи, които разширяват контекста с нулева или почти нулева фина настройка, комбинират премащабиране на RoPE с трикове за модел на внимание и поддържат качество в целия прозорец, а не само в краищата. Очаквайте по-тясно интегриране на тези техники в предварителната подготовка, така че дългият контекст да е естествен, а не преоборудван.
Внедряване в реалния свят
Разширяване на отворен 4K-контекст модел до 32K или 128K за отговор на въпроси с дълъг документ с кратка фина настройка
Разрешаване на системи с разширени извличане да приемат много свързани пасажи без съкращаване
Захранване на асистенти за код, които се нуждаят от цял голям файл от хранилище или множество файлове в една подкана
Адаптиране на базов модел за дълги многооборотни разговори, които натрупват големи истории на чатове
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN and Context Length Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Интерполация на позиция за разширение на контекста
Frequently asked questions
What is YaRN and Context Length Extension?
YaRN (Jet another RoPE extensioN) е ефективна техника за разтягане на използваем контекстен прозорец на модел далеч отвъд това, върху което е бил обучен. Той умело премащабира вграждането на въртяща се позиция, така че модел, обучен на, да речем, 4K токени, може да се справи с 32K или повече с минимална фина настройка.
Какъв метод за кодиране на позиция променя YaRN, за да разшири контекста?
YaRN, чието име означава Yet another RoPE extensioN, премащабира вградените ротационни позиции, използвани в повечето съвременни LLM.
Какво се обърка, когато модел RoPE вижда последователности, по-дълги от продължителността на обучението му?
Позициите извън обучението създават ъгли на въртене, които моделът никога не е виждал, така че поведението на внимание рязко се влошава.
Как YaRN третира различните честотни измерения на RoPE?
YaRN използва NTK по части рампа, която интерполира нискочестотни димове с дълга дължина на вълната и оставя почти непокътнати високочестотни димове с къс обхват.
Освен премащабиране на честотите, каква допълнителна корекция прилага YaRN?
YaRN добавя температурно мащабиране към логиците на вниманието, за да противодейства на промените в ентропията, които възникват с нарастването на контекста.
Какво е ключово практическо предимство на YaRN пред простата интерполация?
YaRN постига силно качество на дълъг контекст след фина настройка на малка част от данните, които наивните методи изискват.