Позиционна интерполация за дълъг контекст
Позиционната интерполация (PI) е проста, въздействаща техника, която разширява контекстния прозорец на Transformer чрез притискане на нови индекси на позиция в диапазона, който моделът вече познава.
Преглед
Instead of extrapolating to unseen positions, it interpolates within trained ones, requiring only brief fine-tuning.
Дълбоко гмуркане
Въведена от изследователи на Meta (Chen et al.) през 2023 г., позиционната интерполация се справя с факта, че моделите с RoPE се провалят катастрофално при екстраполиране към позиции извън обучението. Прозрението е контраинтуитивно: вместо да поиска от модела да обработва по-големи стойности на позицията, които никога не е виждал, PI разделя входящите индекси на позицията на мащабен фактор, така че целевата дължина от, да речем, 8K се преобразува обратно в оригиналния диапазон от 2K. Тъй като моделът е обучен в този диапазон, ротациите остават в разпределението. След само 1000 стъпки за фина настройка, модел LLaMA, разширен по този начин, се справя до 32K контекст. Докладът показа, че екстраполацията може да взриви оценките за внимание до огромни стойности, докато интерполацията ги поддържа ограничени и стабилни, поради което интерполацията работи значително по-добре от екстраполацията.
Техническа информация
PI променя позицията m до m/s, където s е коефициентът на разширение (напр. нова дължина, разделена на оригиналната дължина). За RoPE това ефективно свива стъпката на въртене между съседни позиции, опаковайки повече позиции в тренирания ъглов диапазон. Теоретичната граница в статията показва, че интерполираните резултати за внимание остават добре контролирани, докато наивната екстраполация може да доведе до резултати с порядък по-голям от всичко, което се вижда в обучението, дестабилизирайки softmax.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на позиционната интерполация за дълъг контекст
Позиционната интерполация стана основата за вълна от последващи действия, включително мащабиране с NTK и YaRN, които интерполират по-селективно, за да запазят локалните детайли. Траекторията е към методи, които се нуждаят от малка или никаква фина настройка и към изпичане на обработката на дълъг контекст в предварително обучение. PI остава ценна базова линия и често се комбинира с по-нови схеми, съобразени с честотата, за ефективно достигане на контекстни прозорци от над 128K.
Внедряване в реалния свят
Разширяване на модел LLaMA с 2K контекст за обработка на 8K-32K токени с около 1000 стъпки за фина настройка
Адаптиране на съществуващ модел на чат за обобщаване на дълги документи без повторно обучение от нулата
Служи като концептуална базова линия, която подобряват мащабирането с NTK и YaRN
Активиране на код с дълъг контекст или анализ на правен документ на модели, първоначално обучени с къси прозорци
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Positional Interpolation for Long Context quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Интерполация на позиция за разширение на контекста
Frequently asked questions
What is Positional Interpolation for Long Context?
Позиционната интерполация (PI) е проста, въздействаща техника, която разширява контекстния прозорец на Transformer чрез притискане на нови индекси на позиция в диапазона, който моделът вече познава. Вместо да екстраполира към невидими позиции, той интерполира в обучени, като изисква само кратка фина настройка.
Каква е основната идея зад позиционната интерполация?
PI разделя индексите на позицията с коефициент на мащабиране, така че по-дългите последователности се картографират обратно в диапазона на обучена позиция, запазвайки ротациите в разпределението.
Защо наивната екстраполация към по-дълги позиции се проваля?
Документът на PI показа, че невиждано големи позиции могат да доведат до резултати за внимание с порядък по-големи от обучението, дестабилизирайки softmax.
Приблизително колко фина настройка изисква оригиналната работа на PI, за да се разшири LLaMA до 32K?
Вестникът съобщава, че около 1000 стъпки за фина настройка са достатъчни, за да разширят контекста до 32K токена.
Ако разширите контекста с фактор s, как PI трансформира позиция m?
PI премащабира позицията m до m/s, компресирайки новия по-голям диапазон в оригиналния обучен диапазон.
Как PI повлия на по-късните методи като YaRN?
PI установи интерполацията като безопасен подход; Мащабирането, съобразено с NTK, и YaRN го усъвършенстваха чрез по-селективно интерполиране на честотите.