Bağlam Uzantısı için Konum Enterpolasyonu
Konum Enterpolasyonu (PI), konum endekslerini tahmin etmek yerine yeniden ölçeklendirerek bir dil modelinin kullanılabilir bağlam penceresini eğitim uzunluğunun çok ötesine genişleten bir tekniktir.
Genel Bakış
It lets a model trained on, say, 2K or 4K tokens handle 32K or more with only light fine-tuning.
Derin Dalış
Çoğu modern LLM, konumu sorgu ve anahtar vektörlere uygulanan dönüş açıları olarak kodlayan döner konumsal yerleştirmeleri (RoPE) kullanır. Yalnızca daha uzun dizileri beslerseniz, model üzerinde hiç eğitim almadığı konumları ve dönüş açılarını görür ve dikkatin aralık dışı frekanslara zayıf bir şekilde tahmin etmesi nedeniyle performans çöker. Konum Enterpolasyonu ekstrapolasyonu önler: L uzunluğundan L' uzunluğuna uzatmak için, her konum indeksini L'/L faktörüne böler ve yeni aralığı tekrar eğitilen aralığa sıkıştırır. Model artık yalnızca daha yoğun aralıklı dağıtım açılarını görüyor. Kısa bir ince ayar (genellikle birkaç yüz ila bin adım), daha ince aralıklara uyum sağlamasına olanak tanır ve ön eğitim maliyetinin çok küçük bir kısmıyla istikrarlı uzun bağlam davranışı sağlar.
Teknik Bilgi
RoPE, inceden kabaya uzanan frekanslarda boyut çiftlerini döndürür. PI, m konumunu s = L'/L olacak şekilde m/s'ye yeniden ölçeklendirir, böylece dönüş açıları ekstrapolasyon yapmak yerine eğitilen aralıkta kalır. NTK duyarlı ölçeklendirme ve YaRN gibi frekansa duyarlı değişkenler daha da ileri gidiyor: düşük frekansları daha az ve yüksek frekansları daha fazla ölçeklendiriyorlar (veya dalga boyuna göre enterpolasyon yapıyorlar), düşük frekanslı uzun menzilli erişimi genişletirken yüksek frekanslı yerel ayrıntıları koruyorlar.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Bağlam Uzantısı için Konum İnterpolasyonunun Geleceği
Bağlam uzantısı hızla ilerliyor. NTK uyumlu RoPE ölçeklendirme, YaRN ve dinamik/uzun RoPE gibi yöntemler artık bazen çok az ince ayar yaparak veya hiç ince ayar yapmadan yüzbinlerce, hatta milyonlarca tokene pencere açıyor. Bu ölçeklendirme hilelerinin verimli dikkat ve KV önbellek sıkıştırmasıyla birleştirilmesini ve model yapılandırmalarında standart düğmeler haline gelmesini bekleyin. Uzun bağlamların sadece nominal olarak desteklenmekle kalmayıp gerçekten kullanılabilir olmasını sağlamak için tüm pencere boyunca doğruluğu yüksek tutmaya yönelik araştırmalar devam ediyor.
Gerçek Dünya Uygulaması
Kısa ince ayarların ardından uzun belgeleri özetlemek için 4K eğitimli bir LLaMA modelini 32K bağlamına genişletme.
Dosyalar arası soru yanıtlaması için kod tabanının tamamını veya büyük bir yasal sözleşmeyi tek bir komut istemine yükleme.
Minimum düzeyde veya hiç ek eğitim olmadan bağlamı genişletmek için NTK uyumlu veya YaRN ölçeklendirmeyi kullanma.
Çıkarım zamanında RoPE pozisyonlarını yeniden ölçeklendirerek uzun sohbet geçmişlerini kesilmeden sunmak.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Position Interpolation for Context Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
YaRN ve Bağlam Uzunluğu Uzantısı
Sık sorulan sorular
What is Position Interpolation for Context Extension?
Konum Enterpolasyonu (PI), konum endekslerini tahmin etmek yerine yeniden ölçeklendirerek bir dil modelinin kullanılabilir bağlam penceresini eğitim uzunluğunun çok ötesine genişleten bir tekniktir. Örneğin 2K veya 4K jetonlarla eğitilmiş bir modelin yalnızca hafif ince ayar ile 32K veya daha fazlasını işlemesine olanak tanır.
Konum İnterpolasyonunun temel fikri nedir?
PI, konum endekslerini uzatma faktörüne göre bölerek daha uzun diziyi, modelin önceden öğrendiği dağıtım aralığına geri eşleştirir.
Konum İnterpolasyonu en çok hangi konumsal kodlama şemasıyla ilişkilidir?
PI, RoPE tabanlı modeller için popüler hale getirildi ve dönüş açıları, eğitilmiş frekanslar dahilinde kalacak şekilde yeniden ölçeklendirildi.
Daha uzun bağlamlara yönelik saf tahminler neden başarısız oluyor?
Daha uzun dizilerin beslenmesi, modeli daha önce hiç eğitim almadığı aralık dışı açılara maruz bırakır, bu da dikkatin ve performansın keskin bir şekilde düşmesine neden olur.
Bağlam uzunluğu L'den L'ye genişletilirse, temel PI m konumuna hangi yeniden ölçeklendirme faktörünü uygular?
PI, m'yi m'ye bölerek s = L'/L faktörüne eşler ve daha uzun aralığı orijinal eğitimli aralığa sıkıştırır.
NTK uyumlu ölçeklendirme ve YaRN, düz Konum Enterpolasyonunda nasıl iyileşir?
Bu yöntemler düşük ve yüksek frekansları farklı şekilde ölçeklendirerek, daha uzun bağlamlara ulaşırken ince taneli yerel konum ayrıntılarını korur.