Döner Pozisyon Gömmeleri
Döner Konum Yerleştirmeleri (RoPE), sorgusunu ve anahtar vektörlerini konumla orantılı bir açıyla döndürerek her bir tokenin sırayla nerede bulunduğunu kodlar.
Genel Bakış
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
Derin Dalış
Transformatörlerin yerleşik bir düzen duygusu yoktur, bu nedenle bir şekilde konum bilgilerinin eklenmesi gerekir. İlk modeller, girişlere sabit sinüzoidal vektörler veya öğrenilmiş konum yerleştirmeleri ekledi. Su ve meslektaşları tarafından 2021'de önerilen RoPE, farklı bir yaklaşım benimsiyor: bir konum vektörü eklemek yerine, sorgudaki ve anahtar vektörlerdeki boyut çiftlerini, tokenın konumuyla birlikte büyüyen bir açıyla döndürür. Model, m konumundaki bir sorgu ile n konumundaki bir anahtar arasındaki nokta çarpımı hesapladığında, matematik, sonuç yalnızca bunların göreceli m eksi n uzaklığına bağlı olacak şekilde çalışır. Bu, gerçek göreceli konum farkındalığı sağlar, etkili dikkat çekirdekleriyle güzel bir şekilde oynar ve mesafeyle birlikte dikkati sorunsuz bir şekilde azaltır. RoPE artık Llama, Mistral, Qwen ve çoğu modern açık modelde kullanılmaktadır.
Teknik Bilgi
RoPE, yerleştirme boyutlarını çiftler halinde ele alır ve her bir çifte, farklı hızlarda çalışan birçok saatin ibreleri gibi farklı frekanslarda dönen farklı çiftlerle 2 boyutlu bir dönüş uygular. M konumuna göre döndürmek ve ardından n konumuna göre döndürülen bir şeyle nokta çarpımı almak yalnızca açı farkını bıraktığından, dikkat puanları göreceli konumun fonksiyonları haline gelir. Yüksek frekans çiftleri hassas yerel düzeni yakalar; düşük frekans çiftleri uzun menzilli konumu yakalar. En önemlisi, değerleri değil sorguları ve anahtarları değiştirir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Döner Pozisyon Gömmelerinin Geleceği
Son zamanlardaki çalışmaların çoğu, RoPE'yi bir modelin eğitildiğinden çok daha uzun bağlamlara genişletmeye odaklanıyor. Konum enterpolasyonu, NTK bilinçli ölçeklendirme ve YaRN gibi teknikler, örneğin 4K tokenlar üzerinde eğitilmiş bir modelin hafif ince ayar ile 32K veya daha fazlasını işleyebilmesi için dönüş frekanslarını ayarlar. RoPE'nin, temel frekansında devam eden iyileştirmeler ve milyon jetonlu bağlamlar için ölçeklendirmeyle ve dikkat davranışıyla nasıl etkileşime girdiğine ilişkin devam eden çalışmalarla baskın konumsal şema olarak kalmasını bekliyoruz.
Gerçek Dünya Uygulaması
Lama, Mistral ve Qwen modellerine ayrı konum yerleştirmeleri olmadan jeton düzeni anlayışının verilmesi
Bir modelin kullanılabilir bağlamını enterpolasyon veya YaRN yoluyla birkaç binden onbinlerce jetona genişletme
Kod modellerinin uzun dosyalardaki parantez, işlevler ve referanslar arasındaki göreli mesafeleri izlemesine yardımcı olma
Soru ve kanıt arasındaki göreceli konumun önemli olduğu durumlarda uzun belgeli soru yanıtını desteklemek
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
ALiBi Pozisyon Önyargısı
Sık sorulan sorular
What is Rotary Position Embeddings?
Döner Konum Yerleştirmeleri (RoPE), sorgusunu ve anahtar vektörlerini konumla orantılı bir açıyla döndürerek her bir tokenin sırayla nerede bulunduğunu kodlar. Bu zarif numara, transformatörlerin göreceli mesafeleri anlamalarını ve daha uzun bağlamlara zarif bir şekilde uzanmalarını sağlar.
RoPE konum bilgisini transformatöre nasıl enjekte eder?
RoPE, ayrı bir konum vektörü eklemek yerine sorgu ve anahtar vektörlerini konumla orantılı bir açıyla döndürür.
RoPE dikkat hesaplamasının hangi kısımlarını değiştirir?
RoPE, dönüşlerini sorgu ve anahtar vektörlere uygulayarak değer vektörlerine dokunmadan bırakır.
RoPE'de neden farklı boyut çiftleri farklı frekanslarda dönüyor?
Saat ibrelerinin farklı hızlarda tik takları gibi, çeşitli frekanslar da bazı çiftlerin kısa menzilli sırayı, diğerlerinin ise uzun menzilli konumu kodlamasına olanak tanır.
Konum enterpolasyonu, NTK bilinçli ölçeklendirme ve YaRN gibi tekniklerin amacı nedir?
Bu yöntemler, bir modelin orijinal eğitim uzunluğundan çok daha uzun bağlamları işleyebilmesi için RoPE'nin dönüş frekanslarını yeniden ölçeklendirir.