Dil AI KILAVUZU

Döner Pozisyon Gömmeleri

Döner Konum Yerleştirmeleri (RoPE), sorgusunu ve anahtar vektörlerini konumla orantılı bir açıyla döndürerek her bir tokenin sırayla nerede bulunduğunu kodlar.

2 min readSon güncelleme

Genel Bakış

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Derin Dalış

Transformatörlerin yerleşik bir düzen duygusu yoktur, bu nedenle bir şekilde konum bilgilerinin eklenmesi gerekir. İlk modeller, girişlere sabit sinüzoidal vektörler veya öğrenilmiş konum yerleştirmeleri ekledi. Su ve meslektaşları tarafından 2021'de önerilen RoPE, farklı bir yaklaşım benimsiyor: bir konum vektörü eklemek yerine, sorgudaki ve anahtar vektörlerdeki boyut çiftlerini, tokenın konumuyla birlikte büyüyen bir açıyla döndürür. Model, m konumundaki bir sorgu ile n konumundaki bir anahtar arasındaki nokta çarpımı hesapladığında, matematik, sonuç yalnızca bunların göreceli m eksi n uzaklığına bağlı olacak şekilde çalışır. Bu, gerçek göreceli konum farkındalığı sağlar, etkili dikkat çekirdekleriyle güzel bir şekilde oynar ve mesafeyle birlikte dikkati sorunsuz bir şekilde azaltır. RoPE artık Llama, Mistral, Qwen ve çoğu modern açık modelde kullanılmaktadır.

Teknik Bilgi

RoPE, yerleştirme boyutlarını çiftler halinde ele alır ve her bir çifte, farklı hızlarda çalışan birçok saatin ibreleri gibi farklı frekanslarda dönen farklı çiftlerle 2 boyutlu bir dönüş uygular. M konumuna göre döndürmek ve ardından n konumuna göre döndürülen bir şeyle nokta çarpımı almak yalnızca açı farkını bıraktığından, dikkat puanları göreceli konumun fonksiyonları haline gelir. Yüksek frekans çiftleri hassas yerel düzeni yakalar; düşük frekans çiftleri uzun menzilli konumu yakalar. En önemlisi, değerleri değil sorguları ve anahtarları değiştirir.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Döner Pozisyon Gömmelerinin Geleceği

Son zamanlardaki çalışmaların çoğu, RoPE'yi bir modelin eğitildiğinden çok daha uzun bağlamlara genişletmeye odaklanıyor. Konum enterpolasyonu, NTK bilinçli ölçeklendirme ve YaRN gibi teknikler, örneğin 4K tokenlar üzerinde eğitilmiş bir modelin hafif ince ayar ile 32K veya daha fazlasını işleyebilmesi için dönüş frekanslarını ayarlar. RoPE'nin, temel frekansında devam eden iyileştirmeler ve milyon jetonlu bağlamlar için ölçeklendirmeyle ve dikkat davranışıyla nasıl etkileşime girdiğine ilişkin devam eden çalışmalarla baskın konumsal şema olarak kalmasını bekliyoruz.

Gerçek Dünya Uygulaması

Lama, Mistral ve Qwen modellerine ayrı konum yerleştirmeleri olmadan jeton düzeni anlayışının verilmesi

Bir modelin kullanılabilir bağlamını enterpolasyon veya YaRN yoluyla birkaç binden onbinlerce jetona genişletme

Kod modellerinin uzun dosyalardaki parantez, işlevler ve referanslar arasındaki göreli mesafeleri izlemesine yardımcı olma

Soru ve kanıt arasındaki göreceli konumun önemli olduğu durumlarda uzun belgeli soru yanıtını desteklemek

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

ALiBi Pozisyon Önyargısı

Sık sorulan sorular

What is Rotary Position Embeddings?

Döner Konum Yerleştirmeleri (RoPE), sorgusunu ve anahtar vektörlerini konumla orantılı bir açıyla döndürerek her bir tokenin sırayla nerede bulunduğunu kodlar. Bu zarif numara, transformatörlerin göreceli mesafeleri anlamalarını ve daha uzun bağlamlara zarif bir şekilde uzanmalarını sağlar.

RoPE konum bilgisini transformatöre nasıl enjekte eder?

RoPE, ayrı bir konum vektörü eklemek yerine sorgu ve anahtar vektörlerini konumla orantılı bir açıyla döndürür.

RoPE dikkat hesaplamasının hangi kısımlarını değiştirir?

RoPE, dönüşlerini sorgu ve anahtar vektörlere uygulayarak değer vektörlerine dokunmadan bırakır.

RoPE'de neden farklı boyut çiftleri farklı frekanslarda dönüyor?

Saat ibrelerinin farklı hızlarda tik takları gibi, çeşitli frekanslar da bazı çiftlerin kısa menzilli sırayı, diğerlerinin ise uzun menzilli konumu kodlamasına olanak tanır.

Konum enterpolasyonu, NTK bilinçli ölçeklendirme ve YaRN gibi tekniklerin amacı nedir?

Bu yöntemler, bir modelin orijinal eğitim uzunluğundan çok daha uzun bağlamları işleyebilmesi için RoPE'nin dönüş frekanslarını yeniden ölçeklendirir.