ALiBi Pozisyon Önyargısı
ALiBi (Doğrusal Önyargılara Dikkat), transformatörlere geleneksel konum yerleştirmeleri olmadan kelime sırası hissi vermenin akıllı bir yoludur.
Genel Bakış
It lets a model trained on short text handle much longer inputs at inference time.
Derin Dalış
Transformatörlerin yerleşik bir kelime sırası kavramı yoktur, bu nedenle konumu kodlamanın bir yoluna ihtiyaçları vardır. Klasik yaklaşım, simge vektörlerine konumsal yerleştirmeler ekler. Press, Smith ve Lewis tarafından 2021'de tanıtılan ALiBi bunları tamamen ortadan kaldırıyor. Bunun yerine, dikkat puanlarını doğrudan yönlendiriyor: Bir sorgu tokenı bir anahtar tokena baktığında, ALiBi aralarındaki mesafeyle orantılı bir ceza çıkarıyor. Birbirinden uzak olan tokenlar daha büyük ceza alıyor, dolayısıyla model doğal olarak yakın bağlamı tercih ediyor. Her dikkat kafasının kendi sabit ceza eğimi vardır, bu nedenle bazı kafalar yerel olarak bakarken diğerleri daha uzağı görür. Önyargı yalnızca mesafenin bir fonksiyonu olduğundan ALiBi, eğitimde görülenlerden çok daha uzun dizilere zarif bir şekilde tahminde bulunur.
Teknik Bilgi
i konumundaki bir sorgu ve j konumundaki anahtar için ALiBi, softmax'tan önceki ham dikkat puanına m * (j - i) ekler; burada m, başa özgü bir sabittir (eğimler 1/2, 1/4, 1/8 gibi geometrik bir dizi oluşturur). Nedensel dikkatte j, i'den küçük veya ona eşit olduğundan, bu terim sıfır veya negatiftir ve uzak belirteçleri cezalandırır. Öğrenilmiş hiçbir parametre ve hiçbir ekleme eklenmediğinden, tek ek yük önceden hesaplanmış bir önyargı matrisidir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
ALiBi Pozisyon Önyargısının Geleceği
ALiBi, göreceli, mesafeye dayalı önyargıların, uzunluk genellemesi için mutlak konum yerleştirmelerini yendiğini ve bu fikrin artık modern uzun bağlam tasarımına nüfuz ettiğini kanıtladı. Bazı yeni modeller bunun yerine döner gömmeleri (RoPE) tercih ediyor, ancak ALiBi aşırı ekstrapolasyonun önemli olduğu yerlerde popüler olmaya devam ediyor ve BLOOM ve MPT gibi modellerde kullanılıyor. Laboratuvarlar bağlam pencerelerini sıfırdan yeniden eğitmeden milyonlarca jetona doğru iterken mesafe önyargılarını RoPE ölçeklendirmesiyle birleştiren hibrit deneylerin devam etmesini bekleyin.
Gerçek Dünya Uygulaması
ALiBi'nin tahminine dayanarak, bir chatbot'u 1.024 jetonlu örnekler üzerinde eğitmek, ancak onu yeniden eğitmeden 4.096 jetonlu belgelere dağıtmak.
Konum yönetimi için ALiBi'yi benimseyen BLOOM 176B çok dilli modeli.
Çıkarımda sınırsız bağlam uzunluğunu etkili bir şekilde tanıtmak için ALiBi'yi kullanan MosaicML'nin MPT modelleri.
Yakın bağlam önyargısının dikkati tutarlı tuttuğu, modelin orijinal eğitim süresini aşan uzun yasal sözleşmelerin özetlenmesi.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the ALiBi Position Bias quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Bağlam Uzantısı için Konum Enterpolasyonu
Sık sorulan sorular
What is ALiBi Position Bias?
ALiBi (Doğrusal Önyargılara Dikkat), transformatörlere geleneksel konum yerleştirmeleri olmadan kelime sırası hissi vermenin akıllı bir yoludur. Kısa metin üzerinde eğitilmiş bir modelin çıkarım zamanında çok daha uzun girdileri işlemesine olanak tanır.
ALiBi'nin açılımı nedir?
ALiBi, adını dikkat puanlarına eklediği doğrusal cezadan alan Doğrusal Önyargılı Dikkat'in kısaltmasıdır.
ALiBi uzaktaki tokenları nasıl cezalandırıyor?
ALiBi, dikkat puanından sorgu anahtarı mesafesiyle orantılı bir değer çıkarır, böylece tokenlar daha az ağırlık kazanır.
ALiBi'nin en ünlü pratik avantajı nedir?
Önyargı yalnızca mesafeye bağlı olduğundan, kısa diziler üzerinde eğitilen modeller, çıkarım zamanında çok daha uzun dizileri işleyebilir.
Dikkat kafaları arasındaki doğrusal önyargının farkı nedir?
ALiBi her kafaya ayrı, sabit bir eğim atar (örneğin 1/2, 1/4, 1/8), böylece farklı kafalar farklı aralıklarda katılır.
Geleneksel konumsal yerleştirmelerle karşılaştırıldığında ALiBi kaç tane öğrenilmiş parametre ekler?
ALiBi öğrenilen yeni parametreler sunmaz; kafa başına eğimler önceden belirlenmiş sabitlerdir.