Bayt Çifti Kodlama
Bayt Çifti Kodlama (BPE), en sık kullanılan sembol çiftini tekrar tekrar birleştirerek bir kelime dağarcığı oluşturan, sıkıştırmadan ilham alan bir algoritmadır.
Genel Bakış
It is the tokenizer behind GPT models, balancing tiny vocabularies of characters against huge vocabularies of whole words.
Derin Dalış
BPE, metni tek tek karakterlerden (veya ham baytlardan) oluşan bir dizi olarak ele alarak başlar. Daha sonra her bitişik sembol çiftini sayar, en sık görülen çifti yeni bir simgede birleştirir ve bunu binlerce kez tekrarlar. Her birleştirme bir kural olarak kaydedilir. 'th', 'ing' gibi yaygın harf dizileri veya sık kullanılan kelimelerin tamamı yavaş yavaş tek belirteçlere dönüşürken, nadir kelimeler daha küçük parçalara bölünmüş halde kalır. Başlangıçta 1994'te bir veri sıkıştırma yöntemi olan bu yöntem, Sennrich ve arkadaşları tarafından NLP'ye uyarlandı. 2016 yılında makine çevirisi için. GPT-2 ve GPT-4, UTF-8 baytları üzerinde çalışan bayt düzeyinde BPE'yi kullanır, böylece herhangi bir karakter, emoji veya dil her zaman sıfır kelime dışı hatayla kodlanabilir.
Teknik Bilgi
BPE eğitimi, birleştirme kurallarının sıralı bir listesini oluşturur. Yeni metni simgeleştirmek için, algoritma onu baytlara/karakterlere böler ve hiçbir kural eşleşmeyene kadar aynı öncelik sırasına göre birleştirmeleri açgözlülükle uygular. Bayt düzeyinde BPE bir geri dönüşü garanti eder: Görünmeyen bir sembol bile kendisini oluşturan baytlara ayrışır, böylece 256 bayt artı öğrenilen birleştirmelerden oluşan kelime dağarcığı, UNK belirteci olmayan her şeyi kapsar.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Bayt Çifti Kodlamanın Geleceği
BPE, en güçlü tokenizer olmaya devam ediyor, ancak açık tokenizasyonu atlayan, kod, matematik veya İngilizce olmayan komut dosyalarındaki garip bölünmeler gibi tuhaflıklardan kaçınan bayt veya karakter düzeyindeki modellere yönelik baskı artıyor. Token içermeyen mimariler ve öğrenilmiş tokenlaştırıcılar üzerine yapılan araştırmalar, BPE'nin önyargılarını düzeltmeyi amaçlıyor. Yine de hızı ve sıkıştırma verimliliği, BPE tarzı sözcük dağarcığının yakın gelecekte çoğu üretim yüksek lisans eğitimine güç vereceği anlamına geliyor.
Gerçek Dünya Uygulaması
GPT-2 ve GPT-4 bayt düzeyinde BPE kullanır, böylece herhangi bir Unicode karakter veya emoji hatasız olarak kodlanabilir.
Makine çevirisi sistemleri, nadir veya bileşik sözcükleri, diller arasında paylaşılan yeniden kullanılabilir alt sözcük parçalarına bölmek için BPE'yi kullanır.
Hugging Face'in tokenizer kütüphanesi, biyomedikal veya hukuki metinler gibi özel alanlar için BPE kelime dağarcığını eğitiyor.
Kod modelleri, 'def' veya '==' gibi sık kullanılan kalıpları tek belirteçlerde birleştirerek tanımlayıcıları ve anahtar kelimeleri BPE ile simgeleştirir.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Byte-Pair Encoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Tokenizasyon ve Bayt Çifti Kodlaması
Sık sorulan sorular
What is Byte-Pair Encoding?
Bayt Çifti Kodlama (BPE), en sık kullanılan sembol çiftini tekrar tekrar birleştirerek bir kelime dağarcığı oluşturan, sıkıştırmadan ilham alan bir algoritmadır. GPT modellerinin ardındaki tokenizer, karakterlerin küçük kelime dağarcığını tam kelimelerden oluşan devasa kelime dağarcığına karşı dengeliyor.
BPE'nin sözcük dağarcığını oluşturmak için tekrarladığı temel işlem nedir?
BPE, bitişik sembol çiftlerini sayar ve en sık görülen tek simgeyi binlerce kez tekrarlayarak yeni bir belirteçte birleştirir.
BPE, eğitime başladığında metni nasıl ele alıyor?
BPE en küçük birimlerden (karakterler veya ham baytlar) başlar ve birleştirmeler yoluyla daha büyük jetonlar büyütür.
Bayt düzeyinde BPE neden sözcük dışı (UNK) hatalardan kaçınıyor?
Temel kelime dağarcığı 256 baytın tamamını içerdiğinden, görünmeyen semboller bile kendi bayt temsillerine geri döner.
BPE algoritması, NLP onu benimsemeden önce nereden geldi?
BPE, 1994 yılında bir veri sıkıştırma tekniği olarak tanıtıldı ve daha sonra 2016 yılında alt kelime tokenizasyonu için uyarlandı.
Yeni metni tokenleştirirken BPE öğrenilen kuralları nasıl uygular?
Birleştirme kuralları sıralanır ve tokenizasyon, başka kural eşleşmesi kalmayıncaya kadar bunları öncelik sırasına göre açgözlülükle uygular.