Dil AI KILAVUZU

Bayt Çifti Kodlama

Bayt Çifti Kodlama (BPE), en sık kullanılan sembol çiftini tekrar tekrar birleştirerek bir kelime dağarcığı oluşturan, sıkıştırmadan ilham alan bir algoritmadır.

2 min readSon güncelleme

Genel Bakış

It is the tokenizer behind GPT models, balancing tiny vocabularies of characters against huge vocabularies of whole words.

Derin Dalış

BPE, metni tek tek karakterlerden (veya ham baytlardan) oluşan bir dizi olarak ele alarak başlar. Daha sonra her bitişik sembol çiftini sayar, en sık görülen çifti yeni bir simgede birleştirir ve bunu binlerce kez tekrarlar. Her birleştirme bir kural olarak kaydedilir. 'th', 'ing' gibi yaygın harf dizileri veya sık kullanılan kelimelerin tamamı yavaş yavaş tek belirteçlere dönüşürken, nadir kelimeler daha küçük parçalara bölünmüş halde kalır. Başlangıçta 1994'te bir veri sıkıştırma yöntemi olan bu yöntem, Sennrich ve arkadaşları tarafından NLP'ye uyarlandı. 2016 yılında makine çevirisi için. GPT-2 ve GPT-4, UTF-8 baytları üzerinde çalışan bayt düzeyinde BPE'yi kullanır, böylece herhangi bir karakter, emoji veya dil her zaman sıfır kelime dışı hatayla kodlanabilir.

Teknik Bilgi

BPE eğitimi, birleştirme kurallarının sıralı bir listesini oluşturur. Yeni metni simgeleştirmek için, algoritma onu baytlara/karakterlere böler ve hiçbir kural eşleşmeyene kadar aynı öncelik sırasına göre birleştirmeleri açgözlülükle uygular. Bayt düzeyinde BPE bir geri dönüşü garanti eder: Görünmeyen bir sembol bile kendisini oluşturan baytlara ayrışır, böylece 256 bayt artı öğrenilen birleştirmelerden oluşan kelime dağarcığı, UNK belirteci olmayan her şeyi kapsar.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Bayt Çifti Kodlamanın Geleceği

BPE, en güçlü tokenizer olmaya devam ediyor, ancak açık tokenizasyonu atlayan, kod, matematik veya İngilizce olmayan komut dosyalarındaki garip bölünmeler gibi tuhaflıklardan kaçınan bayt veya karakter düzeyindeki modellere yönelik baskı artıyor. Token içermeyen mimariler ve öğrenilmiş tokenlaştırıcılar üzerine yapılan araştırmalar, BPE'nin önyargılarını düzeltmeyi amaçlıyor. Yine de hızı ve sıkıştırma verimliliği, BPE tarzı sözcük dağarcığının yakın gelecekte çoğu üretim yüksek lisans eğitimine güç vereceği anlamına geliyor.

Gerçek Dünya Uygulaması

GPT-2 ve GPT-4 bayt düzeyinde BPE kullanır, böylece herhangi bir Unicode karakter veya emoji hatasız olarak kodlanabilir.

Makine çevirisi sistemleri, nadir veya bileşik sözcükleri, diller arasında paylaşılan yeniden kullanılabilir alt sözcük parçalarına bölmek için BPE'yi kullanır.

Hugging Face'in tokenizer kütüphanesi, biyomedikal veya hukuki metinler gibi özel alanlar için BPE kelime dağarcığını eğitiyor.

Kod modelleri, 'def' veya '==' gibi sık kullanılan kalıpları tek belirteçlerde birleştirerek tanımlayıcıları ve anahtar kelimeleri BPE ile simgeleştirir.

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Byte-Pair Encoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Tokenizasyon ve Bayt Çifti Kodlaması

Sık sorulan sorular

What is Byte-Pair Encoding?

Bayt Çifti Kodlama (BPE), en sık kullanılan sembol çiftini tekrar tekrar birleştirerek bir kelime dağarcığı oluşturan, sıkıştırmadan ilham alan bir algoritmadır. GPT modellerinin ardındaki tokenizer, karakterlerin küçük kelime dağarcığını tam kelimelerden oluşan devasa kelime dağarcığına karşı dengeliyor.

BPE'nin sözcük dağarcığını oluşturmak için tekrarladığı temel işlem nedir?

BPE, bitişik sembol çiftlerini sayar ve en sık görülen tek simgeyi binlerce kez tekrarlayarak yeni bir belirteçte birleştirir.

BPE, eğitime başladığında metni nasıl ele alıyor?

BPE en küçük birimlerden (karakterler veya ham baytlar) başlar ve birleştirmeler yoluyla daha büyük jetonlar büyütür.

Bayt düzeyinde BPE neden sözcük dışı (UNK) hatalardan kaçınıyor?

Temel kelime dağarcığı 256 baytın tamamını içerdiğinden, görünmeyen semboller bile kendi bayt temsillerine geri döner.

BPE algoritması, NLP onu benimsemeden önce nereden geldi?

BPE, 1994 yılında bir veri sıkıştırma tekniği olarak tanıtıldı ve daha sonra 2016 yılında alt kelime tokenizasyonu için uyarlandı.

Yeni metni tokenleştirirken BPE öğrenilen kuralları nasıl uygular?

Birleştirme kuralları sıralanır ve tokenizasyon, başka kural eşleşmesi kalmayıncaya kadar bunları öncelik sırasına göre açgözlülükle uygular.