Teknik KILAVUZ

Tokenizasyon ve Bayt Çifti Kodlaması

Tokenizasyon, metni bir dil modelinin gerçekten okuduğu küçük birimlere böler ve Bayt Çifti Kodlama (BPE), bu kelime dağarcığını oluşturmanın popüler yöntemidir.

2 min readSon güncelleme

Genel Bakış

It balances having a manageable vocabulary against handling any word the model might encounter.

Derin Dalış

Dil modelleri ham karakterleri veya tam kelimeleri görmez; metin parçalarıyla eşlenen belirteçleri, tamsayı kimliklerini görürler. Bu parçaları seçmek bir değiş tokuştur: Kelime düzeyindeki kelime dağarcığı çok büyüktür ve görünmeyen veya yanlış yazılan sözcüklerde boğulurken, karakter düzeyindekiler dizileri çok uzun hale getirir. Bayt Çifti Kodlaması orta bir noktaya ulaşır. 1990'ların veri sıkıştırma algoritmasından ödünç alınan BPE, tek tek karakterlerden (veya ham baytlardan) başlar ve en sık görülen bitişik çifti tekrar tekrar yeni bir belirteçte birleştirerek kelime dağarcığını ortak alt kelimelere doğru genişletir. Sık kullanılan kelimeler tek belirteçlere dönüşürken nadir kelimeler yeniden kullanılabilir parçalara bölünür. GPT modelleri tarafından kullanılan bayt düzeyinde BPE, ham baytlarla çalışır, böylece herhangi bir Unicode metni (emoji ve herhangi bir dil dahil) sözcük dışı hatalar olmadan temsil edebilir.

Teknik Bilgi

BPE eğitimi açgözlü ve frekans odaklıdır. Bir temel alfabeden başlayarak, bir bütündeki bitişik sembol çiftlerini sayar ve en yaygın çifti birleştirerek her birleştirmeyi bir kural olarak kaydeder. Bunun binlerce kez tekrarlanması sıralı bir birleştirme listesi ve sabit bir sözcük dağarcığı üretir. Çıkarımda metin, bu birleştirme kuralları sırayla uygulanarak kodlanır. Bu nedenle jeton sayıları nadiren kelime sayımlarıyla eşleşir: boşluklar, büyük harfler ve nadir kelimelerin tümü metnin jetonlara nasıl bölündüğünü değiştirir ve tek bir kelime birden fazla jeton haline gelebilir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Tokenizasyon ve Bayt Çifti Kodlamanın Geleceği

Tokenizasyon aktif olarak yeniden düşünülüyor. ByT5 gibi bayt ve karakter düzeyindeki modeller ve yeni ortaya çıkan belirteçsiz veya "bayt gizli" mimariler, sabit sözcük dağarcığını tamamen ortadan kaldırmayı, böylece modellerin her türlü girdiyi ve her dili aynı şekilde işlemesini amaçlamaktadır. Araştırmacılar ayrıca tokenizasyon adaleti ile de mücadele ediyor; İngilizce dışındaki ve düşük kaynaklı dillerin çoğu şu anda cümle başına çok daha fazla token maliyetine sahip, bu da fiyatı artırıyor ve etkili bağlamı daraltıyor. Kod, matematik ve çok dilli denge için ayarlanmış belirteçlerin yanı sıra sınırı ham baytlara doğru itmek için devam eden deneyler bekliyoruz.

Gerçek Dünya Uygulaması

GPT ve Llama modelleri, istemleri ağın işlediği belirteç kimliklerine dönüştürmek için BPE tarzı belirteçler kullanır.

API fiyatlandırması ve bağlam penceresi sınırları jetonlarla ölçülür, dolayısıyla jetonlaştırma maliyeti ve ne kadar metnin sığacağını doğrudan etkiler.

Emojiyi, kodu ve nadir kelimeleri yeniden kullanılabilir alt kelimeye veya bayt parçalarına bölerek zarif bir şekilde işleme.

Bayt düzeyinde kodlama yoluyla, dil başına ayrı bir sözlük olmadan tek bir modelde birçok dili destekleme.

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization and Byte Pair Encoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Bayt Çifti Kodlama

Sık sorulan sorular

What is Tokenization and Byte Pair Encoding?

Tokenizasyon, metni bir dil modelinin gerçekten okuduğu küçük birimlere böler ve Bayt Çifti Kodlama (BPE), bu kelime dağarcığını oluşturmanın popüler yöntemidir. Yönetilebilir bir kelime dağarcığına sahip olmak ile modelin karşılaşabileceği herhangi bir kelimeyi kullanmak arasında denge kurar.

Tokenizasyon, bir dil modelinin okunması için ne üretir?

Modeller ham metin dizeleri yerine belirteçler (karakterleri, alt sözcükleri veya sözcükleri temsil eden tamsayı kimlikleri) üzerinde çalışır.

Bayt Çifti Kodlama kelime dağarcığını nasıl oluşturur?

BPE, karakterlerden veya baytlardan başlar ve en sık görülen bitişik çiftleri açgözlülükle birleştirerek yavaş yavaş ortak alt kelime belirteçleri oluşturur.

BPE gibi alt kelime yöntemleri, kelime düzeyinde tokenizasyona kıyasla hangi sorunu çözer?

Kelime düzeyindeki sözcük dağarcığı, görülmeyen sözcüklerde başarısız oluyor; Alt kelime tokenizasyonu, nadir kelimeleri bilinen parçalara bölerek kelime dağarcığı dışı sorunlardan kaçınırken kelime dağarcığını yönetilebilir tutar.

GPT modellerinde kullanıldığı şekliyle bayt düzeyinde BPE'nin avantajı nedir?

Ham baytlarla çalışmak, mümkün olan her girişin kodlanabileceği anlamına gelir; böylece dil veya sembolden bağımsız olarak gerçekten bilinmeyen karakterler kalmaz.

Bir modelin belirteç sayısı neden genellikle bir cümledeki sözcük sayısından farklıdır?

Alt kelime tokenizasyonu, tek bir kelimeyi birden fazla parçaya bölebilir ve boşluklara ve büyük/küçük harfe duyarlı olduğundan, jeton sayıları nadiren kelime sayılarına eşit olur.