Temel Bilgiler KILAVUZU

Tokenleştirme

Belirteçleştirme, metni, dil modelinin gerçekte okuduğu ve tahmin ettiği birimler olan belirteç adı verilen daha küçük parçalara bölen adımdır.

2 min readSon güncelleme

Genel Bakış

It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.

Derin Dalış

Bir model metninizi görmeden önce, bir belirteç oluşturucu onu, tam kelimeler veya tek harfler yerine genellikle alt kelime parçaları olan belirteçlere böler. 'Mutsuzluk' kelimesi 'un', 'mutluluk' haline gelebilir veya 'belirteçleştirme', 'belirteç' ve 'oluşturma'ya bölünebilir. Yaygın sözcükler genellikle tek bir simgeyle eşleşirken nadir sözcükler, adlar veya kodlar birden fazla simgeye bölünür. Daha sonra her bir jeton, modelin bir vektöre dönüştürdüğü bir kimlik numarasıyla eşleştirilir. Bu pratik olarak önemlidir, çünkü modellerde jeton cinsinden ölçülen sabit bağlam pencereleri bulunur ve API'ler jeton başına faturalandırılır; bu nedenle kaba bir İngilizce kuralı, jeton başına yaklaşık 4 karakter veya 0,75 kelimedir. Tokenizasyon aynı zamanda klasik model tuhaflıklarını da açıklıyor: Harfleri saymak veya tam yazım yapmak zordur çünkü model tek tek karakterleri değil parçaları görür.

Teknik Bilgi

Modern LLM'lerin çoğu, Bayt Çifti Kodlama (BPE) veya bunun bayt düzeyindeki çeşitleri gibi alt kelime tokenizasyonunu kullanır. BPE karakterlerden başlar ve sabit bir kelime dağarcığı (genellikle 30.000 ila 100.000'den fazla belirteç) oluşturmak için en sık görülen bitişik çiftleri tekrar tekrar birleştirir. Bu, iki uç noktayı dengeler: Kelime düzeyindeki tokenizasyon, görünmeyen sözcükleri işleyemezken, karakter düzeyindeki diziler çok uzun hale gelir. Alt kelimeler, dizileri oldukça kısa tutarken bilinen parçaları bir araya getirerek modelin yazım hataları ve yeni kelimeler de dahil olmak üzere herhangi bir dizeyi temsil etmesine olanak tanır.

Stratejik Etki

Daha net kararlar

Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.

Maliyet ve bütçe

Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.

Ekip ve iş akışı

Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.

Tokenizasyonun Geleceği

Tokenizasyon, tam olarak verimliliği ve adaleti sınırladığı için aktif bir araştırma alanıdır. Daha fazla parçaya ayrılan diller daha fazla maliyete sahiptir ve bağlamı daha hızlı tüketir; bu nedenle çok dilli adalet, daha iyi, daha dengeli kelime dağarcıklarıyla ele alınması gereken gerçek bir endişedir. Araştırmacılar ayrıca token içermeyen veya bayt düzeyindeki modelleri (ByT5 gibi) ve kırılgan, elle ayarlanan adımı tamamen ortadan kaldırabilecek öğrenilmiş tokenizasyonu araştırıyorlar. Şimdilik, daha geniş kelime dağarcığı, daha akıllı çok dilli belirteçler ve belirteç tabanlı fiyatlandırma ve bağlam bütçeleme konusunda artan kullanıcı farkındalığını bekleyebilirsiniz.

Gerçek Dünya Uygulaması

GPT ve Claude gibi modeller için API fiyatlandırması, giriş ve çıkış jetonu başına faturalandırılır; dolayısıyla jeton sayıları doğrudan maliyeti etkiler.

Bağlam penceresi sınırları (ör. 128K veya 200K belirteçleri) belirteçlerle ölçülür ve ne kadar metin veya kod ekleyebileceğinizi sınırlar.

Geliştiriciler, istekleri göndermeden önce bilgi istemi boyutunu tahmin etmek ve içeriği kırpmak için belirteçleri (tiktoken gibi) kullanır.

Belirteçleştirme, modellerin karakterleri değil alt kelime parçalarını gördükleri için neden bir kelimedeki harfleri saymakta veya bir dizeyi tersine çevirmede zorlandığını açıklıyor.

Riskler ve Korkuluklar

Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.

Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.

Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.

Uygulama Yol Haritası

1

İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.

2

Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.

3

Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.

4

Tokenizasyonun nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Cümle Parçası Tokenizasyonu

Sık sorulan sorular

What is Tokenization?

Belirteçleştirme, metni, dil modelinin gerçekte okuduğu ve tahmin ettiği birimler olan belirteç adı verilen daha küçük parçalara bölen adımdır. Maliyeti, bağlam sınırlarını ve hatta bir modelin yazım ve nadir sözcükleri ne kadar iyi ele aldığını sessizce şekillendirir.

Dil modeli bağlamında 'belirteç' nedir?

Belirteçler, bir modelin işlediği birimlerdir; genellikle alt sözcük parçaları, bazen tam sözcükler veya tek karakterler.

Modern LLM'lerin çoğu hangi tokenizasyon yaklaşımını kullanıyor?

BPE gibi alt kelime yöntemleri, sık görülen karakter çiftlerini birleştirerek saf kelime seviyesi ve karakter seviyesi yaklaşımlarının zayıf yönlerini dengeler.

Tokenizasyon, yüksek lisans öğrencileri için bir kelimedeki harfleri saymak gibi görevleri neden zorlaştırıyor?

Metin alt kelime belirteçleri halinde gruplandırıldığından, model her karakteri doğrudan algılamaz, bu da harf düzeyindeki görevleri hataya açık hale getirir.

Tokenizasyon API maliyeti ve bağlam sınırları açısından neden önemlidir?

Sağlayıcıların jeton başına faturalandırması ve bağlam pencereleri jeton cinsinden boyutlandırılır, dolayısıyla jeton sayıları hem fiyatı hem de ne kadar ekleyebileceğinizi belirler.

Neden aynı cümle bazı dillerde İngilizceye göre daha fazla jetona mal olabilir?

Çoğunlukla İngilizce üzerine eğitilen kelime dağarcığı, diğer dilleri daha fazla simgeye bölerek maliyeti artırıyor ve bağlamı daha hızlı tüketiyor.