SıradakiSonraki rehber
ChatGPT ve LLM'ler
Dil Yapay Zeka
Temel Bilgiler KILAVUZU
Büyük dil modelleri, metni tek seferde bir karakter okumadıkları için harfleri saymakta zorluk çekerler.
Karakter yığınları olan belirteçleri okurlar, dolayısıyla bir kelimenin içindeki tek tek harfler çoğu zaman model tarafından asla doğrudan görülemez. Bu tek gerçek, yazım, sayma, ters çevirme ve kafiyelemeyle ilgili bir dizi tuhaf hatayı açıklıyor ve size bunların üstesinden nasıl gelmeniz gerektiğini anlatıyor.
Bir dil modeli herhangi bir metni görmeden önce, bir belirteçleyici onu belirteçlere böler. Çoğu modern belirteç, büyük bir metin gövdesinden ortak karakter dizilerini öğrenen bayt çifti kodlaması gibi bir yöntem kullanır. Sık kullanılan kelimeler genellikle tek bir simge haline gelir ve daha nadir kelimeler birkaç parçaya bölünür. Model daha sonra her jetonu bir sayı olarak alır ve bir vektöre dönüştürür. Bu belirtecin içindeki harfleri hiçbir zaman ayrı girdiler olarak almaz. Yani 'çilek'te kaç tane r var diye sorduğunuz zaman model on karakteri taramıyor. Belki iki veya üç parça görüyor ve eğitim sırasında öğrendiği kalıplardan bu parçaların içerdiği harfleri hatırlaması gerekiyor. Bu bilgi vardır ama dolaylı ve bulanıktır, tıpkı size e harfinin yalnızca resim olarak gördüğünüz bir kelimede kaç kez göründüğünün sorulması gibi. Çilek sorusu 2024'te geniş çapta paylaşılan bir örnek haline geldi çünkü cevap insanlar için açık, chatbotlar için ise şaşırtıcı derecede zor. Aynı neden ilgili hatalara da yol açar: Yüksek sesle hecelemeniz istendiğinde yazım hatası yapmak, kelimeleri yanlış şekilde tersine çevirmek, akrostiş veya lipogram gibi harf tabanlı kısıtlamalarda başarısız olmak ve uzunluk sınırlamaları için karakterleri yanlış saymak. Tam bölünmeler belirteçler arasında farklılık gösterir, bu nedenle bir model belirli bir kelimeyi doğru çıkarırken diğeri başarısız olabilir. Yaygın bir yanılgı, bunun modellerin akıl yürütemediğini veya sadece dikkatsiz olduğunu gösterdiğidir. Sınır, genel akıl yürütmede değil, çoğunlukla giriş biçimindedir. Bir modelden önce kelimeyi hecelemesi istendiğinde, her harf kendi simgesi haline gelir ve sayma çok daha kolay bir iş haline gelir. Daha yeni muhakeme modelleri genellikle bu yazım adımını kendi başlarına yaparlar; bu da bu soruları daha sık doğru yanıtlamalarının bir nedenidir. Kesinliğin önemli olduğu herhangi bir şey için kısa bir kod parçası çalıştırmak hala en güvenilir yöntemdir.
Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.
Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.
Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.
Araştırmacılar, doğrudan baytlar veya karakterler üzerinde çalışan modelleri ve baytları dinamik olarak gruplandıran, karakter düzeyindeki görevleri daha doğal hale getirebilecek hibrit tasarımları araştırıyor. Bu yaklaşımların bazı dezavantajları vardır çünkü daha uzun giriş dizileri daha fazla hesaplamaya mal olur. Bu arada, kelimeleri adım adım heceleyen akıl yürütme modelleri ve kod araçlarını çağıran modeller, pratikte bu hataların çoğunu zaten azaltıyor. Zaman içinde daha az utanç verici harf sayma hatası beklemek mantıklıdır, ancak tam karakter sayımı gerektiren görevler için, bir modelin geri çağrılmasına güvenmek yerine kod kullanmak muhtemelen iyi bir uygulama olmaya devam edecektir.
'Çilek' sözcüğünde r harfinin kaç kez geçtiği sorulduğunda, bir sohbet robotu üç yerine iki yanıtını veriyor, çünkü sözcük modele on ayrı harf yerine birkaç çok harfli parça halinde ulaşıyor.
Bir öğretmen, bir modelden, her kelimenin s harfiyle başladığı bir cümle yazmasını ister ve her kelimenin ilk harfini görmek yerine çıkarım yapması gerektiğinden, olmayan kelimelerde kayar.
Bir geliştirici 'ansiklopedi' kelimesinin tersten yazılışını ister ve harflerin değiştirilmiş veya eksik olduğu bir versiyon alır; Modelden önce harfleri her satırda bir tane olacak şekilde listelemesini, ardından listeyi tersine çevirmesini istemek sorunu düzeltir.
Bir bulmaca uygulaması, bir kelime oyunu için tam harf sayılarına ihtiyaç duyar, bu nedenle bunları tek bir sıradan kod satırıyla hesaplar ve modeli yalnızca ipuçlarını yazmak için kullanır.
Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.
Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.
Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.
İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.
Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.
Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.
Hukuk Yüksek Lisansının Mektupları Saymak İçin Neden Mücadele Ettiğinin nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Büyük dil modelleri, metni tek seferde bir karakter okumadıkları için harfleri saymakta zorluk çekerler. Karakter yığınları olan belirteçleri okurlar, dolayısıyla bir kelimenin içindeki tek tek harfler çoğu zaman model tarafından asla doğrudan görülemez. Bu tek gerçek, yazım, sayma, ters çevirme ve kafiyelemeyle ilgili bir dizi tuhaf hatayı açıklıyor ve size bunların üstesinden nasıl gelmeniz gerektiğini anlatıyor.
Modeller genellikle birden fazla karakter içeren jetonlar alır. Bir jetonun içindeki harfler ayrı girdiler değildir, dolayısıyla modelin bunları dolaylı olarak hatırlaması gerekir.
Tokenizer, metni sabit bir kelime dağarcığından parçalara böler ve her birini bir tamsayı kimliğiyle eşleştirir ve bu daha sonra bir vektöre dönüştürülür.
Kelimeyi s-t-r-a-w gibi ayırıcılarla yazmak genellikle her harfi kendi belirtecine koyar, bu da saymayı çok daha kolay bir iş haline getirir.
BPE baytlardan veya karakterlerden başlar ve en sık görülen bitişik çifti birleştirmeye devam eder, böylece ortak dizeler tek belirteçler haline gelir.
Tokenlaştırıcılar genellikle tokenların başında boşluklar ve büyük/küçük harfler içerir, bu nedenle küçük yüzey değişiklikleri farklı token bölünmelerine neden olabilir.
Öğrenmeye devam et
Bu konu için daha fazla rehber seçildi
SıradakiSonraki rehber
ChatGPT ve LLM'ler
Dil Yapay Zeka