Dil AI KILAVUZU

Metin Sınıflandırması

Metin sınıflandırma, bir e-postayı spam olarak veya bir incelemeyi olumlu olarak etiketlemek gibi metin parçalarını otomatik olarak kategorilere ayırır.

2 min readSon güncelleme

Genel Bakış

It is one of the most widely deployed NLP tasks because it turns messy free text into structured labels a system can act on.

Derin Dalış

Sınıflandırma birçok şekli kapsar. İkili sınıflandırma iki etiketten birini seçer (spam veya spam değil). Çoklu sınıf, çeşitli seçeneklerden (bir bileti faturalandırmaya, satışa veya desteğe yönlendirme) tam olarak bir etiket atar. Çoklu etiket aynı anda birden fazla etikete izin verir (hem 'siyaset' hem de 'ekonomi' etiketli bir makale). Duyarlılık analizi, konu etiketleme, amaç tespiti ve toksisite filtrelemenin tümü sınıflandırma görevleridir. Modern sistemler, metni anlamı yakalayan sayısal yerleştirmelere dönüştürür, ardından bir sınıflandırıcı bu özellikleri etiket olasılıklarına eşler. Gerçek veriler genellikle dengesiz olduğundan, performans basit doğruluğun ötesinde ölçümlerle değerlendirilir; kesinlik (kaç işaretli öğenin doğru olduğu) ve hatırlama (kaç gerçek vakanın yakalandığı) önemlidir ve F1 puanı bu ikisini dengeler. Bir kategorinin hakim olduğu sınıf dengesizliği yaygın bir tuzaktır.

Teknik Bilgi

Tipik bir işlem hattı, metni BERT gibi bir modelle yoğun bir vektöre kodlar ve ardından onu sınıf başına bir puan veren son katmandan geçirir. Softmax, puanları tek etiketli görevler için olasılıklara dönüştürürken, etiket başına sigmoid, kategorilerin bağımsız olduğu çok etiketli görevleri yönetir. Büyük dil modellerinde, aynı görev, kategorileri bir komut isteminde basitçe tanımlayarak, etiketli bir eğitim seti gerektirmeden, esneklik ve kurulum hızı için bir miktar doğruluk ve tutarlılıktan ödün vererek sıfır atışla yapılabilir.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Metin Sınıflandırmanın Geleceği

Büyük dil modelleriyle sıfır atışlı ve az atışlı sınıflandırma, binlerce örneği elle etiketleme ihtiyacını azaltarak ekiplerin kısa bir açıklamadan yeni sınıflandırıcılar oluşturmasına olanak tanıyor. Bir LLM'nin, üretim için daha küçük, daha ucuz, daha hızlı bir uzman modeli eğiten etiketleri önyüklediği daha fazla hibrit kurulum bekleyebilirsiniz. Açıklanabilirliğin önemi artıyor, özellikle içerik denetimi ve özgeçmiş taraması gibi, bir etiketin neden atandığını bilmenin önemli olduğu hassas kullanımlar için. Spam gönderenlerin filtreleri atlatmak için farklı ifadeler kullanması gibi düşmanca veya değişken dile karşı dayanıklılık, aktif bir odak noktası olmaya devam ediyor.

Gerçek Dünya Uygulaması

E-posta sağlayıcıları spam ve kimlik avı mesajlarını gelen kutunuzdan filtreler.

Markalar, müşteri ruh halini ölçmek için ürün incelemeleri ve sosyal paylaşımlar üzerinde duyarlılık analizi yapıyor.

Destek masaları, mesaj içeriğine göre gelen biletleri otomatik olarak doğru ekibe yönlendirir.

Sosyal platformlar, nefret söylemini veya zararlı yorumları denetleme incelemesi için işaretliyor.

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text Classification quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Metin Gömmeleri

Sık sorulan sorular

What is Text Classification?

Metin sınıflandırma, bir e-postayı spam olarak veya bir incelemeyi olumlu olarak etiketlemek gibi metin parçalarını otomatik olarak kategorilere ayırır. En yaygın kullanılan NLP görevlerinden biridir çünkü dağınık serbest metni, sistemin üzerinde işlem yapabileceği yapılandırılmış etiketlere dönüştürür.

Metin sınıflandırmanın amacı nedir?

Metin sınıflandırması, bir metin parçasına bir veya daha fazla kategori etiketi atayarak serbest metni yapılandırılmış çıktıya dönüştürür.

Hangi senaryo çoklu etiket sınıflandırmasına örnektir?

Çoklu etiket sınıflandırması, aynı öğeye aynı anda birden fazla kategorinin uygulanmasına olanak sağlar.

Neden düz doğruluk genellikle metin sınıflandırması için yanıltıcı bir ölçümdür?

Bir sınıf hakim olduğunda, her zaman o sınıfın yararlı hiçbir şey yakalayamadan yüksek doğruluk sağlayacağını tahmin etmek, dolayısıyla hassasiyet, geri çağırma ve F1'e ihtiyaç duyulur.

Bir sınıflandırma görevinde hatırlama neyi ölçer?

Geri çağırma, sistemin doğru şekilde tanımladığı, ne kadarını kaçırdığını yakalayan gerçek pozitif vakaların oranıdır.

'Sıfır atış' metin sınıflandırması ne anlama geliyor?

Sıfır atış sınıflandırması, büyük bir dil modelinin, etiketli bir eğitim seti olmadan yalnızca onları açıklayan bir bilgi isteminden kategoriler atamasına olanak tanır.