PANDUAN AI Bahasa

Model TF-IDF dan Bag-of-Words

Bag-of-words mengubah teks menjadi jumlah kata dengan mengabaikan urutan, dan TF-IDF memberi bobot pada jumlah kata tersebut sangat jarang, kata-kata yang berbeda lebih penting daripada kata-kata biasa.

2 min readTerakhir diperbarui

Ikhtisar

Together they were the workhorses of search and text classification before deep learning.

Menyelam Lebih Dalam

Model bag-of-words (BoW) merepresentasikan dokumen sebagai vektor jumlah kata, membuang tata bahasa dan urutan kata: 'the dog bit the man' dan 'the man bit the dog' terlihat identik. Kesederhanaan ini ternyata bekerja dengan sangat baik untuk banyak tugas. TF-IDF menyempurnakan BoW dengan menimbang ulang persyaratan. Term Frekuensi (TF) mengukur seberapa sering sebuah kata muncul dalam dokumen, sedangkan Inverse Document Frekuensi (IDF) menurunkan bobot kata-kata yang muncul di banyak dokumen. Mengalikannya akan memberikan skor tinggi pada kata-kata yang sering muncul dalam satu dokumen namun jarang ditemukan di seluruh koleksi, seperti kata kunci topik tertentu, sedangkan kata-kata umum seperti 'the' mendapatkan bobot mendekati nol. Vektor TF-IDF memperkuat peringkat pencarian kata kunci dan memberi pengklasifikasi klasik seperti Naive Bayes dan SVM.

Wawasan Teknis

IDF biasanya dihitung sebagai log(N / df), di mana N adalah jumlah total dokumen dan df adalah jumlah dokumen yang mengandung istilah tersebut, sehingga sebuah kata di setiap dokumen menghasilkan IDF mendekati nol. Skor akhir TF-IDF adalah TF dikalikan IDF. Vektor dokumen biasanya dinormalisasi L2 dan dibandingkan dengan kesamaan kosinus, yang mengukur sudut antar vektor dan mengabaikan perbedaan panjang dokumen.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Model TF-IDF dan Bag-of-Words

Penyematan saraf padat dan model transformator kini menangkap urutan kata dan makna yang tidak bisa dilakukan oleh BoW dan TF-IDF, sehingga model mendalam mendominasi NLP mutakhir. Namun TF-IDF tetap merupakan garis dasar yang cepat, dapat ditafsirkan, dan sumber daya rendah yang sulit dikalahkan dalam penelusuran kata kunci, dan masih mendukung sistem pengambilan hibrid di mana skor TF-IDF/BM25 yang jarang digabungkan dengan penyematan yang padat untuk meningkatkan penelusuran dan pembuatan augmented pengambilan.

Implementasi Dunia Nyata

Mesin pencari memberi peringkat dokumen berdasarkan TF-IDF atau penggantinya BM25 berdasarkan kueri

Filter spam menggunakan fitur kumpulan kata yang dimasukkan ke dalam pengklasifikasi Naive Bayes

Mengekstrak kata kunci atau tag dari sebuah artikel dengan memilih istilah TF-IDF tertinggi

Merekomendasikan artikel berita serupa dengan membandingkan vektor TF-IDF dengan kesamaan kosinus

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TF-IDF and Bag-of-Words Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Penyematan Kata

Pertanyaan yang sering diajukan

What is TF-IDF and Bag-of-Words Models?

Bag-of-words mengubah teks menjadi jumlah kata dengan mengabaikan urutan, dan TF-IDF memberi bobot pada jumlah kata tersebut sangat jarang, kata-kata yang berbeda lebih penting daripada kata-kata biasa. Bersama-sama, mereka adalah pekerja keras dalam penelusuran dan klasifikasi teks sebelum pembelajaran mendalam.

Informasi penting apa yang dibuang oleh model sekumpulan kata?

Bag-of-words menghitung jumlah kata tetapi membuang urutan kata dan struktur tata bahasa.

Apa yang dilakukan bagian IDF dari TF-IDF?

Frekuensi Dokumen Terbalik mengurangi bobot istilah yang muncul di banyak dokumen, sehingga kata-kata umum seperti 'the' hanya memberikan kontribusi yang kecil.

Sebuah kata yang muncul di setiap dokumen dalam koleksi mendapat nilai IDF mendekati apa?

Dengan IDF = log(N/df), jika df sama dengan N rasionya adalah 1 dan log(1) adalah 0, sehingga istilah tersebut hampir tidak memiliki bobot.

Bagaimana cara menghitung skor TF-IDF untuk suatu istilah?

Bobot TF-IDF adalah frekuensi term dikalikan dengan frekuensi invers dokumen.

Ukuran kesamaan manakah yang biasa digunakan untuk membandingkan vektor dokumen TF-IDF?

Kesamaan kosinus mengukur sudut antar vektor dan merupakan standar untuk membandingkan representasi TF-IDF terlepas dari panjang dokumen.