ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Μοντέλα TF-IDF και Bag-of-Words

Η συλλογή λέξεων μετατρέπει το κείμενο σε πλήθος λέξεων αγνοώντας τη σειρά και το TF-IDF σταθμίζει αυτές τις μετρήσεις τόσο σπάνιες, διακριτικές λέξεις έχουν μεγαλύτερη σημασία από τις κοινές.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Together they were the workhorses of search and text classification before deep learning.

Βαθιά κατάδυση

Ένα μοντέλο τσάντας λέξεων (BoW) αντιπροσωπεύει ένα έγγραφο ως διάνυσμα πλήθους λέξεων, απορρίπτοντας τη γραμματική και τη σειρά λέξεων: «ο σκύλος δάγκωσε τον άντρα» και «ο άνθρωπος δάγκωσε τον σκύλο» φαίνονται πανομοιότυπα. Αυτή η απλότητα λειτουργεί εκπληκτικά καλά για πολλές εργασίες. Το TF-IDF βελτιώνει το BoW επανασταθμίζοντας τους όρους. Η Συχνότητα Όρων (TF) μετρά πόσο συχνά μια λέξη εμφανίζεται σε ένα έγγραφο, ενώ η Συχνότητα Αντίστροφου Εγγράφου (IDF) μειώνει το βάρος των λέξεων που εμφανίζονται σε πολλά έγγραφα. Ο πολλαπλασιασμός τους δίνει υψηλές βαθμολογίες σε λέξεις που είναι συχνές σε ένα έγγραφο, αλλά σπάνιες σε όλη τη συλλογή, όπως μια λέξη-κλειδί χαρακτηριστικού θέματος, ενώ οι κοινές λέξεις όπως «το» έχουν σχεδόν μηδενικό βάρος. Τα διανύσματα TF-IDF ενεργοποιούν την κατάταξη αναζήτησης λέξεων-κλειδιών και τροφοδοτούν κλασικούς ταξινομητές όπως οι Naive Bayes και τα SVM.

Τεχνική διορατικότητα

Το IDF συνήθως υπολογίζεται ως log(N / df), όπου N είναι ο συνολικός αριθμός των εγγράφων και df είναι ο αριθμός των εγγράφων που περιέχουν τον όρο, επομένως μια λέξη σε κάθε έγγραφο αποδίδει ένα IDF κοντά στο μηδέν. Η τελική βαθμολογία TF-IDF είναι TF πολλαπλασιασμένη επί IDF. Τα διανύσματα εγγράφων συνήθως κανονικοποιούνται με L2 και συγκρίνονται με την ομοιότητα συνημιτόνου, η οποία μετρά τη γωνία μεταξύ των διανυσμάτων και αγνοεί τις διαφορές μήκους εγγράφου.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Το μέλλον των μοντέλων TF-IDF και Bag-of-Words

Οι πυκνές νευρικές ενσωματώσεις και τα μοντέλα μετασχηματιστών καταγράφουν τώρα τη σειρά λέξεων και το νόημα που δεν μπορούν να κάνουν το BoW και το TF-IDF, επομένως τα βαθιά μοντέλα κυριαρχούν στο NLP αιχμής. Ωστόσο, το TF-IDF παραμένει μια γρήγορη, ερμηνεύσιμη γραμμή βάσης χαμηλών πόρων που είναι δύσκολο να ξεπεραστεί για την αναζήτηση λέξεων-κλειδιών και εξακολουθεί να στηρίζει τα υβριδικά συστήματα ανάκτησης όπου οι αραιές βαθμολογίες TF-IDF/BM25 συνδυάζονται με πυκνές ενσωματώσεις για τη βελτίωση της αναζήτησης και της επαυξημένης παραγωγής ανάκτησης.

Υλοποίηση σε πραγματικό κόσμο

Οι μηχανές αναζήτησης ταξινομούν έγγραφα από το TF-IDF ή το διάδοχό του BM25 σε σχέση με ένα ερώτημα

Τα φίλτρα ανεπιθύμητης αλληλογραφίας που χρησιμοποιούν λειτουργίες τσάντας λέξεων τροφοδοτούνται σε έναν ταξινομητή Naive Bayes

Εξαγωγή λέξεων-κλειδιών ή ετικετών από ένα άρθρο επιλέγοντας τους υψηλότερους όρους TF-IDF

Πρόταση παρόμοιων άρθρων ειδήσεων συγκρίνοντας διανύσματα TF-IDF με ομοιότητα συνημιτόνου

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TF-IDF and Bag-of-Words Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

What is TF-IDF and Bag-of-Words Models?

Η συλλογή λέξεων μετατρέπει το κείμενο σε πλήθος λέξεων αγνοώντας τη σειρά και το TF-IDF σταθμίζει αυτές τις μετρήσεις τόσο σπάνιες, διακριτικές λέξεις έχουν μεγαλύτερη σημασία από τις κοινές. Μαζί ήταν οι εργάτες της αναζήτησης και της ταξινόμησης κειμένων πριν από τη βαθιά μάθηση.

Ποιες βασικές πληροφορίες απορρίπτει ένα μοντέλο τσάντας λέξεων;

Η συλλογή λέξεων διατηρεί τον αριθμό των λέξεων, αλλά απορρίπτει τη σειρά των λέξεων και τη γραμματική δομή.

Τι κάνει το τμήμα IDF του TF-IDF;

Η Αντίστροφη Συχνότητα Εγγράφων μειώνει το βάρος των όρων που εμφανίζονται σε πολλά έγγραφα, επομένως κοινές λέξεις όπως «το» συμβάλλουν ελάχιστα.

Μια λέξη που εμφανίζεται σε κάθε έγγραφο της συλλογής λαμβάνει μια τιμή IDF κοντά σε τι;

Με IDF = log(N/df), αν το df ισούται με N, ο λόγος είναι 1 και το log(1) είναι 0, δίνοντας στον όρο σχεδόν καθόλου βάρος.

Πώς υπολογίζεται μια βαθμολογία TF-IDF για έναν όρο;

Το βάρος TF-IDF είναι ο όρος συχνότητα πολλαπλασιαζόμενος με την αντίστροφη συχνότητα εγγράφου.

Ποιο μέτρο ομοιότητας χρησιμοποιείται συνήθως για τη σύγκριση διανυσμάτων εγγράφων TF-IDF;

Η ομοιότητα συνημιτόνου μετρά τη γωνία μεταξύ των διανυσμάτων και είναι τυπική για τη σύγκριση αναπαραστάσεων TF-IDF ανεξάρτητα από το μήκος του εγγράφου.