Nyelvi AI ÚTMUTATÓ

TF-IDF és Bag-of-Words modellek

A zsák-szavak a szöveget szószámokká alakítják, figyelmen kívül hagyva a sorrendet, a TF-IDF pedig súlyozza ezeket a számokat, így a ritka, megkülönböztető szavak többet számítanak, mint a gyakoriak.

2 perc olvasásUtoljára frissítve

Áttekintés

Together they were the workhorses of search and text classification before deep learning.

Mély merülés

A zsákos szavak (BoW) modell egy dokumentumot a szavak számának vektoraként ábrázol, elvetve a nyelvtant és a szórendet: „a kutya megharapta az embert” és „az ember megharapta a kutyát” azonosnak tűnik. Ez az egyszerűség meglepően jól működik számos feladatnál. A TF-IDF a kifejezések újrasúlyozásával finomítja a BoW-t. A kifejezés gyakorisága (TF) azt méri, hogy egy szó milyen gyakran jelenik meg egy dokumentumban, míg az Inverz dokumentumgyakoriság (IDF) csökkenti a sok dokumentumban előforduló szavak súlyozását. Szorzásuk magas pontszámot ad azoknak a szavaknak, amelyek gyakran előfordulnak egy dokumentumban, de ritkák a gyűjteményben, például egy jellegzetes témakulcsszóként, míg az olyan gyakori szavak, mint a „the” közel nulla súlyt kapnak. A TF-IDF vektorok kulcsszavas keresési rangsorolást biztosítanak, és olyan klasszikus osztályozókat táplálnak, mint a Naive Bayes és az SVM.

Technikai betekintés

Az IDF-et általában log(N / df)ként számítják ki, ahol N a dokumentumok teljes száma, df pedig a kifejezést tartalmazó dokumentumok száma, tehát minden dokumentumban egy szó nullához közeli IDF-et eredményez. A végső TF-IDF pontszám a TF szorozva IDF-fel. A dokumentumvektorokat általában L2-normalizálják, és a koszinusz hasonlósággal hasonlítják össze, amely a vektorok közötti szöget méri, és figyelmen kívül hagyja a dokumentumhossz-különbségeket.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A TF-IDF és a Bag-of-Words modellek jövője

A sűrű neurális beágyazások és a transzformátormodellek most olyan szórendet és jelentést rögzítenek, amelyet a BoW és a TF-IDF nem képes, így a mély modellek uralják az élvonalbeli NLP-t. Ennek ellenére a TF-IDF továbbra is gyors, értelmezhető, alacsony erőforrás-igényű alapvonal, amelyet nehéz felülmúlni a kulcsszavas keresésnél, és továbbra is a hibrid visszakeresési rendszerek alapját képezi, ahol a ritka TF-IDF/BM25 pontszámokat sűrű beágyazásokkal kombinálják a keresés és a visszakereséssel kiegészített generálás javítása érdekében.

Valós megvalósítás

A keresőmotorok a TF-IDF vagy utódja, a BM25 alapján rangsorolják a dokumentumokat egy lekérdezés alapján

A levélszemétszűrők a Naive Bayes osztályozóba betáplált zsákos szavakat használnak

Kulcsszavak vagy címkék kinyerése egy cikkből a legmagasabb TF-IDF kifejezések kiválasztásával

Hasonló hírcikkek ajánlása a TF-IDF vektorok koszinuszos hasonlósággal való összehasonlításával

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TF-IDF and Bag-of-Words Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is TF-IDF and Bag-of-Words Models?

A zsák-szavak a szöveget szószámokká alakítják, figyelmen kívül hagyva a sorrendet, a TF-IDF pedig súlyozza ezeket a számokat, így a ritka, megkülönböztető szavak többet számítanak, mint a gyakoriak. Együtt a keresés és a szövegosztályozás igáslovai voltak a mély tanulás előtt.

Milyen kulcsfontosságú információkat dob ​​el egy zsák-szavas modell?

A Bag-of-words megtartja a szavak számát, de elveti a szórendet és a nyelvtani szerkezetet.

Mit csinál a TF-IDF IDF része?

Az inverz dokumentumgyakoriság csökkenti a sok dokumentumban előforduló kifejezések súlyát, így az olyan gyakori szavak, mint a „the” kevéssé járulnak hozzá.

Mihez közeli IDF-értéket kap egy szó, amely a gyűjtemény minden dokumentumában megjelenik?

Ha IDF = log(N/df), ha df egyenlő N, akkor az arány 1, a log(1) pedig 0, így a kifejezésnek szinte nincs súlya.

Hogyan számítható ki egy kifejezés TF-IDF pontszáma?

A TF-IDF súlya a gyakoriság kifejezés szorozva a dokumentum inverz gyakoriságával.

Melyik hasonlósági mértéket használják általában a TF-IDF dokumentumvektorok összehasonlítására?

A koszinusz hasonlóság a vektorok közötti szöget méri, és szabványos a TF-IDF ábrázolások összehasonlításához, függetlenül a dokumentum hosszától.