Модели TF-IDF и Bag-of-Words
Bag-of-words превръща текста в преброяване на думи, като игнорира реда, а TF-IDF претегля тези преброявания, така че редките, отличителни думи са по-важни от обичайните.
Преглед
Together they were the workhorses of search and text classification before deep learning.
Дълбоко гмуркане
Моделът на чантата с думи (BoW) представя документ като вектор от преброяване на думи, отхвърляйки граматиката и словореда: „кучето ухапа човека“ и „човекът ухапа кучето“ изглеждат идентични. Тази простота работи изненадващо добре за много задачи. TF-IDF прецизира BoW, като претегля термините. Честотата на термините (TF) измерва колко често се появява дума в документ, докато обратната честота на документа (IDF) намалява думите, които се появяват в много документи. Умножаването им дава високи резултати на думи, които са чести в един документ, но рядко срещани в колекцията, като отличителна ключова дума за тема, докато общи думи като „the“ получават почти нулева тежест. TF-IDF вектори захранват класирането при търсене по ключови думи и захранват класически класификатори като Naive Bayes и SVM.
Техническа информация
IDF обикновено се изчислява като log(N / df), където N е общият брой документи, а df е броят на документите, съдържащи термина, така че една дума във всеки документ дава IDF близо до нула. Крайният TF-IDF резултат е TF, умножен по IDF. Векторите на документи обикновено са L2-нормализирани и се сравняват с косинусово сходство, което измерва ъгъла между векторите и игнорира разликите в дължината на документа.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на моделите TF-IDF и Bag-of-Words
Плътните невронни вграждания и трансформиращите модели сега улавят реда на думите и означават, че BoW и TF-IDF не могат, така че дълбоките модели доминират в най-съвременното НЛП. И все пак TF-IDF остава бърза, интерпретируема базова линия с малко ресурси, която е трудно да се победи за търсене по ключови думи, и все още е в основата на хибридни системи за извличане, където оскъдни TF-IDF/BM25 резултати се комбинират с плътни вграждания, за да се подобри търсенето и разширеното генериране на извличане.
Внедряване в реалния свят
Търсачките класират документи от TF-IDF или неговия наследник BM25 спрямо заявка
Филтри за нежелана поща, използвайки функции за пакет от думи, въведени в Naive Bayes класификатор
Извличане на ключови думи или етикети от статия чрез избиране на нейните най-високи TF-IDF условия
Препоръчване на подобни новинарски статии чрез сравняване на TF-IDF вектори с косинусово сходство
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the TF-IDF and Bag-of-Words Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Вграждане на думи
Frequently asked questions
What is TF-IDF and Bag-of-Words Models?
Bag-of-words превръща текста в преброяване на думи, като игнорира реда, а TF-IDF претегля тези преброявания, така че редките, отличителни думи са по-важни от обичайните. Заедно те бяха работните коне на търсенето и класифицирането на текст преди дълбокото обучение.
Каква ключова информация отхвърля моделът с думи?
Bag-of-words поддържа броя на думите, но изхвърля словореда и граматическата структура.
Какво прави IDF частта на TF-IDF?
Обратната честота на документа намалява тежестта на термините, които се появяват в много документи, така че често срещаните думи като „the“ допринасят малко.
Дума, която се появява във всеки документ в колекцията, получава IDF стойност, близка до какво?
При IDF = log(N/df), ако df е равно на N, съотношението е 1 и log(1) е 0, което не дава на члена почти никаква тежест.
Как се изчислява TF-IDF оценка за термин?
Теглото на TF-IDF е честотата на термина, умножена по обратната честота на документа.
Коя мярка за сходство обикновено се използва за сравняване на вектори на документи TF-IDF?
Косинусното сходство измерва ъгъла между векторите и е стандартно за сравняване на TF-IDF представяния, независимо от дължината на документа.