คู่มือ AI ภาษา

TF-IDF และโมเดล Bag-of-Words

Bag-of-Words เปลี่ยนข้อความเป็นการนับจำนวนคำโดยไม่เรียงลำดับ และ TF-IDF จะชั่งน้ำหนักคำที่หายากและโดดเด่นมีความสำคัญมากกว่าคำทั่วไป

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Together they were the workhorses of search and text classification before deep learning.

เจาะลึก

โมเดลแบบถุงคำ (BoW) นำเสนอเอกสารในรูปแบบเวกเตอร์ของการนับจำนวนคำ โดยละทิ้งไวยากรณ์และลำดับคำ: 'สุนัขกัดคน' และ 'ผู้ชายกัดสุนัข' มีลักษณะเหมือนกัน ความเรียบง่ายนี้ทำงานได้ดีอย่างน่าประหลาดใจสำหรับงานหลายอย่าง TF-IDF ปรับแต่ง BoW ด้วยการปรับน้ำหนักเงื่อนไขใหม่ ความถี่ของคำ (TF) จะวัดความถี่ที่คำปรากฏในเอกสาร ในขณะที่ความถี่ของเอกสารผกผัน (IDF) จะลดน้ำหนักคำที่ปรากฏในเอกสารจำนวนมาก การคูณจะทำให้ได้คะแนนสูงสำหรับคำที่ใช้บ่อยในเอกสารเดียวแต่พบไม่บ่อยในคอลเลคชัน เช่น คีย์เวิร์ดหัวข้อที่โดดเด่น ในขณะที่คำทั่วไป เช่น 'the' จะมีน้ำหนักเกือบเป็นศูนย์ เวกเตอร์ TF-IDF ขับเคลื่อนการจัดอันดับการค้นหาคำหลัก และป้อนตัวแยกประเภทแบบคลาสสิก เช่น Naive Bayes และ SVM

ข้อมูลเชิงลึกทางเทคนิค

โดยทั่วไป IDF จะคำนวณเป็น log (N / df) โดยที่ N คือจำนวนเอกสารทั้งหมด และ df คือจำนวนเอกสารที่มีคำนั้น ดังนั้นคำในเอกสารทุกฉบับจะทำให้ IDF ใกล้ศูนย์ คะแนน TF-IDF สุดท้ายคือ TF คูณด้วย IDF เวกเตอร์เอกสารมักจะถูกทำให้เป็นมาตรฐาน L2 และเปรียบเทียบกับความคล้ายคลึงของโคไซน์ ซึ่งวัดมุมระหว่างเวกเตอร์และละเว้นความแตกต่างของความยาวของเอกสาร

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของโมเดล TF-IDF และ Bag-of-Words

การฝังประสาทแบบหนาแน่นและโมเดลหม้อแปลงในขณะนี้จับลำดับคำและหมายความว่า BoW และ TF-IDF ไม่สามารถทำได้ ดังนั้นโมเดลเชิงลึกจึงครอง NLP ที่ล้ำสมัย อย่างไรก็ตาม TF-IDF ยังคงเป็นเส้นฐานที่รวดเร็ว ตีความได้ และมีทรัพยากรต่ำ ซึ่งยากจะหาใครเทียบได้สำหรับการค้นหาคำหลัก และยังคงสนับสนุนระบบการดึงข้อมูลแบบไฮบริด โดยที่คะแนน TF-IDF/BM25 แบบกระจัดกระจายถูกรวมเข้ากับการฝังที่หนาแน่นเพื่อปรับปรุงการค้นหาและการสร้างเสริมการเรียกค้น

การใช้งานจริงในโลกแห่งความเป็นจริง

เครื่องมือค้นหาจัดอันดับเอกสารตาม TF-IDF หรือ BM25 ที่สืบทอดต่อจากข้อความค้นหา

ตัวกรองสแปมโดยใช้คุณลักษณะถุงคำที่ป้อนเข้าไปในตัวแยกประเภท Naive Bayes

แยกคำหลักหรือแท็กออกจากบทความโดยเลือกคำศัพท์ TF-IDF ที่สูงที่สุด

แนะนำบทความข่าวที่คล้ายกันโดยการเปรียบเทียบเวกเตอร์ TF-IDF กับความคล้ายคลึงโคไซน์

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TF-IDF and Bag-of-Words Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is TF-IDF and Bag-of-Words Models?

Bag-of-Words เปลี่ยนข้อความเป็นการนับจำนวนคำโดยไม่เรียงลำดับ และ TF-IDF จะชั่งน้ำหนักคำที่หายากและโดดเด่นมีความสำคัญมากกว่าคำทั่วไป พวกเขาช่วยกันทำงานด้านการค้นหาและการจัดหมวดหมู่ข้อความก่อนการเรียนรู้เชิงลึก

ข้อมูลสำคัญใดที่โมเดลแบบถุงคำละทิ้งไป

Bag-of-words เก็บจำนวนคำแต่ละทิ้งลำดับคำและโครงสร้างไวยากรณ์

ส่วน IDF ของ TF-IDF ทำหน้าที่อะไร

ความถี่ของเอกสารผกผันจะลดน้ำหนักของคำศัพท์ที่ปรากฏในเอกสารจำนวนมาก ดังนั้นคำทั่วไปเช่น 'the' มีส่วนช่วยเพียงเล็กน้อย

คำที่ปรากฏในทุกเอกสารในคอลเลกชันจะได้ค่า IDF ใกล้เคียงกับข้อใด

ด้วย IDF = log(N/df) ถ้า df เท่ากับ N อัตราส่วนจะเป็น 1 และ log(1) เท่ากับ 0 ทำให้พจน์แทบไม่มีน้ำหนักเลย

คะแนน TF-IDF สำหรับภาคเรียนคำนวณอย่างไร

น้ำหนัก TF-IDF คือความถี่ของคำคูณด้วยความถี่ของเอกสารผกผัน

การวัดความคล้ายคลึงกันแบบใดที่มักใช้เพื่อเปรียบเทียบเวกเตอร์เอกสาร TF-IDF

ความคล้ายคลึงของโคไซน์จะวัดมุมระหว่างเวกเตอร์และเป็นมาตรฐานสำหรับการเปรียบเทียบการแสดง TF-IDF โดยไม่คำนึงถึงความยาวของเอกสาร