คู่มือ AI ภาษา

การจำแนกข้อความ

การจัดหมวดหมู่ข้อความจะจัดเรียงข้อความเป็นหมวดหมู่โดยอัตโนมัติ เช่น การแท็กอีเมลว่าเป็นสแปมหรือบทวิจารณ์ว่าเป็นเชิงบวก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It is one of the most widely deployed NLP tasks because it turns messy free text into structured labels a system can act on.

เจาะลึก

การจำแนกประเภทครอบคลุมหลายรูปทรง การจำแนกประเภทไบนารีเลือกหนึ่งในสองป้ายกำกับ (สแปมหรือไม่ใช่สแปม) หลายคลาสจะกำหนดป้ายกำกับเดียวจากหลายตัวเลือก (การกำหนดเส้นทางตั๋วไปยังการเรียกเก็บเงิน การขาย หรือการสนับสนุน) Multi-label อนุญาตให้ใช้ป้ายกำกับหลายรายการพร้อมกัน (บทความที่มีแท็กทั้ง 'การเมือง' และ 'เศรษฐกิจ') การวิเคราะห์ความรู้สึก การติดป้ายกำกับหัวข้อ การตรวจจับเจตนา และการกรองความเป็นพิษ ล้วนเป็นงานจำแนกประเภท ระบบสมัยใหม่แปลงข้อความเป็นการฝังตัวเลขที่จับความหมาย จากนั้นตัวแยกประเภทจะจับคู่คุณลักษณะเหล่านั้นกับป้ายกำกับความน่าจะเป็น ประสิทธิภาพจะถูกตัดสินด้วยหน่วยเมตริกที่เกินกว่าความแม่นยำปกติ เนื่องจากข้อมูลจริงมักจะไม่สมดุล ความแม่นยำ (จำนวนรายการที่ถูกตั้งค่าสถานะถูกต้อง) และการเรียกคืน (จำนวนกรณีจริงที่ถูกจับได้) มีความสำคัญ และคะแนน F1 จะทำให้ทั้งสองสมดุลกัน ความไม่สมดุลของชั้นเรียนซึ่งมีหมวดหมู่หนึ่งครอบงำ ถือเป็นข้อผิดพลาดทั่วไป

ข้อมูลเชิงลึกทางเทคนิค

ไปป์ไลน์ทั่วไปจะเข้ารหัสข้อความด้วยโมเดลอย่าง BERT ให้เป็นเวกเตอร์หนาแน่น จากนั้นส่งผ่านเลเยอร์สุดท้ายที่ให้ผลลัพธ์เป็นคะแนนต่อคลาส softmax เปลี่ยนคะแนนเป็นความน่าจะเป็นสำหรับงานที่มีป้ายกำกับเดียว ในขณะที่ sigmoid ต่อป้ายกำกับจะจัดการงานที่มีหลายป้ายกำกับโดยที่หมวดหมู่ไม่เป็นอิสระ ด้วยโมเดลภาษาขนาดใหญ่ งานเดียวกันนี้สามารถทำได้โดยไม่ต้องเสียเวลาเพียงแค่อธิบายหมวดหมู่ในทันที โดยไม่ต้องใช้ชุดการฝึกอบรมที่มีป้ายกำกับ แลกเปลี่ยนความแม่นยำและความสม่ำเสมอบางส่วนเพื่อความยืดหยุ่นและความรวดเร็วในการตั้งค่า

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการจำแนกข้อความ

การจัดหมวดหมู่แบบ Zero-shot และไม่กี่ช็อตด้วยโมเดลภาษาขนาดใหญ่ช่วยลดความจำเป็นในการติดป้ายกำกับตัวอย่างนับพันรายการด้วยมือ ทำให้ทีมสามารถแยกตัวแยกประเภทใหม่จากคำอธิบายสั้นๆ ได้ คาดว่าจะมีการตั้งค่าแบบไฮบริดมากขึ้น โดยที่ LLM จะติดป้ายกำกับที่ฝึกโมเดลผู้เชี่ยวชาญที่เล็กกว่า ราคาถูกกว่า และเร็วกว่าสำหรับการผลิต ความสามารถในการอธิบายมีความสำคัญเพิ่มมากขึ้น โดยเฉพาะอย่างยิ่งสำหรับการใช้งานที่มีความละเอียดอ่อน เช่น การกลั่นกรองเนื้อหาและการคัดกรองต่อ โดยที่การรู้ว่าเหตุใดจึงกำหนดป้ายกำกับจึงมีความสำคัญ ความเข้มแข็งต่อปฏิปักษ์หรือภาษาที่เปลี่ยนแปลง เช่น ผู้ส่งอีเมลขยะที่ใช้ถ้อยคำซ้ำๆ เพื่อหลบตัวกรอง ยังคงเป็นประเด็นสำคัญ

การใช้งานจริงในโลกแห่งความเป็นจริง

ผู้ให้บริการอีเมลกรองข้อความสแปมและฟิชชิ่งออกจากกล่องจดหมายของคุณ

แบรนด์ดำเนินการวิเคราะห์ความรู้สึกในการรีวิวผลิตภัณฑ์และโพสต์โซเชียลเพื่อวัดอารมณ์ของลูกค้า

โต๊ะสนับสนุนกำหนดเส้นทางตั๋วขาเข้าอัตโนมัติไปยังทีมที่เหมาะสมตามเนื้อหาข้อความ

แพลตฟอร์มโซเชียลที่ทำเครื่องหมายคำพูดแสดงความเกลียดชังหรือความคิดเห็นที่เป็นพิษเพื่อการตรวจสอบการกลั่นกรอง

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text Classification quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Text Classification?

การจัดหมวดหมู่ข้อความจะจัดเรียงข้อความเป็นหมวดหมู่โดยอัตโนมัติ เช่น การแท็กอีเมลว่าเป็นสแปมหรือบทวิจารณ์ว่าเป็นเชิงบวก นี่เป็นหนึ่งในงาน NLP ที่มีการปรับใช้กันอย่างแพร่หลายมากที่สุด เนื่องจากจะเปลี่ยนข้อความที่ไม่ยุ่งเหยิงให้เป็นป้ายกำกับที่มีโครงสร้างซึ่งระบบสามารถดำเนินการได้

เป้าหมายของการจัดหมวดหมู่ข้อความคืออะไร?

การจัดหมวดหมู่ข้อความจะกำหนดป้ายกำกับหมวดหมู่ตั้งแต่หนึ่งรายการขึ้นไปให้กับข้อความชิ้นหนึ่ง โดยเปลี่ยนข้อความอิสระให้เป็นเอาต์พุตที่มีโครงสร้าง

สถานการณ์ใดเป็นตัวอย่างของการจำแนกประเภทหลายป้ายกำกับ

การจำแนกประเภทหลายป้ายกำกับช่วยให้สามารถนำไปใช้กับรายการเดียวกันได้มากกว่าหนึ่งหมวดหมู่พร้อมกัน

เหตุใดความแม่นยำธรรมดาจึงมักเป็นตัวชี้วัดที่ทำให้เข้าใจผิดในการจัดประเภทข้อความ

เมื่อคลาสหนึ่งมีอิทธิพลเหนือ การคาดการณ์เสมอว่าคลาสนั้นจะให้ความแม่นยำสูงโดยที่ไม่มีประโยชน์อะไรเลย ดังนั้นจึงจำเป็นต้องมีความแม่นยำ การเรียกคืน และ F1

การเรียกคืนใช้วัดอะไรในงานจำแนกประเภท?

การเรียกคืนคือเศษส่วนของกรณีที่เป็นบวกจริงที่ระบบระบุอย่างถูกต้อง โดยบันทึกจำนวนที่พลาดไป

การจัดประเภทข้อความแบบ 'zero-shot' หมายถึงอะไร

การจัดหมวดหมู่แบบ Zero-shot ช่วยให้โมเดลภาษาขนาดใหญ่สามารถกำหนดหมวดหมู่ได้จากพรอมต์ที่อธิบาย โดยไม่ต้องมีชุดการฝึกอบรมที่มีป้ายกำกับ