คู่มือ AI ภาษา

การแท็กส่วนหนึ่งของคำพูด

การแท็กส่วนของคำพูด (POS) จะติดป้ายกำกับแต่ละคำในประโยคโดยมีบทบาททางไวยากรณ์ เช่น คำนาม กริยา หรือคำคุณศัพท์

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

นี่เป็นขั้นตอนพื้นฐานของ NLP ที่ช่วยให้เครื่องจักรเข้าใจโครงสร้างประโยคและแก้ไขคําที่มีความหมายต่างกันในบริบทต่าง ๆ

เจาะลึก

หลายคำมีความคลุมเครือ: 'book' เป็นคำนามใน 'read a book' แต่คำกริยาใน 'book a flight' และ 'back' อาจเป็นคำนาม กริยา คำคุณศัพท์ หรือคำวิเศษณ์ การติดแท็ก POS ใช้บริบทโดยรอบเพื่อเลือกแท็กที่ถูกต้อง ซึ่งเป็นเหตุผลว่าทำไมบริบทจึงมีความสำคัญมาก ระบบภาษาอังกฤษมักใช้ชุดแท็กของ Penn Treebank ซึ่งมีแท็กโดยละเอียดประมาณ 36 แท็ก (NN สำหรับคำนามเอกพจน์ VBD สำหรับกริยากาลที่ผ่านมา JJ สำหรับคำคุณศัพท์ และอื่นๆ) ในขณะที่โครงการ Universal Dependencies กำหนดชุดที่เล็กกว่าและเป็นกลางทางภาษาประมาณ 17 แท็กสำหรับความสอดคล้องข้ามภาษา แท็ก POS ฟีดงานดาวน์สตรีม: ช่วยจดจำเอนทิตีที่มีชื่อ การแยกวิเคราะห์ และการดึงข้อมูล และช่วยให้เครื่องมือค้นหาและไวยากรณ์จัดการคำได้อย่างถูกต้อง การแท็กข้อความที่ชัดเจนอย่างถูกต้องในปัจจุบันเกิน 97% แม้ว่าข้อความที่ไม่เป็นทางการ คำสแลง และการสลับรหัสจะยังคงทำได้ยากกว่า

ข้อมูลเชิงลึกทางเทคนิค

แท็กเกอร์แบบคลาสสิกใช้โมเดลมาร์คอฟที่ซ่อนอยู่ โดยเลือกลำดับแท็กที่มีความน่าจะเป็นรวมสูงสุดของแต่ละแท็กที่กำหนดคำและกำหนดให้กับแท็กก่อนหน้า แท็กเกอร์ยุคใหม่ป้อนการฝังตามบริบทจากโมเดลอย่าง BERT ลงในตัวแยกประเภทที่ติดป้ายกำกับทุกโทเค็น ซึ่งมักจะมีเลเยอร์ที่บังคับใช้การเปลี่ยนแท็กที่สมเหตุสมผล เนื่องจากคำเดียวกันสามารถใช้แท็กต่างกันได้ โมเดลจึงต้องอ่านทั้งประโยค ไม่ใช่แต่ละคำแยกกัน ซึ่งเป็นสิ่งที่การฝังตามบริบทมีให้ทุกประการ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการแท็กบางส่วนของคำพูด

การติดแท็ก POS ที่ชัดเจนจะถูกดูดซึมเข้าสู่โมเดลที่ได้รับการฝึกล่วงหน้าขนาดใหญ่มากขึ้น ซึ่งจะเรียนรู้โครงสร้างไวยากรณ์โดยปริยาย ดังนั้นแท็กเกอร์แบบสแตนด์อโลนจึงไม่ค่อยเป็นศูนย์กลางสำหรับภาษาที่มีทรัพยากรสูง เช่น ภาษาอังกฤษ แต่การแท็ก POS ยังคงมีคุณค่าสำหรับภาษาที่มีทรัพยากรต่ำ การวิจัยทางภาษา และไปป์ไลน์ที่ไม่ซับซ้อนซึ่ง LLM เต็มรูปแบบนั้นต้องใช้ทรัพยากรมากเกินไป คาดหวังความคืบหน้าอย่างต่อเนื่องเกี่ยวกับข้อความโซเชียลมีเดียที่มีเสียงดัง การป้อนข้อมูลหลายภาษาและสลับรหัส และข้อความในอดีตหรือเฉพาะทาง เนื่องจากเป็น Building Block ที่รวดเร็วและตีความได้ การติดแท็ก POS จะยังคงเป็นส่วนหนึ่งของชุดเครื่องมือ NLP แม้ว่าโมเดลแบบ end-to-end จะควบคุมงานที่ฉูดฉาดกว่าก็ตาม

การใช้งานจริงในโลกแห่งความเป็นจริง

เครื่องตรวจสอบไวยากรณ์ใช้แท็กเพื่อระบุข้อผิดพลาด เช่น กริยาที่ต้องใช้คำนาม

เครื่องมือค้นหาที่แยกคำกริยา 'book' คำนามออกจาก 'book' เพื่อให้ได้ผลลัพธ์ที่ดีขึ้น

ไปป์ไลน์การจดจำเอนทิตีที่มีชื่อโดยใช้แท็ก POS เป็นคุณสมบัติในการค้นหาผู้คน สถานที่ และองค์กร

ระบบแปลงข้อความเป็นคำพูดโดยใช้แท็กเพื่อเลือกการออกเสียงที่ถูกต้องของคำที่แตกต่าง เช่น 'อ่าน' (ปัจจุบันกับอดีต)

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Part-of-Speech Tagging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ข้อความเป็นคำพูด

คำถามที่พบบ่อย

การติดแท็กแบบ Part-of-Voice คืออะไร?

การแท็กส่วนของคำพูด (POS) จะติดป้ายกำกับแต่ละคำในประโยคโดยมีบทบาททางไวยากรณ์ เช่น คำนาม กริยา หรือคำคุณศัพท์ เป็นขั้นตอนพื้นฐาน NLP ที่ช่วยให้เครื่องจักรเข้าใจโครงสร้างประโยคและแก้ไขคำที่มีความหมายต่างกันในบริบทที่ต่างกัน

การแท็กส่วนของคำพูดกำหนดอะไรให้กับแต่ละคำ

การแท็ก POS จะติดป้ายกำกับทุกคำด้วยหมวดหมู่ไวยากรณ์ เช่น คำนาม กริยา หรือคำคุณศัพท์

เหตุใดบริบทจึงจำเป็นสำหรับการติดแท็ก POS

คำเช่น 'book' อาจเป็นคำนามหรือคำกริยาได้ ดังนั้นจึงจำเป็นต้องใช้คำที่อยู่รอบๆ เพื่อเลือกแท็กที่ถูกต้อง

แท็กของ Penn Treebank คืออะไร

แท็กของ Penn Treebank คือคอลเลกชันมาตรฐานของแท็กแบบละเอียดประมาณ 36 แท็กที่ใช้สำหรับการติดแท็ก POS ภาษาอังกฤษ

แท็กเกอร์ Hidden Markov Model แบบคลาสสิกเลือกแท็กได้อย่างไร

ตัวแท็ก HMM เลือกลำดับที่เป็นไปได้มากที่สุดโดยพิจารณาจากโอกาสที่แต่ละแท็กจะได้รับคำและให้กับแท็กก่อนหน้า

เหตุใดนักแท็กสมัยใหม่จึงต้องอ่านทั้งประโยคแทนที่จะอ่านแต่ละคำเพียงอย่างเดียว

เนื่องจากคำเดียวกันสามารถใช้แท็กต่างกันได้ จึงจำเป็นต้องมีข้อมูลเชิงบริบทจากทั้งประโยคเพื่อติดป้ายกำกับให้ถูกต้อง