Penandaan Bagian dari Pidato
Penandaan part-of-speech (POS) memberi label pada setiap kata dalam kalimat dengan peran tata bahasanya, seperti kata benda, kata kerja, atau kata sifat.
Ikhtisar
It is a foundational NLP step that helps machines understand sentence structure and resolve words that mean different things in different contexts.
Menyelam Lebih Dalam
Banyak kata yang ambigu: 'book' adalah kata benda dalam 'read a book' tetapi kata kerja dalam 'book a flight', dan 'back' dapat berupa kata benda, kata kerja, kata sifat, atau kata keterangan. Pemberian tag POS menggunakan konteks sekitar untuk memilih tag yang tepat, itulah sebabnya konteks sangat penting. Sistem bahasa Inggris sering menggunakan taget Penn Treebank, yang memiliki sekitar 36 tag terperinci (NN untuk kata benda tunggal, VBD untuk kata kerja bentuk lampau, JJ untuk kata sifat, dan sebagainya), sedangkan proyek Ketergantungan Universal mendefinisikan kumpulan tag yang lebih kecil dan netral bahasa, yaitu sekitar 17 tag untuk konsistensi lintas bahasa. Tag POS memberikan tugas-tugas hilir: membantu pengenalan entitas bernama, penguraian, dan ekstraksi informasi, serta memungkinkan alat penelusuran dan tata bahasa menangani kata dengan benar. Pemberian tag yang akurat pada teks bersih kini melebihi 97%, meskipun teks informal, bahasa gaul, dan alih kode masih lebih sulit dilakukan.
Wawasan Teknis
Pemberi tag klasik menggunakan Model Markov Tersembunyi, memilih urutan tag dengan probabilitas gabungan tertinggi dari setiap tag berdasarkan kata dan tag sebelumnya. Pemberi tag modern memasukkan penyematan kontekstual dari model seperti BERT ke dalam pengklasifikasi yang memberi label pada setiap token, seringkali dengan lapisan yang menerapkan transisi tag yang masuk akal. Karena kata yang sama dapat menggunakan tag yang berbeda, model harus membaca keseluruhan kalimat, bukan setiap kata secara terpisah, dan hal inilah yang disediakan oleh penyematan kontekstual.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Pemberian Tag Part-of-Speech
Pemberian tag POS yang eksplisit semakin banyak diserap ke dalam model-model besar yang telah dilatih sebelumnya, yang mempelajari struktur tata bahasa secara implisit, sehingga pemberi tag yang berdiri sendiri kurang penting untuk bahasa dengan sumber daya tinggi seperti bahasa Inggris. Namun penandaan POS tetap berharga untuk bahasa dengan sumber daya rendah, penelitian linguistik, dan saluran ringan di mana LLM penuh berlebihan. Harapkan kemajuan berkelanjutan dalam teks media sosial yang ramai, masukan multibahasa dan alih kode, serta teks sejarah atau khusus. Sebagai elemen penyusun yang cepat dan dapat diinterpretasikan, penandaan POS akan tetap menjadi bagian dari perangkat NLP bahkan ketika model end-to-end mendominasi tugas-tugas yang lebih menarik.
Implementasi Dunia Nyata
Pemeriksa tata bahasa menggunakan tag untuk menemukan kesalahan, seperti kata kerja yang diharapkan mengandung kata benda.
Mesin pencari membedakan 'book' kata benda dari 'book' kata kerja untuk memberikan hasil yang lebih baik.
Saluran pengenalan entitas bernama menggunakan tag POS sebagai fitur untuk menemukan orang, tempat, dan organisasi.
Sistem text-to-speech menggunakan tag untuk memilih pengucapan heteronim yang tepat seperti 'baca' (masa kini vs. masa lalu).
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Part-of-Speech Tagging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Teks ke Ucapan
Pertanyaan yang sering diajukan
What is Part-of-Speech Tagging?
Penandaan part-of-speech (POS) memberi label pada setiap kata dalam kalimat dengan peran tata bahasanya, seperti kata benda, kata kerja, atau kata sifat. Ini adalah langkah dasar NLP yang membantu mesin memahami struktur kalimat dan menyelesaikan kata-kata yang memiliki arti berbeda dalam konteks berbeda.
Apa yang diberikan penandaan part-of-speech pada setiap kata?
Penandaan POS memberi label pada setiap kata berdasarkan kategori tata bahasanya, seperti kata benda, kata kerja, atau kata sifat.
Mengapa konteks penting untuk penandaan POS?
Kata-kata seperti 'buku' bisa berupa kata benda atau kata kerja, sehingga diperlukan kata-kata di sekitarnya untuk memilih tag yang tepat.
Apa taget Penn Treebank?
Tag Penn Treebank adalah kumpulan standar dari sekitar 36 tag terperinci yang digunakan untuk penandaan POS berbahasa Inggris.
Bagaimana pemberi tag Model Markov Tersembunyi klasik memilih tag?
Pemberi tag HMM memilih urutan yang paling mungkin berdasarkan seberapa besar kemungkinan setiap tag diberi kata dan diberi tag sebelumnya.
Mengapa pemberi tag modern harus membaca keseluruhan kalimat, bukan setiap kata saja?
Karena kata yang sama dapat menggunakan tag yang berbeda, informasi kontekstual dari keseluruhan kalimat diperlukan untuk memberi label dengan benar.