भाषा एआई गाइड

पाठ वर्गीकरण

पाठ वर्गीकरण स्वचालित रूप से पाठ के टुकड़ों को श्रेणियों में क्रमबद्ध करता है, जैसे किसी ईमेल को स्पैम के रूप में टैग करना या किसी समीक्षा को सकारात्मक के रूप में टैग करना।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It is one of the most widely deployed NLP tasks because it turns messy free text into structured labels a system can act on.

गहरा गोता

वर्गीकरण में कई आकृतियाँ शामिल हैं। बाइनरी वर्गीकरण दो लेबल (स्पैम या स्पैम नहीं) में से एक को चुनता है। मल्टी-क्लास कई विकल्पों में से बिल्कुल एक लेबल निर्दिष्ट करता है (बिलिंग, बिक्री या समर्थन के लिए टिकट को रूट करना)। मल्टी-लेबल एक साथ कई लेबल की अनुमति देता है (एक लेख 'राजनीति' और 'अर्थव्यवस्था' दोनों को टैग करता है)। भावना विश्लेषण, विषय लेबलिंग, आशय का पता लगाना और विषाक्तता फ़िल्टरिंग सभी वर्गीकरण कार्य हैं। आधुनिक प्रणालियाँ पाठ को संख्यात्मक एम्बेडिंग में परिवर्तित करती हैं जो अर्थ को पकड़ती हैं, फिर एक क्लासिफायरियर संभावनाओं को लेबल करने के लिए उन विशेषताओं को मैप करता है। प्रदर्शन को साधारण सटीकता से परे मैट्रिक्स के साथ आंका जाता है, क्योंकि वास्तविक डेटा अक्सर असंतुलित होता है; सटीकता (कितने चिह्नित आइटम सही थे) और रिकॉल (कितने वास्तविक मामले पकड़े गए) मायने रखते हैं, और एफ 1 स्कोर दोनों को संतुलित करता है। वर्ग असंतुलन, जहां एक श्रेणी हावी होती है, एक सामान्य ख़तरा है।

तकनीकी अंतर्दृष्टि

एक विशिष्ट पाइपलाइन BERT जैसे मॉडल के साथ टेक्स्ट को एक घने वेक्टर में एन्कोड करती है, फिर इसे एक अंतिम परत से गुजारती है जो प्रति वर्ग एक स्कोर आउटपुट करती है। सॉफ्टमैक्स एकल-लेबल कार्यों के लिए स्कोर को संभावनाओं में बदल देता है, जबकि प्रति लेबल एक सिग्मॉइड मल्टी-लेबल कार्यों को संभालता है जहां श्रेणियां स्वतंत्र होती हैं। बड़े भाषा मॉडल के साथ, एक ही कार्य को केवल शीघ्रता से श्रेणियों का वर्णन करके शून्य-शॉट किया जा सकता है, किसी लेबल प्रशिक्षण सेट की आवश्यकता नहीं है, लचीलेपन और सेटअप की गति के लिए कुछ सटीकता और स्थिरता का व्यापार किया जा सकता है।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

पाठ वर्गीकरण का भविष्य

बड़े भाषा मॉडल के साथ शून्य-शॉट और कुछ-शॉट वर्गीकरण हजारों उदाहरणों को हाथ से लेबल करने की आवश्यकता को कम कर रहा है, जिससे टीमों को संक्षिप्त विवरण से नए क्लासिफायर को स्पिन करने की सुविधा मिल रही है। अधिक हाइब्रिड सेटअप की अपेक्षा करें जहां एलएलएम बूटस्ट्रैप लेबल उत्पादन के लिए एक छोटे, सस्ते, तेज विशेषज्ञ मॉडल को प्रशिक्षित करते हैं। व्याख्यात्मकता का महत्व बढ़ रहा है, विशेष रूप से सामग्री मॉडरेशन और फिर से शुरू स्क्रीनिंग जैसे संवेदनशील उपयोगों के लिए, जहां यह जानना मायने रखता है कि एक लेबल क्यों सौंपा गया था। प्रतिकूल या बदलती भाषा, जैसे कि फ़िल्टर से बचने के लिए स्पैमर को दोबारा लिखने वाले, के ख़िलाफ़ दृढ़ता, एक सक्रिय फोकस बनी हुई है।

वास्तविक विश्व कार्यान्वयन

ईमेल प्रदाता आपके इनबॉक्स से स्पैम और फ़िशिंग संदेशों को फ़िल्टर कर रहे हैं।

ग्राहकों का मूड जानने के लिए ब्रांड उत्पाद समीक्षाओं और सामाजिक पोस्टों पर भावना विश्लेषण चला रहे हैं।

सपोर्ट डेस्क संदेश सामग्री के आधार पर आने वाले टिकटों को सही टीम तक ऑटो-रूटिंग करता है।

मॉडरेशन समीक्षा के लिए सामाजिक मंच घृणास्पद भाषण या जहरीली टिप्पणियों को चिह्नित कर रहे हैं।

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text Classification quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Text Classification?

पाठ वर्गीकरण स्वचालित रूप से पाठ के टुकड़ों को श्रेणियों में क्रमबद्ध करता है, जैसे किसी ईमेल को स्पैम के रूप में टैग करना या किसी समीक्षा को सकारात्मक के रूप में टैग करना। यह सबसे व्यापक रूप से तैनात एनएलपी कार्यों में से एक है क्योंकि यह गंदे मुक्त टेक्स्ट को संरचित लेबल में बदल देता है जिस पर सिस्टम कार्य कर सकता है।

पाठ वर्गीकरण का लक्ष्य क्या है?

पाठ वर्गीकरण पाठ के एक टुकड़े पर एक या अधिक श्रेणी लेबल निर्दिष्ट करता है, जिससे मुक्त पाठ संरचित आउटपुट में बदल जाता है।

कौन सा परिदृश्य मल्टी-लेबल वर्गीकरण का उदाहरण है?

मल्टी-लेबल वर्गीकरण एक ही आइटम पर एक से अधिक श्रेणियों को एक साथ लागू करने की अनुमति देता है।

पाठ वर्गीकरण के लिए सामान्य सटीकता अक्सर एक भ्रामक मीट्रिक क्यों होती है?

जब एक वर्ग हावी होता है, तो हमेशा यह भविष्यवाणी करना कि वर्ग उच्च सटीकता प्रदान करता है, जबकि कुछ भी उपयोगी नहीं पकड़ता है, इसलिए सटीकता, रिकॉल और एफ 1 की आवश्यकता होती है।

वर्गीकरण कार्य में रिकॉल क्या मापता है?

रिकॉल वास्तविक सकारात्मक मामलों का वह अंश है जिसे सिस्टम ने सही ढंग से पहचाना है, यह कैप्चर करते हुए कि वह कितना चूक गया।

'जीरो-शॉट' पाठ वर्गीकरण का क्या अर्थ है?

शून्य-शॉट वर्गीकरण एक बड़े भाषा मॉडल को लेबल किए गए प्रशिक्षण सेट के बिना, केवल उनका वर्णन करने वाले संकेत से श्रेणियां निर्दिष्ट करने देता है।