भाषा एआई गाइड

Word2Vec स्किप-ग्राम और CBOW

Word2Vec Google की 2013 की एक तकनीक है जो अपने पड़ोसियों से शब्दों की भविष्यवाणी करके घने शब्द वैक्टर सीखती है, भाषा को ज्यामिति में बदल देती है जहां समान शब्द एक साथ बैठते हैं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It made the famous "king - man + woman ≈ queen" analogy possible and kicked off the modern embedding era.

गहरा गोता

2013 में Google में टॉमस मिकोलोव और सहकर्मियों द्वारा पेश किया गया Word2Vec, एक स्लाइडिंग संदर्भ विंडो पर एक उथले दो-परत तंत्रिका नेटवर्क को प्रशिक्षित करके प्रत्येक शब्द के लिए एक वेक्टर (आमतौर पर 100-300 संख्या) सीखता है। यह दो स्वादों में आता है। सीबीओडब्ल्यू (कंटीन्यूअस बैग ऑफ वर्ड्स) आसपास के संदर्भ शब्दों को लेता है और संदर्भ वैक्टरों को एक साथ मिलाकर, लापता केंद्र शब्द की भविष्यवाणी करता है। स्किप-ग्राम इसे फ़्लिप करता है: यह केंद्र शब्द लेता है और प्रत्येक आसपास के संदर्भ शब्द की भविष्यवाणी करने का प्रयास करता है। मॉडल कभी भी भविष्यवाणी कार्य की परवाह नहीं करता; लक्ष्य वह भार मैट्रिक्स है जो वह रास्ते में सीखता है, जिसकी पंक्तियाँ शब्द वैक्टर बन जाती हैं। समान संदर्भों में दिखाई देने वाले शब्द समान वैक्टर के साथ समाप्त होते हैं, जो पूरी तरह से सह-घटना से अर्थ ग्रहण करते हैं।

तकनीकी अंतर्दृष्टि

एक विशाल शब्दावली पर पूर्ण सॉफ्टमैक्स का प्रशिक्षण बहुत धीमा है, इसलिए Word2Vec नकारात्मक नमूनाकरण जैसी तरकीबों का उपयोग करता है, जो भविष्यवाणी को द्विआधारी वर्गीकरण के रूप में फिर से परिभाषित करता है: एक सच्चे संदर्भ शब्द को मुट्ठी भर यादृच्छिक "नकारात्मक" शब्दों से अलग करता है। यह "द" जैसे बार-बार आने वाले शब्दों का भी उप-नमूना तैयार करता है और नकारात्मक को चुनने के लिए यूनीग्राम-उठाए गए 0.75 वितरण का उपयोग करता है। बारंबार शब्दों के लिए CBOW तेज़ और बेहतर है; नकारात्मक नमूने के साथ स्किप-ग्राम दुर्लभ शब्दों और छोटे कॉर्पोरा को बेहतर ढंग से संभालता है।

सामरिक प्रभाव

गति और पैमाना

भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।

पहुंच और पहुंच

यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।

स्पष्ट निर्णय

टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।

Word2Vec स्किप-ग्राम और CBOW का भविष्य

Word2Vec जैसे स्थैतिक एम्बेडिंग को बड़े पैमाने पर प्रासंगिक मॉडल (ईएलएमओ, बीईआरटी, ट्रांसफॉर्मर) द्वारा प्रतिस्थापित किया गया है जो वाक्य संदर्भ के आधार पर एक शब्द को अलग-अलग वैक्टर देते हैं, पॉलीसेमी समस्या को हल करते हैं जहां "बैंक" में एक निश्चित वेक्टर होता है। फिर भी Word2Vec वहां कायम है जहां गति, सरलता और व्याख्यात्मकता मायने रखती है: अनुशंसा प्रणाली, खोज और एक शिक्षण आधार के रूप में। इसका मूल विचार, जिसका अर्थ सह-घटना आंकड़ों से निकलता है, सभी आधुनिक भाषा मॉडलों का वैचारिक आधार बना हुआ है।

वास्तविक विश्व कार्यान्वयन

Spotify और Airbnb ने अनुशंसाओं के लिए उपयोगकर्ता सत्र अनुक्रमों से गाने और लिस्टिंग ("आइटम2वेक") की एम्बेडिंग सीखने के लिए स्किप-ग्राम को अनुकूलित किया

शब्दार्थ खोज और पर्यायवाची विस्तार को सशक्त बनाना ताकि "लैपटॉप" के लिए एक क्वेरी "नोटबुक" और "कंप्यूटर" भी सामने आए

पाठ में उपमाओं और संबंधों का पता लगाना, जैसे राजधानी-देश के जोड़े (पेरिस फ्रांस के लिए है और टोक्यो जापान के लिए है)

सीमित डेटा पर भावना विश्लेषण और दस्तावेज़ वर्गीकरण के लिए बड़ी एनएलपी पाइपलाइनों की इनपुट परत को प्रारंभ करना

जोखिम और रेलिंग

मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।

त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।

यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।

कार्यान्वयन रोडमैप

1

रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।

2

जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।

3

उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।

4

विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Word2Vec Skip-Gram and CBOW quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

राजमार्ग नेटवर्क और स्किप कनेक्शन

अक्सर पूछे जाने वाले प्रश्नों

What is Word2Vec Skip-Gram and CBOW?

Word2Vec Google की 2013 की एक तकनीक है जो अपने पड़ोसियों से शब्दों की भविष्यवाणी करके घने शब्द वैक्टर सीखती है, भाषा को ज्यामिति में बदल देती है जहां समान शब्द एक साथ बैठते हैं। इसने प्रसिद्ध "राजा - पुरुष + महिला ≈ रानी" सादृश्य को संभव बनाया और आधुनिक एम्बेडिंग युग की शुरुआत की।

स्किप-ग्राम आर्किटेक्चर क्या भविष्यवाणी करता है?

स्किप-ग्राम एक एकल केंद्र शब्द लेता है और उसके आसपास के प्रत्येक संदर्भ शब्द की भविष्यवाणी करने की कोशिश करता है, जो सीबीओडब्ल्यू के विपरीत है।

Word2Vec मॉडल के प्रशिक्षण का वास्तविक उपयोगी आउटपुट क्या है?

भविष्यवाणी कार्य केवल अंत का एक साधन है; लक्ष्य सीखा हुआ वज़न मैट्रिक्स है जिसकी पंक्तियाँ सघन शब्द एम्बेडिंग बन जाती हैं।

Word2Vec नकारात्मक नमूनाकरण का उपयोग क्यों करता है?

नकारात्मक नमूनाकरण समस्या को कुछ यादृच्छिक शब्दों के विरुद्ध द्विआधारी वर्गीकरण के रूप में पुन: प्रस्तुत करता है, हजारों शब्दों से अधिक महंगे सॉफ्टमैक्स से बचता है।

कौन सा Word2Vec संस्करण आम तौर पर दुर्लभ शब्दों और छोटे डेटासेट पर बेहतर प्रदर्शन करता है?

नकारात्मक नमूने के साथ स्किप-ग्राम दुर्लभ शब्दों को बेहतर ढंग से कैप्चर करता है, जबकि सीबीओडब्ल्यू तेज़ है और लगातार शब्दों को पसंद करता है।

Word2Vec वैक्टर की कौन सी प्रसिद्ध संपत्ति "राजा - पुरुष + महिला ≈ रानी" द्वारा चित्रित है?

Word2Vec वैक्टर रिश्तों को एनकोड करते हैं ताकि सिमेंटिक सादृश्यों को सरल वेक्टर जोड़ और घटाव के साथ हल किया जा सके।