क्या हुआ?
मुगलहेड इन्वेस्टमेंट मैगज़ीन की रिपोर्ट है कि प्यू रिसर्च सेंटर ने कॉमन क्रॉल आर्काइव से एकत्र किए गए लगभग 490,000 वेबपेजों का विश्लेषण किया और नवंबर 2022 में ChatGPT के लॉन्च होने के बाद प्रकाशित लगभग 35% पेजों पर AI लेखकत्व से जुड़े महत्वपूर्ण संकेत पाए। अध्ययन की गई पूरी अवधि में, जनवरी 2021 से जुलाई 2026 तक, AI से जुड़े पैटर्न लगभग 10 अंग्रेजी भाषा के वेबपेजों में से एक पर दिखाई दिए। स्रोत स्वतंत्र रूप से प्यू के अंतर्निहित विश्लेषण या डेटासेट को सत्यापित नहीं करता है।
मुगलहेड की रिपोर्ट है कि प्यू रिसर्च सेंटर ने कॉमन क्रॉल वेब संग्रह से एकत्र किए गए लगभग 490,000 वेबपेजों की जांच की। पेज जनवरी 2021 और जुलाई 2026 के बीच प्रकाशित किए गए थे, जिससे शोधकर्ताओं को नवंबर 2022 में ChatGPT लॉन्च होने से पहले और बाद में लेखन पैटर्न की तुलना करने की अनुमति मिली। रिपोर्ट के अनुसार, व्यापक डेटासेट में 10 अंग्रेजी भाषा के वेबपेजों में से एक पर AI-संबंधित संकेत दिखाई दिए, लेकिन ChatGPT के लॉन्च के बाद प्रकाशित पृष्ठों के बीच यह दर लगभग 35% तक बढ़ गई। ये आंकड़े एक पहचान प्रणाली द्वारा चिह्नित पृष्ठों की हिस्सेदारी का वर्णन करते हैं; वे यह स्थापित नहीं करते हैं कि एआई ने प्रत्येक पृष्ठ पर सभी या यहां तक कि अधिकांश पाठ उत्पन्न किया है।
रिपोर्ट में कहा गया है कि शोधकर्ताओं ने ओपन पैंग्राम का इस्तेमाल किया, जो पंग्राम लैब्स द्वारा विकसित एक एआई-डिटेक्शन मॉडल है। अलग-अलग शब्दों या वाक्यांशों की खोज करने के बजाय, सॉफ़्टवेयर बड़ी मात्रा में लेखन में सांख्यिकीय पैटर्न की तलाश करता है। मुगलहेड की रिपोर्ट है कि परिणाम डोमेन के अनुसार तेजी से भिन्न होते हैं: .com पृष्ठों में .edu और .gov पृष्ठों की दर से लगभग 10 गुना अधिक एआई लेखन के संकेत दिखाई देते हैं, जिनकी दरें 1% के करीब थीं। लगभग 4.6% .org पृष्ठों में एआई भागीदारी के महत्वपूर्ण संकेत दिखे। रिपोर्ट के अनुसार, 2021 में चार डोमेन श्रेणियों की दरें समान रूप से कम दर्ज की गईं।
मुगलहेड जेनेरिक एआई से जुड़े लेखन पैटर्न में बदलाव का भी वर्णन करता है। एम डैश 2023 से पहले की तुलना में लगभग दोगुनी बार दिखाई दिए, जबकि ऑक्सफोर्ड अल्पविराम का उपयोग 63% बढ़ गया। "डेल्वे," "इंटरप्ले" और "टेस्टामेंट" जैसे शब्दों की आवृत्ति दोगुनी से अधिक हो गई है, और नकारात्मक समानता-निर्माण जैसे "सिर्फ एक्स नहीं, बल्कि वाई"-लगभग तीन गुना हो गया है। रिपोर्ट में कहा गया है कि तेजी से वृद्धि के बावजूद पैटर्न असामान्य बना हुआ है। यह भी रिपोर्ट करता है कि .com पेजों पर AI-संबद्ध लेखन जनवरी 2021 में लगभग 1% से बढ़कर जनवरी 2026 तक 9.35% हो गया।
यह क्यों मायने रखता है?
निष्कर्षों से पता चलता है कि मशीन-सहायता लेखन खोज, प्रकाशन और भविष्य के एआई प्रशिक्षण डेटा के लिए प्रासंगिक पैमाने पर वेब में प्रवेश कर सकता है। मुगलहेड की रिपोर्ट है कि वाणिज्यिक .com पृष्ठों ने इन संकेतों को .edu और .gov पृष्ठों की दर से लगभग 10 गुना अधिक दिखाया। यदि मशीन-जनरेटेड सामग्री को भविष्य के प्रशिक्षण सेटों में बार-बार शामिल किया जाता है, तो शोधकर्ताओं ने चेतावनी दी है कि त्रुटियों, पूर्वाग्रह और खोई हुई जानकारी को बढ़ाया जा सकता है, हालांकि अध्ययन यह स्थापित नहीं कर सकता है कि प्रत्येक ध्वजांकित पृष्ठ एआई द्वारा लिखा गया था।
रिपोर्ट की गई वृद्धि मायने रखती है क्योंकि ओपन वेब एक प्रकाशन वातावरण और बाद की सूचना प्रणालियों के लिए सामग्री का स्रोत दोनों है। मुगलहेड का कहना है कि कॉमन क्रॉल का अनुमान है कि इसका संग्रह लगभग सभी प्रमुख बड़े भाषा मॉडलों द्वारा उपयोग किए जाने वाले 70% से 90% प्रशिक्षण-डेटा टोकन की आपूर्ति करता है। यदि वह अनुमान और रिपोर्ट किए गए पता लगाने के परिणाम प्रतिनिधि हैं, तो भविष्य के मॉडल विकास के लिए एकत्र किए जाने से पहले एआई सहायता के साथ वेब टेक्स्ट की बढ़ती हिस्सेदारी का उत्पादन या परिवर्तन किया जा सकता है। व्यावहारिक चिंता केवल यह नहीं है कि पाठकों को कृत्रिम गद्य का सामना करना पड़ता है; यह है कि सिंथेटिक गद्य बाद की प्रणालियों के निर्माण के लिए उपयोग की जाने वाली पृष्ठभूमि सामग्री का हिस्सा बन सकता है।
स्रोत इस संभावना को मॉडल पतन से जोड़ता है, एक शब्द जिसका उपयोग गिरावट के लिए किया जाता है जो तब हो सकता है जब एआई सिस्टम को मशीन-जनित सामग्री पर बार-बार प्रशिक्षित किया जाता है। मुगलहेड की रिपोर्ट है कि शोधकर्ताओं ने चेतावनी दी है कि सिंथेटिक डेटा पर बार-बार प्रशिक्षण एक मॉडल द्वारा संरक्षित जानकारी को कम कर सकता है और मौजूदा त्रुटियों, पूर्वाग्रहों और अनुचितता को मजबूत कर सकता है। टोरंटो विश्वविद्यालय के कंप्यूटर इंजीनियरिंग प्रोफेसर निकोलस पेपरनोट ने इस प्रक्रिया की तुलना एक फोटोकॉपी को बार-बार फोटोकॉपी करने से की। वह तुलना रिपोर्ट किए गए जोखिम को बताती है, लेकिन स्रोत इस बात का कोई परिमाणित अनुमान नहीं देता है कि गिरावट का कारण बनने के लिए कितनी वेब-आधारित सिंथेटिक सामग्री की आवश्यकता होगी या क्या वर्तमान वाणिज्यिक प्रशिक्षण पाइपलाइन पहले से ही इसका अनुभव कर रहे हैं।
डोमेन अंतर एआई-सहायता प्रकाशन के असमान वितरण की ओर भी इशारा करते हैं। मुगलहेड की रिपोर्ट है कि वाणिज्यिक साइटों में अकादमिक और सरकारी साइटों की तुलना में कहीं अधिक पहचान दर थी, जिसे लेख आंशिक रूप से संपादकीय समीक्षा, संस्थागत अनुमोदन, प्रकाशन गति और पैमाने में अंतर से जोड़ता है। रिपोर्ट के अनुसार, वाणिज्यिक डोमेन में समाचार आउटलेट, मार्केटिंग संचालन और स्वचालित सामग्री व्यवसाय शामिल हैं। हालाँकि, वे श्रेणियाँ व्यापक हैं, और स्रोत यह नहीं दिखाता है कि पत्रकारिता, विज्ञापन, उत्पाद पृष्ठ या अन्य प्रकार की .com सामग्री के बीच परिणाम कैसे भिन्न होते हैं। इसलिए निष्कर्ष इस चिंता का समर्थन करते हैं कि एआई-सहायता प्राप्त लेखन कहाँ केंद्रित हो सकता है, न कि व्यावसायिक वेबपेजों की गुणवत्ता या उत्पत्ति के बारे में एक व्यापक निष्कर्ष।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
आगे क्या देखना है
मुख्य मुद्दा यह है कि क्या एआई-डिटेक्शन सिस्टम एआई द्वारा सहायता प्राप्त मानव लेखन से उत्पन्न पाठ को अलग करने के लिए पर्याप्त विश्वसनीय बन सकते हैं। मुगलहेड की रिपोर्ट है कि ओपन पैंग्राम मॉडल विशेष शब्दों के बजाय सांख्यिकीय पैटर्न का पता लगाता है, और यह पता लगाने से गलत वर्गीकरण उत्पन्न हो सकता है। भविष्य की रिपोर्टिंग में प्यू के तरीकों, डिटेक्टर की मान्यता, विषय और भाषा के आधार पर परिणाम कैसे भिन्न होते हैं, और क्या कॉमन क्रॉल या मॉडल डेवलपर्स सिंथेटिक पाठ पर बार-बार प्रशिक्षण के खिलाफ सुरक्षा उपाय पेश करते हैं, इसकी जांच करनी चाहिए।
सबसे बड़ी अनिश्चितता यह है कि सकारात्मक पहचान परिणाम का क्या मतलब है। मुगलहेड स्पष्ट रूप से रिपोर्ट करता है कि एआई-डिटेक्शन सॉफ़्टवेयर मानव-लिखित और मशीन-जनित पाठ दोनों को गलत तरीके से वर्गीकृत कर सकता है। फ़्लैग किए गए पेज में पूरी तरह से किसी मॉडल द्वारा तैयार किए गए टेक्स्ट के बजाय एआई द्वारा संपादित या सहायता प्राप्त लेखन शामिल हो सकता है। स्रोत स्वतंत्र रूप से प्यू विश्लेषण की पुष्टि नहीं करता है, डिटेक्टर की मापी गई झूठी-सकारात्मक और झूठी-नकारात्मक दरों की पहचान नहीं करता है, या यह नहीं बताता है कि बहुभाषी पृष्ठ, कॉपी किए गए पाठ, संशोधन और खोज-इंजन सामग्री को कैसे संभाला गया था। वे पद्धतिगत विवरण यह निर्धारित करेंगे कि पाठकों को 35% के आंकड़े पर कितना भरोसा करना चाहिए।
लेखन परंपरा और मॉडल आउटपुट विकसित होने पर डिटेक्टर का प्रदर्शन भी बदल सकता है। रिपोर्ट में कहा गया है कि Anthropic ने कथित तौर पर Claude आउटपुट के लिए मॉडल-स्तरीय टेक्स्ट फिंगरप्रिंटिंग पर काम किया है, जो पूरी तरह से भाषाई पैटर्न पर भरोसा किए बिना उत्पन्न लेखन की पहचान कर सकता है। मुगलहेड इस बात का सबूत नहीं देता है कि इस तरह की फिंगरप्रिंटिंग तैनात है, सभी प्रणालियों में प्रभावी है, या प्यू के नमूने में पृष्ठों के लिए उपलब्ध है। अनुवर्ती कार्य में सांख्यिकीय डिटेक्टरों की तुलना उद्गम उपकरणों के साथ की जानी चाहिए, पूरी तरह से उत्पन्न पाठ से अलग मानव-एआई सहयोग का आकलन करना चाहिए, और परीक्षण करना चाहिए कि लेखकों और मॉडलों के अनुकूलन के बाद सामान्य शैलीगत संकेत उपयोगी रहते हैं या नहीं।
भविष्य के कवरेज में यह भी ट्रैक किया जाना चाहिए कि वेब अभिलेखागार और मॉडल डेवलपर्स कैसे प्रतिक्रिया देते हैं। प्रश्नों में शामिल है कि क्या कॉमन क्रॉल सिंथेटिक सामग्री को लेबल या फ़िल्टर कर सकता है, क्या प्रकाशक एआई सहायता का खुलासा करते हैं, और क्या मॉडल-प्रशिक्षण पाइपलाइन मानव-लिखित, एआई-सहायता प्राप्त और मशीन-जनित पाठ को अलग करते हैं। स्रोत इस बात का कोई सबूत नहीं देता है कि इनमें से कोई भी सुरक्षा उपाय वर्तमान में मौजूद हैं। यह भी स्थापित नहीं करता है कि रिपोर्ट की गई वृद्धि से मौजूदा मॉडल को मापने योग्य नुकसान हुआ है। सबसे बचाव योग्य निकट अवधि का निष्कर्ष संकीर्ण है: मुगलहेड ने एआई लेखन से जुड़े सांख्यिकीय संकेतों को प्रदर्शित करने वाले पृष्ठों में पर्याप्त वृद्धि की रिपोर्ट दी है, जबकि पैमाने, कारण और डाउनस्ट्रीम प्रभाव अधूरे ज्ञात हैं।