समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

मुगलहेड ने ChatGPT के बाद प्रकाशित 35% वेबपेजों पर AI से जुड़े लेखन संकेतों की रिपोर्ट दी है

मुगलहेड की रिपोर्ट है कि प्यू रिसर्च सेंटर के विश्लेषण में ChatGPT लॉन्च होने के बाद प्रकाशित लगभग 35% अंग्रेजी-भाषा वेबपेजों पर एआई लेखन से जुड़े महत्वपूर्ण संकेत मिले, जबकि चेतावनी दी गई कि पता लगाने के परिणाम यह साबित नहीं करते हैं कि एआई ने एक संपूर्ण पृष्ठ उत्पन्न किया है।

5 min readRead the linked source
Source-provided image accompanying Mugglehead reports AI-associated writing signs on 35% of webpages published after ChatGPT
स्रोत संदर्भस्रोत रिकार्ड किया गया
प्रकाशक
mugglehead.com
स्रोत लिंक
mugglehead.comhttps://mugglehead.com/artificial-intelligence-signs-appear-on-35-of-webpages-published-since-chatgpt/
स्रोत प्रकार
लिंक्ड स्रोत - प्राथमिक-स्रोत स्थिति स्थापित नहीं की गई है।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

सिंथेटिक डेटा
संवेदनशील प्रशिक्षण डेटा को बढ़ाने, अनुकरण करने या संरक्षित करने के लिए कृत्रिम रूप से उत्पन्न डेटा का उपयोग किया जाता है।
जेनरेटिव एआई
एआई सिस्टम जो टेक्स्ट, चित्र, ऑडियो, वीडियो या कोड जैसी नई सामग्री तैयार करते हैं।
डेटासेट
प्रशिक्षण, सत्यापन या परीक्षण के लिए उपयोग किए जाने वाले संरचित या असंरचित उदाहरणों का संग्रह।
स्वयं की जांच करोएआई क्या है? प्रश्नोत्तरी

क्या हुआ?

मुगलहेड इन्वेस्टमेंट मैगज़ीन की रिपोर्ट है कि प्यू रिसर्च सेंटर ने कॉमन क्रॉल आर्काइव से एकत्र किए गए लगभग 490,000 वेबपेजों का विश्लेषण किया और नवंबर 2022 में ChatGPT के लॉन्च होने के बाद प्रकाशित लगभग 35% पेजों पर AI लेखकत्व से जुड़े महत्वपूर्ण संकेत पाए। अध्ययन की गई पूरी अवधि में, जनवरी 2021 से जुलाई 2026 तक, AI से जुड़े पैटर्न लगभग 10 अंग्रेजी भाषा के वेबपेजों में से एक पर दिखाई दिए। स्रोत स्वतंत्र रूप से प्यू के अंतर्निहित विश्लेषण या डेटासेट को सत्यापित नहीं करता है।

मुगलहेड की रिपोर्ट है कि प्यू रिसर्च सेंटर ने कॉमन क्रॉल वेब संग्रह से एकत्र किए गए लगभग 490,000 वेबपेजों की जांच की। पेज जनवरी 2021 और जुलाई 2026 के बीच प्रकाशित किए गए थे, जिससे शोधकर्ताओं को नवंबर 2022 में ChatGPT लॉन्च होने से पहले और बाद में लेखन पैटर्न की तुलना करने की अनुमति मिली। रिपोर्ट के अनुसार, व्यापक डेटासेट में 10 अंग्रेजी भाषा के वेबपेजों में से एक पर AI-संबंधित संकेत दिखाई दिए, लेकिन ChatGPT के लॉन्च के बाद प्रकाशित पृष्ठों के बीच यह दर लगभग 35% तक बढ़ गई। ये आंकड़े एक पहचान प्रणाली द्वारा चिह्नित पृष्ठों की हिस्सेदारी का वर्णन करते हैं; वे यह स्थापित नहीं करते हैं कि एआई ने प्रत्येक पृष्ठ पर सभी या यहां तक ​​कि अधिकांश पाठ उत्पन्न किया है।

रिपोर्ट में कहा गया है कि शोधकर्ताओं ने ओपन पैंग्राम का इस्तेमाल किया, जो पंग्राम लैब्स द्वारा विकसित एक एआई-डिटेक्शन मॉडल है। अलग-अलग शब्दों या वाक्यांशों की खोज करने के बजाय, सॉफ़्टवेयर बड़ी मात्रा में लेखन में सांख्यिकीय पैटर्न की तलाश करता है। मुगलहेड की रिपोर्ट है कि परिणाम डोमेन के अनुसार तेजी से भिन्न होते हैं: .com पृष्ठों में .edu और .gov पृष्ठों की दर से लगभग 10 गुना अधिक एआई लेखन के संकेत दिखाई देते हैं, जिनकी दरें 1% के करीब थीं। लगभग 4.6% .org पृष्ठों में एआई भागीदारी के महत्वपूर्ण संकेत दिखे। रिपोर्ट के अनुसार, 2021 में चार डोमेन श्रेणियों की दरें समान रूप से कम दर्ज की गईं।

मुगलहेड जेनेरिक एआई से जुड़े लेखन पैटर्न में बदलाव का भी वर्णन करता है। एम डैश 2023 से पहले की तुलना में लगभग दोगुनी बार दिखाई दिए, जबकि ऑक्सफोर्ड अल्पविराम का उपयोग 63% बढ़ गया। "डेल्वे," "इंटरप्ले" और "टेस्टामेंट" जैसे शब्दों की आवृत्ति दोगुनी से अधिक हो गई है, और नकारात्मक समानता-निर्माण जैसे "सिर्फ एक्स नहीं, बल्कि वाई"-लगभग तीन गुना हो गया है। रिपोर्ट में कहा गया है कि तेजी से वृद्धि के बावजूद पैटर्न असामान्य बना हुआ है। यह भी रिपोर्ट करता है कि .com पेजों पर AI-संबद्ध लेखन जनवरी 2021 में लगभग 1% से बढ़कर जनवरी 2026 तक 9.35% हो गया।

स्रोत विवरण: mugglehead.com ↗

यह क्यों मायने रखता है?

निष्कर्षों से पता चलता है कि मशीन-सहायता लेखन खोज, प्रकाशन और भविष्य के एआई प्रशिक्षण डेटा के लिए प्रासंगिक पैमाने पर वेब में प्रवेश कर सकता है। मुगलहेड की रिपोर्ट है कि वाणिज्यिक .com पृष्ठों ने इन संकेतों को .edu और .gov पृष्ठों की दर से लगभग 10 गुना अधिक दिखाया। यदि मशीन-जनरेटेड सामग्री को भविष्य के प्रशिक्षण सेटों में बार-बार शामिल किया जाता है, तो शोधकर्ताओं ने चेतावनी दी है कि त्रुटियों, पूर्वाग्रह और खोई हुई जानकारी को बढ़ाया जा सकता है, हालांकि अध्ययन यह स्थापित नहीं कर सकता है कि प्रत्येक ध्वजांकित पृष्ठ एआई द्वारा लिखा गया था।

रिपोर्ट की गई वृद्धि मायने रखती है क्योंकि ओपन वेब एक प्रकाशन वातावरण और बाद की सूचना प्रणालियों के लिए सामग्री का स्रोत दोनों है। मुगलहेड का कहना है कि कॉमन क्रॉल का अनुमान है कि इसका संग्रह लगभग सभी प्रमुख बड़े भाषा मॉडलों द्वारा उपयोग किए जाने वाले 70% से 90% प्रशिक्षण-डेटा टोकन की आपूर्ति करता है। यदि वह अनुमान और रिपोर्ट किए गए पता लगाने के परिणाम प्रतिनिधि हैं, तो भविष्य के मॉडल विकास के लिए एकत्र किए जाने से पहले एआई सहायता के साथ वेब टेक्स्ट की बढ़ती हिस्सेदारी का उत्पादन या परिवर्तन किया जा सकता है। व्यावहारिक चिंता केवल यह नहीं है कि पाठकों को कृत्रिम गद्य का सामना करना पड़ता है; यह है कि सिंथेटिक गद्य बाद की प्रणालियों के निर्माण के लिए उपयोग की जाने वाली पृष्ठभूमि सामग्री का हिस्सा बन सकता है।

स्रोत इस संभावना को मॉडल पतन से जोड़ता है, एक शब्द जिसका उपयोग गिरावट के लिए किया जाता है जो तब हो सकता है जब एआई सिस्टम को मशीन-जनित सामग्री पर बार-बार प्रशिक्षित किया जाता है। मुगलहेड की रिपोर्ट है कि शोधकर्ताओं ने चेतावनी दी है कि सिंथेटिक डेटा पर बार-बार प्रशिक्षण एक मॉडल द्वारा संरक्षित जानकारी को कम कर सकता है और मौजूदा त्रुटियों, पूर्वाग्रहों और अनुचितता को मजबूत कर सकता है। टोरंटो विश्वविद्यालय के कंप्यूटर इंजीनियरिंग प्रोफेसर निकोलस पेपरनोट ने इस प्रक्रिया की तुलना एक फोटोकॉपी को बार-बार फोटोकॉपी करने से की। वह तुलना रिपोर्ट किए गए जोखिम को बताती है, लेकिन स्रोत इस बात का कोई परिमाणित अनुमान नहीं देता है कि गिरावट का कारण बनने के लिए कितनी वेब-आधारित सिंथेटिक सामग्री की आवश्यकता होगी या क्या वर्तमान वाणिज्यिक प्रशिक्षण पाइपलाइन पहले से ही इसका अनुभव कर रहे हैं।

डोमेन अंतर एआई-सहायता प्रकाशन के असमान वितरण की ओर भी इशारा करते हैं। मुगलहेड की रिपोर्ट है कि वाणिज्यिक साइटों में अकादमिक और सरकारी साइटों की तुलना में कहीं अधिक पहचान दर थी, जिसे लेख आंशिक रूप से संपादकीय समीक्षा, संस्थागत अनुमोदन, प्रकाशन गति और पैमाने में अंतर से जोड़ता है। रिपोर्ट के अनुसार, वाणिज्यिक डोमेन में समाचार आउटलेट, मार्केटिंग संचालन और स्वचालित सामग्री व्यवसाय शामिल हैं। हालाँकि, वे श्रेणियाँ व्यापक हैं, और स्रोत यह नहीं दिखाता है कि पत्रकारिता, विज्ञापन, उत्पाद पृष्ठ या अन्य प्रकार की .com सामग्री के बीच परिणाम कैसे भिन्न होते हैं। इसलिए निष्कर्ष इस चिंता का समर्थन करते हैं कि एआई-सहायता प्राप्त लेखन कहाँ केंद्रित हो सकता है, न कि व्यावसायिक वेबपेजों की गुणवत्ता या उत्पत्ति के बारे में एक व्यापक निष्कर्ष।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

आगे क्या देखना है

मुख्य मुद्दा यह है कि क्या एआई-डिटेक्शन सिस्टम एआई द्वारा सहायता प्राप्त मानव लेखन से उत्पन्न पाठ को अलग करने के लिए पर्याप्त विश्वसनीय बन सकते हैं। मुगलहेड की रिपोर्ट है कि ओपन पैंग्राम मॉडल विशेष शब्दों के बजाय सांख्यिकीय पैटर्न का पता लगाता है, और यह पता लगाने से गलत वर्गीकरण उत्पन्न हो सकता है। भविष्य की रिपोर्टिंग में प्यू के तरीकों, डिटेक्टर की मान्यता, विषय और भाषा के आधार पर परिणाम कैसे भिन्न होते हैं, और क्या कॉमन क्रॉल या मॉडल डेवलपर्स सिंथेटिक पाठ पर बार-बार प्रशिक्षण के खिलाफ सुरक्षा उपाय पेश करते हैं, इसकी जांच करनी चाहिए।

सबसे बड़ी अनिश्चितता यह है कि सकारात्मक पहचान परिणाम का क्या मतलब है। मुगलहेड स्पष्ट रूप से रिपोर्ट करता है कि एआई-डिटेक्शन सॉफ़्टवेयर मानव-लिखित और मशीन-जनित पाठ दोनों को गलत तरीके से वर्गीकृत कर सकता है। फ़्लैग किए गए पेज में पूरी तरह से किसी मॉडल द्वारा तैयार किए गए टेक्स्ट के बजाय एआई द्वारा संपादित या सहायता प्राप्त लेखन शामिल हो सकता है। स्रोत स्वतंत्र रूप से प्यू विश्लेषण की पुष्टि नहीं करता है, डिटेक्टर की मापी गई झूठी-सकारात्मक और झूठी-नकारात्मक दरों की पहचान नहीं करता है, या यह नहीं बताता है कि बहुभाषी पृष्ठ, कॉपी किए गए पाठ, संशोधन और खोज-इंजन सामग्री को कैसे संभाला गया था। वे पद्धतिगत विवरण यह निर्धारित करेंगे कि पाठकों को 35% के आंकड़े पर कितना भरोसा करना चाहिए।

लेखन परंपरा और मॉडल आउटपुट विकसित होने पर डिटेक्टर का प्रदर्शन भी बदल सकता है। रिपोर्ट में कहा गया है कि Anthropic ने कथित तौर पर Claude आउटपुट के लिए मॉडल-स्तरीय टेक्स्ट फिंगरप्रिंटिंग पर काम किया है, जो पूरी तरह से भाषाई पैटर्न पर भरोसा किए बिना उत्पन्न लेखन की पहचान कर सकता है। मुगलहेड इस बात का सबूत नहीं देता है कि इस तरह की फिंगरप्रिंटिंग तैनात है, सभी प्रणालियों में प्रभावी है, या प्यू के नमूने में पृष्ठों के लिए उपलब्ध है। अनुवर्ती कार्य में सांख्यिकीय डिटेक्टरों की तुलना उद्गम उपकरणों के साथ की जानी चाहिए, पूरी तरह से उत्पन्न पाठ से अलग मानव-एआई सहयोग का आकलन करना चाहिए, और परीक्षण करना चाहिए कि लेखकों और मॉडलों के अनुकूलन के बाद सामान्य शैलीगत संकेत उपयोगी रहते हैं या नहीं।

भविष्य के कवरेज में यह भी ट्रैक किया जाना चाहिए कि वेब अभिलेखागार और मॉडल डेवलपर्स कैसे प्रतिक्रिया देते हैं। प्रश्नों में शामिल है कि क्या कॉमन क्रॉल सिंथेटिक सामग्री को लेबल या फ़िल्टर कर सकता है, क्या प्रकाशक एआई सहायता का खुलासा करते हैं, और क्या मॉडल-प्रशिक्षण पाइपलाइन मानव-लिखित, एआई-सहायता प्राप्त और मशीन-जनित पाठ को अलग करते हैं। स्रोत इस बात का कोई सबूत नहीं देता है कि इनमें से कोई भी सुरक्षा उपाय वर्तमान में मौजूद हैं। यह भी स्थापित नहीं करता है कि रिपोर्ट की गई वृद्धि से मौजूदा मॉडल को मापने योग्य नुकसान हुआ है। सबसे बचाव योग्य निकट अवधि का निष्कर्ष संकीर्ण है: मुगलहेड ने एआई लेखन से जुड़े सांख्यिकीय संकेतों को प्रदर्शित करने वाले पृष्ठों में पर्याप्त वृद्धि की रिपोर्ट दी है, जबकि पैमाने, कारण और डाउनस्ट्रीम प्रभाव अधूरे ज्ञात हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई क्या है?एआई मॉडल की व्याख्याएआई प्रशिक्षणएआई नैतिकताआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?