समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

पेपर यह अनुमान लगाने का प्रस्ताव करता है कि वॉटरमार्क वाले एआई मॉडल से कितना मिश्रित पाठ आया

एक संशोधित arXiv पेपर पाठ में वॉटरमार्क भाषा-मॉडल सामग्री की हिस्सेदारी के लिए अनुमानक प्रस्तुत करता है जो मानव और एआई लेखन को जोड़ता है, जबकि यह दर्शाता है कि कुछ वॉटरमार्किंग योजनाएं विश्वसनीय अनुपात अनुमानों का समर्थन नहीं कर सकती हैं।

5 min readRead the primary source
Source-page capture accompanying Paper proposes estimating how much of mixed text came from a watermarked AI model
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2506.22343
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
मशीन लर्निंग (एमएल)
वे विधियाँ जो सिस्टम को डेटा से पैटर्न सीखने और समय के साथ सुधार करने की अनुमति देती हैं।
सिंथेटिक डेटा
संवेदनशील प्रशिक्षण डेटा को बढ़ाने, अनुकरण करने या संरक्षित करने के लिए कृत्रिम रूप से उत्पन्न डेटा का उपयोग किया जाता है।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

एक शोध दल ने पाठ में एआई-जनित सामग्री के अनुपात का अनुमान लगाने पर एक पेपर का एक संशोधित संस्करण प्रकाशित किया है जो वॉटरमार्क वाले बड़े भाषा मॉडल से आउटपुट के साथ मानव लेखन को मिश्रित करता है। पेपर वॉटरमार्किंग विधियों को अलग करता है जहां उस अनुपात को उन तरीकों से पहचाना जा सकता है जहां यह नहीं किया जा सकता है, और ओपन-सोर्स मॉडल द्वारा उत्पन्न सिंथेटिक डेटा और मिश्रित-स्रोत पाठ का उपयोग करके मूल्यांकन में उच्च सटीकता की रिपोर्ट करता है।

स्रोत "हाइब्रिड एआई-मानव ग्रंथों में वॉटरमार्क अनुपात का इष्टतम अनुमान" के लिए एक arXiv रिकॉर्ड है, जिसे जियांग ली, गैरेट वेन, वेइकिंग हे, जियायुआन वू, क्यूई लॉन्ग और वीजी जे. सु द्वारा लिखा गया है। रिकॉर्ड कहता है कि पेपर पहली बार 27 जून, 2025 को प्रस्तुत किया गया था और 30 अगस्त, 2026 को संस्करण 2 में संशोधित किया गया था। वह संशोधन तिथि स्रोत को वर्तमान समाचार विंडो के भीतर रखती है, लेकिन रिकॉर्ड यह वर्णन नहीं करता है कि संस्करणों के बीच पेपर के कौन से हिस्से बदले गए हैं। कार्य को मशीन लर्निंग, संगणना और भाषा, और सांख्यिकीय पद्धति के अंतर्गत सूचीबद्ध किया गया है।

पेपर उस पाठ का अध्ययन करता है जो टेक्स्ट वॉटरमार्क का उपयोग करके एक बड़े भाषा मॉडल द्वारा निर्मित सामग्री के साथ मानव-लिखित सामग्री को जोड़ता है। इसका केंद्रीय प्रश्न केवल यह नहीं है कि क्या एक संपूर्ण दस्तावेज़ वॉटरमार्क किया गया है। इसके बजाय, यह अनुमानित किए जाने वाले अनुपात पैरामीटर के रूप में वॉटरमार्क सामग्री के हिस्से को मानता है। लेखक समस्या को महत्वपूर्ण आँकड़ों के आधार पर एक मिश्रण मॉडल के रूप में तैयार करते हैं, जो वॉटरमार्क संकेतों के पेपर के विश्लेषण में उपयोग किए जाने वाले आँकड़ों का एक वर्ग है। सार के अनुसार, वे पहले दिखाते हैं कि कुछ वॉटरमार्किंग योजनाओं के तहत अनुपात की पहचान नहीं की जा सकती है। उन मामलों में, उपलब्ध साक्ष्य विशिष्ट रूप से मिश्रण अनुपात को निर्धारित नहीं कर सकते हैं, इसलिए बताई गई व्यवस्था के तहत लगातार अनुमान असंभव है।

पेपर वॉटरमार्किंग विधियों के लिए एक अलग परिणाम की रिपोर्ट करता है जो पता लगाने के लिए निरंतर महत्वपूर्ण आंकड़ों का उपयोग करता है। हल्की परिस्थितियों में, लेखकों का कहना है कि इस वर्ग के तरीकों के लिए अनुपात पहचान योग्य हो जाता है। वे कुशल अनुमानकों का प्रस्ताव करते हैं, उदाहरण के रूप में कई लोकप्रिय निष्पक्ष वॉटरमार्क शामिल करते हैं, और महत्वपूर्ण आंकड़ों के आधार पर किसी भी मापने योग्य अनुमानक के लिए न्यूनतम न्यूनतम सीमाएं प्राप्त करते हैं। सार कहता है कि प्रस्तावित अनुमानकर्ता उन निचली सीमाओं तक पहुँचते हैं। ओपन-सोर्स मॉडल द्वारा उत्पन्न सिंथेटिक डेटा और मिश्रित-स्रोत पाठ पर मूल्यांकन लगातार उच्च अनुमान सटीकता दिखाने की सूचना है। स्रोत उस प्रदर्शन दावे के आकार और व्यापकता का आकलन करने के लिए आवश्यक संख्यात्मक परिणाम, डेटासेट, मॉडल नाम या प्रयोगात्मक सेटिंग्स प्रदान नहीं करता है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

अधिकांश वॉटरमार्क शोध पूछते हैं कि क्या संपूर्ण पाठ एआई-जनित है या वॉटरमार्क है। यह कार्य एक अधिक जटिल मामले को संबोधित करता है: मानव-लिखित और वॉटरमार्क वाली AI-जनित सामग्री दोनों से इकट्ठी की गई सामग्री। यदि पेपर के प्रयोगों से परे मान्य किया जाता है, तो द्विआधारी निर्णय लेने के बजाय अनुपात का अनुमान लगाने से शोधकर्ताओं और संगठनों को मिश्रित-स्रोत पाठ का विश्लेषण करने का अधिक सटीक तरीका मिल सकता है। निष्कर्षों से यह भी पता चलता है कि वॉटरमार्क का डिज़ाइन यह निर्धारित कर सकता है कि क्या ऐसे अनुमान सैद्धांतिक रूप से संभव हैं।

इस पेपर में व्यावहारिक अंतर बाइनरी डिटेक्शन और डिग्री द्वारा एट्रिब्यूशन के बीच है। एक बाइनरी डिटेक्टर पूछता है कि क्या संपूर्ण पाठ में वॉटरमार्क का सबूत है। इसके बजाय पेपर एक दस्तावेज़ को संबोधित करता है जिसके स्रोत मिश्रित हैं और पूछता है कि कितनी सामग्री वॉटरमार्क भाषा मॉडल से जुड़ी है। यह स्रोत में वर्णित कई समग्र ग्रंथों की संरचना के करीब है, जहां मानव और एआई-लिखित मार्ग एक साथ दिखाई दे सकते हैं। इसलिए एक विश्वसनीय अनुमान एकल हां-या-नहीं लेबल से अधिक जानकारी प्रदान कर सकता है, कम से कम उन सेटिंग्स में जहां प्रासंगिक वॉटरमार्किंग धारणाएं लागू होती हैं।

सैद्धांतिक खोज भी उतनी ही महत्वपूर्ण है। सारांश एआई भागीदारी को मापने के लिए वॉटरमार्किंग को एक सार्वभौमिक समाधान के रूप में प्रस्तुत नहीं करता है। इसमें कहा गया है कि कुछ योजनाएं अनुपात पैरामीटर को अज्ञात बना देती हैं, जबकि निरंतर महत्वपूर्ण आंकड़ों पर आधारित विधियां इसे हल्की परिस्थितियों में पहचानने योग्य बना सकती हैं। स्पष्ट शब्दों में, माप की समस्या वॉटरमार्क के सांख्यिकीय डिज़ाइन पर ही निर्भर करती है। एक डिटेक्टर उस सिग्नल के कारण मिश्रित पाठ के हिस्से को निर्धारित करने के लिए पर्याप्त जानकारी प्रदान किए बिना सबूत प्रदान कर सकता है कि एक सिग्नल मौजूद है। वॉटरमार्किंग क्या स्थापित कर सकती है, इसके बारे में उस सीमा को व्यापक दावों पर अंकुश लगाना चाहिए।

रिपोर्ट किए गए मिनिमैक्स परिणाम पेपर की औपचारिक सेटिंग के भीतर एक प्रदर्शन बेंचमार्क जोड़ते हैं। निम्न सीमाएँ प्राप्त करके और यह बताते हुए कि इसके अनुमानकर्ता उन्हें प्राप्त करते हैं, अनुसंधान न केवल यह दावा करता है कि एक विधि ने प्रयोगों में अच्छा काम किया है, बल्कि यह कि अनुमानक प्रक्रियाओं के विचारित वर्ग के लिए एक परिभाषित सांख्यिकीय सीमा के विरुद्ध इष्टतम हैं। यदि धारणाएँ वास्तविक वॉटरमार्क परिनियोजन से मेल खाती हैं, तो इससे भविष्य में वॉटरमार्किंग सिस्टम और मूल्यांकन विधियों के डिज़ाइन को निर्देशित करने में मदद मिल सकती है। हालाँकि, स्रोत इन्हें arXiv पेपर में लेखकों के परिणामों के रूप में प्रस्तुत करता है। यह स्वतंत्र पुष्टि, सहकर्मी-समीक्षा जानकारी या सबूत प्रदान नहीं करता है कि विधि परिचालन उपयोग के लिए तैयार है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

स्रोत पेपर के नमूना आकार, सटीक सटीकता के आंकड़े, अनुमानक सूत्र, या सभी परीक्षण किए गए वॉटरमार्किंग तरीकों के नाम और कार्यान्वयन विवरण प्रदान नहीं करता है। यह यह भी स्थापित नहीं करता है कि दृष्टिकोण वाणिज्यिक प्रणालियों, संपादित या संक्षिप्त पाठ, या कई एआई स्रोतों वाली सामग्री पर कैसा प्रदर्शन करता है। आगे की जांच में स्वतंत्र प्रतिकृति, रिपोर्ट किए गए प्रयोगों के बाहर मजबूती और परिणामी निर्णयों में अनुपात अनुमानों की व्याख्या कैसे की जाएगी, इस पर ध्यान केंद्रित किया जाना चाहिए।

देखने लायक पहला मुद्दा प्रतिलिपि प्रस्तुत करने योग्यता है। सूत्र का कहना है कि लेखकों ने ओपन-सोर्स मॉडल द्वारा उत्पन्न सिंथेटिक डेटा और मिश्रित-स्रोत पाठ पर अनुमानकों का मूल्यांकन किया, लेकिन यह नहीं बताया गया कि कितने पाठों का उपयोग किया गया था, मानव और एआई भागों को कैसे जोड़ा गया था, कौन सी वॉटरमार्किंग योजनाओं का परीक्षण किया गया था, या "उच्च अनुमान सटीकता" का संख्यात्मक रूप से क्या मतलब है। वे विवरण यह निर्धारित करने के लिए आवश्यक हैं कि रिपोर्ट किए गए परिणाम मजबूत हैं या अनुकूल प्रयोगात्मक स्थितियों पर निर्भर हैं। स्वतंत्र प्रतिकृति के लिए पेपर की पूर्ण विधियाँ और डेटा उपलब्धता विशेष रूप से प्रासंगिक होगी।

दूसरा मुद्दा यह है कि क्या विधि वास्तविक पाठ में सामान्य परिवर्तनों से बची रहती है। स्रोत यह नहीं बताता है कि संपादन, पुनर्लेखन, व्याख्या, अनुवाद, स्वरूपण परिवर्तन, या एक से अधिक मॉडल से आउटपुट के संयोजन के बाद अनुमान कैसे व्यवहार करते हैं। यह यह भी स्पष्ट नहीं करता है कि क्या वॉटरमार्क तब पता लगाने योग्य रहता है जब किसी दस्तावेज़ का केवल एक छोटा सा हिस्सा वॉटरमार्क किया जाता है। क्योंकि पेपर की गारंटी विशेष वॉटरमार्किंग योजनाओं और सांख्यिकीय स्थितियों से जुड़ी होती है, किसी अनुमान को एआई भागीदारी के भरोसेमंद उपाय के रूप में मानने से पहले उन स्थितियों के बाहर परीक्षण करना महत्वपूर्ण होगा।

अंत में, पाठकों को यह देखना चाहिए कि ऐसे अनुमानों का उपयोग कैसे किया जाता है। एक अनुपात अनुमान आवश्यक रूप से लेखकत्व, इरादे या कदाचार का प्रमाण नहीं है, और स्रोत यह दावा नहीं करता है कि यह है। पेपर का सार पहचान और अनुमान के बारे में एक सांख्यिकीय परिणाम प्रदान करता है, न कि लोगों या दस्तावेजों को आंकने की नीति। भविष्य के काम में अनिश्चितता की सीमा, विफलता मोड और उचित सीमाएँ स्पष्ट होनी चाहिए, खासकर यदि संगठन शिक्षा, रोजगार, प्रकाशन, या अन्य उच्च-दांव वाली सेटिंग्स में परिणामों का उपयोग करने पर विचार करते हैं। वर्तमान स्रोत उन परिनियोजन प्रश्नों को खुला छोड़ देता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई नैतिकताChatGPT और एलएलएमआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?