क्या हुआ?
लेखकों की रिपोर्ट है कि पुनर्प्राप्ति-संवर्धित भाषा-मॉडल प्रणालियाँ अस्थिर हो सकती हैं जब खोज परिणामों में पहले से समान मॉडल द्वारा उत्पन्न सामग्री शामिल होती है। तीन सिमुलेशन प्रकारों, तीन मॉडल परिवारों और 1,019 सूचना-प्राप्ति संकेतों में, 1,528 सिमुलेशन में से 1,216 कथित तौर पर ढह गए।
स्रोत 22 अगस्त, 2026 को प्रस्तुत एक arXiv पेपर है, जिसका शीर्षक है "आरएजी पतन: एलएलएम प्रतिक्रियाएँ संक्षिप्त जब पुनर्प्राप्त दस्तावेज़ स्व-लेखक होते हैं।" इसका केंद्रीय दावा यह है कि एक भाषा-मॉडल प्रणाली ख़राब हो सकती है जब एक पुनर्प्राप्ति उपकरण उसी प्रणाली द्वारा उत्पन्न संदर्भ लौटाता है। लेखक इसे मॉडल आउटपुट पर पुनरावर्ती प्रशिक्षण से अलग करते हैं: यहां, फीडबैक लूप को सूचना पुनर्प्राप्ति के दौरान पेश किया जाता है, जब उत्पन्न दस्तावेज़ बाद की प्रतिक्रियाओं के लिए संदर्भ के रूप में उपलब्ध हो जाते हैं। पेपर परिणामी पैटर्न को "आरएजी पतन" कहता है।
लेखकों का कहना है कि उन्होंने एआई सिस्टम से जुड़े तीन प्रकार के सिमुलेशन का परीक्षण किया, जो उनके द्वारा उत्पन्न संदर्भों को पुनः प्राप्त कर रहे थे। प्रदान किया गया सार तीन मॉडल परिवारों, 1,019 सूचना-मांग संकेत, 1,528 सिमुलेशन और दस लाख से अधिक भाषा-मॉडल एपीआई कॉल की पहचान करता है। यह रिपोर्ट करता है कि 1,216 सिमुलेशन, या 79.6%, पतन में समाप्त हो गए। स्रोत मॉडल परिवारों का नाम नहीं देता है, संकेतों का विस्तार से वर्णन नहीं करता है, पुनर्प्राप्ति कॉन्फ़िगरेशन निर्दिष्ट करता है, या यह तय करने के लिए उपयोग किए जाने वाले परिचालन परीक्षण देता है कि सिमुलेशन ढह गया था।
पेपर यह भी रिपोर्ट करता है कि एक स्व-लिखित संदर्भ प्रभाव को ट्रिगर करने के लिए पर्याप्त हो सकता है। लेखकों के अनुसार, भाषा मॉडल ने असंगत रूप से अपनी स्वयं की सामग्री का हवाला दिया, और यह आत्म-पूर्वाग्रह शोधकर्ताओं द्वारा संदर्भ गुणवत्ता के लिए नियंत्रित किए जाने के बाद भी बना रहा। यह अंतर मायने रखता है: रिपोर्ट किया गया तंत्र केवल यह नहीं है कि खराब दस्तावेज़ पुनर्प्राप्ति सेट को दूषित करते हैं। इसके बजाय स्रोत स्वयं-लेखकत्व को एक स्वतंत्र कारक के रूप में प्रस्तुत करता है कि पुनर्प्राप्त संदर्भों का चयन या उपयोग कैसे किया जाता है।
ये निष्कर्ष आपूर्ति की गई सामग्री में स्वतंत्र रूप से स्थापित तथ्यों के बजाय arXiv सबमिशन के दावे बने हुए हैं। स्रोत इस कार्य की पहचान 31 अंकों और चार तालिकाओं वाले 36-पृष्ठ के पेपर के रूप में करता है, लेकिन प्रदान किए गए पाठ में केवल सार और ग्रंथ सूची संबंधी जानकारी शामिल है। यह सहकर्मी समीक्षा, बाहरी प्रतिकृति, लाइव-सिस्टम परीक्षण या पूर्ण प्रयोगात्मक परिणामों की रिपोर्ट नहीं करता है। दृश्यमान टाइमस्टैम्प सबमिशन को वर्तमान 96-घंटे की विंडो के भीतर रखता है, लेकिन स्रोत प्रारंभिक सबमिशन के बाद कोई बाद का अपडेट प्रदान नहीं करता है।
यह क्यों मायने रखता है?
परिणाम उन प्रणालियों के लिए संभावित फीडबैक समस्या की पहचान करता है जो जमीनी उत्तरों के लिए खोज या दस्तावेज़ पुनर्प्राप्ति का उपयोग करते हैं। यह सुझाव देता है कि मॉडल-जनरेटेड सामग्री असंगत प्रभाव प्राप्त कर सकती है, भले ही वह अन्य संदर्भों से बेहतर न हो, हालांकि आपूर्ति किया गया स्रोत यह स्थापित नहीं करता है कि तैनात सिस्टम में यह कितनी बार होता है।
पुनर्प्राप्ति-संवर्धित पीढ़ी का उद्देश्य किसी भाषा मॉडल को केवल उसके मापदंडों में संग्रहीत जानकारी पर निर्भर रहने के बजाय बाहरी संदर्भों से जोड़ना है। यदि पुनर्प्राप्त सामग्री में तेजी से मॉडल-जनित पाठ शामिल होता है, तो सिस्टम अपने स्वयं के वाक्यांश, चूक या त्रुटियों को बाद के उत्तरों में फ़ीड कर सकता है। इसलिए पेपर का रिपोर्ट किया गया परिणाम एआई सिस्टम के लिए प्रत्यक्ष विश्वसनीयता जोखिम की चिंता करता है जो दस्तावेज़ संग्रह की खोज, सारांश या पुन: उपयोग करता है।
रिपोर्ट किया गया आत्म-पूर्वाग्रह विशेष रूप से प्रासंगिक है क्योंकि यह तब भी बना रह सकता है जब अन्य संदर्भ तुलनीय या अधिक गुणवत्ता वाले हों। यदि पेपर के सिमुलेशन के बाहर पुष्टि की जाती है, तो यह आम धारणाओं को जटिल बना देगा कि अधिक पुनर्प्राप्त सामग्री जोड़ने से स्वचालित रूप से ग्राउंडिंग में सुधार होता है। एक पुनर्प्राप्ति प्रणाली को केवल प्रासंगिकता या स्पष्ट गुणवत्ता के आधार पर दस्तावेजों का मूल्यांकन करने के बजाय, उत्पत्ति को ट्रैक करने और मॉडल-लिखित दस्तावेजों को स्वतंत्र रूप से उत्पादित स्रोतों से अलग तरीके से व्यवहार करने की आवश्यकता हो सकती है।
व्यावहारिक निहितार्थ संभावित रूप से व्यापक हैं लेकिन इन्हें बढ़ा-चढ़ाकर नहीं बताया जाना चाहिए। स्रोत यह नहीं दिखाता है कि तैनात खोज इंजन, उद्यम ज्ञान आधार, या उपभोक्ता सहायक वर्तमान में पतन के दौर से गुजर रहे हैं। यह यह भी स्थापित नहीं करता है कि सभी मॉडल-जनरेटेड दस्तावेज़ अविश्वसनीय हैं, कि पुनर्प्राप्ति प्रणालियाँ नियमित रूप से स्व-लिखित सामग्री का पक्ष लेती हैं, या कि रिपोर्ट की गई दर परीक्षण किए गए सिमुलेशन के बाहर लागू होती है। पेपर एक संभावित फीडबैक तंत्र के बारे में चेतावनी देता है, न कि व्यापक एआई पारिस्थितिकी तंत्र में इसकी व्यापकता का मापा अनुमान।
परिणाम शासन और माप की समस्या को भी उजागर करता है। जब एआई-जनित सामग्री सूचना वातावरण में प्रवेश करती है, तो बाद के सिस्टम को मूल साक्ष्य को व्युत्पन्न पाठ से अलग करने में कठिनाई हो सकती है। आपूर्ति किया गया स्रोत पूर्ण समाधान का प्रस्ताव नहीं करता है, लेकिन इसके निष्कर्ष पुनर्प्राप्ति-आधारित एआई का उपयोग करने वाले डेवलपर्स और संस्थानों के लिए उत्पत्ति, स्रोत स्वतंत्रता और बार-बार सामग्री का पता लगाने को व्यावहारिक मुद्दे बनाते हैं। वे निहितार्थ लेखकों के दावे से सशर्त रूप से अनुसरण करते हैं और व्यापक परिचालन निष्कर्षों का समर्थन करने से पहले वास्तविक पुनर्प्राप्ति पाइपलाइनों के खिलाफ परीक्षण की आवश्यकता होती है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
What is a common training objective for an autoregressive language model?
आगे क्या देखना है
मुख्य अनुवर्ती प्रश्न यह हैं कि पेपर पतन को कैसे परिभाषित करता है, क्या परिणाम मॉडल और वास्तविक दुनिया पुनर्प्राप्ति प्रणालियों में दोहराया जाता है, और कौन से सुरक्षा उपाय प्रभाव को कम करते हैं। स्रोत वे विवरण प्रदान नहीं करता है, न ही यह किसी हस्तक्षेप, परिनियोजन अध्ययन, या बाहरी प्रतिकृति की रिपोर्ट करता है।
जांच करने योग्य पहला मुद्दा पेपर की "पतन" की परिभाषा है। सार शब्द का उपयोग करता है और इसे पुनरावर्ती मॉडल प्रशिक्षण पर पहले के काम से जोड़ता है, जहां आउटपुट कम विविध हो जाते हैं और अंततः मूल डेटा जैसा दिखना बंद हो जाते हैं। लेकिन आपूर्ति किए गए स्रोत में यह नहीं बताया गया है कि नए प्रयोगों में विविधता, तथ्यात्मक सटीकता, स्रोत ओवरलैप, उद्धरण व्यवहार, उत्तर समानता, या किसी अन्य परिणाम को मापा गया है या नहीं। पूरे पेपर का मानदंड यह निर्धारित करेगा कि परिणाम सीधे उपयोगकर्ता-दृश्यमान विश्वसनीयता विफलताओं को कैसे दर्शाता है।
प्रतिकृति अगला महत्वपूर्ण परीक्षण है। लेखक तीन मॉडल परिवारों और तीन सिमुलेशन प्रकारों की रिपोर्ट करते हैं, लेकिन स्रोत उनकी पहचान नहीं करता है या यह नहीं बताता है कि वे वर्तमान पुनर्प्राप्ति-संवर्धित प्रणालियों के कितने प्रतिनिधि हैं। स्वतंत्र शोधकर्ताओं को विभिन्न मॉडल आकार, पुनर्प्राप्ति एल्गोरिदम, दस्तावेज़ मिश्रण, प्रेरक रणनीतियों और एआई-जनित सामग्री के अनुपात का परीक्षण करने की आवश्यकता होगी। उन्हें स्व-लेखकत्व के कारण होने वाले प्रभावों को सामान्य पुनर्प्राप्ति त्रुटियों, डुप्लिकेट दस्तावेज़ों या निम्न-गुणवत्ता वाले संदर्भों से अलग करने की भी आवश्यकता होगी।
वास्तविक दुनिया की व्यापकता एक और अज्ञात है। पेपर में बताया गया है कि 79.6% सिमुलेशन ख़त्म हो रहे हैं, लेकिन यह आंकड़ा इंटरनेट खोज, एंटरप्राइज़ डेटाबेस, या किसी अन्य तैनात सिस्टम के लिए जनसंख्या अनुमान नहीं है। स्रोत यह नहीं बताता है कि किसी मॉडल के स्वयं के दस्तावेज़ प्रासंगिक पुनर्प्राप्ति परिणामों में कितनी बार दिखाई देते हैं, फीडबैक लूप में कितना समय लगता है, या क्या मानव-संपादित और स्वतंत्र रूप से सत्यापित सामग्री इसमें बाधा डालती है। सिमुलेशन परिणाम को सार्वजनिक प्रभाव के पूर्वानुमान में अनुवाद करने से पहले वे माप आवश्यक हैं।
अंत में, अनुवर्ती कार्य में सुरक्षा उपायों का परीक्षण किया जाना चाहिए। उपयोगी तुलनाओं में उद्गम लेबल, एक ही मॉडल या सिस्टम द्वारा उत्पन्न दस्तावेज़ों का बहिष्कार, स्रोत-विविधता आवश्यकताएं, स्वतंत्र रैंकिंग और उच्च जोखिम वाले उपयोगों के लिए मानव समीक्षा शामिल होगी। आपूर्ति किया गया स्रोत किसी शमन प्रयोग की रिपोर्ट नहीं करता है और कोई उपलब्धता या उत्पाद का दावा नहीं करता है। जब तक ऐसे परीक्षण प्रकाशित नहीं हो जाते, डेवलपर्स और उपयोगकर्ताओं को पेपर को संभावित रूप से महत्वपूर्ण विफलता मोड के सबूत के रूप में मानना चाहिए, जबकि यह पहचानना चाहिए कि इसकी गंभीरता और उपचार अनसुलझे हैं।