क्या हुआ?
टेक एक्सप्लोर ने एलएलएमएसकॉलरबेंच पर रिपोर्ट दी है, जो कॉम्प्लेक्सिटी साइंस हब से जुड़े शोधकर्ताओं द्वारा विकसित एक बेंचमार्क है, जो यह मूल्यांकन करता है कि बड़े भाषा मॉडल विशेषज्ञों को कैसे सलाह देते हैं। रिपोर्ट में कहा गया है कि बेंचमार्क ने तकनीकी-गुणवत्ता और सामाजिक-प्रतिनिधित्व मेट्रिक्स में 22 मॉडलों का परीक्षण किया, जिसमें पाया गया कि सिफारिशें अक्सर उच्च उद्धृत, वरिष्ठ, पुरुष, यू.एस.-आधारित और श्वेत विद्वानों का पक्ष लेती हैं। पुनर्प्राप्ति-संवर्धित पीढ़ी ने तथ्यात्मक सटीकता में सुधार किया, जबकि संकेत प्रतिनिधित्व को बढ़ा सकता है, लेकिन दो लक्ष्य तनाव में बने रहे।
टेक एक्सप्लोर ने एलएलएमएसकॉलरबेंच पर रिपोर्ट दी है, जिसे कॉम्प्लेक्सिटी साइंस हब से जुड़े शोधकर्ताओं ने 22 मॉडलों से विशेषज्ञ सिफारिशों का परीक्षण करने के लिए विकसित किया है: Gemini, GPT, Llama, Qwen, DeepSeek, Grok, Mistral और जेम्मा सहित परिवारों से 20 ओपन-वेट और दो मालिकाना मॉडल। इसने पांच तकनीकी मेट्रिक्स - तथ्यात्मक सटीकता, स्थिरता, वैधता, इनकार और डुप्लिकेट अनुशंसाएं - और चार सामाजिक मेट्रिक्स: कनेक्टिविटी, ग्रंथसूची समानता, विविधता और समता को मापा।
शोधकर्ताओं ने पहले पांच भौतिकी अनुशंसा कार्यों पर छह ओपन-वेट मॉडल का मूल्यांकन किया, जिसमें शीर्ष पांच और शीर्ष 100 प्रभावशाली विशेषज्ञों के अनुरोध शामिल थे। संदर्भ डेटाबेस में 450,000 से अधिक वैज्ञानिक शामिल थे, जिन्होंने 1893 और 2020 के बीच अमेरिकन फिजिकल सोसाइटी पत्रिकाओं में प्रकाशित किया था। टेक एक्सप्लोर का कहना है कि मॉडल ने लगभग 80% सिफारिशों में उस डेटाबेस में वैज्ञानिकों का नाम दिया, जबकि क्षेत्र और वरिष्ठता बेमेल कठिन थे; प्रारंभिक परीक्षण में भौतिकी-उपक्षेत्र बेमेल का औसत लगभग 40% था।
रिपोर्ट जनसांख्यिकीय और भौगोलिक विषमताओं का वर्णन करती है। उपक्षेत्र और अवधि के आधार पर, संदर्भ रिकॉर्ड में 14% से 32% शोधकर्ताओं का प्रतिनिधित्व महिलाओं ने किया, लेकिन मॉडलों ने अक्सर कम महिलाओं या किसी की भी सिफारिश नहीं की। एशियाई विद्वान सबसे बड़ा जनसांख्यिकीय समूह थे, फिर भी श्वेत विद्वानों को अक्सर अधिक प्रतिनिधित्व दिया गया जबकि काले और लातीनी शोधकर्ता अक्सर अनुपस्थित थे। सिफ़ारिशें अत्यधिक प्रकाशित और उद्धृत विद्वानों पर केंद्रित थीं, और छोटे मॉडलों ने कम देशों में सिफ़ारिशों को समूहीकृत किया।
टेक एक्सप्लोर तथ्यात्मकता स्कोर 0.63 से 0.82, विविधता स्कोर 0.44 से 0.69 और समता स्कोर 54% से 60% रिपोर्ट करता है। DeepSeek और Gemini तथ्यात्मकता के मामले में सबसे मजबूत थे, DeepSeek विविधता के मामले में आगे थे, और जेम्मा समानता के मामले में आगे थे। 22 मॉडलों में चार हस्तक्षेपों से पता चला कि पुनर्प्राप्ति-संवर्धित पीढ़ी ने तकनीकी गुणवत्ता, विशेष रूप से सटीकता में सुधार किया है, जबकि त्वरित इंजीनियरिंग ने प्रतिनिधित्व में सुधार किया है; उन्हें मिलाने से भी हर उपाय में एक साथ सुधार नहीं हुआ।
एक आगे के अध्ययन ने जांच की कि क्या निर्दिष्ट भूमिका, भाषा या भौगोलिक स्थान ने छह शैक्षणिक विषयों में सिफारिशों को बदल दिया है। स्थान ने परिणामों को प्रभावित किया, जबकि भाषा और भूमिका ने नहीं। वेब पुनर्प्राप्ति के साथ नए मालिकाना Gemini 2.5 प्रो और फ्लैश मॉडल के परीक्षणों ने कथित तौर पर तथ्यात्मक सटीकता में वृद्धि की लेकिन विविधता और समानता को कम कर दिया। स्रोत एलएलएमएसकॉलरबेंच को एक निश्चित रैंकिंग के बजाय एक चालू ऑडिटिंग टूल के रूप में प्रस्तुत करता है, यह देखते हुए कि शोध के बाद से कुछ मॉडल अपडेट किए गए हो सकते हैं।
यह क्यों मायने रखता है?
शोधकर्ताओं, डॉक्टरों और वकीलों सहित पेशेवर अवसरों के लिए लोगों को खोजने के लिए एआई सिस्टम का तेजी से उपयोग किया जा रहा है। यदि सिफारिशें बार-बार उन लोगों का पक्ष लेती हैं जो पहले से ही अत्यधिक दृश्यमान हैं, तो सिस्टम उनके आउटपुट को तटस्थ के रूप में प्रस्तुत करते हुए अवसरों तक पहुंच को सीमित कर सकता है। निष्कर्ष यह भी दिखाते हैं कि अनुशंसा प्रणालियों के लिए अकेले सटीकता एक अधूरा उपाय क्यों है: एक सूची में वास्तविक विशेषज्ञ शामिल हो सकते हैं और फिर भी जनसांख्यिकीय और भौगोलिक असंतुलन को पुन: उत्पन्न या तीव्र कर सकते हैं।
विशेषज्ञ की सिफारिश एक गेटकीपिंग कदम हो सकती है: सम्मेलन आयोजकों को मुख्य वक्ता मिल सकते हैं, नियोक्ता उम्मीदवार पूल इकट्ठा कर सकते हैं, और मरीज एलएलएम के माध्यम से डॉक्टरों की तलाश कर सकते हैं। टेक एक्सप्लोर की रिपोर्ट है कि शोधकर्ता इन जोखिमों को शिक्षा जगत से परे देखते हैं। अत्यधिक दृश्यमान लोगों का बार-बार नाम लेने से एक ही समूह की ओर ध्यान और अवसर जा सकते हैं, जबकि कम दिखाई देने वाले योग्य लोगों को अनदेखा किया जा सकता है।
निष्कर्ष तथ्यात्मकता को निष्पक्षता से अलग करते हैं। एक सिफारिश तथ्यात्मक रूप से मान्य हो सकती है क्योंकि व्यक्ति मौजूद है और क्षेत्र में काम करता है, फिर भी सामाजिक रूप से असंतुलित है यदि इसमें प्रासंगिक पेशेवर आबादी में मौजूद समूहों को शामिल नहीं किया गया है। तकनीकी गुणवत्ता और सामाजिक प्रतिनिधित्व के बीच रिपोर्ट का अंतर केवल यह जांचने की तुलना में अधिक उपयोगी रूपरेखा प्रदान करता है कि क्या नाम वास्तविक हैं या क्या उद्धरण उपलब्ध हैं।
हस्तक्षेप के परिणाम इस धारणा को जटिल बनाते हैं कि वेब खोज अनुशंसा पूर्वाग्रह को हल करती है। टेक एक्सप्लोर का कहना है कि पुनर्प्राप्ति ने तथ्यात्मक सटीकता में सुधार किया है, लेकिन नए मालिकाना मॉडल के परीक्षणों में, विविधता और समानता कम हो गई है। शोधकर्ता उस जोखिम का श्रेय वेब पर कम प्रतिनिधित्व को देते हैं; स्रोत इसे उनकी व्याख्या के रूप में प्रस्तुत करता है, न कि स्वतंत्र रूप से स्थापित कारण खोज के रूप में। इसलिए किसी सिस्टम को बाहरी रूप से ग्राउंड करने से उसकी जानकारी स्वचालित रूप से प्रतिनिधि नहीं बन जाती है।
अंतर्राष्ट्रीय उपयोगकर्ताओं के लिए भौगोलिक प्रभाव मायने रखता है। यदि स्थान बदलता है जिसके लिए विद्वानों की सिफारिश की जाती है, तो एक प्रणाली अकेले विशेषज्ञता के बजाय स्थानीय प्रासंगिकता या दृश्यता के बारे में धारणाओं को एन्कोड कर सकती है। सूत्र का कहना है कि भाषा और भूमिका ने रिपोर्ट किए गए परीक्षणों में परिणाम नहीं बदले, लेकिन इससे यह नहीं पता चलता कि वे अन्य विषयों, भाषाओं या मॉडलों में कभी मायने नहीं रखते। परिणाम अध्ययन की परीक्षण की गई स्थितियों पर लागू होता है।
स्रोत यह स्थापित नहीं करता है कि किसी मॉडल के कारण किसी को नौकरी, निमंत्रण या अवसर खोना पड़ा। इसमें जनसांख्यिकीय असाइनमेंट, प्रत्येक स्कोर के पीछे रनों की संख्या, या अनिश्चितता गणना निर्धारित करने के लिए पर्याप्त पद्धतिगत विवरण का भी अभाव है। संकेतों, मॉडल संस्करणों, पुनर्प्राप्ति स्रोतों और नमूने के साथ स्कोर भिन्न हो सकते हैं। इसलिए कार्य का सार्वजनिक मूल्य एक मापने योग्य जोखिम को उजागर करना और एक दोहराने योग्य ऑडिट संरचना का प्रस्ताव करना है, यह साबित नहीं करना कि प्रत्येक तैनाती समान व्यवहार करती है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
What is a common training objective for an autoregressive language model?
आगे क्या देखना है
स्रोत 2026 ACM SIGKDD प्रकाशन और दो arXiv अध्ययनों का हवाला देता है, लेकिन उन प्राथमिक सामग्रियों की यहां स्वतंत्र रूप से समीक्षा नहीं की गई। महत्वपूर्ण खुले प्रश्नों में शामिल है कि संकेत, नमूनाकरण, मॉडल अपडेट और जनसांख्यिकीय-वर्गीकरण विधियों के साथ परिणाम कैसे भिन्न होते हैं, और क्या बेंचमार्क वास्तविक भर्ती, प्रवेश या सम्मेलन-चयन प्रणालियों में परिणामों की भविष्यवाणी करता है। भविष्य के मूल्यांकनों में यह परीक्षण किया जाना चाहिए कि क्या व्यापक संदर्भ डेटा और संरचित मानव समीक्षा एक साथ तथ्यात्मकता और प्रतिनिधित्व में सुधार कर सकती है।
उद्धृत प्राथमिक शोध की स्वतंत्र जांच पहली प्राथमिकता है। टेक एक्सप्लोर ने बेंचमार्किंग और हस्तक्षेप-आधारित ऑडिटिंग पर 2026 एसीएम एसआईजीकेडीडी पेपर की पहचान की है, साथ ही प्रारंभिक ऑडिट और व्यक्तित्व-संकेत प्रभावों पर arXiv पेपर की पहचान की है। उन सामग्रियों में संकेतों, मॉडल संस्करणों, परीक्षण गणनाओं, सांख्यिकीय अनिश्चितता, जनसांख्यिकीय-लेबलिंग प्रक्रियाओं, संदर्भ आबादी, इनकार और डुप्लिकेट को स्पष्ट करना चाहिए। इन विवरणों का अनुमान केवल द्वितीयक रिपोर्ट से नहीं लगाया जाना चाहिए।
शोधकर्ताओं और तैनातीकर्ताओं को परीक्षण करना चाहिए कि क्या एलएलएमएसकॉलरबेंच के निष्कर्ष भौतिकी और वर्णित छह विषयों से परे हैं। एपीएस प्रकाशन रिकॉर्ड विभिन्न प्रकाशन पैटर्न, भौगोलिक संरचनाओं या जनसांख्यिकीय डेटा वाले क्षेत्रों का प्रतिनिधित्व नहीं कर सकते हैं, और अकादमिक प्रकाशन के बाहर दस्तावेजित विशेषज्ञता को याद कर सकते हैं। चिकित्सा, कानून, इंजीनियरिंग, सार्वजनिक सेवा और कुशल व्यवसायों के परीक्षण से पता चलेगा कि क्या जोखिम उन सेटिंग्स तक सामान्य है जहां लोग पहले से ही एआई सिफारिशों का उपयोग करते हैं।
मॉडल अद्यतन और पुनर्प्राप्ति स्रोतों को निरंतर निगरानी की आवश्यकता होती है। रिपोर्ट में कहा गया है कि कुछ मूल्यांकन किए गए मॉडल बदल गए हैं और वेब पुनर्प्राप्ति के साथ नए Gemini परीक्षणों का वर्णन करते हैं जो परिणामों का एक अलग संतुलन उत्पन्न करते हैं। एक भी रन पुराना हो सकता है. फॉलो-अप में समय के साथ रिलीज़ की तुलना, दस्तावेज़ पुनर्प्राप्त वेब स्रोतों की तुलना करनी चाहिए, और मापना चाहिए कि क्या परिवर्तन आयामों के बीच प्रदर्शन को बदलने के बजाय सटीकता और प्रतिनिधित्व में एक साथ सुधार करते हैं।
लोगों की अनुशंसा करने के लिए एआई का उपयोग करने वाले संगठनों को पारदर्शी मानदंड, मानवीय समीक्षा और छोड़े जाने पर योग्य व्यक्तियों पर विचार करने के तरीके की आवश्यकता होनी चाहिए। उन्हें प्रॉम्प्ट, मॉडल संस्करण, पुनर्प्राप्ति सेटिंग और आउटपुट रिकॉर्ड करना चाहिए, और नाम वास्तविक हैं या नहीं, उससे अधिक मूल्यांकन करना चाहिए। स्रोत न तो किसी नियामक आवश्यकता की रिपोर्ट करता है और न ही किसी पुष्ट उद्योग प्रतिक्रिया की, इसलिए ये जोखिमों द्वारा सुझाए गए व्यावहारिक सुरक्षा उपाय हैं, न कि बेंचमार्क के कारण पहले से अपनाए गए उपाय।
यह अनसुलझा है कि क्या अधिक प्रतिनिधि डेटा रिपोर्ट किए गए व्यापार-बंद को दूर कर सकता है। टेक एक्सप्लोर का कहना है कि टीम एक व्यापक विद्वतापूर्ण ज्ञान आधार बनाने की योजना बना रही है, लेकिन इस बात का कोई सबूत नहीं देता है कि यह पूर्ण है या बेंचमार्क प्रदर्शन में सुधार करता है। भविष्य के परिणामों को तथ्यात्मकता, विविधता और समानता में पुनरुत्पादित लाभ दिखाना चाहिए, साथ ही केवल बेंचमार्क को अनुकूलित किए बिना यथार्थवादी अनुशंसा कार्यों में दृढ़ता दिखानी चाहिए।