समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

टेक एक्सप्लोर ने 22 एलएलएम में विशेषज्ञ अनुशंसाओं में बेंचमार्क खोज पूर्वाग्रह की रिपोर्ट दी है

टेक एक्सप्लोर की रिपोर्ट है कि 22 भाषा मॉडल के एक बेंचमार्क में तथ्यात्मक सटीकता और सामाजिक प्रतिनिधित्व के बीच व्यापार-बंद पाया गया जब मॉडल विशेषज्ञों की सिफारिश करते हैं। पुनर्प्राप्ति ने तथ्यात्मकता में सुधार किया, जबकि प्रतिनिधित्व में सुधार को प्रेरित किया, लेकिन किसी भी परीक्षण किए गए हस्तक्षेप से दोनों में सुधार नहीं हुआ।

6 min readRead the linked source
Source-provided image accompanying Tech Xplore reports benchmark finding bias in expert recommendations across 22 LLMs
स्रोत संदर्भस्रोत रिकार्ड किया गया
प्रकाशक
techxplore.com
स्रोत लिंक
techxplore.comhttps://techxplore.com/news/2026-08-ai-expert-benchmark-bias-llms.html
स्रोत प्रकार
लिंक्ड स्रोत - प्राथमिक-स्रोत स्थिति स्थापित नहीं की गई है।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
पूर्वाग्रह
डेटा या मॉडल व्यवहार में त्रुटि या अनुचितता का एक सुसंगत पैटर्न।
आरएजी (पुनर्प्राप्ति-संवर्धित पीढ़ी)
एक विधि जो बाहरी ज्ञान को पुनः प्राप्त करती है और उसे अनुमान के समय पीढ़ी में फीड करती है।
स्वयं की जांच करोChatGPT एवं एलएलएम प्रश्नोत्तरी

क्या हुआ?

टेक एक्सप्लोर ने एलएलएमएसकॉलरबेंच पर रिपोर्ट दी है, जो कॉम्प्लेक्सिटी साइंस हब से जुड़े शोधकर्ताओं द्वारा विकसित एक बेंचमार्क है, जो यह मूल्यांकन करता है कि बड़े भाषा मॉडल विशेषज्ञों को कैसे सलाह देते हैं। रिपोर्ट में कहा गया है कि बेंचमार्क ने तकनीकी-गुणवत्ता और सामाजिक-प्रतिनिधित्व मेट्रिक्स में 22 मॉडलों का परीक्षण किया, जिसमें पाया गया कि सिफारिशें अक्सर उच्च उद्धृत, वरिष्ठ, पुरुष, यू.एस.-आधारित और श्वेत विद्वानों का पक्ष लेती हैं। पुनर्प्राप्ति-संवर्धित पीढ़ी ने तथ्यात्मक सटीकता में सुधार किया, जबकि संकेत प्रतिनिधित्व को बढ़ा सकता है, लेकिन दो लक्ष्य तनाव में बने रहे।

टेक एक्सप्लोर ने एलएलएमएसकॉलरबेंच पर रिपोर्ट दी है, जिसे कॉम्प्लेक्सिटी साइंस हब से जुड़े शोधकर्ताओं ने 22 मॉडलों से विशेषज्ञ सिफारिशों का परीक्षण करने के लिए विकसित किया है: Gemini, GPT, Llama, Qwen, DeepSeek, Grok, Mistral और जेम्मा सहित परिवारों से 20 ओपन-वेट और दो मालिकाना मॉडल। इसने पांच तकनीकी मेट्रिक्स - तथ्यात्मक सटीकता, स्थिरता, वैधता, इनकार और डुप्लिकेट अनुशंसाएं - और चार सामाजिक मेट्रिक्स: कनेक्टिविटी, ग्रंथसूची समानता, विविधता और समता को मापा।

शोधकर्ताओं ने पहले पांच भौतिकी अनुशंसा कार्यों पर छह ओपन-वेट मॉडल का मूल्यांकन किया, जिसमें शीर्ष पांच और शीर्ष 100 प्रभावशाली विशेषज्ञों के अनुरोध शामिल थे। संदर्भ डेटाबेस में 450,000 से अधिक वैज्ञानिक शामिल थे, जिन्होंने 1893 और 2020 के बीच अमेरिकन फिजिकल सोसाइटी पत्रिकाओं में प्रकाशित किया था। टेक एक्सप्लोर का कहना है कि मॉडल ने लगभग 80% सिफारिशों में उस डेटाबेस में वैज्ञानिकों का नाम दिया, जबकि क्षेत्र और वरिष्ठता बेमेल कठिन थे; प्रारंभिक परीक्षण में भौतिकी-उपक्षेत्र बेमेल का औसत लगभग 40% था।

रिपोर्ट जनसांख्यिकीय और भौगोलिक विषमताओं का वर्णन करती है। उपक्षेत्र और अवधि के आधार पर, संदर्भ रिकॉर्ड में 14% से 32% शोधकर्ताओं का प्रतिनिधित्व महिलाओं ने किया, लेकिन मॉडलों ने अक्सर कम महिलाओं या किसी की भी सिफारिश नहीं की। एशियाई विद्वान सबसे बड़ा जनसांख्यिकीय समूह थे, फिर भी श्वेत विद्वानों को अक्सर अधिक प्रतिनिधित्व दिया गया जबकि काले और लातीनी शोधकर्ता अक्सर अनुपस्थित थे। सिफ़ारिशें अत्यधिक प्रकाशित और उद्धृत विद्वानों पर केंद्रित थीं, और छोटे मॉडलों ने कम देशों में सिफ़ारिशों को समूहीकृत किया।

टेक एक्सप्लोर तथ्यात्मकता स्कोर 0.63 से 0.82, विविधता स्कोर 0.44 से 0.69 और समता स्कोर 54% से 60% रिपोर्ट करता है। DeepSeek और Gemini तथ्यात्मकता के मामले में सबसे मजबूत थे, DeepSeek विविधता के मामले में आगे थे, और जेम्मा समानता के मामले में आगे थे। 22 मॉडलों में चार हस्तक्षेपों से पता चला कि पुनर्प्राप्ति-संवर्धित पीढ़ी ने तकनीकी गुणवत्ता, विशेष रूप से सटीकता में सुधार किया है, जबकि त्वरित इंजीनियरिंग ने प्रतिनिधित्व में सुधार किया है; उन्हें मिलाने से भी हर उपाय में एक साथ सुधार नहीं हुआ।

एक आगे के अध्ययन ने जांच की कि क्या निर्दिष्ट भूमिका, भाषा या भौगोलिक स्थान ने छह शैक्षणिक विषयों में सिफारिशों को बदल दिया है। स्थान ने परिणामों को प्रभावित किया, जबकि भाषा और भूमिका ने नहीं। वेब पुनर्प्राप्ति के साथ नए मालिकाना Gemini 2.5 प्रो और फ्लैश मॉडल के परीक्षणों ने कथित तौर पर तथ्यात्मक सटीकता में वृद्धि की लेकिन विविधता और समानता को कम कर दिया। स्रोत एलएलएमएसकॉलरबेंच को एक निश्चित रैंकिंग के बजाय एक चालू ऑडिटिंग टूल के रूप में प्रस्तुत करता है, यह देखते हुए कि शोध के बाद से कुछ मॉडल अपडेट किए गए हो सकते हैं।

स्रोत विवरण: techxplore.com ↗

यह क्यों मायने रखता है?

शोधकर्ताओं, डॉक्टरों और वकीलों सहित पेशेवर अवसरों के लिए लोगों को खोजने के लिए एआई सिस्टम का तेजी से उपयोग किया जा रहा है। यदि सिफारिशें बार-बार उन लोगों का पक्ष लेती हैं जो पहले से ही अत्यधिक दृश्यमान हैं, तो सिस्टम उनके आउटपुट को तटस्थ के रूप में प्रस्तुत करते हुए अवसरों तक पहुंच को सीमित कर सकता है। निष्कर्ष यह भी दिखाते हैं कि अनुशंसा प्रणालियों के लिए अकेले सटीकता एक अधूरा उपाय क्यों है: एक सूची में वास्तविक विशेषज्ञ शामिल हो सकते हैं और फिर भी जनसांख्यिकीय और भौगोलिक असंतुलन को पुन: उत्पन्न या तीव्र कर सकते हैं।

विशेषज्ञ की सिफारिश एक गेटकीपिंग कदम हो सकती है: सम्मेलन आयोजकों को मुख्य वक्ता मिल सकते हैं, नियोक्ता उम्मीदवार पूल इकट्ठा कर सकते हैं, और मरीज एलएलएम के माध्यम से डॉक्टरों की तलाश कर सकते हैं। टेक एक्सप्लोर की रिपोर्ट है कि शोधकर्ता इन जोखिमों को शिक्षा जगत से परे देखते हैं। अत्यधिक दृश्यमान लोगों का बार-बार नाम लेने से एक ही समूह की ओर ध्यान और अवसर जा सकते हैं, जबकि कम दिखाई देने वाले योग्य लोगों को अनदेखा किया जा सकता है।

निष्कर्ष तथ्यात्मकता को निष्पक्षता से अलग करते हैं। एक सिफारिश तथ्यात्मक रूप से मान्य हो सकती है क्योंकि व्यक्ति मौजूद है और क्षेत्र में काम करता है, फिर भी सामाजिक रूप से असंतुलित है यदि इसमें प्रासंगिक पेशेवर आबादी में मौजूद समूहों को शामिल नहीं किया गया है। तकनीकी गुणवत्ता और सामाजिक प्रतिनिधित्व के बीच रिपोर्ट का अंतर केवल यह जांचने की तुलना में अधिक उपयोगी रूपरेखा प्रदान करता है कि क्या नाम वास्तविक हैं या क्या उद्धरण उपलब्ध हैं।

हस्तक्षेप के परिणाम इस धारणा को जटिल बनाते हैं कि वेब खोज अनुशंसा पूर्वाग्रह को हल करती है। टेक एक्सप्लोर का कहना है कि पुनर्प्राप्ति ने तथ्यात्मक सटीकता में सुधार किया है, लेकिन नए मालिकाना मॉडल के परीक्षणों में, विविधता और समानता कम हो गई है। शोधकर्ता उस जोखिम का श्रेय वेब पर कम प्रतिनिधित्व को देते हैं; स्रोत इसे उनकी व्याख्या के रूप में प्रस्तुत करता है, न कि स्वतंत्र रूप से स्थापित कारण खोज के रूप में। इसलिए किसी सिस्टम को बाहरी रूप से ग्राउंड करने से उसकी जानकारी स्वचालित रूप से प्रतिनिधि नहीं बन जाती है।

अंतर्राष्ट्रीय उपयोगकर्ताओं के लिए भौगोलिक प्रभाव मायने रखता है। यदि स्थान बदलता है जिसके लिए विद्वानों की सिफारिश की जाती है, तो एक प्रणाली अकेले विशेषज्ञता के बजाय स्थानीय प्रासंगिकता या दृश्यता के बारे में धारणाओं को एन्कोड कर सकती है। सूत्र का कहना है कि भाषा और भूमिका ने रिपोर्ट किए गए परीक्षणों में परिणाम नहीं बदले, लेकिन इससे यह नहीं पता चलता कि वे अन्य विषयों, भाषाओं या मॉडलों में कभी मायने नहीं रखते। परिणाम अध्ययन की परीक्षण की गई स्थितियों पर लागू होता है।

स्रोत यह स्थापित नहीं करता है कि किसी मॉडल के कारण किसी को नौकरी, निमंत्रण या अवसर खोना पड़ा। इसमें जनसांख्यिकीय असाइनमेंट, प्रत्येक स्कोर के पीछे रनों की संख्या, या अनिश्चितता गणना निर्धारित करने के लिए पर्याप्त पद्धतिगत विवरण का भी अभाव है। संकेतों, मॉडल संस्करणों, पुनर्प्राप्ति स्रोतों और नमूने के साथ स्कोर भिन्न हो सकते हैं। इसलिए कार्य का सार्वजनिक मूल्य एक मापने योग्य जोखिम को उजागर करना और एक दोहराने योग्य ऑडिट संरचना का प्रस्ताव करना है, यह साबित नहीं करना कि प्रत्येक तैनाती समान व्यवहार करती है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

आगे क्या देखना है

स्रोत 2026 ACM SIGKDD प्रकाशन और दो arXiv अध्ययनों का हवाला देता है, लेकिन उन प्राथमिक सामग्रियों की यहां स्वतंत्र रूप से समीक्षा नहीं की गई। महत्वपूर्ण खुले प्रश्नों में शामिल है कि संकेत, नमूनाकरण, मॉडल अपडेट और जनसांख्यिकीय-वर्गीकरण विधियों के साथ परिणाम कैसे भिन्न होते हैं, और क्या बेंचमार्क वास्तविक भर्ती, प्रवेश या सम्मेलन-चयन प्रणालियों में परिणामों की भविष्यवाणी करता है। भविष्य के मूल्यांकनों में यह परीक्षण किया जाना चाहिए कि क्या व्यापक संदर्भ डेटा और संरचित मानव समीक्षा एक साथ तथ्यात्मकता और प्रतिनिधित्व में सुधार कर सकती है।

उद्धृत प्राथमिक शोध की स्वतंत्र जांच पहली प्राथमिकता है। टेक एक्सप्लोर ने बेंचमार्किंग और हस्तक्षेप-आधारित ऑडिटिंग पर 2026 एसीएम एसआईजीकेडीडी पेपर की पहचान की है, साथ ही प्रारंभिक ऑडिट और व्यक्तित्व-संकेत प्रभावों पर arXiv पेपर की पहचान की है। उन सामग्रियों में संकेतों, मॉडल संस्करणों, परीक्षण गणनाओं, सांख्यिकीय अनिश्चितता, जनसांख्यिकीय-लेबलिंग प्रक्रियाओं, संदर्भ आबादी, इनकार और डुप्लिकेट को स्पष्ट करना चाहिए। इन विवरणों का अनुमान केवल द्वितीयक रिपोर्ट से नहीं लगाया जाना चाहिए।

शोधकर्ताओं और तैनातीकर्ताओं को परीक्षण करना चाहिए कि क्या एलएलएमएसकॉलरबेंच के निष्कर्ष भौतिकी और वर्णित छह विषयों से परे हैं। एपीएस प्रकाशन रिकॉर्ड विभिन्न प्रकाशन पैटर्न, भौगोलिक संरचनाओं या जनसांख्यिकीय डेटा वाले क्षेत्रों का प्रतिनिधित्व नहीं कर सकते हैं, और अकादमिक प्रकाशन के बाहर दस्तावेजित विशेषज्ञता को याद कर सकते हैं। चिकित्सा, कानून, इंजीनियरिंग, सार्वजनिक सेवा और कुशल व्यवसायों के परीक्षण से पता चलेगा कि क्या जोखिम उन सेटिंग्स तक सामान्य है जहां लोग पहले से ही एआई सिफारिशों का उपयोग करते हैं।

मॉडल अद्यतन और पुनर्प्राप्ति स्रोतों को निरंतर निगरानी की आवश्यकता होती है। रिपोर्ट में कहा गया है कि कुछ मूल्यांकन किए गए मॉडल बदल गए हैं और वेब पुनर्प्राप्ति के साथ नए Gemini परीक्षणों का वर्णन करते हैं जो परिणामों का एक अलग संतुलन उत्पन्न करते हैं। एक भी रन पुराना हो सकता है. फॉलो-अप में समय के साथ रिलीज़ की तुलना, दस्तावेज़ पुनर्प्राप्त वेब स्रोतों की तुलना करनी चाहिए, और मापना चाहिए कि क्या परिवर्तन आयामों के बीच प्रदर्शन को बदलने के बजाय सटीकता और प्रतिनिधित्व में एक साथ सुधार करते हैं।

लोगों की अनुशंसा करने के लिए एआई का उपयोग करने वाले संगठनों को पारदर्शी मानदंड, मानवीय समीक्षा और छोड़े जाने पर योग्य व्यक्तियों पर विचार करने के तरीके की आवश्यकता होनी चाहिए। उन्हें प्रॉम्प्ट, मॉडल संस्करण, पुनर्प्राप्ति सेटिंग और आउटपुट रिकॉर्ड करना चाहिए, और नाम वास्तविक हैं या नहीं, उससे अधिक मूल्यांकन करना चाहिए। स्रोत न तो किसी नियामक आवश्यकता की रिपोर्ट करता है और न ही किसी पुष्ट उद्योग प्रतिक्रिया की, इसलिए ये जोखिमों द्वारा सुझाए गए व्यावहारिक सुरक्षा उपाय हैं, न कि बेंचमार्क के कारण पहले से अपनाए गए उपाय।

यह अनसुलझा है कि क्या अधिक प्रतिनिधि डेटा रिपोर्ट किए गए व्यापार-बंद को दूर कर सकता है। टेक एक्सप्लोर का कहना है कि टीम एक व्यापक विद्वतापूर्ण ज्ञान आधार बनाने की योजना बना रही है, लेकिन इस बात का कोई सबूत नहीं देता है कि यह पूर्ण है या बेंचमार्क प्रदर्शन में सुधार करता है। भविष्य के परिणामों को तथ्यात्मकता, विविधता और समानता में पुनरुत्पादित लाभ दिखाना चाहिए, साथ ही केवल बेंचमार्क को अनुकूलित किए बिना यथार्थवादी अनुशंसा कार्यों में दृढ़ता दिखानी चाहिए।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

ChatGPT और एलएलएमएआई मॉडल की व्याख्याएआई नैतिकताट्रांसफार्मरआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?