समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

प्रीप्रिंट एआई पैदल यात्री-उपज वाले निर्णयों में जनसांख्यिकीय पूर्वाग्रह की रिपोर्ट करता है

एक नया बेंचमार्क रिपोर्ट करता है कि भाषा और दृष्टि-भाषा मॉडल जनसांख्यिकीय विशेषताओं के आधार पर पैदल यात्री-उपज वाले निर्णयों को बदलते हैं, जिससे एआई-निर्देशित स्वायत्त वाहनों के लिए निष्पक्षता संबंधी चिंताएं बढ़ जाती हैं।

5 min readRead the primary source
Source-provided image accompanying Preprint reports demographic bias in AI pedestrian-yielding decisions
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2609.00192
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

पूर्वाग्रह
डेटा या मॉडल व्यवहार में त्रुटि या अनुचितता का एक सुसंगत पैटर्न।
बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
स्वयं की जांच करोएआई नैतिकता प्रश्नोत्तरी

क्या हुआ?

एक arXiv प्रीप्रिंट बड़े भाषा मॉडल और स्वायत्त-वाहन निर्णयों को सूचित करने के लिए उपयोग किए जाने वाले दृष्टि-भाषा मॉडल में पूर्वाग्रह को मापने के लिए दो परीक्षण पेश करता है। लेखकों की रिपोर्ट है कि मॉडलों की पैदल चलने वालों की पसंद लिंग, जातीयता, धर्म, विकलांगता, उम्र, त्वचा की टोन और सामाजिक आर्थिक स्थिति से प्रभावित थी।

31 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर, स्वायत्त-वाहन निर्णय लेने में सामान्य-उद्देश्य "सामान्य ज्ञान" मॉडल के प्रस्तावित उपयोग की जांच करता है। इसका केंद्रीय प्रश्न यह है कि क्या भाषा मॉडल और दृष्टि-भाषा मॉडल मानव ड्राइविंग पूर्वाग्रहों को इस निर्णय में लाते हैं कि वाहन को पैदल यात्री के लिए रास्ता देना चाहिए या नहीं। स्रोत इसे एआई सिस्टम के लिए एक मूल्यांकन समस्या के रूप में प्रस्तुत करता है, न कि इस सबूत के रूप में कि एक विशेष वाणिज्यिक स्वायत्त-वाहन बेड़े ने दस्तावेजी नुकसान पहुंचाया है। उपलब्ध सार कार्य को मॉडल व्यवहार और मूल्यांकन के दायरे के इर्द-गिर्द ढाँचा देता है, न कि रिकॉर्ड की गई सड़क की घटनाओं के इर्द-गिर्द।

लेखक दो परीक्षण विधियाँ प्रस्तावित करते हैं। "ऑल एल्स बीइंग इक्वल" परीक्षणों का उद्देश्य पैदल यात्री विशेषता को बदलते समय निर्णयों की तुलना करना है, जिससे शोधकर्ताओं को यह जांचने की अनुमति मिलती है कि क्या बाकी परिदृश्य को स्थिर रखने पर मॉडल की प्रतिक्रिया बदलती है। "स्व-संगति" परीक्षण यह जांच करते हैं कि क्या कोई मॉडल संबंधित मूल्यांकनों में स्थिर निर्णय लेता है। स्रोत इन विधियों की पहचान करता है लेकिन उपलब्ध सार में उनकी पूर्ण प्रक्रियाएं, नमूना आकार, मॉडल सूची या संख्यात्मक परिणाम प्रदान नहीं करता है। ये विवरण पूर्ण पेपर के लिए कार्यान्वयन विवरण छोड़ते हुए, तुलनात्मक रूपरेखा स्थापित करते हैं।

सार रिपोर्ट है कि एलएलएम और वीएलएम दोनों ने लिंग, जातीयता, धर्म, विकलांगता, उम्र, त्वचा की टोन और सामाजिक आर्थिक स्थिति से प्रभावित होकर पैदल चलने वाले-उपज वाले निर्णय लिए। इसमें कहा गया है कि पूर्वाग्रह का प्रकार और डिग्री सभी मॉडलों में भिन्न है और आवर्ती पैटर्न पर प्रकाश डालता है। स्रोत यह नहीं कहता है कि सभी मॉडलों ने एक ही पूर्वाग्रह दिखाया, उन विशिष्ट समूहों की पहचान की जो हर परीक्षण में पसंदीदा या वंचित थे, या यह स्थापित नहीं किया कि भौतिक सड़क वातावरण में कोई भी परिणाम कितनी बार आएगा। तदनुसार, सार मापा मॉडल प्रतिक्रियाओं के बारे में चिंता का समर्थन करता है लेकिन तैनाती के बारे में निष्कर्ष को सीमित करता है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

निष्कर्ष बताते हैं कि स्वायत्त वाहनों के लिए एआई का मूल्यांकन करने के लिए तकनीकी सफलता को मापने से कहीं अधिक की आवश्यकता है: मॉडल निर्णयों में जनसांख्यिकीय पूर्वाग्रह इस बात को प्रभावित कर सकता है कि सिस्टम सुरक्षा-महत्वपूर्ण स्थितियों में पैदल चलने वालों के साथ कैसा व्यवहार करते हैं।

व्यावहारिक महत्व यह है कि जब सामाजिक विशेषताएँ परिदृश्य का हिस्सा होती हैं तो एक मॉडल असमान निर्णय लेते हुए भी एक सामान्य कार्य में सक्षम दिखाई दे सकता है। एक स्वायत्त-वाहन संदर्भ में, पैदल चलने वालों का झुकना केवल एक भाषाई कार्य नहीं है: यह एक सुरक्षा-महत्वपूर्ण विकल्प से जुड़ा है कि एक वाहन को कमजोर सड़क उपयोगकर्ताओं के आसपास कैसे व्यवहार करना चाहिए। इसलिए पेपर का तर्क है कि जब ऐसे निर्णयों को निर्देशित करने के लिए मॉडल का उपयोग किया जाता है तो तकनीकी प्रदर्शन के साथ-साथ निष्पक्षता का भी मूल्यांकन किया जाना चाहिए। यह अंतर मायने रखता है क्योंकि प्रासंगिक आउटपुट एक निर्णय अनुशंसा है, न कि संपूर्ण ड्राइविंग नीति।

अध्ययन वाहन तर्क के लिए सामान्य प्रयोजन मॉडल का उपयोग करने के पीछे एक आम धारणा को भी चुनौती देता है: मानव ज्ञान का व्यापक प्रदर्शन विश्वसनीय सामान्य ज्ञान निर्णय प्रदान करेगा। यदि मॉडल असमान मानव व्यवहार से जुड़े पैटर्न को पुन: पेश करता है, तो इसे वाहन की निर्णय प्रक्रिया में जोड़ने से उन पैटर्न को सार्वजनिक स्थान पर संचालित होने वाली प्रणाली में स्थानांतरित किया जा सकता है। स्रोत यह प्रदर्शित नहीं करता है कि यह स्थानांतरण तैनात वाहनों में हुआ है, लेकिन यह एक संभावित जोखिम की पहचान करता है जिसे डेवलपर्स को इन मॉडलों पर भरोसा करने से पहले परीक्षण करने की आवश्यकता होगी। परिणामस्वरूप चिंता एक संभावित डिज़ाइन मार्ग और उसके मूल्यांकन के बारे में है, न कि दस्तावेजी बेड़े के परिणाम के बारे में।

बेंचमार्क उपयोगी हो सकता है क्योंकि यह पूर्वाग्रह परीक्षण को केवल तैनाती के बाद खोजे गए मुद्दे के बजाय एआई मूल्यांकन के दोहराए जाने वाले भाग के रूप में मानता है। एकाधिक विशेषताओं का परीक्षण करने से उन इंटरैक्शन का पता चल सकता है जो एक संरक्षित-श्रेणी की जांच से चूक जाते हैं, जबकि मॉडल की तुलना करने से पता चल सकता है कि अलग-अलग सिस्टम अलग-अलग तरीकों से विफल होते हैं। फिर भी, पेपर एक arXiv प्रीप्रिंट है, और उपलब्ध स्रोत में कोई स्वतंत्र प्रतिकृति, सहकर्मी-समीक्षा स्थिति, वास्तविक दुनिया ड्राइविंग डेटा, क्रैश विश्लेषण या सबूत नहीं है कि बेंचमार्क अंतर सीधे भौतिक परिणामों में अनुवाद करते हैं। वे सीमाएँ स्क्रीनिंग के लिए बेंचमार्क को जानकारीपूर्ण बनाती हैं, जबकि वास्तविक दुनिया के महत्व को अनसुलझा छोड़ देती हैं।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

आगे क्या देखना है

अगले महत्वपूर्ण प्रश्न हैं कि कौन से मॉडल और परिदृश्य सबसे मजबूत प्रभाव उत्पन्न करते हैं, क्या निष्कर्ष बेंचमार्क संकेतों के बाहर बने रहते हैं, और क्या मॉडल परिवर्तन या स्वतंत्र सुरक्षा उपाय नई सुरक्षा समस्याएं पैदा किए बिना पूर्वाग्रह को कम कर सकते हैं।

एक पूर्ण मूल्यांकन में बेंचमार्क के डिज़ाइन और कवरेज को स्पष्ट करना चाहिए। महत्वपूर्ण विवरणों में मूल्यांकन किए गए मॉडलों की संख्या और पहचान शामिल है, क्या एलएलएम को केवल पाठ परिदृश्य प्राप्त हुए जबकि वीएलएम को छवियां प्राप्त हुईं, पैदल यात्री विशेषताओं का प्रतिनिधित्व कैसे किया गया, उपज को कैसे परिभाषित किया गया, और क्या परिदृश्य यथार्थवादी सड़क स्थितियों को प्रतिबिंबित करते हैं। सार प्रभाव आकार, आत्मविश्वास अंतराल, त्रुटि दर, आधारभूत तुलना या मामलों के वितरण की रिपोर्ट नहीं करता है, इसलिए पाठक इस स्रोत से यह निर्धारित नहीं कर सकते हैं कि रिपोर्ट किए गए अंतर कितने बड़े या मजबूत हैं। उन मापों के बिना, सार दिशा और दायरे को इंगित करता है लेकिन जोखिम का सटीक अनुमान नहीं देता है।

सबसे मजबूत अनुवर्ती परीक्षण करेगा कि क्या पैटर्न शब्दों, छवि संरचना, प्रकाश व्यवस्था, सड़क लेआउट और पैदल यात्री व्यवहार में बदलाव से बचे हैं। किसी वाहन को नियंत्रित करने वाली वास्तविक नीति या नियंत्रण परत के साथ मॉडल आउटपुट की तुलना करना भी महत्वपूर्ण होगा, क्योंकि किसी मॉडल की अनुशंसा को अन्य घटकों द्वारा फ़िल्टर, ओवरराइड या अनदेखा किया जा सकता है। स्रोत उन मॉडलों पर चर्चा करता है जो स्वायत्त-वाहन निर्णय लेने का मार्गदर्शन करते हैं, लेकिन यह स्थापित नहीं करता है कि परीक्षण किए गए सिस्टम सीधे वाहन को नियंत्रित करते हैं या किसी भी मूल्यांकन किए गए मॉडल को सड़क पर चलने वाले उत्पाद में तैनात किया जाता है। किसी बड़े वाहन प्रणाली के बारे में साक्ष्य के रूप में बेंचमार्क परिणाम की व्याख्या करने के लिए यह पृथक्करण आवश्यक है।

डेवलपर्स और नियामकों को यह देखने की आवश्यकता हो सकती है कि ऐसे परीक्षणों को सुरक्षा मामलों और खरीद मानकों में कैसे शामिल किया जाता है। उपयोगी सुरक्षा उपायों में विशेषता-बदले गए मूल्यांकन, स्वतंत्र ऑडिटिंग, स्पष्ट अनिश्चितता से निपटने और निर्णय लेने के लिए गैर-मॉडल-आधारित नियंत्रण शामिल हो सकते हैं, लेकिन स्रोत किसी भी शमन का परीक्षण नहीं करता है। भविष्य के काम में रिपोर्ट दी जानी चाहिए कि क्या जनसांख्यिकीय संवेदनशीलता को कम करने से समग्र सुरक्षा में भी बदलाव आता है, क्या मॉडल अपने निर्णयों को लगातार समझा सकते हैं, और यदि मॉडल-निर्देशित प्रणाली असुरक्षित या भेदभावपूर्ण विकल्प चुनती है तो जिम्मेदारी कैसे सौंपी जाएगी। केंद्रीय अज्ञात यह बना हुआ है कि क्या पूर्वाग्रह के बेंचमार्क साक्ष्य वास्तविक ट्रैफ़िक में व्यवहार की भविष्यवाणी करते हैं। उस प्रश्न के लिए नियंत्रित मॉडल आउटपुट को ट्रैफ़िक में निर्णयों और परिणामों से जोड़ने वाले साक्ष्य की आवश्यकता होगी।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई नैतिकताएआई मॉडल की व्याख्याएआई का भविष्यएआई प्रशिक्षणआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?