समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

अध्ययन में कहा गया है कि जब प्रश्न फ्रेम में बदलाव होता है तो एलएलएम व्यक्तित्व का मूल्यांकन बदल जाता है

एक arXiv प्रीप्रिंट रिपोर्ट करता है कि GPT-4o के अनुरूपित व्यक्तित्व पैटर्न आंशिक रूप से इस बात पर निर्भर करते हैं कि व्यक्तित्व प्रश्नों को कैसे क्रमबद्ध और संरेखित किया जाता है, यह सुझाव देता है कि एकल समग्र स्कोर महत्वपूर्ण व्यवहार को याद कर सकते हैं।

5 min readRead the primary source
Source-page capture accompanying Study says LLM persona evaluations change when question frames shift
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2607.02368
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
सामान्यीकरण
कोई मॉडल प्रशिक्षण सेट के बाहर नए, अनदेखे डेटा पर कितना अच्छा प्रदर्शन करता है।
शीघ्र
जनरेटिव मॉडल को प्रदान किए गए इनपुट निर्देश और संदर्भ।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

युआन युआन द्वारा एक प्रीप्रिंट यह जांच करता है कि क्या एलएलएम व्यक्तित्व से जुड़े आंतरिक सहसंबंध पैटर्न एक मूल्यांकन कैसे तैयार किया जाता है इसकी स्थिर विशेषताएं या कलाकृतियां हैं। अमेरिकी और चीनी-अमेरिकी व्यक्तित्वों का अनुकरण करने के लिए GPT-4o का उपयोग करते हुए, अध्ययन विभिन्न प्रश्न क्रमों के तहत 50-आइटम अंतर्राष्ट्रीय व्यक्तित्व आइटम पूल प्रश्नावली के जवाबों का विश्लेषण करता है। यह रिपोर्ट करता है कि जब मूल्यांकन ढांचा बदलता है तो समग्र बिग फाइव स्कोर और प्रतिक्रियाओं के बीच ज्यामितीय संबंध अलग-अलग व्यवहार करते हैं।

पेपर बड़े भाषा मॉडल के मूल्यांकन में एक विशिष्ट समस्या का अध्ययन करता है: क्या किसी मॉडल के स्पष्ट व्यक्तित्व को समग्र प्रश्नावली स्कोर तक कम किया जा सकता है या क्या व्यक्तिगत उत्तरों के बीच संबंधों में भी सार्थक जानकारी होती है। यह IPIP-50 प्रश्नावली का उपयोग करता है, जिसे बिग फाइव व्यक्तित्व आयामों को मापने के लिए डिज़ाइन किया गया है, और मॉडल की प्रतिक्रियाओं से उदाहरण के भीतर सहसंबंध मैट्रिक्स का निर्माण करता है। फिर उन आव्यूहों का विश्लेषण सममित सकारात्मक-निश्चित, या एसपीडी, मैनिफोल्ड्स पर बिंदुओं के रूप में किया जाता है - जो सहसंबंध संरचना का गणितीय प्रतिनिधित्व है। स्रोत इसे उस जानकारी को संरक्षित करने के एक तरीके के रूप में प्रस्तुत करता है जिसे सामान्य सारांश स्कोर त्याग देते हैं।

प्रयोग अमेरिकी और चीनी-अमेरिकी व्यक्तित्वों का अनुकरण करने के लिए GPT-4o का उपयोग करता है। शोधकर्ता प्रश्नों के क्रम में हेरफेर करते हैं और तुलना करते हैं कि जब मूल्यांकन फ़्रेम यादृच्छिक, गलत संरेखित या साझा किए जाते हैं तो क्या होता है। सार उन परिवर्तनों के प्रति दो अलग-अलग प्रतिक्रियाओं की रिपोर्ट करता है। बिग फाइव स्कोर द्वारा दर्शाई गई समग्र विशेषताएं, रैंडमाइजेशन के तहत 21% की गिरावट दर्शाती हैं, लेकिन उन्हें फ्रेम-मजबूत के रूप में वर्णित किया गया है। जब प्रश्न साझा फ़्रेम का उपयोग करते हैं, तो ज्यामितीय विशेषताएं फ़्रेम मिसलिग्न्मेंट के तहत 42% की गिरावट दर्शाती हैं और फिर 84% तक काफी हद तक ठीक हो जाती हैं। सार कहता है कि यह पुनर्प्राप्ति समग्र सुविधाओं के लिए संबंधित 76% परिणाम से अधिक है।

पेपर इन परिणामों को एलएलएम व्यक्तित्व अभिव्यक्ति के दो अलग-अलग घटकों के साक्ष्य के रूप में चित्रित करता है: फ्रेम-मजबूत समुच्चय और फ्रेम-निर्भर ज्यामिति। पेपर के विवरण में, ज्यामितीय घटक एक निश्चित विशेषता के बजाय उत्तरों के बीच एक समन्वय पैटर्न है जो हर प्रस्तुति के तहत अपरिवर्तित रहता है। स्रोत प्रयोग के पैमाने या सटीक गणनाओं का स्वतंत्र रूप से आकलन करने के लिए आवश्यक अमूर्त-स्तरीय विवरण प्रदान नहीं करता है। यह प्रतिक्रिया नमूनों की संख्या, व्यक्तियों को बनाने के लिए उपयोग किए जाने वाले पूर्ण संकेतों, यादृच्छिकीकरण प्रोटोकॉल, डिकोडिंग सेटिंग्स, या प्रतिशत स्कोर को कैसे परिभाषित किया गया था, यह नहीं बताता है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

पेपर का केंद्रीय निहितार्थ यह है कि एलएलएम व्यक्तित्व मूल्यांकन प्रश्नावली संरचना के प्रति संवेदनशील हो सकता है, न कि केवल मॉडल या व्यक्तित्व संकेत का परीक्षण किया जा सकता है। यदि इसे दोहराया जाता है, तो यह प्रभावित कर सकता है कि शोधकर्ता मॉडल व्यक्तित्व, स्थिरता, सांस्कृतिक विविधता और सुरक्षा-संबंधी व्यवहार के बारे में दावों की व्याख्या कैसे करते हैं। यह स्थापित नहीं करता है कि एलएलएम में मानवीय व्यक्तित्व होते हैं, और स्रोत यह नहीं दिखाता है कि रिपोर्ट किया गया पैटर्न परीक्षण किए गए सेटअप से परे सामान्यीकृत है।

व्यावहारिक मुद्दा माप है. जब प्रश्नावली को पुन: व्यवस्थित किया जाता है या अलग तरीके से तैयार किया जाता है, तो एक मॉडल व्यक्तिगत उत्तरों के बीच संबंधों को बदलते हुए समान समग्र बिग फाइव स्कोर उत्पन्न कर सकता है। यदि वह पैटर्न व्यापक परीक्षण में कायम रहता है, तो एक मूल्यांकनकर्ता जो केवल पांच सारांश स्कोर रिकॉर्ड करता है, वह यह निष्कर्ष निकाल सकता है कि एक व्यक्तित्व स्थिर है, जबकि मॉडल की प्रतिक्रिया संरचना में कोई बदलाव नहीं है। इसलिए पेपर फ्रेम-अवेयर मूल्यांकन के लिए तर्क देता है जो समग्र प्रवृत्तियों और प्रतिक्रियाओं की ज्यामिति दोनों को रिकॉर्ड करता है। यह प्रीप्रिंट का एक पद्धतिगत दावा है, कोई स्थापित सर्वसम्मति नहीं।

यह मॉडल व्यवहार पर शोध के लिए मायने रखता है क्योंकि व्यक्तित्व संकेतों का उपयोग अक्सर स्थिरता, सांस्कृतिक प्रतिनिधित्व, पूर्वाग्रह और संरेखण का अध्ययन करने के लिए किया जाता है। फ़्रेम-संवेदनशील मूल्यांकन से पता चल सकता है कि कुछ देखे गए अंतर टिकाऊ मॉडल विशेषता के बजाय परीक्षण डिज़ाइन से उत्पन्न होते हैं। यह शोधकर्ताओं को औसत उत्तरों में स्थिर बदलाव और उत्तरों के एक-दूसरे के साथ मेल खाने के तरीके में बदलाव के बीच अंतर करने में भी मदद कर सकता है। स्रोत तैनात उत्पादों, उपयोगकर्ता निर्णयों या सुरक्षा घटनाओं के परिणामों को प्रदर्शित नहीं करता है, इसलिए वे निहितार्थ संभावित बने रहते हैं।

निष्कर्षों को इस सबूत के रूप में नहीं पढ़ा जाना चाहिए कि GPT-4o का व्यक्तित्व मानव जैसा है या नकली अमेरिकी और चीनी-अमेरिकी व्यक्तित्व वास्तविक आबादी के अनुरूप हैं। अध्ययन एक परिभाषित सेटअप के तहत मॉडल-जनित प्रश्नावली प्रतिक्रियाओं का परीक्षण करता है। यह यह भी स्थापित नहीं करता है कि एसपीडी-मैनिफोल्ड विश्लेषण प्रत्येक व्यक्तित्व मूल्यांकन के लिए बेहतर है, न ही इसकी रिपोर्ट की गई पुनर्प्राप्ति वास्तविक दुनिया के व्यवहार की भविष्यवाणियों में सुधार करेगी। स्रोत द्वारा वर्णित मुख्य योगदान दो प्रकार के माप संकेतों और एक चेतावनी के बीच प्रस्तावित अंतर है कि एकत्रीकरण फ्रेम-निर्भर संरचना को छिपा सकता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

अगले प्रमुख चरण मॉडलों, व्यक्तित्व निर्देशों, भाषाओं, प्रश्नावली और नमूनाकरण प्रक्रियाओं में प्रतिकृति हैं। पाठकों को रिपोर्ट किए गए प्रतिशत परिवर्तनों के पीछे पूर्ण प्रयोगात्मक विवरण भी देखना चाहिए, जिसमें नमूना आकार, संकेत, प्रतिक्रिया-उत्पन्न सेटिंग्स और ज्यामितीय तुलनाओं के लिए उपयोग की जाने वाली सटीक मीट्रिक शामिल हैं। अध्ययन एक arXiv प्रीप्रिंट है, इसलिए इसके निष्कर्षों को व्यापक जांच की प्रतीक्षा में शोध दावों के रूप में माना जाना चाहिए।

प्रतिकृति यह निर्धारित करेगी कि रिपोर्ट किए गए 21%, 42%, 84% और 76% आंकड़े मजबूत हैं या नहीं। महत्वपूर्ण तुलनाओं में अन्य भाषा मॉडल, GPT-4o के विभिन्न संस्करण, वैकल्पिक व्यक्तित्व संकेत, बार-बार नमूनाकरण और IPIP-50 से परे प्रश्नावली शामिल होंगी। शोधकर्ताओं को यह भी परीक्षण करना चाहिए कि क्या वही प्रभाव तब दिखाई देते हैं जब शब्दों को बदले बिना प्रश्न क्रम बदल दिया जाता है, जब शब्दांकन और सांस्कृतिक रूपरेखा अलग-अलग होती है, और जब मूल्यांकनकर्ता नकली जनसांख्यिकीय व्यक्तित्वों के बजाय स्वतंत्र संकेतों का उपयोग करते हैं।

पूरा पेपर और बाद के अध्ययन यह स्पष्ट कर सकते हैं कि क्या ज्यामितीय प्रभाव मॉडल व्यवहार की सार्थक संपत्ति को दर्शाता है या सहसंबंध मैट्रिक्स के निर्माण और कई गुना मीट्रिक की पसंद द्वारा शुरू की गई संवेदनशीलता को दर्शाता है। स्रोत का सार सटीक दूरी माप, सांख्यिकीय परीक्षण, आधार रेखा या अनिश्चितता अनुमान की पहचान नहीं करता है। समग्र और ज्यामितीय विशेषताओं में रिपोर्ट किए गए प्रतिशत की तुलना करने या यह तय करने से पहले कि मूल्यांकनकर्ताओं को किसी भी संकेत को कितना महत्व देना चाहिए, वे विवरण आवश्यक हैं।

व्यावहारिक उपयोगकर्ताओं के लिए, तात्कालिक पाठ सीमित लेकिन उपयोगी है: एक एकल व्यक्तित्व परीक्षण को एलएलएम के व्यवहार का संपूर्ण विवरण नहीं माना जाना चाहिए। मॉडलों का मूल्यांकन करने वाली टीमें प्रश्न क्रम और फ़्रेमिंग को अलग-अलग करना चाहती हैं, आइटम-स्तरीय प्रतिक्रियाओं को संरक्षित करना चाहती हैं, और केवल एक निश्चित व्यक्तित्व लेबल पर भरोसा करने के बजाय अनिश्चितता की रिपोर्ट करना चाहती हैं। क्या ऐसी प्रक्रियाएं वास्तविक इंटरैक्शन की भविष्यवाणी में सुधार करती हैं यह अज्ञात है। पेपर एक प्रीप्रिंट है, और स्रोत परीक्षण किए गए GPT-4o सेटअप के अलावा सहकर्मी समीक्षा, स्वतंत्र प्रतिकृति, तैनाती प्रभाव, या मॉडल के सामान्यीकरण के बारे में कोई जानकारी प्रदान नहीं करता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई नैतिकताPrompt Engineeringआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?