समाचार पर वापस जाएँ
सुरक्षाAI Understanding ब्रीफिंग

शोधकर्ताओं ने 100,000 एजेंटों के लिए एआई प्रभाव-अभियान सिम्युलेटर बनाया

IO फ़ैक्टरी अभियान योजना, सिम्युलेटेड प्लेटफ़ॉर्म गतिविधि, दर्शकों के प्रदर्शन और मापा स्थिति परिवर्तनों को जोड़ती है, लेकिन इसके लेखक इस बात पर जोर देते हैं कि परिणाम वास्तविक दुनिया के अनुनय का अनुमान नहीं लगाते हैं या यह साबित नहीं करते हैं कि कोई अभियान हुआ था।

6 min readRead the primary source
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
IO Factory research paper on arXiv
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.10920
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

ज़मीनी सच्चाई
मॉडल आउटपुट को प्रशिक्षित या मूल्यांकन करने के लिए विश्वसनीय संदर्भ लेबल का उपयोग किया जाता है।
अंशांकन
किसी मॉडल का आत्मविश्वास स्कोर वास्तविक शुद्धता संभावनाओं से कितना मेल खाता है।
स्वयं की जांच करोएआई सुरक्षा प्रश्नोत्तरी

क्या हुआ?

एक नया arXiv पेपर IO फ़ैक्टरी प्रस्तुत करता है, जो एआई-सक्षम प्रभाव अभियानों को ट्रेस करने योग्य जीवनचक्र के रूप में अनुकरण करने के लिए एक शोध ढांचा है। सिस्टम समन्वित एजेंट क्रियाओं को एक्सपोज़र रिकॉर्ड और कॉन्फ़िगर किए गए ऑडियंस परिवर्तनों से जोड़ता है, जिससे शोधकर्ताओं को एक नियंत्रित प्लेटफ़ॉर्म के अंदर एक मिलान बेसलाइन के साथ चलाए गए सक्रिय अभियान की तुलना करने की अनुमति मिलती है।

रूपरेखा तीन परतों को अलग करती है जो अक्सर ऑनलाइन हेरफेर की चर्चाओं में ध्वस्त हो जाती हैं: एक नियंत्रण विमान जो प्रयोग को शेड्यूल करता है, एक सिमुलेशन विमान जहां एजेंट एक मंच पर कार्य करते हैं, और एक मूल्यांकन विमान जो जोखिम और स्थिति परिवर्तनों को मापता है। किसी संदेश को केवल इसलिए प्रभाव के रूप में नहीं गिना जाता क्योंकि वह उत्पन्न हुआ था। इसे रखा जाना चाहिए, प्लेटफ़ॉर्म नियमों के तहत दृश्यमान होना चाहिए, एक मॉडल किए गए नागरिक तक पहुंचना चाहिए, कॉन्फ़िगर की गई माप प्रक्रिया को पास करना चाहिए, और फिर बेसलाइन के साथ तुलना की जानी चाहिए।

रिपोर्ट किया गया कार्यान्वयन सिम्युलेटेड एक्टर्स के लिए H200 नोड्स पर जेम्मा 4 31B का उपयोग करता है और 100,000 नागरिकों और 10,000 प्रभाव-संचालन ऑपरेटरों के साथ सत्यापन रन का समर्थन करता है। पेपर का मिलान साक्ष्य 10,000 नागरिकों और 13 जोड़ी बेसलाइन-सक्रिय प्रतिकृतियों के साथ छोटे डिजाइनों से आता है। लेखक दो-निर्माण परिदृश्य का परीक्षण करते हैं जो रूस में बढ़ते विश्वास और खाने वाले कीड़ों के लिए समर्थन को लक्षित करता है, साथ ही सार्वजनिक संस्थानों में कम विश्वास को लक्षित करने वाला एक अलग परिदृश्य; ये सिमुलेशन सेटिंग्स हैं, वास्तविक आबादी के बारे में अवलोकन नहीं।

दो-निर्माण डिज़ाइन में, पेपर कीड़े खाने के समर्थन के लिए 0.132 और रूस में विश्वास के लिए 0.130 की दिशात्मक लिफ्ट की रिपोर्ट करता है। एकल-निर्माण डिज़ाइन में, 0.336 की रिपोर्ट की गई साइन-समायोजित लिफ्ट के साथ बेसलाइन के सापेक्ष सार्वजनिक संस्थानों में विश्वास कम हो जाता है। पी<0.001 पर होल्म सुधार के बाद सभी तीन प्राथमिक समापन बिंदु महत्वपूर्ण हैं। वही तालिका सक्रिय रन में उच्च मॉडल वाले ध्रुवीकरण की रिपोर्ट करती है, जिसमें एकल-निर्माण डिज़ाइन के लिए 4.714 बनाम 3.865 शामिल है, लेकिन वे मान सिम्युलेटर के पैमाने पर बने रहते हैं।

लेखक दोनों मुख्य डिज़ाइनों में लगभग 0.494 के सक्रिय-पहुंच अंश की भी रिपोर्ट करते हैं, जिसका अर्थ है कि मॉडल किए गए लगभग आधे नागरिकों के पास प्रभाव-संचालन स्रोत से जुड़ा एक एक्सपोज़र रिकॉर्ड था। कॉन्फ़िगर किए गए माप के तहत नागरिक रिले गतिविधि कम थी, खासकर एकल-निर्माण डिज़ाइन में। पेपर बार-बार व्याख्या को सीमित करता है: रन से पता चलता है कि आईओ फैक्ट्री घोषित अभियान मान्यताओं को निष्पादित और माप सकती है, न कि एआई अभियान वास्तविक मंच या आबादी पर उन प्रभावों को प्राप्त करेगा।

स्रोत विवरण: IO Factory research paper on arXiv ↗

यह क्यों मायने रखता है?

व्यावहारिक योगदान एक खतरे के मॉडल के लिए एक ऑडिट ट्रेल है जिसे अलग-अलग पोस्ट से नहीं समझा जा सकता है। यह रक्षकों को यह जांचने का एक तरीका देता है कि किसी सिंथेटिक पैटर्न को वास्तविक प्रभाव के साक्ष्य के रूप में मानने से पहले समन्वय, प्लेटफ़ॉर्म दृश्यता, एक्सपोज़र और दर्शकों का माप कैसे परस्पर क्रिया करता है।

जेनरेटिव मॉडल संदेशों को सस्ता, धाराप्रवाह और अनुकूलित बना सकते हैं, लेकिन केवल संदेश की मात्रा ही अनुनय स्थापित नहीं करती है। स्रोत विश्वास, दोहराव, सामाजिक संदर्भ, पूर्व विश्वास और वह मार्ग जिसके द्वारा कोई व्यक्ति किसी दावे का सामना करता है, सभी मायने रखते हैं। आईओ फैक्ट्री उन धारणाओं को जीवनचक्र के हिस्से के रूप में स्पष्ट करती है, ताकि एक शोधकर्ता भाषा मॉडल में हर अंतर को जिम्मेदार ठहराने के बजाय यह देख सके कि सक्रिय रन और बेसलाइन के बीच कौन सा चरण बदल गया है।

वह संरचना रक्षात्मक अभ्यासों में सुधार कर सकती है। एक मंच, चुनाव मॉनिटर, सार्वजनिक-हित समूह, या सुरक्षा टीम समन्वित एजेंटों की संख्या, उनके कार्यों का समय, दृश्यता नियम या हस्तक्षेप बिंदु को अलग-अलग कर सकती है, फिर परिणामी उद्गम रिकॉर्ड का निरीक्षण कर सकती है। यह मान किसी काल्पनिक जनसंख्या का पूर्वानुमान नहीं है। यह पूछने के लिए एक पुनरुत्पादित स्थान है कि कौन से सिग्नल देखने योग्य हैं, कौन से माप गायब हैं, और प्रस्तावित पहचान या घर्षण तंत्र अभियान पथ को कैसे प्रभावित कर सकता है।

पेपर में कार्रवाई को साक्ष्य से अलग करना घटना विश्लेषण के लिए विशेष रूप से उपयोगी है। समान संदेशों का समूह एक लक्षण हो सकता है, लेकिन मजबूत सबूत समय के साथ खातों, कार्यों, एक्सपोज़र पथ और अनुकूलन को जोड़ देंगे। एक नियंत्रित सिम्युलेटर शोधकर्ताओं को उन रिकॉर्डों को डिज़ाइन करने और पता लगाने के तरीकों की तुलना करने में मदद कर सकता है। यह तब भी उजागर हो सकता है जब एक मूल्यांकनकर्ता दर्शकों की मान्यताओं में बदलाव के बजाय गतिविधि या मॉडल-न्यायाधीश के आत्मविश्वास को माप रहा है।

सीमा को दृश्यमान बनाए रखना एक सार्वजनिक हित की सुरक्षा है। रिपोर्ट किए गए रूस, कीट-समर्थन और संस्थागत-विश्वास परिदृश्य प्रयोग के लिए चुने गए विन्यास योग्य निर्माण हैं। वे सर्वेक्षण परिणाम, खुफिया निष्कर्ष या सबूत नहीं हैं कि लोगों को मना लिया गया था। सिम्युलेटर आउटपुट को वास्तविक दुनिया की घटना मानने से एक अलग तरह का सूचना जोखिम पैदा होगा: किसी देश, समुदाय या चुनाव के बारे में सबूत के लिए एक सिंथेटिक प्रदर्शन को गलत समझा जा सकता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Safety Quiz

What is 'specification gaming' in AI systems?

आगे क्या देखना है

अगले साक्ष्य को सिम्युलेटर को नैतिक रूप से एकत्र किए गए अवलोकनों से जोड़ना चाहिए, परीक्षण करना चाहिए कि क्या इसके माप मॉडल और प्लेटफ़ॉर्म परिवर्तनों से बचते हैं, और यह दिखाना चाहिए कि बचावकर्ता सिंथेटिक आउटपुट को आरोपों में बदले बिना ऑडिट ट्रेल का उपयोग कैसे कर सकते हैं।

स्वतंत्र शोधकर्ताओं को विभिन्न भाषा मॉडल, अभिनेता नीतियों, जनसंख्या जनरेटर और नेटवर्क संरचनाओं के साथ मिलान किए गए डिज़ाइन को पुन: पेश करना चाहिए। वर्तमान पेपर अपने रिपोर्ट किए गए रन के लिए एक मॉडल कॉन्फ़िगरेशन का उपयोग करता है और कई सिम्युलेटर नियमों की घोषणा करता है। संवेदनशीलता विश्लेषण को यह दिखाना चाहिए कि संदेश की गुणवत्ता, स्रोत की विश्वसनीयता, एक्सपोज़र थ्रेशोल्ड और रिले व्यवहार में परिवर्तन होने पर कौन से निष्कर्ष बने रहते हैं, बजाय यह मानने के कि एकल पैरामीटर ऑनलाइन जीवन का प्रतिनिधित्व करता है।

वास्तविक अवलोकनों के विरुद्ध अंशांकन कठिन कदम है। नैतिक क्षेत्र डेटा में पहुंच और बातचीत के सार्वजनिक, सहमति, या गोपनीयता-संरक्षण उपाय शामिल हो सकते हैं, लेकिन वे डेटा स्वचालित रूप से विश्वास परिवर्तन को प्रकट नहीं करेंगे। भविष्य के काम में मंच की घटनाओं की तुलना मान्य सामाजिक-विज्ञान उपायों के साथ की जानी चाहिए, अनिश्चितता का खुलासा किया जाना चाहिए, और यह अंतर करना चाहिए कि सिम्युलेटर क्या पुन: उत्पन्न कर सकता है और इसे केवल दृश्यमान रूप से प्रशंसनीय बनाता है। मॉडल-आधारित न्यायाधीशों को ऑडिट के लिए माप उपकरण बने रहना चाहिए, न कि जमीनी सच्चाई का विकल्प।

रक्षकों को अनुकूली अभियानों और रक्षात्मक हस्तक्षेपों का भी परीक्षण करना चाहिए। पेपर योजना, प्रदर्शन, माप और अनुकूलन का वर्णन करता है, फिर भी एक वास्तविक प्रतिद्वंद्वी निगरानी की जाने वाली चीज़ सीखने के बाद समय, स्रोत पहचान, भाषा या बातचीत शैली को बदल सकता है। उपयोगी मूल्यांकन सामान्य उपयोगकर्ताओं पर झूठी सकारात्मकता और संपार्श्विक प्रभावों को मापते समय घर्षण, उद्गम लॉगिंग, समन्वित-व्यवहार का पता लगाने और मानव समीक्षा की तुलना करेंगे।

अंत में, जिम्मेदार उपयोग के लिए ढांचे के चारों ओर नियंत्रण की आवश्यकता होती है। रेड-टीम वातावरण को परिदृश्यों को सीमित रखना चाहिए, वास्तविक लोगों को लक्षित करने से बचना चाहिए, किसी भी लिंक किए गए डेटा की रक्षा करनी चाहिए, और यह दस्तावेज करना चाहिए कि कैसे सिंथेटिक एजेंटों और उत्पन्न सामग्री को सार्वजनिक प्लेटफार्मों से अलग किया जाता है। बाहरी सत्यापन आने तक, IO फ़ैक्टरी को एक पारदर्शी अनुसंधान और ख़तरा-मॉडलिंग उपकरण के रूप में सबसे अच्छा समझा जाता है: मान्यताओं का परीक्षण करने के लिए मूल्यवान, वास्तविक दुनिया के अनुनय या वास्तविक घटना का दावा करने के लिए अपर्याप्त।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई सुरक्षाएआई नैतिकताएआई एजेंटएलएलएम मूल्यांकनआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई विनियमन ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?