समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

Meta FAIR GPU चलने से पहले AI प्रयोगों को स्क्रीन करने के लिए प्राथमिकता मॉडल की रिपोर्ट करता है

मार्कटेकपोस्ट की रिपोर्ट है कि Meta FAIR, ऑक्सफ़ोर्ड और UCL के शोधकर्ताओं ने AI रिसर्च प्रेफरेंस मॉडल का परीक्षण किया, जो महंगे GPU निष्पादन से पहले अप्रयुक्त मशीन-लर्निंग प्रयोगों को रैंक करते हैं।

4 min readRead the linked source
Source-provided image accompanying Meta FAIR reports preference models to screen AI experiments before GPU runs
स्रोत संदर्भस्रोत रिकार्ड किया गया
प्रकाशक
marktechpost.com
स्रोत लिंक
marktechpost.comhttps://www.marktechpost.com/2026/09/06/meta-fair-introduces-ai-research-preference-models-rpms-ranking-ml-experiments-before-spending-gpu-hours/amp/
स्रोत प्रकार
लिंक्ड स्रोत - प्राथमिक-स्रोत स्थिति स्थापित नहीं की गई है।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

मजबूती
शोर, बदलाव, या प्रतिकूल इनपुट के तहत प्रदर्शन को बनाए रखने की एक मॉडल की क्षमता।
बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
अनुमान
रनटाइम चरण जहां एक प्रशिक्षित मॉडल भविष्यवाणियां या आउटपुट उत्पन्न करता है।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

मार्कटेकपोस्ट की रिपोर्ट है कि Meta FAIR, ऑक्सफोर्ड विश्वविद्यालय और यूनिवर्सिटी कॉलेज लंदन के शोधकर्ताओं ने AI रिसर्च एजेंट को कौन से प्रयोग चलाने चाहिए, इसका चयन करने के लिए AI रिसर्च प्रेफरेंस मॉडल या RPM पेश किए। रिपोर्ट किए गए एआईआरएस-बेंच मूल्यांकन पर, आरपीएम ने औसत सामान्यीकृत स्कोर में सुधार किया और 24 के बजाय लगभग 15 घंटों में यादृच्छिक-चयन बेसलाइन तक पहुंच गया।

मार्कटेकपोस्ट की रिपोर्ट है कि आरपीएम उनके पूर्ण स्कोर की भविष्यवाणी करने के बजाय अप्रयुक्त उम्मीदवार प्रयोगों को रैंक करते हैं। रिपोर्ट की गई प्रणाली AIRA-dojo नामक एक विकासवादी वृक्ष-खोज मचान का उपयोग करती है। एक एजेंट समानांतर में 15 उम्मीदवार बच्चों को तैयार करता है, नॉकआउट टूर्नामेंट में उनकी जोड़ीवार तुलना करता है, और केवल विजेता को निष्पादित करता है। तुलनाएं पहले से खोजे गए संदर्भ नोड्स और उनके सत्यापन स्कोर का उपयोग करती हैं।

लेख दो प्रकारों का वर्णन करता है। केवल-अनुमान आरपीएम एक जमे हुए पूर्व-प्रशिक्षित भाषा मॉडल के साथ उम्मीदवार की योजनाओं, कोड और खोज इतिहास का आकलन करता है। एजेंटिक RPM अतिरिक्त रूप से Python, बैश और एक सबमिशन टूल का उपयोग करके एक H200 GPU वाले क्लोन वातावरण में छोटे पायलट प्रयोग चलाता है। मार्कटेकपोस्ट की रिपोर्ट है कि एजेंट चयनकर्ता का उपयोग केवल ड्राफ्ट और सुधार चरणों के लिए किया गया था, जबकि डीबग चयन यादृच्छिक पर वापस आ गया क्योंकि पायलटों ने एजेंट के समय बजट का उपभोग किया था।

एआईआरएस-बेंच पर, जिसे मार्कटेकपोस्ट 20 सार्वजनिक पाठ और सारणीबद्ध कार्यों के रूप में वर्णित करता है, रिपोर्ट किए गए औसत सामान्यीकृत स्कोर यादृच्छिक चयन के लिए 0.684, केवल-अनुमान आरपीएम के लिए 0.711 और एजेंटिक आरपीएम के लिए 0.729 थे। कथित तौर पर सेटअप ने प्रयोग ऑपरेटरों और आरपीएम दोनों के लिए Qwen3.6-27B का उपयोग किया, जिसमें प्रति कार्य एक H200 पर 10 बीज और 24 घंटे थे।

मार्कटेकपोस्ट की रिपोर्ट है कि दोनों आरपीएम वेरिएंट लगभग 15 घंटों में यादृच्छिक-चयन बेसलाइन तक पहुंच गए: केवल अनुमान के लिए 14.88 घंटे और एजेंटिक चयन के लिए 15.50 घंटे। लेख विनोग्रांडे पर 94.1% और एसवीएएमपी पर 95.7% के परिणामों की भी रिपोर्ट करता है, उन्हें नए अत्याधुनिक परिणाम के रूप में वर्णित करता है। ये आंकड़े और तुलनाएं आपूर्ति की गई रिपोर्ट के दावे हैं, स्वतंत्र रूप से पुष्टि किए गए परिणाम नहीं।

लेख में कहा गया है कि AIRA-डोजो स्कैफोल्ड और AIRS-बेंच ओपन सोर्स हैं और Qwen3.6-27B ओपन वेट के रूप में उपलब्ध है। यह सीधी पहुंच लिंक, लाइसेंसिंग शर्तें, होस्ट की गई सेवा, वाणिज्यिक समर्थन विवरण या मूल्य निर्धारण प्रदान नहीं करता है। आपूर्ति की गई सामग्री यह भी स्थापित नहीं करती है कि सिस्टम सामान्य उत्पादन उपयोग के लिए तैयार है।

स्रोत विवरण: marktechpost.com ↗

यह क्यों मायने रखता है?

यदि रिपोर्ट किए गए परिणाम सही रहते हैं, तो निष्पादन से पहले प्रयोगों का चयन एआई-सहायता प्राप्त अनुसंधान को अधिक गणना-कुशल बना सकता है। दृष्टिकोण एक व्यावहारिक बाधा को संबोधित करता है: अनुसंधान एजेंट कई उम्मीदवार प्रयोग उत्पन्न कर सकते हैं, लेकिन प्रत्येक का परीक्षण करना महंगा है। साक्ष्य रिपोर्ट किए गए बेंचमार्क तक ही सीमित है और आपूर्ति की गई सामग्री में इसकी स्वतंत्र रूप से पुष्टि नहीं की गई है।

रिपोर्ट किया गया कार्य केवल मॉडल के बेंचमार्क स्कोर में सुधार के बजाय एआई अनुसंधान में संसाधन-आवंटन समस्या को लक्षित करता है। एक एजेंट जो एक टीम की तुलना में अधिक विचार उत्पन्न कर सकता है, उसे परीक्षण करने के लिए एक विश्वसनीय तरीके की आवश्यकता होती है ताकि यह तय किया जा सके कि कौन से प्रयोग गणना के लायक हैं। इसलिए एक चयन परत अनुसंधान थ्रूपुट को प्रभावित कर सकती है, खासकर जहां प्रशिक्षण या मूल्यांकन चलने में घंटों या दिन लगते हैं।

रिपोर्ट की गई तुलना से पता चलता है कि उम्मीदवारों के बीच चयन करने से कुछ लाभ हुआ, क्योंकि प्रयोग ऑपरेटरों और आरपीएम के लिए समान Qwen3.6-27B बैकबोन का उपयोग किया गया था। मार्कटेकपोस्ट केवल अनुमान चयन के लिए 0.684 से 0.711 तक 6.0% की सापेक्ष वृद्धि और एजेंटिक चयन के लिए 6.6% की वृद्धि से 0.729 की रिपोर्ट करता है, लेकिन आपूर्ति किया गया लेख इसके घोषित आत्मविश्वास अंतराल से परे सांख्यिकीय मजबूती का आकलन करने के लिए पर्याप्त पद्धतिगत विवरण प्रदान नहीं करता है।

सार्थक सीमाएँ हैं. एआईआरएस-बेंच में 20 सार्वजनिक पाठ और सारणीबद्ध कार्य शामिल हैं, और प्रयोगों में एकल एच200 सेटअप का उपयोग किया गया है, इसलिए निष्कर्ष बड़े शोध कार्यक्रमों, अन्य हार्डवेयर या वैज्ञानिक डोमेन में स्थानांतरित नहीं हो सकते हैं। रिपोर्ट कोई स्वतंत्र प्रतिकृति, परिनियोजन मामले का अध्ययन या सबूत नहीं देती है कि दृष्टिकोण बेंचमार्क परिणामों के बजाय वास्तविक दुनिया की खोजों में सुधार करता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

अंतर्निहित कागज़, कोड और बेंचमार्क कलाकृतियों पर नज़र रखें; अतिरिक्त कार्यों पर प्रतिकृति; और इस बारे में साक्ष्य कि क्या लाभ विभिन्न मॉडलों, ऑपरेटरों, हार्डवेयर और अनुसंधान डोमेन के साथ बना रहता है। रिपोर्ट किए गए ओपन-सोर्स घटकों तक पहुंच का वर्णन किया गया है, लेकिन मूल्य निर्धारण, होस्ट की गई उपलब्धता और उत्पादन समर्थन का दस्तावेजीकरण नहीं किया गया है।

सबसे उपयोगी अगली जांच यह है कि क्या शोधकर्ता अंतर्निहित पेपर, कार्यान्वयन और मूल्यांकन लॉग प्रकाशित करते हैं, और क्या बाहरी टीमें रिपोर्ट किए गए स्कोर और समय की बचत को पुन: पेश करती हैं। आपूर्ति की गई रिपोर्ट ओपन-सोर्स घटकों की ओर इशारा करती है लेकिन उनकी उपलब्धता या उपयोगिता को स्वतंत्र रूप से सत्यापित नहीं करती है।

भविष्य के मूल्यांकन में विभिन्न रीढ़ मॉडल, उम्मीदवार-पीढ़ी के तरीकों, कार्य परिवारों और गणना बजट का परीक्षण करना चाहिए। रिपोर्ट किए गए एजेंटिक डिज़ाइन में छोटे पायलट प्रयोगों और जानबूझकर अतिरंजित शेष बजट का भी उपयोग किया जाता है, ऐसे विकल्प जो परिणामों को प्रभावित कर सकते हैं और सामान्य संसाधन लेखांकन के तहत परीक्षण के लायक हैं।

संभावित उपयोगकर्ताओं को रिपोर्ट किए गए टूल को अनुसंधान घटकों के रूप में मानना ​​चाहिए, न कि एक दस्तावेज़ीकृत वाणिज्यिक उत्पाद के रूप में। स्रोत कोई कीमत, सेवा-स्तर की शर्तें, स्थापना आवश्यकताएँ या सामान्य-उपलब्धता विवरण नहीं देता है। यह यह भी नहीं दिखाता है कि क्या आरपीएम उन प्रयोगों को सुरक्षित रूप से संभाल सकता है जिनकी विफलताएं महंगी हैं या जिनकी सत्यापन मीट्रिक अविश्वसनीय हैं।

रिपोर्ट किए गए WinoGrande और SVAMP परिणाम उद्धृत पूर्व बेसलाइन के विरुद्ध सत्यापन की गारंटी देते हैं। लेख यह निर्धारित करने के लिए स्वतंत्र परीक्षण, विस्तृत सांख्यिकीय विवरण या पर्याप्त जानकारी प्रदान नहीं करता है कि वे लाभ कितने व्यापक रूप से सामान्य हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याएआई प्रशिक्षणआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?