समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

पीसीएफबेंच ने पाया कि चरण दर चरण उत्पाद उत्सर्जन का आकलन करते समय फ्रंटियर एआई मॉडल विश्वसनीयता खो देते हैं

एक नया arXiv बेंचमार्क परीक्षण करता है कि क्या AI सिस्टम गणना के प्रत्येक चरण में उत्पाद कार्बन फ़ुटप्रिंट का विश्वसनीय रूप से अनुमान लगा सकता है। लेखकों की रिपोर्ट है कि मॉडल अक्सर उन्हें तैयार करने के लिए आवश्यक मध्यवर्ती चरणों की तुलना में अंतिम योग पर अधिक सटीक दिखाई देते हैं।

5 min readRead the primary source
Source-provided image accompanying PCFBench finds frontier AI models lose reliability when estimating product emissions step by step
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.27716
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
पुनर्प्राप्ति
किसी प्रश्न के लिए ज्ञान स्रोत से प्रासंगिक दस्तावेज़ या रिकॉर्ड ढूँढना।
डेटासेट
प्रशिक्षण, सत्यापन या परीक्षण के लिए उपयोग किए जाने वाले संरचित या असंरचित उदाहरणों का संग्रह।
स्वयं की जांच करोएआई क्या है? प्रश्नोत्तरी

क्या हुआ?

शोधकर्ताओं ने पीसीएफबेंच पेश किया, जो एआई सिस्टम के लिए एक मूल्यांकन सूट है जो उत्पाद कार्बन फुटप्रिंट का अनुमान लगाता है। बेंचमार्क में छह कार्यों में अपघटन, सूचना पुनर्प्राप्ति, ऑन्कोलॉजी मिलान और संख्यात्मक निष्कर्षण को कवर करने वाले 614 विशेषज्ञ-लेबल आइटम शामिल हैं। चार प्रदाताओं के आठ फ्रंटियर भाषा मॉडल के परीक्षणों में, पेपर की रिपोर्ट है कि कोई भी मॉडल लगातार हावी नहीं रहा।

स्रोत उत्पाद कार्बन-फ़ुटप्रिंट अनुमान को एक डोमेन-विशिष्ट वर्कफ़्लो के रूप में वर्णित करता है जिसमें शुद्धता न केवल अंतिम उत्तर में बल्कि मध्यवर्ती चरणों में भी मायने रखती है। उत्पाद कार्बन फ़ुटप्रिंट किसी भौतिक उत्पाद के कारण होने वाले ग्रीनहाउस-गैस उत्सर्जन को संदर्भित करता है। शोधकर्ता पीसीएफबेंच को एक डायग्नोस्टिक बेंचमार्क के रूप में प्रस्तुत करते हैं, जिसे यह उजागर करने के लिए डिज़ाइन किया गया है कि उस अनुमान का निर्माण करते समय एआई सिस्टम कहाँ सफल या विफल होता है। यह डिज़ाइन अंतिम रिपोर्ट किए गए कुल योग की तुलना के लिए मध्यवर्ती संचालन को दृश्यमान रखता है।

पीसीएफबेंच वर्कफ़्लो को छह स्वतंत्र रूप से मूल्यांकन योग्य कार्यों में विभाजित करता है। सार परीक्षण के तहत क्षमताओं के बीच अपघटन, पुनर्प्राप्ति, ऑन्कोलॉजी मिलान और संख्यात्मक निष्कर्षण की पहचान करता है। बेंचमार्क में विशेषज्ञों द्वारा लेबल किए गए 614 आइटम शामिल हैं और जब जानकारी अधूरी होती है, जब प्रासंगिक जानकारी में टकराव होता है, और जब संख्यात्मक बाधाओं का सम्मान किया जाना चाहिए तो तर्क का परीक्षण करने के लिए डिज़ाइन किया गया है।

लेखकों ने चार प्रदाताओं से आठ सीमांत बड़े भाषा मॉडल का मूल्यांकन किया और रिपोर्ट दी कि बेंचमार्क में कोई भी एकल मॉडल हावी नहीं हुआ। जब चरण दर चरण गणना की गई तो उन्होंने कुल उत्पाद-उत्सर्जन अनुमानों पर मॉडलों के प्रदर्शन की तुलना उनके प्रदर्शन से की। सार के अनुसार, कुल-अनुमान सेटिंग में 77% उत्पादों के लिए सबसे मजबूत मॉडल घोषित कुल में से दो के कारक के भीतर आए।

जब प्रक्रिया विघटित हो गई तो वह स्पष्ट प्रदर्शन कमजोर हो गया। जब उत्पाद कार्बन फ़ुटप्रिंट चरण दर चरण उत्पन्न हुआ तो रिपोर्ट की गई दर 37% से 58% तक गिर गई, जबकि केवल 45% से 75% आउटपुट ने बड़े पैमाने पर संरक्षण का पालन किया। स्रोत अलग-अलग मॉडलों की पहचान नहीं करता है, यह नहीं बताता है कि किस प्रदाता ने कौन सा परिणाम दिया, या सार में प्रत्येक विफलता के विस्तृत कारण प्रदान नहीं किए हैं। शोधकर्ताओं का कहना है कि वे आगे के काम के लिए डेटासेट और मूल्यांकन हार्नेस जारी कर रहे हैं।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

उत्पाद कार्बन-फ़ुटप्रिंट अनुमान उत्पादों और डीकार्बोनाइजेशन के बारे में निर्णयों के बीच तुलना को प्रभावित कर सकते हैं। पेपर का तर्क है कि केवल अंतिम उत्सर्जन कुल की जाँच करने से अंतर्निहित गणना में ऑफसेटिंग गलतियों को छुपाया जा सकता है। इसके परिणाम बताते हैं कि एआई-जनित आकलन कम पारदर्शी और कम भरोसेमंद हो सकते हैं जब सिस्टम को चरण दर चरण अनुमान बनाना होगा।

केंद्रीय व्यावहारिक मुद्दा यह है कि क्या एआई-जनित कार्बन अनुमान का निरीक्षण और भरोसा किया जा सकता है, बजाय इसके कि क्या इसकी अंतिम संख्या प्रशंसनीय लगती है। एक प्रणाली उन घटकों में त्रुटियां करते हुए एक करीबी कुल तक पहुंच सकती है जो एक दूसरे को रद्द करने के लिए होती हैं। पीसीएफबेंच का उद्देश्य घटक कार्यों का अलग से मूल्यांकन करके उन छिपे हुए त्रुटि स्रोतों को दृश्यमान बनाना है।

यह उत्पादों की तुलना करने वाले या उत्सर्जन कम करने के तरीकों की तलाश करने वाले संगठनों के लिए मायने रखता है। यदि कोई एआई सिस्टम किसी सामग्री की गलत पहचान करता है, अनुपयुक्त उत्सर्जन कारक को पुनः प्राप्त करता है, गलत तरीके से संख्या निकालता है या बुनियादी संख्यात्मक बाधा का उल्लंघन करता है, तो परिणामी मूल्यांकन उपयोगकर्ताओं को गलत तुलना या अप्रभावी डीकार्बोनाइजेशन प्राथमिकता की ओर इंगित कर सकता है। इन उपयोगों के लिए पेपर पारदर्शिता को एक आवश्यकता के रूप में प्रस्तुत करता है।

बड़े पैमाने पर संरक्षण का परिणाम पेपर के स्वयं के परीक्षण डिजाइन के भीतर विशेष रूप से महत्वपूर्ण है। केवल 45% से 75% चरण-दर-चरण आउटपुट उस बाधा को संतुष्ट करते हैं, यह दर्शाता है कि कुछ प्रणालियों ने गणनाएँ उत्पन्न कीं जिनकी मात्राएँ आंतरिक रूप से सुसंगत नहीं रहीं। स्रोत यह नहीं कहता है कि प्रत्येक उल्लंघन खरीदारी या नीति निर्णय को बदल देगा, लेकिन यह दर्शाता है कि स्पष्ट रूप से उचित अंतिम कुल को जांच की आवश्यकता क्यों हो सकती है।

निष्कर्ष सरल मॉडल रैंकिंग को भी जटिल बनाते हैं। क्योंकि आठ प्रणालियों और छह कार्यों में कोई भी मॉडल हावी नहीं है, कार्बन-फ़ुटप्रिंट कार्य के लिए एआई सिस्टम चुनने के लिए एकल समग्र स्कोर पर निर्भर रहने के बजाय विशिष्ट क्षमताओं की जांच करने की आवश्यकता हो सकती है। स्रोत बेंचमार्क परिणाम स्थापित करता है, तैनात कार्बन-लेखा प्रणालियों में नुकसान का प्रमाण नहीं। यह स्वतंत्र प्रतिकृति, क्षेत्र सत्यापन या मानव विश्लेषकों के साथ तुलना की रिपोर्ट भी नहीं करता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

आगे क्या देखना है

जारी किए गए डेटासेट और मूल्यांकन हार्नेस शोधकर्ताओं और चिकित्सकों को एआई-सहायता प्राप्त कार्बन लेखांकन में लक्षित सुधारों का परीक्षण करने की अनुमति दे सकते हैं। महत्वपूर्ण अज्ञात बने हुए हैं: स्रोत यह स्थापित नहीं करता है कि बेंचमार्क हर वास्तविक दुनिया के उत्पाद श्रेणी को कैसे दर्शाता है, क्या परीक्षण किए गए सिस्टम को कार्यों के लिए अनुकूलित किया गया था, या क्या बेहतर बेंचमार्क स्कोर विश्वसनीय परिचालन निर्णयों में तब्दील होंगे।

जारी किए गए बेंचमार्क और मूल्यांकन हार्नेस पेपर का सबसे ठोस अगला कदम है। शोधकर्ता उनका उपयोग यह परीक्षण करने के लिए कर सकते हैं कि पुनर्प्राप्ति, अपघटन, संख्यात्मक तर्क या ऑन्कोलॉजी मिलान में सुधार पीसीएफबेंच द्वारा पहचानी गई विशेष कमजोरियों को संबोधित करते हैं या नहीं। एक उपयोगी अनुवर्ती यह दिखाएगा कि क्या व्यक्तिगत कार्यों पर लाभ भी नई विसंगतियों को पेश किए बिना संपूर्ण उत्पाद-पदचिह्न गणना में सुधार करता है।

भविष्य के मूल्यांकन से यह स्पष्ट होना चाहिए कि 614 विशेषज्ञ-लेबल आइटम व्यवहार में आने वाले उत्पादों, सामग्रियों, आपूर्ति श्रृंखलाओं और रिपोर्टिंग सम्मेलनों के कितने प्रतिनिधि हैं। स्रोत सार में बेंचमार्क के पूर्ण उत्पाद कवरेज का वर्णन नहीं करता है, इसलिए इसके परिणामों को स्वचालित रूप से सभी एआई-सहायता प्राप्त कार्बन लेखांकन के माप के रूप में नहीं माना जाना चाहिए।

घोषित योग और अंतर्निहित सत्य के बीच संबंध पर भी ध्यान देने की आवश्यकता है। सार तुलना बिंदु के रूप में घोषित उत्पाद योग का उपयोग करता है, लेकिन यह स्पष्ट नहीं करता है कि उन घोषणाओं का उत्पादन कैसे किया गया था, उनमें अनिश्चितता को कैसे नियंत्रित किया गया था, या क्या वैकल्पिक वैध लेखांकन विकल्प संभव थे। वे विवरण प्रभावित कर सकते हैं कि रिपोर्ट किए गए कारक-दो और चरण-दर-चरण दरों की व्याख्या कैसे की जानी चाहिए।

उत्पाद-कार्बन विश्लेषण के लिए एआई पर विचार करने वाले चिकित्सकों को उन सबूतों पर ध्यान देना चाहिए जो सिस्टम मध्यवर्ती गणनाओं को संरक्षित करते हैं, लापता या परस्पर विरोधी इनपुट की पहचान करते हैं और संख्यात्मक मूल्यों के स्रोतों को उजागर करते हैं। वर्तमान स्रोत जारी अनुसंधान सामग्रियों से परे कोई उपलब्धता, तैनाती या प्रदर्शन की जानकारी प्रदान नहीं करता है, और यह स्थापित नहीं करता है कि कोई भी परीक्षण किया गया मॉडल उत्पादों या डीकार्बोनाइजेशन के बारे में बिना पर्यवेक्षित निर्णय लेने के लिए तैयार है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई क्या है?एआई मॉडल की व्याख्याएआई नैतिकताएआई प्रशिक्षणआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?