क्या हुआ?
Anthropic ने 7 अगस्त को Claude फैबल 5 के जीव विज्ञान सुरक्षा उपायों को अपडेट किया, जिससे एक क्लासिफायरियर को सीमित कर दिया गया, जिसने लगभग हर जीव विज्ञान क्वेरी को कम जैविक रूप से सक्षम मॉडल में बदल दिया था।
जब क्लासिफायरियर किसी अनुरोध को चिह्नित करता है, तो Anthropic इसे फैबल 5 से ओपस 5 पर रूट करता है। कंपनी का कहना है कि ओपस 5 सामान्य उपयोग के लिए सक्षम रहता है, लेकिन उन्नत जीव विज्ञान पर कम परिचालन सहायता प्रदान करता है, जिससे हानिकारक काम करने वाले किसी व्यक्ति के लिए सिस्टम का मूल्य कम हो जाता है।
Anthropic का कहना है कि इसने क्लासिफायर के संविधान को फिर से लिखा, आंतरिक और बाहरी विशेषज्ञों से फीडबैक इकट्ठा किया, नया प्रशिक्षण डेटा बनाया, क्लासिफायर को फिर से प्रशिक्षित किया, और जांच की कि यह अभी भी आम तौर पर हानिकारक और दोहरे उपयोग वाले अनुसंधान अनुरोधों पर ट्रिगर होता है। कंपनी के परीक्षण में, अपडेट ने उसके सभी उत्पादों में जीव विज्ञान से संबंधित कमियां लगभग 85% कम कर दीं।
यह परिवर्तन जानबूझकर रूढ़िवादी लॉन्च मुद्रा का अनुसरण करता है। Anthropic का कहना है कि Fable 5 ने शुरू में लगभग हर जीवविज्ञान अनुरोध को Opus 5 में भेज दिया क्योंकि कंपनी ने एक व्यापक सुरक्षा सीमा को प्राथमिकता दी, जबकि उसे पता चला कि सौम्य स्वास्थ्य और शिक्षा के प्रश्न कहाँ पकड़े जा रहे थे। अगस्त का अपडेट मॉडल की अंतर्निहित जीव विज्ञान क्षमता को बदलने के बजाय एक अलग क्लासिफायरियर के माध्यम से उस सीमा को सीमित करता है। यह रिलीज़ को एक नीति-और-रूटिंग परिवर्तन बनाता है, न कि इस बात का सबूत कि फ़ेबल 5 चिकित्सकीय रूप से मान्य जीवविज्ञान सहायक बन गया है।
परिवर्तन का उद्देश्य फ़ेबल 5 को रोजमर्रा के स्वास्थ्य, नैदानिक और शैक्षिक प्रश्नों का अधिक उत्तर देना है। Anthropic का कहना है कि वायरोलॉजी, टॉक्सिकोलॉजी और आणविक डिजाइन सहित दोहरे उपयोग वाले क्षेत्रों के लिए सामान्य पहुंच अभी भी कम है, इसलिए पेशेवर जीवविज्ञान अनुसंधान या दवा विकास के लिए मॉडल अभी तक उस पथ के माध्यम से उपलब्ध नहीं है।
स्रोत विवरण: Anthropic's Fable 5 biology safeguards announcement ↗
यह क्यों मायने रखता है?
अद्यतन एक व्यावहारिक परीक्षण है कि क्या फ्रंटियर-मॉडल सुरक्षा उपाय व्यापक पहुंच और व्यापक इनकार के बीच चयन किए बिना अधिक सटीक हो सकते हैं।
एक मोटा फ़िल्टर जोखिम को तुरंत कम कर सकता है, लेकिन यह छात्रों, रोगियों, शिक्षकों और स्वास्थ्य देखभाल पेशेवरों को भी अवरुद्ध कर सकता है जिनके प्रश्न संवेदनशील अनुसंधान के समान तकनीकी भाषा का उपयोग करते हैं। Anthropic ने फ़ेबल 5 जारी करते समय उस रूढ़िवादी शुरुआती बिंदु को चुना, फिर सौम्य अनुरोधों के लिए सीमा को स्थानांतरित करने के लिए अधिक विस्तृत नीति और नए प्रशिक्षण उदाहरणों का उपयोग किया।
उपयोगकर्ता अनुभव परिवर्तन उत्पाद के अनुसार भिन्न होता है क्योंकि जीव विज्ञान गिरावट का केवल एक कारण है। Anthropic का अनुमान है कि सभी प्रकार के कुल फ़ॉलबैक में Claude.ai पर लगभग 67%, कोवर्क में 55%, Claude Code में 17% और Claude प्लेटफ़ॉर्म पर 7% की गिरावट आएगी। वे कंपनी के माप हैं, स्वतंत्र ऑडिट परिणाम नहीं।
तंत्र भी मायने रखता है: एक फ़्लैग किए गए अनुरोध को फ़ेबल 5 द्वारा उत्तर देने के बजाय फिर से भेजा जाता है। यह क्षमता को रोकते हुए एक सामान्य मॉडल तक पहुंच को सुरक्षित रखता है जिसे Anthropic सबसे अधिक चिंताजनक मानता है, लेकिन यह स्थापित नहीं करता है कि प्रत्येक अनुमत स्वास्थ्य उत्तर एक नैदानिक निर्णय के लिए सटीक या उपयुक्त है।
संगठनों के लिए, व्यावहारिक प्रश्न यह है कि सीमा संदर्भों में कैसे व्यवहार करती है। एक छात्र सामान्य भाषा में स्पष्टीकरण मांग रहा है, एक चिकित्सक शब्दावली की जांच कर रहा है, और एक शोधकर्ता एक प्रयोगात्मक प्रोटोकॉल का अनुरोध कर रहा है, जो बहुत अलग जोखिम पेश करते हुए ओवरलैपिंग शब्दों का उपयोग कर सकता है। Anthropic का रूटिंग दृष्टिकोण पहले दो मामलों के लिए एक सुरक्षित सामान्य उत्तर को संरक्षित कर सकता है, लेकिन केवल तभी जब क्लासिफायरियर इरादे, वार्तालाप इतिहास को पहचानता है, और एक वैध पेशेवर वर्कफ़्लो को अपारदर्शी इनकार में बदले बिना परिचालन विवरण का अनुरोध करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').What is 'specification gaming' in AI systems?
आगे क्या देखना है
साक्ष्य के लिए देखें कि कम फ़ॉलबैक दर वास्तव में खतरनाक अनुरोधों की मजबूत पहचान, साथ ही विश्वसनीय अनुसंधान पहुंच के लिए स्पष्ट नियमों से मेल खाती है।
Anthropic ने इस घोषणा के साथ मूल्यांकन सेट, गलत-नकारात्मक दर या एक स्वतंत्र प्रतिकृति प्रकाशित नहीं की। कंपनी का कहना है कि झूठी सकारात्मकताएँ बनी रहेंगी और क्लासिफायर को भी जेलब्रेक प्रयासों का सामना करना होगा, इसलिए 85% का आंकड़ा पूर्ण सुरक्षा ट्रेडऑफ़ के बजाय कम फ़ॉलबैक को मापता है।
अगले उपयोगी खुलासे पैराफ़्रेज़, भाषाओं, मल्टी-टर्न वार्तालापों और टूल-सक्षम वर्कफ़्लोज़ में प्रदर्शन दिखाएंगे। शोधकर्ताओं को यह भी जानना होगा कि हानिकारक अनुरोध कितनी बार नई सीमा को पार करता है और नए बाईपास दिखाई देने पर क्लासिफायरियर कितनी जल्दी अपडेट होता है।
Anthropic का कहना है कि यह सीमांत जीव विज्ञान क्षमताओं के लिए विश्वसनीय-पहुंच मार्ग विकसित कर रहा है। उनकी विश्वसनीयता इस बात पर निर्भर करेगी कि कौन योग्य है, कौन सी निगरानी और गोपनीयता सुरक्षा लागू होती है, घटनाओं की समीक्षा कैसे की जाती है, और क्या वैध शोधकर्ता गलत प्रतिबंध को चुनौती दे सकते हैं।
अगले प्रकटीकरण में यह भी बताया जाना चाहिए कि तैनाती के बाद क्लासिफायरियर का मूल्यांकन कैसे किया जाता है। झूठी सकारात्मकता को कम करके, कठिन मामलों को दूसरे मॉडल में स्थानांतरित करके, या अधिक हानिकारक अनुरोधों को गायब करके कम फ़ॉलबैक दर प्राप्त की जा सकती है; उन परिणामों के बहुत भिन्न सुरक्षा अर्थ हैं। उपयोगी रिपोर्टिंग में अनुरोध प्रकार के अनुसार गलत-सकारात्मक और गलत-नकारात्मक अनुमान, मल्टी-टर्न एस्केलेशन और पैराफ्रेज़ के तहत प्रदर्शन, भाषा कवरेज, टूल कॉल से निपटना और जेलब्रेक या किसी घटना के बाद सीमा को अपडेट करने की प्रक्रिया शामिल होगी।
उपयोगकर्ता-सामना वाले वादे का परीक्षण सुरक्षा सीमा की तरह ही सावधानी से किया जाना चाहिए। Anthropic का कहना है कि अपडेट को रोजमर्रा के स्वास्थ्य, नैदानिक और शैक्षिक प्रश्नों में मदद करनी चाहिए, लेकिन कम फ़ॉलबैक दर चिकित्सा सटीकता, उचित ट्राइएज या पेशेवर निर्णयों के लिए उपयुक्तता स्थापित नहीं करती है। स्वतंत्र समीक्षकों को असमर्थित निश्चितता, लापता सुरक्षा सलाह और हानिकारक प्रक्रियात्मक विवरण के लिए अनुमत उत्तरों का नमूना लेना चाहिए, साथ ही यह भी जांचना चाहिए कि फ़ॉलबैक मॉडल अपनी सीमाओं को स्पष्ट रूप से बताता है या नहीं। सबसे मजबूत साक्ष्य क्लासिफायर परिवर्तन से पहले और बाद में मिलान किए गए अनुरोधों की तुलना करेगा और बाहरी शोधकर्ताओं के लिए लाभ और नए विफलता मोड दोनों को समझने के लिए पर्याप्त अज्ञात उदाहरण प्रकाशित करेगा।
उस साक्ष्य को उपभोक्ता चैट, कोडिंग, एजेंटिक वर्कफ़्लो और एपीआई के लिए अलग से रिपोर्ट किया जाना चाहिए क्योंकि एक ही क्लासिफायर सीमा प्रत्येक उत्पाद में अलग-अलग टूल, संदर्भ विंडो और उपयोगकर्ता की अपेक्षाओं को ले जा सकती है। एक एकल मिश्रित फ़ॉलबैक प्रतिशत एक सतह में दूसरे में सुधार के पीछे एक सार्थक प्रतिगमन को छिपा सकता है। हर, आत्मविश्वास अंतराल और उत्पाद-स्तर की गणना को प्रकाशित करने से परिणाम केवल एक शीर्षक संख्या की तुलना करने वाले पाठकों के बजाय शिक्षकों, चिकित्सकों, डेवलपर्स और सुरक्षा शोधकर्ताओं के लिए उपयोगी हो जाएगा।