समाचार पर वापस जाएँ
उत्पादAI Understanding ब्रीफिंग

Anthropic का कहना है कि फैबल 5 बायोलॉजी फ़ॉलबैक में 85% की गिरावट आई है

Anthropic का कहना है कि एक पुनः प्रशिक्षित सुरक्षा क्लासिफायर ने जीव विज्ञान से संबंधित कमियों को लगभग 85% तक कम कर दिया है, जिससे दोहरे उपयोग वाले अनुसंधान को प्रतिबंधित रखते हुए अधिक स्वास्थ्य और शिक्षा संबंधी प्रश्नों की अनुमति मिलती है।

5 min readRead the primary source
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
Anthropic's Fable 5 biology safeguards announcement
स्रोत लिंक
anthropic.comhttps://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

एपीआई (एप्लिकेशन प्रोग्रामिंग इंटरफ़ेस)
एक सॉफ्टवेयर सिस्टम के लिए दूसरे सिस्टम को अनुरोध भेजने और उससे प्रतिक्रिया प्राप्त करने का एक संरचित तरीका।
मूल्यांकन सेट
प्रशिक्षण के बाद मॉडल की गुणवत्ता को मापने के लिए उपयोग किया जाने वाला एक आयोजित डेटासेट।
वर्गीकरणकर्ता
वर्गीकरण कार्यों के लिए विशेष रूप से डिज़ाइन किया गया एक मॉडल।
स्वयं की जांच करोएआई सुरक्षा प्रश्नोत्तरी

क्या हुआ?

Anthropic ने 7 अगस्त को Claude फैबल 5 के जीव विज्ञान सुरक्षा उपायों को अपडेट किया, जिससे एक क्लासिफायरियर को सीमित कर दिया गया, जिसने लगभग हर जीव विज्ञान क्वेरी को कम जैविक रूप से सक्षम मॉडल में बदल दिया था।

जब क्लासिफायरियर किसी अनुरोध को चिह्नित करता है, तो Anthropic इसे फैबल 5 से ओपस 5 पर रूट करता है। कंपनी का कहना है कि ओपस 5 सामान्य उपयोग के लिए सक्षम रहता है, लेकिन उन्नत जीव विज्ञान पर कम परिचालन सहायता प्रदान करता है, जिससे हानिकारक काम करने वाले किसी व्यक्ति के लिए सिस्टम का मूल्य कम हो जाता है।

Anthropic का कहना है कि इसने क्लासिफायर के संविधान को फिर से लिखा, आंतरिक और बाहरी विशेषज्ञों से फीडबैक इकट्ठा किया, नया प्रशिक्षण डेटा बनाया, क्लासिफायर को फिर से प्रशिक्षित किया, और जांच की कि यह अभी भी आम तौर पर हानिकारक और दोहरे उपयोग वाले अनुसंधान अनुरोधों पर ट्रिगर होता है। कंपनी के परीक्षण में, अपडेट ने उसके सभी उत्पादों में जीव विज्ञान से संबंधित कमियां लगभग 85% कम कर दीं।

यह परिवर्तन जानबूझकर रूढ़िवादी लॉन्च मुद्रा का अनुसरण करता है। Anthropic का कहना है कि Fable 5 ने शुरू में लगभग हर जीवविज्ञान अनुरोध को Opus 5 में भेज दिया क्योंकि कंपनी ने एक व्यापक सुरक्षा सीमा को प्राथमिकता दी, जबकि उसे पता चला कि सौम्य स्वास्थ्य और शिक्षा के प्रश्न कहाँ पकड़े जा रहे थे। अगस्त का अपडेट मॉडल की अंतर्निहित जीव विज्ञान क्षमता को बदलने के बजाय एक अलग क्लासिफायरियर के माध्यम से उस सीमा को सीमित करता है। यह रिलीज़ को एक नीति-और-रूटिंग परिवर्तन बनाता है, न कि इस बात का सबूत कि फ़ेबल 5 चिकित्सकीय रूप से मान्य जीवविज्ञान सहायक बन गया है।

परिवर्तन का उद्देश्य फ़ेबल 5 को रोजमर्रा के स्वास्थ्य, नैदानिक ​​और शैक्षिक प्रश्नों का अधिक उत्तर देना है। Anthropic का कहना है कि वायरोलॉजी, टॉक्सिकोलॉजी और आणविक डिजाइन सहित दोहरे उपयोग वाले क्षेत्रों के लिए सामान्य पहुंच अभी भी कम है, इसलिए पेशेवर जीवविज्ञान अनुसंधान या दवा विकास के लिए मॉडल अभी तक उस पथ के माध्यम से उपलब्ध नहीं है।

स्रोत विवरण: Anthropic's Fable 5 biology safeguards announcement ↗

यह क्यों मायने रखता है?

अद्यतन एक व्यावहारिक परीक्षण है कि क्या फ्रंटियर-मॉडल सुरक्षा उपाय व्यापक पहुंच और व्यापक इनकार के बीच चयन किए बिना अधिक सटीक हो सकते हैं।

एक मोटा फ़िल्टर जोखिम को तुरंत कम कर सकता है, लेकिन यह छात्रों, रोगियों, शिक्षकों और स्वास्थ्य देखभाल पेशेवरों को भी अवरुद्ध कर सकता है जिनके प्रश्न संवेदनशील अनुसंधान के समान तकनीकी भाषा का उपयोग करते हैं। Anthropic ने फ़ेबल 5 जारी करते समय उस रूढ़िवादी शुरुआती बिंदु को चुना, फिर सौम्य अनुरोधों के लिए सीमा को स्थानांतरित करने के लिए अधिक विस्तृत नीति और नए प्रशिक्षण उदाहरणों का उपयोग किया।

उपयोगकर्ता अनुभव परिवर्तन उत्पाद के अनुसार भिन्न होता है क्योंकि जीव विज्ञान गिरावट का केवल एक कारण है। Anthropic का अनुमान है कि सभी प्रकार के कुल फ़ॉलबैक में Claude.ai पर लगभग 67%, कोवर्क में 55%, Claude Code में 17% और Claude प्लेटफ़ॉर्म पर 7% की गिरावट आएगी। वे कंपनी के माप हैं, स्वतंत्र ऑडिट परिणाम नहीं।

तंत्र भी मायने रखता है: एक फ़्लैग किए गए अनुरोध को फ़ेबल 5 द्वारा उत्तर देने के बजाय फिर से भेजा जाता है। यह क्षमता को रोकते हुए एक सामान्य मॉडल तक पहुंच को सुरक्षित रखता है जिसे Anthropic सबसे अधिक चिंताजनक मानता है, लेकिन यह स्थापित नहीं करता है कि प्रत्येक अनुमत स्वास्थ्य उत्तर एक नैदानिक ​​​​निर्णय के लिए सटीक या उपयुक्त है।

संगठनों के लिए, व्यावहारिक प्रश्न यह है कि सीमा संदर्भों में कैसे व्यवहार करती है। एक छात्र सामान्य भाषा में स्पष्टीकरण मांग रहा है, एक चिकित्सक शब्दावली की जांच कर रहा है, और एक शोधकर्ता एक प्रयोगात्मक प्रोटोकॉल का अनुरोध कर रहा है, जो बहुत अलग जोखिम पेश करते हुए ओवरलैपिंग शब्दों का उपयोग कर सकता है। Anthropic का रूटिंग दृष्टिकोण पहले दो मामलों के लिए एक सुरक्षित सामान्य उत्तर को संरक्षित कर सकता है, लेकिन केवल तभी जब क्लासिफायरियर इरादे, वार्तालाप इतिहास को पहचानता है, और एक वैध पेशेवर वर्कफ़्लो को अपारदर्शी इनकार में बदले बिना परिचालन विवरण का अनुरोध करता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Safety Quiz

What is 'specification gaming' in AI systems?

आगे क्या देखना है

साक्ष्य के लिए देखें कि कम फ़ॉलबैक दर वास्तव में खतरनाक अनुरोधों की मजबूत पहचान, साथ ही विश्वसनीय अनुसंधान पहुंच के लिए स्पष्ट नियमों से मेल खाती है।

Anthropic ने इस घोषणा के साथ मूल्यांकन सेट, गलत-नकारात्मक दर या एक स्वतंत्र प्रतिकृति प्रकाशित नहीं की। कंपनी का कहना है कि झूठी सकारात्मकताएँ बनी रहेंगी और क्लासिफायर को भी जेलब्रेक प्रयासों का सामना करना होगा, इसलिए 85% का आंकड़ा पूर्ण सुरक्षा ट्रेडऑफ़ के बजाय कम फ़ॉलबैक को मापता है।

अगले उपयोगी खुलासे पैराफ़्रेज़, भाषाओं, मल्टी-टर्न वार्तालापों और टूल-सक्षम वर्कफ़्लोज़ में प्रदर्शन दिखाएंगे। शोधकर्ताओं को यह भी जानना होगा कि हानिकारक अनुरोध कितनी बार नई सीमा को पार करता है और नए बाईपास दिखाई देने पर क्लासिफायरियर कितनी जल्दी अपडेट होता है।

Anthropic का कहना है कि यह सीमांत जीव विज्ञान क्षमताओं के लिए विश्वसनीय-पहुंच मार्ग विकसित कर रहा है। उनकी विश्वसनीयता इस बात पर निर्भर करेगी कि कौन योग्य है, कौन सी निगरानी और गोपनीयता सुरक्षा लागू होती है, घटनाओं की समीक्षा कैसे की जाती है, और क्या वैध शोधकर्ता गलत प्रतिबंध को चुनौती दे सकते हैं।

अगले प्रकटीकरण में यह भी बताया जाना चाहिए कि तैनाती के बाद क्लासिफायरियर का मूल्यांकन कैसे किया जाता है। झूठी सकारात्मकता को कम करके, कठिन मामलों को दूसरे मॉडल में स्थानांतरित करके, या अधिक हानिकारक अनुरोधों को गायब करके कम फ़ॉलबैक दर प्राप्त की जा सकती है; उन परिणामों के बहुत भिन्न सुरक्षा अर्थ हैं। उपयोगी रिपोर्टिंग में अनुरोध प्रकार के अनुसार गलत-सकारात्मक और गलत-नकारात्मक अनुमान, मल्टी-टर्न एस्केलेशन और पैराफ्रेज़ के तहत प्रदर्शन, भाषा कवरेज, टूल कॉल से निपटना और जेलब्रेक या किसी घटना के बाद सीमा को अपडेट करने की प्रक्रिया शामिल होगी।

उपयोगकर्ता-सामना वाले वादे का परीक्षण सुरक्षा सीमा की तरह ही सावधानी से किया जाना चाहिए। Anthropic का कहना है कि अपडेट को रोजमर्रा के स्वास्थ्य, नैदानिक ​​और शैक्षिक प्रश्नों में मदद करनी चाहिए, लेकिन कम फ़ॉलबैक दर चिकित्सा सटीकता, उचित ट्राइएज या पेशेवर निर्णयों के लिए उपयुक्तता स्थापित नहीं करती है। स्वतंत्र समीक्षकों को असमर्थित निश्चितता, लापता सुरक्षा सलाह और हानिकारक प्रक्रियात्मक विवरण के लिए अनुमत उत्तरों का नमूना लेना चाहिए, साथ ही यह भी जांचना चाहिए कि फ़ॉलबैक मॉडल अपनी सीमाओं को स्पष्ट रूप से बताता है या नहीं। सबसे मजबूत साक्ष्य क्लासिफायर परिवर्तन से पहले और बाद में मिलान किए गए अनुरोधों की तुलना करेगा और बाहरी शोधकर्ताओं के लिए लाभ और नए विफलता मोड दोनों को समझने के लिए पर्याप्त अज्ञात उदाहरण प्रकाशित करेगा।

उस साक्ष्य को उपभोक्ता चैट, कोडिंग, एजेंटिक वर्कफ़्लो और एपीआई के लिए अलग से रिपोर्ट किया जाना चाहिए क्योंकि एक ही क्लासिफायर सीमा प्रत्येक उत्पाद में अलग-अलग टूल, संदर्भ विंडो और उपयोगकर्ता की अपेक्षाओं को ले जा सकती है। एक एकल मिश्रित फ़ॉलबैक प्रतिशत एक सतह में दूसरे में सुधार के पीछे एक सार्थक प्रतिगमन को छिपा सकता है। हर, आत्मविश्वास अंतराल और उत्पाद-स्तर की गणना को प्रकाशित करने से परिणाम केवल एक शीर्षक संख्या की तुलना करने वाले पाठकों के बजाय शिक्षकों, चिकित्सकों, डेवलपर्स और सुरक्षा शोधकर्ताओं के लिए उपयोगी हो जाएगा।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई सुरक्षाएआई मॉडल की व्याख्याएआई नैतिकताआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?