संवैधानिक ए.आई
संवैधानिक AI सिद्धांतों के लिखित सेट - एक 'संविधान' - का उपयोग करके मॉडलों को संरेखित करने के लिए Anthropic की विधि है - इसलिए AI हानिकारक सामग्री को लेबल करने के लिए केवल मनुष्यों पर निर्भर रहने के बजाय अपने स्वयं के उत्तरों की आलोचना और संशोधन करता है।
सिंहावलोकन
It aims to make models helpful and harmless with far less human labor.
गहरा गोता
पारंपरिक संरेखण मानव प्रतिक्रिया (आरएलएचएफ) से सुदृढीकरण सीखने पर निर्भर करता है, जहां लोग मॉडल को यह सिखाने के लिए कि क्या टालना है, परेशान करने वाले सहित बहुत सारे मॉडल आउटपुट को रैंक करते हैं। संवैधानिक एआई मॉडल को संयुक्त राष्ट्र मानवाधिकार घोषणापत्र और विश्वास-और-सुरक्षा सर्वोत्तम प्रथाओं जैसे स्रोतों से तैयार लिखित सिद्धांतों की एक स्पष्ट सूची देकर उस बोझ को कम करता है। प्रशिक्षण के दो चरण हैं. सबसे पहले, एक पर्यवेक्षित चरण: मॉडल एक प्रतिक्रिया उत्पन्न करता है, फिर संवैधानिक सिद्धांत के विरुद्ध इसकी आलोचना करता है और इसे बेहतर बनाने के लिए इसे फिर से लिखता है; इन स्व-सुधारित उत्तरों का उपयोग इसे बेहतर बनाने के लिए किया जाता है। दूसरा, एक सुदृढीकरण-सीखने का चरण, आरएलएआईएफ, जहां मॉडल स्वयं संविधान के अनुसार प्रतिक्रियाओं के जोड़े को रैंक करता है, और एआई-जनित वरीयता डेटा एक इनाम मॉडल को प्रशिक्षित करता है। सिद्धांत पारदर्शी और संपादन योग्य हैं, जिससे मॉडल को चलाने वाले मूल्य अपारदर्शी मानव लेबल के अंदर छिपे होने के बजाय निरीक्षण योग्य हो जाते हैं।
तकनीकी अंतर्दृष्टि
दो चरणों को अक्सर SL-CAI और RL-CAI कहा जाता है। पर्यवेक्षित शिक्षण में, एक 'आलोचना-और-संशोधन' लूप मॉडल को यह पता लगाने के लिए प्रेरित करता है कि उसका स्वयं का उत्तर नमूना सिद्धांत का उल्लंघन कहां करता है और इसे फिर से लिखता है, मानव हानि-लेबलिंग के बिना प्रशिक्षण डेटा उत्पन्न करता है। आरएल चरण में, दूसरा मॉडल यह तय करता है कि दो प्रतिक्रियाओं में से कौन सा बेहतर ढंग से संविधान का पालन करता है, एआई वरीयता लेबल (आरएलएआईएफ) का उत्पादन करता है जो मानक आरएल में उपयोग किए जाने वाले इनाम मॉडल को प्रशिक्षित करता है। संविधान सादा-पाठ मार्गदर्शन है जिसे संकेतों में शामिल किया गया है, इसलिए मॉडल के व्यवहार को बदलना सिद्धांतों को संपादित करने जितना ही प्रत्यक्ष हो सकता है।
सामरिक प्रभाव
गति और पैमाना
भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।
पहुंच और पहुंच
यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।
स्पष्ट निर्णय
टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।
संवैधानिक एआई का भविष्य
संवैधानिक एआई 'स्केलेबल ओवरसाइट' की ओर इशारा करता है, जहां एआई एआई की निगरानी में मदद करता है क्योंकि मॉडल मनुष्यों के लिए हर आउटपुट की जांच करने में सक्षम हो जाते हैं। अधिक समृद्ध, अधिक सूक्ष्म संविधान, सार्वजनिक और सहभागी इनपुट की अपेक्षा करें जिसमें सिद्धांतों को चुना जाता है (Anthropic ने 'सामूहिक संवैधानिक एआई' प्रयोग चलाए हैं), और एआई आत्म-आलोचना के साथ मानव प्रतिक्रिया को मिश्रित करने वाले संकर दृष्टिकोण। लिखित सिद्धांतों की पारदर्शिता इसे उन नियामकों और लेखा परीक्षकों के लिए आकर्षक बनाती है जो सिस्टम द्वारा एन्कोड किए गए मूल्यों को देखना चाहते हैं। जैसे-जैसे सीमांत मॉडल आगे बढ़ते हैं, वे विधियाँ जो मॉडलों को विश्वसनीय रूप से आलोचना करने और स्पष्ट नियमों के विरुद्ध खुद को बेहतर बनाने देती हैं, संभवतः सुरक्षा के लिए केंद्रीय बन जाएंगी।
वास्तविक विश्व कार्यान्वयन
एक चैटबॉट को नुकसान-बचाव सिद्धांत के खिलाफ अपने स्वयं के मसौदा उत्तर की आलोचना करके और उसे फिर से लिखकर हथियार बनाने में मदद करने से इनकार करने के लिए प्रशिक्षित करना
संविधान द्वारा निर्देशित एआई-जनित वरीयता डेटा (आरएलएआईएफ) के साथ जहरीले आउटपुट की महंगी मानव रेड-टीम लेबलिंग को बदलना
एक मॉडल कितना सतर्क है, इसे समायोजित करने के लिए एक लिखित सिद्धांत को संपादित करना, फिर हजारों उदाहरणों को पुनः लेबल किए बिना व्यवहार परिवर्तन का अवलोकन करना
सामूहिक इनपुट अभ्यास चलाना जहां जनता उन सिद्धांतों का प्रस्ताव करती है जो मॉडल के संविधान को आकार देते हैं
जोखिम और रेलिंग
मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।
त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।
यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।
कार्यान्वयन रोडमैप
रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।
जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।
उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।
विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
अनुदेश ट्यूनिंग
अक्सर पूछे जाने वाले प्रश्नों
What is Constitutional AI?
संवैधानिक AI सिद्धांतों के लिखित सेट - एक 'संविधान' - का उपयोग करके मॉडलों को संरेखित करने के लिए Anthropic की विधि है - इसलिए AI हानिकारक सामग्री को लेबल करने के लिए केवल मनुष्यों पर निर्भर रहने के बजाय अपने स्वयं के उत्तरों की आलोचना और संशोधन करता है। इसका लक्ष्य बहुत कम मानव श्रम के साथ मॉडलों को सहायक और हानिरहित बनाना है।
संवैधानिक एआई में 'संविधान' क्या है?
संविधान लिखित सिद्धांतों का एक पारदर्शी सेट है, जो मानवाधिकार दस्तावेजों जैसे स्रोतों से तैयार किया गया है, जिसका उपयोग मॉडल अपने उत्तरों का मूल्यांकन और सुधार करने के लिए करता है।
संवैधानिक एआई का लक्ष्य मानक आरएलएचएफ के साथ किस प्रमुख समस्या को कम करना है?
सिद्धांतों के विरुद्ध मॉडल की आलोचना करने से, संवैधानिक एआई परेशान करने वाले या हानिकारक आउटपुट की समीक्षा करने और उन्हें लेबल करने के मानव श्रम में कटौती करता है।
संवैधानिक एआई के पर्यवेक्षित चरण में, मॉडल अपने आउटपुट के लिए क्या करता है?
मॉडल एक समालोचना-और-संशोधन लूप चलाता है: यह पहचानता है कि इसका मसौदा नमूना सिद्धांत का उल्लंघन कहां करता है, फिर उत्तर को फिर से लिखता है, स्व-सुधारित प्रशिक्षण डेटा बनाता है।
सुदृढीकरण-सीखने के चरण में RLAIF का क्या अर्थ है?
आरएलएआईएफ का अर्थ है एआई फीडबैक से सुदृढीकरण सीखना: एक मॉडल संविधान के अनुसार प्रतिक्रियाओं को रैंक करता है, मानव लेबल के बजाय एआई-जनित वरीयता डेटा का उत्पादन करता है।
पारदर्शिता के लिए लिखित सिद्धांतों के उपयोग को एक लाभ क्यों माना जाता है?
क्योंकि मार्गदर्शक मूल्यों को लिखा गया है, उनका निरीक्षण, लेखापरीक्षा और संपादन सीधे किया जा सकता है, बिखरी हुई मानव रेटिंग में निहित प्राथमिकताओं के विपरीत।