الذكاء الاصطناعي الدستوري
الذكاء الاصطناعي الدستوري هو طريقة Anthropic لمواءمة النماذج باستخدام مجموعة مكتوبة من المبادئ - "الدستور" - لذا ينتقد الذكاء الاصطناعي إجاباته وينقحها بدلاً من الاعتماد فقط على البشر لتصنيف المحتوى الضار.
نظرة عامة
It aims to make models helpful and harmless with far less human labor.
الغوص العميق
تعتمد المواءمة التقليدية على التعلم المعزز من ردود الفعل البشرية (RLHF)، حيث يقوم الأشخاص بتصنيف الكثير من مخرجات النموذج، بما في ذلك المخرجات المزعجة، لتعليم النموذج ما يجب تجنبه. يعمل الذكاء الاصطناعي الدستوري على تقليل هذا العبء من خلال إعطاء النموذج قائمة واضحة من المبادئ المكتوبة المستمدة من مصادر مثل إعلان الأمم المتحدة لحقوق الإنسان وأفضل ممارسات الثقة والسلامة. التدريب له مرحلتين. أولاً، مرحلة تحت الإشراف: يولد النموذج استجابة، ثم ينتقدها ضد مبدأ دستوري ويعيد كتابتها لتكون أفضل؛ يتم استخدام هذه الإجابات المحسّنة ذاتيًا لضبطها. ثانيًا، مرحلة التعلم المعزز، RLAIF، حيث يقوم النموذج نفسه بتصنيف أزواج من الاستجابات وفقًا للدستور، وتقوم بيانات التفضيلات الناتجة عن الذكاء الاصطناعي بتدريب نموذج المكافأة. تتميز المبادئ بالشفافية وقابلة للتحرير، مما يجعل القيم التي توجه النموذج قابلة للفحص بدلاً من إخفائها داخل ملصقات بشرية مبهمة.
البصيرة الفنية
غالبًا ما يُطلق على المرحلتين اسم SL-CAI وRL-CAI. في التعلم الخاضع للإشراف، تحث حلقة "النقد والمراجعة" النموذج على العثور على المكان الذي تنتهك فيه إجابته مبدأ العينة وإعادة كتابته، مما يؤدي إلى توليد بيانات تدريب دون تصنيف الضرر البشري. في مرحلة RL، يحكم النموذج الثاني على أي من الاستجابتين يتبع الدستور بشكل أفضل، وينتج تسميات تفضيلات الذكاء الاصطناعي (RLAIF) التي تدرب نموذج المكافأة المستخدم في RL القياسي. الدستور عبارة عن توجيه نصي عادي تم إدخاله في المطالبات، لذا فإن تغيير سلوك النموذج يمكن أن يكون مباشرًا مثل تحرير المبادئ.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل الذكاء الاصطناعي الدستوري
ويشير الذكاء الاصطناعي الدستوري إلى "الرقابة القابلة للتطوير"، حيث يساعد الذكاء الاصطناعي في الإشراف على الذكاء الاصطناعي مع نمو النماذج بحيث تصبح قادرة على التحقق من كل مخرجات. توقع دساتير أكثر ثراءً ودقة، ومدخلات عامة وتشاركية يتم فيها اختيار المبادئ (Anthropic أجرت تجارب "الذكاء الاصطناعي الدستوري الجماعي")، وأساليب هجينة تمزج ردود الفعل البشرية مع النقد الذاتي للذكاء الاصطناعي. إن شفافية المبادئ المكتوبة تجعل هذا أمرًا جذابًا للمنظمين والمدققين الراغبين في رؤية القيم التي يرمزها النظام. ومع تقدم النماذج الحدودية، من المرجح أن تصبح الأساليب التي تسمح للنماذج بنقد وتحسين نفسها بشكل موثوق في مواجهة القواعد الصريحة أمرًا أساسيًا للسلامة.
التنفيذ في العالم الحقيقي
تدريب روبوت الدردشة على رفض المساعدة في بناء سلاح من خلال جعله ينتقد مسودة إجابته الخاصة ضد مبدأ تجنب الضرر وإعادة كتابتها
استبدال العلامات المكلفة للفريق الأحمر البشري للمخرجات السامة ببيانات التفضيلات التي ينشئها الذكاء الاصطناعي (RLAIF) مسترشدة بالدستور
تحرير مبدأ مكتوب لضبط مدى حذر النموذج، ثم ملاحظة تغير السلوك دون إعادة تسمية آلاف الأمثلة
إجراء تمارين مدخلات جماعية حيث يقترح الجمهور المبادئ التي تشكل دستور النموذج
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
ضبط التعليمات
الأسئلة المتداولة
What is Constitutional AI?
الذكاء الاصطناعي الدستوري هو طريقة Anthropic لمواءمة النماذج باستخدام مجموعة مكتوبة من المبادئ - "الدستور" - لذا ينتقد الذكاء الاصطناعي إجاباته وينقحها بدلاً من الاعتماد فقط على البشر لتصنيف المحتوى الضار. ويهدف إلى جعل النماذج مفيدة وغير ضارة بجهد بشري أقل بكثير.
ما هو "الدستور" في الذكاء الاصطناعي الدستوري؟
فالدستور عبارة عن مجموعة شفافة من المبادئ المكتوبة، المستمدة من مصادر مثل وثائق حقوق الإنسان، والتي يستخدمها النموذج لتقييم وتحسين إجاباته.
ما هي المشكلة الرئيسية في RLHF القياسية التي يهدف الذكاء الاصطناعي الدستوري إلى الحد منها؟
ومن خلال قيام النموذج بنقد نفسه ضد المبادئ، فإن الذكاء الاصطناعي الدستوري يقلل من العمل البشري المتمثل في مراجعة وتصنيف النتائج المزعجة أو الضارة.
في المرحلة الخاضعة للإشراف من الذكاء الاصطناعي الدستوري، ما الذي يفعله النموذج بمخرجاته الخاصة؟
يدير النموذج حلقة نقد ومراجعة: فهو يحدد أين تنتهك مسودته مبدأ العينة، ثم يعيد كتابة الإجابة، مما يؤدي إلى إنشاء بيانات تدريب محسنة ذاتيًا.
ما الذي يمثله RLAIF في مرحلة التعلم المعزز؟
RLAIF يعني التعلم المعزز من تعليقات الذكاء الاصطناعي: وهو نموذج يصنف الاستجابات وفقًا للدستور، وينتج بيانات التفضيلات التي ينشئها الذكاء الاصطناعي بدلاً من التصنيفات البشرية.
لماذا يعتبر استخدام المبادئ المكتوبة ميزة للشفافية؟
ونظرًا لأن القيم التوجيهية مكتوبة، فمن الممكن فحصها وتدقيقها وتحريرها مباشرةً، على عكس التفضيلات المشفرة ضمنيًا في التقييمات البشرية المتفرقة.