Anayasal Yapay Zeka
Anayasal yapay zeka, Anthropic'ün, yazılı bir dizi ilke (bir 'anayasa') kullanarak modelleri uyumlu hale getirme yöntemidir; böylece yapay zeka, zararlı içeriği etiketlemek için yalnızca insanlara güvenmek yerine kendi yanıtlarını eleştirir ve revize eder.
Genel Bakış
It aims to make models helpful and harmless with far less human labor.
Derin Dalış
Geleneksel hizalama, modele nelerden kaçınılması gerektiğini öğretmek için insanların rahatsız edici olanlar da dahil olmak üzere birçok model çıktısını sıraladığı insan geri bildiriminden (RLHF) takviyeli öğrenmeye dayanır. Anayasal yapay zeka, modele BM İnsan Hakları Bildirgesi ve güven ve güvenlikle ilgili en iyi uygulamalar gibi kaynaklardan alınan yazılı ilkelerin açık bir listesini vererek bu yükü azaltır. Eğitimin iki aşaması vardır. İlk olarak denetimli bir aşama: Model bir yanıt üretir, ardından onu anayasal bir ilkeye göre eleştirir ve daha iyi olması için yeniden yazar; kendi kendine geliştirilen bu yanıtlar, ince ayar yapmak için kullanılır. İkincisi, modelin kendisinin yapıya göre yanıt çiftlerini sıraladığı ve yapay zeka tarafından oluşturulan tercih verilerinin bir ödül modelini eğittiği takviyeli öğrenme aşaması olan RLAIF. İlkeler şeffaf ve düzenlenebilir olup, modeli yönlendiren değerlerin opak insan etiketlerinin içine gizlenmesi yerine incelenebilir olmasını sağlar.
Teknik Bilgi
Bu iki aşamaya genellikle SL-CAI ve RL-CAI adı verilir. Denetimli öğrenmede, bir 'eleştir ve gözden geçir' döngüsü, modelin, kendi cevabının örneklenmiş bir prensibi nerede ihlal ettiğini bulmasını ve onu yeniden yazmasını sağlayarak, insanların zararlarını etiketlemeden eğitim verileri üretmesini sağlar. RL aşamasında ikinci bir model, iki yanıttan hangisinin anayasaya daha iyi uyduğunu değerlendirir ve standart RL'de kullanılan bir ödül modelini eğiten AI tercih etiketleri (RLAIF) üretir. Anayasa, istemlere enjekte edilen düz metinli bir kılavuzdur, dolayısıyla modelin davranışını değiştirmek, ilkeleri düzenlemek kadar doğrudan olabilir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Anayasal Yapay Zekanın Geleceği
Anayasal yapay zeka, modeller insanların her çıktıyı kontrol edemeyecek kadar yetenekli hale geldikçe yapay zekanın yapay zekayı denetlemeye yardımcı olduğu "ölçeklenebilir gözetime" işaret ediyor. Daha zengin, daha incelikli anayasalar, ilkelerin seçildiği kamusal ve katılımcı girdiler (Anthropic 'kolektif anayasal yapay zeka' deneyleri yürütmüştür) ve insan geribildirimini yapay zeka öz eleştirisiyle harmanlayan hibrit yaklaşımlar bekleyin. Yazılı ilkelerin şeffaflığı, bir sistemin kodladığı değerleri görmek isteyen düzenleyiciler ve denetçiler için bunu çekici kılmaktadır. Sınır modelleri ilerledikçe, modellerin güvenilir bir şekilde eleştiri yapmasına ve açık kurallara göre kendilerini geliştirmesine olanak tanıyan yöntemler muhtemelen güvenlik açısından merkezi hale gelecektir.
Gerçek Dünya Uygulaması
Bir chatbot'un, zarardan kaçınma ilkesine göre kendi taslak yanıtını eleştirmesini ve yeniden yazmasını sağlayarak, silah yapımına yardım etmeyi reddetmesi konusunda eğitim verilmesi
Toksik çıktılara ilişkin maliyetli kırmızı takım etiketlemesinin, anayasa tarafından yönlendirilen yapay zeka tarafından oluşturulan tercih verileri (RLAIF) ile değiştirilmesi
Bir modelin ne kadar dikkatli olacağını ayarlamak için yazılı bir prensibi düzenlemek, ardından binlerce örneği yeniden etiketlemeden davranış değişikliğini gözlemlemek
Kamuoyunun modelin yapısını şekillendiren ilkeleri önerdiği kolektif girdi alıştırmalarının yürütülmesi
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Talimat Ayarlama
Sık sorulan sorular
What is Constitutional AI?
Anayasal yapay zeka, Anthropic'ün, yazılı bir dizi ilke (bir 'anayasa') kullanarak modelleri uyumlu hale getirme yöntemidir; böylece yapay zeka, zararlı içeriği etiketlemek için yalnızca insanlara güvenmek yerine kendi yanıtlarını eleştirir ve revize eder. Modellerin çok daha az insan emeğiyle faydalı ve zararsız hale getirilmesi amaçlanıyor.
Anayasal AI'daki 'anayasa' nedir?
Anayasa, modelin yanıtlarını değerlendirmek ve geliştirmek için kullandığı, insan hakları belgeleri gibi kaynaklardan alınan şeffaf bir yazılı ilkeler dizisidir.
Anayasal Yapay Zeka, standart RLHF ile ilgili hangi temel sorunu azaltmayı amaçlıyor?
Anayasal Yapay Zeka, modelin kendisini ilkelere göre eleştirmesini sağlayarak, rahatsız edici veya zararlı çıktıları inceleme ve etiketleme konusunda insan emeğini azaltır.
Anayasal Yapay Zekanın denetlenen aşamasında model kendi çıktısına ne yapar?
Model bir eleştiri ve gözden geçirme döngüsü çalıştırır: taslağının örneklenmiş bir prensibi nerede ihlal ettiğini belirler, ardından yanıtı yeniden yazarak kendi kendini geliştiren eğitim verileri oluşturur.
Takviyeli öğrenme aşamasında RLAIF ne anlama geliyor?
RLAIF, Yapay Zeka Geri Bildiriminden Takviyeli Öğrenme anlamına gelir: bir model, yanıtları yapıya göre sıralayarak insan etiketleri yerine yapay zeka tarafından oluşturulan tercih verilerini üretir.
Yazılı ilkelerin kullanılması neden şeffaflık açısından bir avantaj olarak görülüyor?
Yol gösterici değerler yazılı olduğundan, dağınık insan derecelendirmelerinde örtülü olarak kodlanan tercihlerin aksine, doğrudan incelenebilir, denetlenebilir ve düzenlenebilir.