Dil AI KILAVUZU

Anayasal Yapay Zeka

Anayasal yapay zeka, Anthropic'ün, yazılı bir dizi ilke (bir 'anayasa') kullanarak modelleri uyumlu hale getirme yöntemidir; böylece yapay zeka, zararlı içeriği etiketlemek için yalnızca insanlara güvenmek yerine kendi yanıtlarını eleştirir ve revize eder.

2 min readSon güncelleme

Genel Bakış

It aims to make models helpful and harmless with far less human labor.

Derin Dalış

Geleneksel hizalama, modele nelerden kaçınılması gerektiğini öğretmek için insanların rahatsız edici olanlar da dahil olmak üzere birçok model çıktısını sıraladığı insan geri bildiriminden (RLHF) takviyeli öğrenmeye dayanır. Anayasal yapay zeka, modele BM İnsan Hakları Bildirgesi ve güven ve güvenlikle ilgili en iyi uygulamalar gibi kaynaklardan alınan yazılı ilkelerin açık bir listesini vererek bu yükü azaltır. Eğitimin iki aşaması vardır. İlk olarak denetimli bir aşama: Model bir yanıt üretir, ardından onu anayasal bir ilkeye göre eleştirir ve daha iyi olması için yeniden yazar; kendi kendine geliştirilen bu yanıtlar, ince ayar yapmak için kullanılır. İkincisi, modelin kendisinin yapıya göre yanıt çiftlerini sıraladığı ve yapay zeka tarafından oluşturulan tercih verilerinin bir ödül modelini eğittiği takviyeli öğrenme aşaması olan RLAIF. İlkeler şeffaf ve düzenlenebilir olup, modeli yönlendiren değerlerin opak insan etiketlerinin içine gizlenmesi yerine incelenebilir olmasını sağlar.

Teknik Bilgi

Bu iki aşamaya genellikle SL-CAI ve RL-CAI adı verilir. Denetimli öğrenmede, bir 'eleştir ve gözden geçir' döngüsü, modelin, kendi cevabının örneklenmiş bir prensibi nerede ihlal ettiğini bulmasını ve onu yeniden yazmasını sağlayarak, insanların zararlarını etiketlemeden eğitim verileri üretmesini sağlar. RL aşamasında ikinci bir model, iki yanıttan hangisinin anayasaya daha iyi uyduğunu değerlendirir ve standart RL'de kullanılan bir ödül modelini eğiten AI tercih etiketleri (RLAIF) üretir. Anayasa, istemlere enjekte edilen düz metinli bir kılavuzdur, dolayısıyla modelin davranışını değiştirmek, ilkeleri düzenlemek kadar doğrudan olabilir.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Anayasal Yapay Zekanın Geleceği

Anayasal yapay zeka, modeller insanların her çıktıyı kontrol edemeyecek kadar yetenekli hale geldikçe yapay zekanın yapay zekayı denetlemeye yardımcı olduğu "ölçeklenebilir gözetime" işaret ediyor. Daha zengin, daha incelikli anayasalar, ilkelerin seçildiği kamusal ve katılımcı girdiler (Anthropic 'kolektif anayasal yapay zeka' deneyleri yürütmüştür) ve insan geribildirimini yapay zeka öz eleştirisiyle harmanlayan hibrit yaklaşımlar bekleyin. Yazılı ilkelerin şeffaflığı, bir sistemin kodladığı değerleri görmek isteyen düzenleyiciler ve denetçiler için bunu çekici kılmaktadır. Sınır modelleri ilerledikçe, modellerin güvenilir bir şekilde eleştiri yapmasına ve açık kurallara göre kendilerini geliştirmesine olanak tanıyan yöntemler muhtemelen güvenlik açısından merkezi hale gelecektir.

Gerçek Dünya Uygulaması

Bir chatbot'un, zarardan kaçınma ilkesine göre kendi taslak yanıtını eleştirmesini ve yeniden yazmasını sağlayarak, silah yapımına yardım etmeyi reddetmesi konusunda eğitim verilmesi

Toksik çıktılara ilişkin maliyetli kırmızı takım etiketlemesinin, anayasa tarafından yönlendirilen yapay zeka tarafından oluşturulan tercih verileri (RLAIF) ile değiştirilmesi

Bir modelin ne kadar dikkatli olacağını ayarlamak için yazılı bir prensibi düzenlemek, ardından binlerce örneği yeniden etiketlemeden davranış değişikliğini gözlemlemek

Kamuoyunun modelin yapısını şekillendiren ilkeleri önerdiği kolektif girdi alıştırmalarının yürütülmesi

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Talimat Ayarlama

Sık sorulan sorular

What is Constitutional AI?

Anayasal yapay zeka, Anthropic'ün, yazılı bir dizi ilke (bir 'anayasa') kullanarak modelleri uyumlu hale getirme yöntemidir; böylece yapay zeka, zararlı içeriği etiketlemek için yalnızca insanlara güvenmek yerine kendi yanıtlarını eleştirir ve revize eder. Modellerin çok daha az insan emeğiyle faydalı ve zararsız hale getirilmesi amaçlanıyor.

Anayasal AI'daki 'anayasa' nedir?

Anayasa, modelin yanıtlarını değerlendirmek ve geliştirmek için kullandığı, insan hakları belgeleri gibi kaynaklardan alınan şeffaf bir yazılı ilkeler dizisidir.

Anayasal Yapay Zeka, standart RLHF ile ilgili hangi temel sorunu azaltmayı amaçlıyor?

Anayasal Yapay Zeka, modelin kendisini ilkelere göre eleştirmesini sağlayarak, rahatsız edici veya zararlı çıktıları inceleme ve etiketleme konusunda insan emeğini azaltır.

Anayasal Yapay Zekanın denetlenen aşamasında model kendi çıktısına ne yapar?

Model bir eleştiri ve gözden geçirme döngüsü çalıştırır: taslağının örneklenmiş bir prensibi nerede ihlal ettiğini belirler, ardından yanıtı yeniden yazarak kendi kendini geliştiren eğitim verileri oluşturur.

Takviyeli öğrenme aşamasında RLAIF ne anlama geliyor?

RLAIF, Yapay Zeka Geri Bildiriminden Takviyeli Öğrenme anlamına gelir: bir model, yanıtları yapıya göre sıralayarak insan etiketleri yerine yapay zeka tarafından oluşturulan tercih verilerini üretir.

Yazılı ilkelerin kullanılması neden şeffaflık açısından bir avantaj olarak görülüyor?

Yol gösterici değerler yazılı olduğundan, dağınık insan derecelendirmelerinde örtülü olarak kodlanan tercihlerin aksine, doğrudan incelenebilir, denetlenebilir ve düzenlenebilir.