Uygulama KILAVUZU

Ajan Korkulukları

Ajan korkulukları, bir AI temsilcisinin ne yapmasına, söylemesine veya erişmesine izin verildiğini kısıtlayan güvenlik kuralları, filtreler ve sınırlamalardır.

2 min readSon güncelleme

Genel Bakış

They keep autonomous systems on-task, on-policy, and out of trouble.

Derin Dalış

Yapay zeka ajanları araçları çağırma, kod yazma, mesaj gönderme ve para harcama yeteneğini kazandıkça korkuluklar yardımcı bir asistan ile sorumluluk arasındaki fark haline gelir. Korkuluklar birkaç katmanda çalışır: giriş korkulukları, jailbreak girişimleri veya konu dışı istekler için kullanıcı istemlerini görüntüler; çıkış korkulukları, aracının toksik, yanlış veya uyumsuz içerik açısından verdiği yanıtları kullanıcıya ulaşmadan önce kontrol eder; ve eylem korkulukları, aracının hangi araçları, API'leri, dosyaları veya harcama limitlerini kullanabileceğini kısıtlar. Bunlar, katı kurallar (yasaklanmış komutların reddedilme listesi) olarak, çıktıları derecelendiren ayrı 'yargılama' modelleri olarak veya tehlikeli eylemleri imkansız hale getiren kapsamlı izinler olarak uygulanabilir. İyi korkuluklar güvenlidir, gözlemlenebilirdir ve modelin davranışına güvenmek yerine rakip girdilere karşı test edilir.

Teknik Bilgi

Ortak bir mimari, çekirdek aracıyı her adımdan önce ve sonra çalışan doğrulayıcılarla sarar. Giriş doğrulayıcıları, hızlı enjeksiyonu tespit etmek için kalıp eşleştirme artı bir sınıflandırıcı kullanabilir; çıktı doğrulayıcıları, güvenliği puanlamak veya iddiaları doğrulamak için daha küçük bir modeli yeniden yönlendirebilir. Eylem korkulukları en az ayrıcalık ilkesine dayanır: aracı, kapsamı dar olan API anahtarlarını, izin verilenler listesindeki araçları ve ücret veya bütçe sınırlarını alır; böylece güvenliği ihlal edilmiş bir istem bile yıkıcı işlemleri tetikleyemez.

Stratejik Etki

Build choices

Uygulama düzeyinde tasarım, yapay zekanın gerçek sonuçları iyileştirip iyileştirmediğini belirler.

Ekip ve iş akışı

İyi iş akışı entegrasyonu, kullanıcıların güvenebileceği üretkenlik kazanımları sağlar.

Risk and safety

İyi kapsamlı kullanım örnekleri, değişiklik yorgunluğunu ve uygulama riskini azaltır.

Ajan Korkuluklarının Geleceği

Korumalar, kırılgan anahtar kelime filtrelerinden, politika motorlarını, korumalı alanda yürütmeyi ve sürekli izlemeyi birleştiren katmanlı savunmalara doğru geçiş yapıyor. Standartlaştırılmış 'hizmet olarak korkuluk' kitaplıkları, kritik aracılar için resmi doğrulama ve jailbreak'leri otomatik olarak araştıran kırmızı ekip oluşturma işlem hatlarını bekleyin. Temsilciler daha bağımsız hareket ettikçe, bir aracıyı görevin ortasında durdurabilen ve neden sonradan akla gelen bir düşünce olmaktan ziyade temel altyapı haline geleceğini açıklayabilen çalışma zamanı korkulukları.

Gerçek Dünya Uygulaması

Kodlama aracısı yalnızca salt okunur komutları çalıştıracak şekilde izin verilenler listesinde olduğundan, dosyaları silemez veya üretime aktaramaz.

Bir müşteri sohbet robotu, kişisel veriler veya finansal tavsiyeler içeren yanıtları engelleyen bir çıktı filtresi kullanır.

Bir satın alma temsilcisinin, model dışında gerçekleştirilen işlem başına 100 ABD doları tutarında kesin harcama sınırı vardır.

Bir girdi sınıflandırıcı, aracının özetlediği bir belgede gizlenen istem ekleme girişimlerini algılar ve reddeder.

Riskler ve Korkuluklar

Bozuk bir süreci otomatikleştirmek mevcut sorunları büyütebilir.

Ekipler aşırı otomatikleşebilir ve gerekli insan muhakemesini ortadan kaldırabilir.

Çıktılar sürekli olarak değerlendirilmezse kalite düşebilir.

Uygulama Yol Haritası

1

Mevcut iş akışının haritasını çıkarın ve en yüksek sürtünmeli adımı belirleyin.

2

Tam otomasyondan önce insan kontrol noktalarını tanımlayın.

3

Kullanıcıları istemler, yükseltme yolları ve kalite standartları konusunda eğitin.

4

Sürdürülebilir değeri doğrulamak için görev düzeyindeki sonuçları izleyin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Agent Guardrails quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Yapay Zeka Aracıları

Sık sorulan sorular

What is Agent Guardrails?

Ajan korkulukları, bir AI temsilcisinin ne yapmasına, söylemesine veya erişmesine izin verildiğini kısıtlayan güvenlik kuralları, filtreler ve sınırlamalardır. Otonom sistemleri görevde, politikada ve beladan uzak tutarlar.

Ajan korkuluklarının asıl amacı nedir?

Korkuluklar, ajanları görevde, politikada ve beladan uzak tutan güvenlik kuralları, filtreler ve sınırlamalardır.

Bir 'çıkış korkuluğu' tipik olarak ne işe yarar?

Çıkış korkulukları, aracının oluşturduğu yanıtları denetler ve güvenli olmayan veya uyumlu olmayan içeriği kullanıcıya ulaşmadan engeller.

'En az ayrıcalık ilkesi' korkuluklara nasıl uygulanır?

En az ayrıcalık, aracının yalnızca gereken minimum araçları, kapsamlı anahtarları ve bütçe sınırlarını alması anlamına gelir; dolayısıyla güvenliği ihlal edilmiş bir istem büyük hasara neden olamaz.

Korkuluklarda kullanılan 'yargıç' veya doğrulayıcı model nedir?

Ayrı bir yargıç modeli, birincil temsilcinin çıktılarını yayınlanmadan önce güvenlik, politikaya uygunluk veya gerçek doğruluk açısından puanlayabilir.

Korkulukları düşman girdilerine karşı test etmek neden önemlidir?

Rekabetçi testler (kırmızı takım), modelin davrandığını varsaymak yerine korkulukların jailbreak ve enjeksiyon girişimlerine karşı nasıl dayandığını ortaya çıkarır.