Ne oldu?
Araştırmacılar Oğuz Serdar ve Cüneyt Mertayak, iş yeri yapay zeka ajanlarında ön taahhüt "devam et veya beklet" kararı için bir kıyaslama olan SteerBench-Work'ü açıklayan bir ön baskı yayınladı. 30 model koşulunda, modellerin fırsatların %28,1'inde yanlış bir şekilde yetkilendirildiğini, kanıtları temize çıkardığını ve %1,0'ında güvenli olmayan çalışmaya yanlışlıkla izin verdiğini bildirdiler.
Oğuz Serdar ve Cüneyt Mertayak adlı iki araştırmacı, 12 Ağustos 2026'da arXiv'de SteerBench-Work'ü tanıtan bir ön baskı yayınladı; bu ön baskı, uzun süredir devam eden bir yapay zeka aracısının iş akışında tek bir karar etrafında inşa edilen bir kıyaslamaydı: bir eylemin gerçekleştirilip gerçekleştirilmeyeceği veya bunu insan veya politika incelemesi için bekletip bekletmeyeceği. Yazarlar bunu yönlendirme kararı olarak adlandırıyor ve bunu eylem sınırı olarak adlandırdıkları noktaya, yani bir temsilcinin e-posta göndermesinden, çekme talebini birleştirmesinden veya ödeme havale etmeden hemen önceki noktaya yerleştiriyor. Karşılaştırma, bir aracının bir görevi tamamlayıp tamamlayamayacağını puanlamaz. Temsilcinin bu sınırı doğru bir şekilde geçip geçmediğini veya bu sınırı doğru bir şekilde koruyup korumadığını puanlar.
Özette açıklanan sürüm, v2026-05 olarak etiketlenmiştir ve geliştirici operasyonlarını, müşteri hizmetlerini, finans, hukuk, tıbbi, İK ve güvenliği kapsayan 106 senaryo içermektedir. Senaryolar kamusal olaylara dayanmaktadır. Her biri, kalibrasyon kontrollerinin yanı sıra, yazarların kanıtları tersine çeviren ayna olarak adlandırdığı (temeldeki kanıtların diğer yolu işaret ettiği aynı durumun bir versiyonu) ile eşleştirilir. Etiketler ilerleme ve bekletme arasında neredeyse eşit bir şekilde bölünmüş durumda ve yazarlar bunun kasıtlı olduğunu söylüyor: iki hata yönüne aynı sayıda gerçekleşme şansı veriyor, bu nedenle bir model sadece varsayılan uyarıyla iyi puan alamaz. Her öğede, bir model önerilen bir eylemi ve mevcut kanıtları gösterir ve bir kapı kararı döndürür.
Yazarlar, 30 model koşulunda arızaların neredeyse tamamen tek yönde ilerlediğini bildiriyor. Modeller, fırsatların %28,1'inde yanlış bir şekilde yetkilendirilmiş, kanıtları temizlenmiş çalışmalara yer verirken, %1,0'ında yanlışlıkla güvensiz çalışmaya izin verdi. Özete göre en zor kategori, yazarların risk çözümlü taahhütler olarak adlandırdığı kategoridir: gerçek bir risk tetikleyicisinin tetiklendiği ancak imzalı veya yapılandırılmış kanıtın bunu zaten temizlediği ve doğru cevabın devam etmek olduğu durumlar. Performans aynı zamanda ünlü olaylar ve bunların aynaları arasında da keskin bir farklılık gösterdi; olayların kendisinde %98,5, kanıtların tersine çevrilmiş versiyonlarında ise %63,8.
Yazarlar genel yetenek ile direksiyon kalibrasyonu arasında başka bir ayrım yapmaktadır. Daha yüksek kapasiteli modellerin genellikle taahhüt sınırında aşırı reddetme yaptığını ve ek akıl yürütmenin, zaten kalibre edilmiş olanı düz bırakırken zayıf bir kapıyı onarabileceğini yazıyorlar. Özet, herkese açık bir sıralama tablosuna işaret ediyor, ancak kaynak sayfa, adresi çalışan bir bağlantı yerine yer tutucu olarak gösteriyor.
Burada mevcut olan materyalle pek çok şey belirlenmemiştir. Özet, test edilen modellerin adını vermiyor, 30 model arasında neyin ayrı bir "model koşulu" olarak sayıldığını tanımlamıyor ve alan başına veya model başına herhangi bir döküm vermiyor. Temel gerçek etiketlerini kimin yazdığı veya anlaşmazlıkların nasıl çözüldüğü açıklanmaz ve v2026-05 sürüm etiketi Ağustos gönderim tarihine göre açıklanmaz. Bu, herhangi bir hakem değerlendirmesi belirtisi olmayan birinci versiyon ön baskıdır ve rakamların hiçbiri bağımsız olarak çoğaltılmamıştır.
Kaynak ayrıntıları: arxiv.org ↗
Neden önemli?
Ajan güvenliği testlerinin çoğu, modellerin zararlı eylemleri engelleyip engellemediğini ölçer. Bu çalışma, her iki hata yönünü de ölçüyor ve baskın başarısızlığın, gerçek işletme maliyetleri taşıyan ve insanları kontrol etmeye itebilen aşırı engelleme olduğunu buluyor. Rakamlar incelenmemiş bir ön baskıdan alınmıştır ve bağımsız olarak doğrulanmamıştır.
Yapay zeka ajanları, yalnızca metin üretmek yerine harekete geçmek için giderek daha fazla görevlendiriliyor ve bir önerinin geri döndürülemez bir etkiye dönüştüğü nokta, riskin fiilen ulaştığı noktadır. Yayınlanan acente güvenliği çalışmalarının büyük bir kısmı tek bir soruyu soruyor: Model zararlı olanı reddetti mi? - ve her şeyi reddeden bir sistem, işe yaramazken bu soruda mükemmel puan alıyor. Devam etme ve tutma etiketlerini dengeleyerek ve her iki hata oranını raporlayarak bu kıyaslama, bir taraf yerine ödünleşimi ölçer.
Bildirilen asimetri genelleştirilirse, kurumsal aracı konuşlandırmalarındaki pratik sorun, kontrolden çıkma eyleminden çok aşırı engellemeye daha yakın olabilir. Yanlış tutmalar ücretsiz değildir. Her bir rota bir kişiye geri döner, bu da görevin otomatikleştirilmesine yönelik verimlilik durumunu tamamen ortadan kaldırır ve gecikmenin kendisinin bir maliyeti olduğu bilet çözümü veya kod incelemesi gibi süreçlere gecikme ekler. Daha ince bir risk de var: Gereksiz yükseltmelerle dolu bir inceleme kuyruğu, incelemecileri hızlı bir şekilde onaylama konusunda eğitiyor ve bu da, bekletme mekanizmasının sağladığı insan gözetimini zayıflatıyor. Bu aşağı yöndeki etki, kıyaslamanın ölçtüğü bir şey değil, kurulumdan elde edilen makul bir çıkarımdır.
Ünlü olaylardaki %98,5 ile delillerin ters çevrildiği aynalardaki %63,8 arasındaki fark, incelemeye en değer sonuçtur. Bu, iyi belgelenmiş bir başarısızlığın şeklini tanıyan ve önlerindeki kanıtları okumak yerine bu tanıma yanıt veren modellerle tutarlıdır. Eğer bu okuma geçerliyse, alıcıların acente güvenlik puanlarını genel olarak nasıl yorumlaması gerektiğini karmaşık hale getirir: Bir model, gerçekler yeniden düzenlendiğinde aynı yapısal durumu kötü bir şekilde ele alırken, yayınlanmış uyarıcı hikayelere benzeyen senaryolarda güvenilir görünebilir. Yazarların "risk çözümlenmiş taahhütler" kategorisi tam olarak bunu test ediyor; tetiklenen bir riski ortadan kaldıran kanıtlar mevcut ve modelin bunu gerçekten işlemesi gerekiyor.
Bulgular aynı zamanda döngüdeki insan gereksinimlerinin nasıl yazıldığıyla da ilgilidir. Eylem kategorilerinin gözden geçirilmesini zorunlu kılan politikalar, kapının güvenli varsayılan olduğunu varsayar. Bu çalışma, kapının, temizlenen işi engelleme yönünde kendi hata oranına sahip olduğunu ve oranın sıfıra yakın olduğunu varsaymak yerine ölçülmesi gerektiğini öne sürüyor.
Tüm bunlara karşı ağırlıkta: kıyaslama, kendisinin toplaması gereken eksik bilgilerle gerçek bir araç döngüsünü çalıştıran bir aracıyı değil, seçilmiş bir kanıt paketi verilen tek bir taahhüt öncesi kararı değerlendirir. Gerçek dağıtımlar aynı zamanda senaryoların tam olarak temsil edemediği izin sistemlerinin ve organizasyonel bağlamın da arkasında yer alır. Ne kadar dikkatli bir şekilde sabitlenmiş olursa olsun, 106 oluşturulmuş senaryonun üretimdeki davranışı tahmin edip edemeyeceği açık bir sorudur ve buradaki iddialar yazarlara aittir.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
What most distinguishes an AI agent from a basic chatbot?
Bundan sonra ne izlenecek?
Makalenin tamamının, veri kümesinin ve sıralama tablosunun test edilen modelleri tanımlayıp tanımlamadığı; bağımsız grupların aşırı reddetme farkını yeniden üretip üretmediği; kanıtların tersine çevrilmiş ayna sonuçlarının kalıp eşleşmesinin bir işareti olarak geçerli olup olmadığı; ve alıcıların ve düzenleyicilerin sahte tutmaları güvenli bir temerrüt yerine ölçülü bir başarısızlık olarak ele almaya başlayıp başlamadıkları.
Aranacak en acil şey ifşadır. Makalenin tamamı, yayımlanan herhangi bir veri seti veya kod ve soyut referansların yer aldığı sıralama tablosu, hangi modellerin test edildiğini, 30 koşulun nasıl oluşturulduğunu ve %28,1'lik rakamın modeller ve alanlara nasıl dağıldığını gösterecektir. 30 koşulu kapsayan toplam sayı, geniş çeşitliliği gizleyebilir ve bir model seçen herkes için pratik soru, hangi sistemlerin bu aralığın hangi ucunda yer aldığıdır.
Bağımsız çoğaltma, manşetteki rakamdan daha önemlidir. Senaryoları yürüten diğer grupları, en zorlu "risk çözümlü taahhüt" vakalarındaki temel gerçeklik etiketlerinin incelenmesini ve olay-ayna farkının, karşılaştırma ölçütünü oluşturmayan kişiler tarafından yapılan testlerde hayatta kalıp kalmadığını izleyin. Bu boşluk makalenin en önemli iddiasıdır ve aynı zamanda aynaların nasıl yapıldığına da en fazla bağlı olanıdır.
Ayrıca tek adımlı çerçevelemenin aktarılıp aktarılmadığı da takip edilmeye değerdir. Önerilen bir eylemi sağlanan kanıtlarla tamamlaması istenen bir model, taahhütte bulunmadan önce hangi kanıtların toplanacağına karar vermesi gereken görev ortasındaki bir temsilciden farklı bir konumdadır. Aynı senaryoları tam aracı döngülerine yerleştiren takip çalışması, burada ölçülen kalibrasyonun gerçek davranışı tahmin edip etmediğini test edecektir.
Benimseme tarafında soru, yanlış tutma oranlarının, ret oranlarının yanı sıra satın alma ve sistem kartlarına da girip girmediği ve model geliştiricilerin, yalnızca tedbir için değil, eylem sınırında kalibrasyon için ayarlama yapmaya başlayıp başlamadığıdır. Yazarların, ilave akıl yürütmenin zayıf kapılara yardımcı olduğu, ancak önceden kalibre edilmiş kapılara yardımcı olmadığı yönündeki iddiası, eğer doğrulanırsa, daha fazla çıkarım zamanı hesaplamasının güvenlikle ilgili kararları güvenilir bir şekilde iyileştirdiği varsayımını çürütecektir.
Son olarak versiyonlamayı izleyin. V2026-05 etiketli ve kamuya açık olaylara odaklanan bir kıyaslama, senaryoları dolaşıma girdikçe ve gelecekteki modeller bunlar üzerinde eğitildikçe bir kirlenme sorunuyla karşı karşıya kalıyor. Yazarların seti nasıl yenileyeceği ve ayna performansının gerçek akıl yürütme kazanımları yoluyla mı yoksa maruz kalma yoluyla mı gelişeceği - sayıların bugün ne kadar uzun süre anlamına geldiğini belirleyecek.