SıradakiSonraki rehber
SWE-bench ve Kodlama Aracısı Karşılaştırmaları
Teknik
Teknik KILAVUZ
Yapay zeka aracılarını değerlendirmek, çok adımlı bir sistemin gerçekçi ortamlarda hedeflere ne kadar iyi ulaştığını ölçmek anlamına gelir.
Bu, görevi tamamlayıp tamamlamadığını, izlediği yolun mantıklı olup olmadığını, araçları doğru kullanıp kullanmadığını, maliyetinin ne kadar olduğunu ve güvende kalıp kalmadığını kapsar. Aracılar birçok adımda hareket eder ve yan etkileri vardır, bu nedenle tek bir cevabı bir referansa göre kontrol etmek yeterli değildir ve iyi değerlendirmeler genellikle aracıyı kontrollü bir ortamda çalıştırır ve son durumu denetler.
Temsilci değerlendirmesi birkaç şeye bakar. Görev başarısı, hedefe gerçekten ulaşılıp ulaşılmadığını sorar; ideal olarak daha sonra çevreye bakarak kontrol edilir: testler başarılıdır, doğru kayıt mevcuttur, dosya doğru içeriğe sahiptir. Yörünge kalitesi, adımların döngüler, anlamsız çağrılar veya şanslı tahminler olmadan makul olup olmadığını sorar. Araç kullanımının doğruluğu, aracının geçerli argümanlarla doğru araçları seçip seçmediğini ve hataları işleyip işlemediğini kontrol eder. Maliyet ve gecikme, belirteçleri, çağrıları ve duvar saati süresini izler. Güvenlik, ajanın zararlı veya yetkisiz eylemlerden kaçınıp kaçınmadığını ve hızlı enjeksiyona direnip direnmediğini kontrol eder. Çevre temelli kıyaslamalar önde gelen bir yaklaşım haline geldi. Princeton araştırmacılarından SWE-bench, temsilcilerden gerçek GitHub sorunlarını çözmelerini ister ve sonuçları projenin testleriyle kontrol eder ve SWE-bench Verified, insanlar tarafından kontrol edilen bir alt kümedir. WebArena, tarama görevleri için kendi kendine barındırılan web siteleri sağlar. OSWorld, tam bilgisayar masaüstü bilgisayarlarını çalıştıran aracıları test eder. GAIA, çok adımlı araştırma ve araçlara ihtiyaç duyan soruları ortaya koyuyor. Tau-bench paketi, kullanıcıları ve etki alanı politikalarını simüle eder ve bir aracının tekrarlanan k denemeden her birinde başarılı olup olmadığını soran bir şifre ölçümü sunar. Derecelendirmede üç ana kontrol türü kullanılır: kesin ve ucuz olan, sonuçlara ilişkin kod tabanlı kontroller; transkriptleri bir değerlendirme tablosuna göre puanlayan, esnek ancak insan yargısına göre kontrol edilmesi gereken model tabanlı notlayıcılar; ve en güvenilir ve en yavaş olan insan incelemesi. Yaygın bir hata, yalnızca halka açık skor tablolarına güvenmektir. Karşılaştırmalar eğitim verilerine sızabilir, doygun hale gelebilir veya kendi iş yükünüze benzemeyebilir. Diğer bir hata, aracıların belirleyici olmaması ve başarı oranındaki küçük farklılıkların gürültü olabileceği için, bir çalıştırmayı gerçekmiş gibi ele almaktır. Ekipler, kendi gerçek görevlerinden ve başarısızlıklarından oluşturulan, tekrar tekrar çalıştırılan ve zaman içinde takip edilen özel bir değerlendirme setinden en fazla değeri elde eder.
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
Temsilciler daha uzun görevler üstlendikçe, değerlendirmeler daha uzun ufuklara, daha gerçekçi ortamlara, güvenilirlik ve maliyet ölçümlerinin yanı sıra en yüksek kapasiteye doğru ilerliyor. Karşılaştırma doygunluğu ve kirliliği muhtemelen geliştiricileri yeni görevler oluşturmaya ve özel, alana özgü test setlerine daha fazla güvenmeye itmeye devam edecek. Ajanların gerçek sistemlere erişmesi nedeniyle, anında enjeksiyona karşı direnç de dahil olmak üzere güvenlik ve güvenlik değerlendirmeleri daha fazla ilgi görüyor. Açık uçlu temsilci davranışını derecelendirmek için üzerinde anlaşmaya varılmış bir standart yoktur; bu nedenle sonuç kontrollerini, kalibre edilmiş model derecelendiricileri ve insan incelemesini birleştirmek muhtemelen yaygın uygulama olmaya devam edecektir.
Bir kodlama aracısı ekibi, farkın doğru görünüp görünmediğine karar vermek yerine, SWE-bench'in yaptığı gibi, deponun gizli testlerinin aracının yamasından sonra geçip geçmediğine göre her girişimi puanlar.
Bir müşteri hizmetleri temsilcisi, simüle edilmiş kullanıcılara ve sahte rezervasyon veritabanına karşı çalışır. Not verenler, son veritabanı durumunun doğru sonuçla eşleşip eşleşmediğini ve aracının geri ödeme politikasını takip edip etmediğini kontrol eder.
Bir mühendislik ekibi her görevi beş kez çalıştırıyor ve aracının beşinde de ne sıklıkla başarılı olduğunu rapor ediyor; bu da tek çalıştırmalı başarı oranının gizleyebileceği değişken davranışları ortaya çıkarıyor.
Bir şirket, görevlerin dosyaları silmek veya veri sızdırmak için yerleşik bir talimat içerdiği bir güvenlik paketi ekler ve aracının itaat etmesi durumunda, normalde başarılı olan bir çalıştırmayı başarısız olarak sayar.
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Yapay zeka aracılarını değerlendirmek, çok adımlı bir sistemin gerçekçi ortamlarda hedeflere ne kadar iyi ulaştığını ölçmek anlamına gelir. Bu, görevi tamamlayıp tamamlamadığını, izlediği yolun mantıklı olup olmadığını, araçları doğru kullanıp kullanmadığını, maliyetinin ne kadar olduğunu ve güvende kalıp kalmadığını kapsar. Aracılar birçok adımda hareket eder ve yan etkileri vardır, bu nedenle tek bir cevabı bir referansa göre kontrol etmek yeterli değildir ve iyi değerlendirmeler genellikle aracıyı kontrollü bir ortamda çalıştırır ve son durumu denetler.
Çok adımlı eylemler ortamları değiştirir; bu nedenle yalnızca son metni değil, gerçekte ne olduğunu ve nasıl olduğunu kontrol etmeniz gerekir.
Çevre tabanlı kontroller, yani projenin testleri, düzeltmenin gerçekten işe yarayıp yaramadığına karar verir.
Tüm k denemelerde başarının gerekli kılınması tutarlılığı ölçer ve bu, gerçek kullanıcılara dağıtılan aracılar için önemlidir.
Yörünge kontrolleri, alınan yolu değerlendirir, döngüleri ve sonuç kontrollerinin tek başına gözden kaçırdığı israfı yakalar.
Model derecelendiriciler esnektir ancak insan yargısına göre kontrol edilmeli ve sistematik önyargı açısından izlenmelidir.
Öğrenmeye devam et
Bu konu için daha fazla rehber seçildi
SıradakiSonraki rehber
SWE-bench ve Kodlama Aracısı Karşılaştırmaları
Teknik