Haberlere Geri Dön
YenilikAI Understanding brifing

Google, uyarlanabilir yapay zeka aracı eğitimi için açık kaynaklı EnvHarness'ı piyasaya sürüyor

Google Cloud AI Research, statik eğitim ortamlarını belirli AI aracısı zayıflıklarını hedef alacak şekilde dinamik olarak değiştiren ve beş kıyaslamada performansı artıran Apache 2.0 lisanslı bir çerçeve olan EnvHarness'i piyasaya sürdü.

4 min readRead the original reporting
Source-provided image accompanying Google releases open-source EnvHarness for adaptive AI agent training
İlişkilendirilmiş raporlamaKaynak kaydedildi
Yayıncı
venturebeat.com
Kaynak bağlantısı
venturebeat.comhttps://venturebeat.com/orchestration/googles-open-source-envharness-lets-ai-agents-train-against-environments-that-evolve-with-them
Kaynak türü
Bir haber kaynağı tarafından yapılan habercilik; birinci taraf bir belge değil.

Bağımsız olarak doğrulayamadıklarımız: Bu iddia adı geçen çıkışa atfedilmektedir. Bunu birinci taraf bir belgeyle doğrulamadık. (venturebeat.com)

Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Yapay Zeka Temsilcisi
Bir hedefe ulaşmak için genellikle araçları ve hafızayı kullanarak gözlemleyebilen, mantık yürütebilen ve harekete geçebilen bir yazılım sistemi.
Takviyeli Öğrenme
Bir aracının uzun vadeli getiriyi en üst düzeye çıkaracak eylemleri öğrendiği ödül sinyalleriyle eğitim.
Temel Gerçek
Model çıktılarını eğitmek veya değerlendirmek için kullanılan güvenilir referans etiketleri.
Kendinizi test edinYapay Zeka Aracıları Sınavı

Ne oldu?

Google Bulut Yapay Zeka Araştırması ve akademik ortaklar, Apache 2.0 lisansı kapsamında açık kaynaklı bir çerçeve olan EnvHarness'i piyasaya sürdü. Araç, bir AI aracısı ile eğitim ortamı arasına programlanabilir bir katman ekleyerek ortamın aracının belirli hatalarına dinamik olarak uyum sağlamasına olanak tanır. Temel doğrulayıcıyı değiştirmeden zayıflıkları teşhis etmek ve görev koşullarını değiştirmek için EnvRigger adlı bir bileşeni kullanan çerçeve, aracıların hedeflenen becerileri uygulamasını sağlar. SWE-bench Verified ve WebArena dahil olmak üzere beş kıyaslamada yapılan testlerde EnvHarness ile eğitilmiş temsilciler, 9 puana kadar performans artışı gösterdi ve statik ortamlara kıyasla görevleri tamamlamak için gereken adım sayısını azalttı.

Google Cloud AI Research'ten araştırmacılar, statik eğitim ortamları sorununu çözmek için EnvHarness'ı geliştirdi. Aracılar geliştikçe bile geleneksel ortamlar sabit kalıyor, bu da zorlu uç durumların bulunmasını zorlaştırıyor. EnvHarness, çekirdek ortamı veya doğrulayıcısını değiştirmeden başlangıç ​​durumlarını değiştirebilen, eylemleri filtreleyebilen ve görev sürelerini değiştirebilen programlanabilir bir katman sunar.

Çerçeve, uyarlama sürecini otomatikleştiren EnvRigger'ı içerir. Bir Gözlemle, Tanıla, Yaz ve Doğrula döngüsünü takip eder. EnvRigger, yinelenen hata modellerini belirlemek için aracı yörüngelerini analiz eder, ardından bu hataları ortaya çıkarmak veya düzeltmek için belirli EnvHarness bileşenlerini oluşturur. Görevleri uygulamadan önce çözülebilir ve kullanışlı kalmasını sağlamak için bu değişiklikleri doğrular.

Testler beş kriter üzerinde gerçekleştirildi: ALFWorld, WebArena, SWE-bench Verified, OfficeQA ve SpreadsheetBench. EnvHarness kullanılarak eğitilen aracılar, beşinde de statik ortamlar konusunda eğitim alan aracılardan daha iyi performans gösterdi. SWE-bench Verified'da ortalama yörünge uzunluğu 55,01 adımdan 49,61 adıma düştü. Çerçeve aynı zamanda hem doğruluk hem de verimlilik açısından SWE-smith ve GenEnv gibi diğer çevre oluşturma sistemlerinden daha iyi performans gösterdi.

Kod, deneme yapılandırmaları ve takviyeli öğrenme uygulaması, Apache 2.0 lisansı altında GitHub adresinde mevcuttur. Çerçeve, Docker tabanlı SWE-bench, OfficeQA ve SpreadsheetBench için başlangıç ​​desteğiyle birlikte mevcut ortamlarla entegre olacak bir Köprü gerektirir. Kodlama ve web otomasyon ortamları gibi kullanıma sunmanın ucuz olduğu ve durumun geri yüklenebildiği dijital sanal alanlar için tasarlanmıştır.

Kaynak ayrıntıları: venturebeat.com ↗

Neden önemli?

Bu sürüm, yapay zeka aracısı geliştirmedeki önemli bir darboğazı ele alıyor: statik eğitim ortamları oluşturmanın yüksek maliyeti ve azalan getirisi. Aracılar geliştikçe sabit ortamlar çok kolay hale geliyor ve geliştiricileri yeni, pahalı simülatörler yaratmaya zorluyor. EnvHarness mevcut, güvenilir ortamların faydasını artırarak pratik bir alternatif sunar. Kurumsal ekipler için bu, simülatörleri sıfırdan yeniden oluşturmaya gerek kalmadan mevcut altyapılarından daha fazla eğitim değeri elde edebilecekleri anlamına gelir. Çerçeve, temel gerçek doğrulayıcıların bütünlüğünü korurken, aracıları testleri atlama veya eksik bilgi gibi belirli davranışsal kısayolların üstesinden gelmeye zorlayan zorlukları dinamik olarak ortaya koyar. Bu yaklaşım, geliştirme yükünü azaltır ve karmaşık, gerçek dünya görevlerinde aracı güvenilirliğini artırmak için ölçeklenebilir bir yol sağlar.

Yeni eğitim ortamları oluşturmak pahalı ve zaman alıcıdır. EnvHarness, ekiplerin mevcut, yüksek kaliteli ortamları bir aracının mevcut zayıf yönleri etrafında dinamik olarak yeniden şekillendirerek yeniden kullanmasına olanak tanır. Bu, sürekli olarak sıfırdan yeni simülatörler oluşturma ihtiyacını azaltır.

Çerçeve, güvenilir doğrulayıcıların bütünlüğünü korur. EnvHarness, görevin kendisinden ziyade bir aracının faaliyet gösterdiği koşulları değiştirerek, başarının hala orijinal, güvenilir temel gerçek tarafından belirlenmesini sağlar. Bu, eğitim sinyallerinin geçerliliğini korumak için çok önemlidir.

Kurumsal yapay zeka ekipleri için bu yaklaşım, önemli altyapı değişiklikleri olmadan aracı performansını iyileştirmenin pratik bir yolunu sunar. Hafif bir eklenti olarak mevcut CI/CD işlem hatlarına entegre edilebilir ve böylece aracıların kontrollü, güvenli ortamlarda sürekli olarak iyileştirilmesine olanak sağlanır.

EnvHarness'ın dinamik yapısı, aracıların kısayollara başvurması sorununu çözmeye yardımcı olur. Çerçeve, aracıları kodu göndermeden önce testler yapmak gibi belirli becerileri uygulamaya zorlayan kısıtlamaları otomatik olarak oluşturarak, daha sağlam ve güvenilir davranışı teşvik eder.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
İnteraktif Konsept Kontrolü+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Bundan sonra ne izlenecek?

Geliştiriciler, ek ortam türlerini destekleyen yeni Bridge uygulamaları için GitHub deposunu izlemelidir. Konteynerli CI/CD işlem hatlarını kullanan kuruluşlar, EnvHarness'ın mevcut Docker veya Kubernetes kurulumlarıyla nasıl entegre olduğunu değerlendirmelidir. Ek olarak topluluk, çevresel zorlukların ve aracı yeteneklerinin birlikte geliştiği geri bildirim döngüleri oluşturmak için EnvHarness'ı aracı tarafı optimizasyon çerçeveleriyle birleştirmeyi muhtemelen keşfedecektir. Uzun vadeli etki, aracı karmaşıklığı arttıkça EnvRigger tanılama döngüsünün hesaplama maliyetinin yönetilebilir kalıp kalmayacağına bağlı olacaktır.

Farklı ortam türleri için yeni Köprülerin mevcudiyeti, çerçevenin geniş çapta uygulanabilirliğini belirleyecektir. Şu anda destek belirli kriterlerle sınırlıdır ancak diğer alanlara genişletilmesi, benimsenmesinin anahtarı olacaktır.

EnvRigger döngüsünün hesaplama maliyeti bir dengedir. Modeller geliştikçe modifikasyonları tasarlama ve doğrulama maliyetinin düşmesi bekleniyor ancak ekiplerin, büyük ölçekli dağıtımlar için geçerli kalmasını sağlamak amacıyla bunu izlemesi gerekecek.

Aracı tarafı optimizasyon çerçeveleriyle entegrasyon, güçlü geri bildirim döngüleri yaratabilir. Bu yazıda birlikte test edilmemiş olsa da EnvHarness'ı, aracının dahili donanımını değiştiren sistemlerle birleştirmek, aracı yeteneklerinde daha kapsamlı iyileştirmelere yol açabilir.

Çerçevenin farklı ortam türlerine uygunluğu odak noktası olacaktır. Ucuz kullanıma ve geri yüklenebilir durumlara sahip dijital sanal alanlar için en uygunudur. Geri dönüşü olmayan yan etkilerin veya pahalı sıfırlamaların olduğu ortamlara uygulanması, dikkatli değerlendirme ve ek güvenlik önlemleri gerektirecektir.

İlgili kılavuzlar ve testler

Yapay Zeka AracılarıYapay Zeka EğitimiAI nedir?Bildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?