Terug naar Nieuws
InnovatieAI Understanding-briefing

Google brengt open-source EnvHarness uit voor adaptieve AI-agenttraining

Google Cloud AI Research heeft EnvHarness uitgebracht, een Apache 2.0-gelicentieerd raamwerk dat statische trainingsomgevingen dynamisch aanpast om specifieke zwakke punten van AI-agenten aan te pakken, waardoor de prestaties over vijf benchmarks worden verbeterd.

4 min readRead the original reporting
Source-provided image accompanying Google releases open-source EnvHarness for adaptive AI agent training
Toegeschreven rapportageBron opgenomen
Uitgever
venturebeat.com
Bronlink
venturebeat.comhttps://venturebeat.com/orchestration/googles-open-source-envharness-lets-ai-agents-train-against-environments-that-evolve-with-them
Brontype
Rapportage door een nieuwskanaal – geen document van eigen hand.

Wat we niet onafhankelijk konden bevestigen: Deze claim wordt toegeschreven aan het genoemde verkooppunt. We hebben het niet geverifieerd aan de hand van een document van de eerste partij. (venturebeat.com)

ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

AI-agent
Een softwaresysteem dat kan observeren, redeneren en actie kan ondernemen om een doel te bereiken, vaak met behulp van tools en geheugen.
Versterkend leren
Training door beloningssignalen waarbij een agent acties leert die het rendement op de lange termijn maximaliseren.
Grondwaarheid
Betrouwbare referentielabels die worden gebruikt om modeluitvoer te trainen of evalueren.
Test jezelfAI-agentenquiz

Wat is er gebeurd

Google Cloud AI Onderzoeks- en academische partners hebben EnvHarness uitgebracht, een open-sourceframework onder de Apache 2.0-licentie. De tool voegt een programmeerbare laag in tussen een AI-agent en zijn trainingsomgeving, waardoor de omgeving zich dynamisch kan aanpassen aan de specifieke fouten van de agent. Door een component genaamd EnvRigger te gebruiken om zwakke punten te diagnosticeren en taakomstandigheden aan te passen zonder de onderliggende verifier te wijzigen, stelt het raamwerk agenten in staat gerichte vaardigheden te oefenen. Bij het testen van vijf benchmarks, waaronder SWE-bench Verified en WebArena, lieten agenten die waren getraind met EnvHarness prestatieverbeteringen zien van maximaal 9 punten en verminderden ze het aantal stappen dat nodig was om taken te voltooien in vergelijking met statische omgevingen.

Onderzoekers van Google Cloud AI Research hebben EnvHarness ontwikkeld om het probleem van statische trainingsomgevingen op te lossen. Traditionele omgevingen blijven vast, zelfs als agenten verbeteren, waardoor het moeilijk wordt om uitdagende edge-cases te vinden. EnvHarness introduceert een programmeerbare laag die de startstatus kan wijzigen, acties kan filteren en de duur van taken kan wijzigen zonder de kernomgeving of de verificateur ervan te wijzigen.

Het raamwerk omvat EnvRigger, dat het aanpassingsproces automatiseert. Het volgt een lus Observeren, Diagnose, Schrijven en Valideren. EnvRigger analyseert agenttrajecten om terugkerende foutpatronen te identificeren en stelt vervolgens specifieke EnvHarness-componenten samen om deze fouten bloot te leggen of te corrigeren. Het valideert deze wijzigingen om ervoor te zorgen dat taken oplosbaar en nuttig blijven voordat ze worden toegepast.

Er zijn tests uitgevoerd op vijf benchmarks: ALFWorld, WebArena, SWE-bench Verified, OfficeQA en SpreadsheetBench. Agenten die waren getraind met EnvHarness presteerden in alle vijf de gevallen beter dan degenen die waren getraind in statische omgevingen. Op SWE-bench Verified daalde de gemiddelde trajectlengte van 55,01 naar 49,61 stappen. Het raamwerk presteerde ook beter dan andere systemen voor het genereren van omgevingen, zoals SWE-smith en GenEnv, zowel qua nauwkeurigheid als efficiëntie.

De code, experimentconfiguraties en implementatie van versterkend leren zijn beschikbaar op GitHub onder de Apache 2.0-licentie. Het raamwerk vereist een Bridge om te integreren met bestaande omgevingen, met initiële ondersteuning voor Docker-gebaseerde SWE-bench, OfficeQA en SpreadsheetBench. Het is ontworpen voor digitale sandboxes waar implementaties goedkoop zijn en de staat kan worden hersteld, zoals codeer- en webautomatiseringsomgevingen.

Brongegevens: venturebeat.com ↗

Waarom het ertoe doet

Deze release pakt een aanzienlijk knelpunt aan bij de ontwikkeling van AI-agenten: de hoge kosten en de afnemende opbrengsten van het bouwen van statische trainingsomgevingen. Naarmate agents verbeteren, worden vaste omgevingen te gemakkelijk, waardoor ontwikkelaars gedwongen worden nieuwe, dure simulatoren te maken. EnvHarness biedt een praktisch alternatief door de bruikbaarheid van bestaande, vertrouwde omgevingen te vergroten. Voor bedrijfsteams betekent dit dat ze meer trainingswaarde uit hun huidige infrastructuur kunnen halen zonder simulators helemaal opnieuw op te bouwen. Het raamwerk behoudt de integriteit van de grondwaarheidsverificateurs en introduceert tegelijkertijd op dynamische wijze uitdagingen die agenten dwingen specifieke gedragssnelkoppelingen te overwinnen, zoals het overslaan van tests of het missen van informatie. Deze aanpak vermindert de ontwikkelingsoverhead en biedt een schaalbaar pad voor het verbeteren van de betrouwbaarheid van agenten bij complexe, realistische taken.

Het bouwen van nieuwe trainingsomgevingen is duur en tijdrovend. Met EnvHarness kunnen teams bestaande, hoogwaardige omgevingen hergebruiken door deze dynamisch te hervormen rond de huidige zwakke punten van een agent. Dit vermindert de noodzaak om voortdurend nieuwe simulatoren vanaf nul te bouwen.

Het raamwerk beschermt de integriteit van vertrouwde verificateurs. Door de omstandigheden aan te passen waaronder een agent opereert in plaats van de taak zelf, zorgt EnvHarness ervoor dat succes nog steeds wordt bepaald door de oorspronkelijke, betrouwbare grondwaarheid. Dit is cruciaal voor het behouden van de geldigheid van trainingssignalen.

Voor zakelijke AI-teams biedt deze aanpak een praktische manier om de prestaties van agenten te verbeteren zonder noemenswaardige veranderingen in de infrastructuur. Het kan worden geïntegreerd in bestaande CI/CD-pijplijnen als een lichtgewicht plug-in, waardoor continue verbetering van agenten in gecontroleerde, veilige omgevingen mogelijk is.

Het dynamische karakter van EnvHarness helpt bij het aanpakken van het probleem dat agenten sluiproutes nemen. Door automatisch beperkingen te creëren die agenten dwingen specifieke vaardigheden te oefenen, zoals het uitvoeren van tests voordat code wordt ingediend, moedigt het raamwerk robuuster en betrouwbaarder gedrag aan.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interactieve conceptcheck+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Wat je nu moet bekijken

Ontwikkelaars moeten de GitHub-repository controleren op nieuwe Bridge-implementaties die aanvullende omgevingstypen ondersteunen. Bedrijven die gecontaineriseerde CI/CD-pijplijnen gebruiken, moeten evalueren hoe EnvHarness integreert met bestaande Docker- of Kubernetes-opstellingen. Bovendien zal de gemeenschap waarschijnlijk de combinatie van EnvHarness met optimalisatieframeworks aan de agentzijde onderzoeken om feedbackloops te creëren waarin milieu-uitdagingen en agentcapaciteiten samen evolueren. De impact op de lange termijn zal afhangen van de vraag of de rekenkosten van de diagnostische lus van EnvRigger beheersbaar blijven naarmate de complexiteit van de agent toeneemt.

De beschikbaarheid van nieuwe Bridges voor verschillende omgevingstypen zal de brede toepasbaarheid van het raamwerk bepalen. Momenteel is de ondersteuning beperkt tot specifieke benchmarks, maar uitbreiding naar andere domeinen zal van cruciaal belang zijn voor de acceptatie ervan.

De rekenkosten van de EnvRigger-lus zijn een afweging. Naarmate de modellen verbeteren, zullen de kosten voor het ontwerpen en valideren van wijzigingen naar verwachting dalen, maar teams zullen dit moeten monitoren om ervoor te zorgen dat het haalbaar blijft voor grootschalige implementaties.

Integratie met optimalisatieframeworks aan de agentzijde zou krachtige feedbackloops kunnen creëren. Hoewel het in dit artikel niet samen wordt getest, zou het combineren van EnvHarness met systemen die het interne harnas van de agent wijzigen, kunnen leiden tot uitgebreidere verbeteringen in de mogelijkheden van agenten.

Er zal aandacht worden besteed aan de geschiktheid van het raamwerk voor verschillende soorten omgevingen. Het is het meest geschikt voor digitale sandboxes met goedkope implementaties en herstelbare statussen. De toepassing ervan in omgevingen met onomkeerbare bijwerkingen of dure resets vereist een zorgvuldige afweging en aanvullende veiligheidsmaatregelen.

Gerelateerde gidsen en quizzen

AI-agentenAI-trainingWat is AI?Test wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?