Tillbaka till Nyheter
InnovationAI Understanding genomgång

Google släpper öppen källkod EnvHarness för adaptiv AI-agentutbildning

Google Cloud AI Research har släppt EnvHarness, ett Apache 2.0-licensierat ramverk som dynamiskt modifierar statiska träningsmiljöer för att rikta in sig på specifika AI-agentsvagheter, vilket förbättrar prestanda över fem riktmärken.

4 min readRead the original reporting
Source-provided image accompanying Google releases open-source EnvHarness for adaptive AI agent training
Tillskriven rapporteringKälla inspelad
Förläggare
venturebeat.com
Källlänk
venturebeat.comhttps://venturebeat.com/orchestration/googles-open-source-envharness-lets-ai-agents-train-against-environments-that-evolve-with-them
Källtyp
Rapportering från ett nyhetsställe – inte ett förstapartsdokument.

Vad vi inte kunde bekräfta oberoende: Detta påstående hänförs till det namngivna försäljningsstället. Vi har inte verifierat det mot ett förstapartsdokument. (venturebeat.com)

SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

AI-agent
Ett mjukvarusystem som kan observera, resonera och vidta åtgärder för att uppnå ett mål, ofta med hjälp av verktyg och minne.
Förstärkningsinlärning
Träning genom belöningssignaler där en agent lär sig handlingar som maximerar långsiktig avkastning.
Grund Sanning
Pålitliga referensetiketter som används för att träna eller utvärdera modellutdata.
Testa dig självAI Agents Quiz

Vad hände

Google Cloud AI Research och akademiska partners släppte EnvHarness, ett ramverk med öppen källkod under Apache 2.0-licensen. Verktyget infogar ett programmerbart lager mellan en AI-agent och dess träningsmiljö, vilket gör att miljön kan anpassas dynamiskt till agentens specifika fel. Genom att använda en komponent som heter EnvRigger för att diagnostisera svagheter och ändra uppgiftsförhållanden utan att ändra den underliggande verifieraren, gör ramverket det möjligt för agenter att öva på riktade färdigheter. I tester över fem benchmarks, inklusive SWE-bench Verified och WebArena, visade agenter utbildade med EnvHarness prestandavinster på upp till 9 poäng och minskade antalet steg som krävs för att slutföra uppgifter jämfört med statiska miljöer.

Forskare från Google Cloud AI Research utvecklade EnvHarness för att lösa problemet med statiska träningsmiljöer. Traditionella miljöer förblir fixerade även när agenter förbättras, vilket gör det svårt att hitta utmanande edge-fall. EnvHarness introducerar ett programmerbart lager som kan ändra starttillstånd, filtrera åtgärder och modifiera uppgiftens varaktighet utan att ändra kärnmiljön eller dess verifierare.

Ramverket inkluderar EnvRigger, som automatiserar anpassningsprocessen. Den följer en loop observera, diagnostisera, skriv och validera. EnvRigger analyserar agentbanor för att identifiera återkommande felmönster och komponerar sedan specifika EnvHarness-komponenter för att avslöja eller korrigera dessa fel. Den validerar dessa ändringar för att säkerställa att uppgifter förblir lösbara och användbara innan de tillämpas.

Testning utfördes på fem benchmarks: ALFWorld, WebArena, SWE-bench Verified, OfficeQA och SpreadsheetBench. Agenter som utbildats med EnvHarness överträffade de som utbildats i statiska miljöer i alla fem. På SWE-bench Verified minskade den genomsnittliga banlängden från 55,01 till 49,61 steg. Ramverket överträffade även andra miljögenererande system som SWE-smith och GenEnv i både noggrannhet och effektivitet.

Koden, experimentkonfigurationerna och implementeringen av förstärkningsinlärning är tillgängliga på GitHub under Apache 2.0-licensen. Ramverket kräver en Bridge för att integrera med befintliga miljöer, med initialt stöd för Docker-baserad SWE-bench, OfficeQA och SpreadsheetBench. Den är designad för digitala sandlådor där utrullningar är billiga och tillståndet kan återställas, såsom kodnings- och webbautomationsmiljöer.

Källinformation: venturebeat.com ↗

Varför det spelar roll

Den här versionen åtgärdar en betydande flaskhals i utvecklingen av AI-agenter: de höga kostnaderna och minskande avkastningen av att bygga statiska träningsmiljöer. När agenter förbättras blir fasta miljöer för lätta, vilket tvingar utvecklare att skapa nya, dyra simulatorer. EnvHarness erbjuder ett praktiskt alternativ genom att förstärka användbarheten i befintliga, pålitliga miljöer. För företagsteam innebär detta att de kan extrahera mer träningsvärde från sin nuvarande infrastruktur utan att bygga om simulatorer från grunden. Ramverket bevarar integriteten hos sanningsverifierare samtidigt som det dynamiskt introducerar utmaningar som tvingar agenter att övervinna specifika beteendegenvägar, som att hoppa över tester eller sakna information. Detta tillvägagångssätt minskar utvecklingskostnader och ger en skalbar väg för att förbättra agentens tillförlitlighet i komplexa, verkliga uppgifter.

Att bygga nya träningsmiljöer är dyrt och tidskrävande. EnvHarness tillåter team att återanvända befintliga miljöer av hög kvalitet genom att dynamiskt omforma dem kring en agents nuvarande svagheter. Detta minskar behovet av att kontinuerligt bygga nya simulatorer från grunden.

Ramverket bevarar integriteten hos betrodda verifierare. Genom att modifiera villkoren för en agents verksamhet snarare än själva uppgiften, säkerställer EnvHarness att framgången fortfarande bestäms av den ursprungliga, pålitliga grundsanningen. Detta är avgörande för att bibehålla träningssignalernas giltighet.

För företags AI-team erbjuder detta tillvägagångssätt ett praktiskt sätt att förbättra agentprestanda utan betydande infrastrukturförändringar. Den kan integreras i befintliga CI/CD-pipelines som en lätt plugin, vilket möjliggör kontinuerlig förbättring av agenter i kontrollerade, säkra miljöer.

Den dynamiska karaktären hos EnvHarness hjälper till att lösa problemet med agenter som tar genvägar. Genom att automatiskt skapa begränsningar som tvingar agenter att öva på specifika färdigheter, som att köra tester innan de skickar in kod, uppmuntrar ramverket mer robust och tillförlitligt beteende.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konceptkontroll+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Vad du ska titta på härnäst

Utvecklare bör övervaka GitHub-förvaret för nya Bridge-implementationer som stöder ytterligare miljötyper. Företag som använder containeriserade CI/CD-pipelines bör utvärdera hur EnvHarness integreras med befintliga Docker- eller Kubernetes-inställningar. Dessutom kommer communityn sannolikt att undersöka att kombinera EnvHarness med optimeringsramverk på agentsidan för att skapa feedbackloopar där miljöutmaningar och agentkapacitet utvecklas tillsammans. Den långsiktiga effekten kommer att bero på om beräkningskostnaden för EnvRiggers diagnosslinga förblir hanterbar när agentens komplexitet ökar.

Tillgången på nya broar för olika miljötyper kommer att avgöra ramverkets breda tillämpbarhet. För närvarande är stödet begränsat till specifika riktmärken, men expansion till andra domäner kommer att vara nyckeln till antagandet.

Beräkningskostnaden för EnvRigger-slingan är en kompromiss. När modellerna förbättras förväntas kostnaderna för att designa och validera modifieringar minska, men teamen kommer att behöva övervaka detta för att säkerställa att det förblir genomförbart för storskaliga utbyggnader.

Integration med optimeringsramverk på agentsidan kan skapa kraftfulla återkopplingsslingor. Även om det inte testats tillsammans i den här artikeln, kan en kombination av EnvHarness med system som modifierar agentens interna sele leda till mer omfattande förbättringar av agentens kapacitet.

Ramverkets lämplighet för olika typer av miljöer kommer att stå i fokus. Den är bäst lämpad för digitala sandlådor med billiga utrullningar och återställbara tillstånd. Dess tillämpning på miljöer med oåterkalleliga biverkningar eller dyra återställningar kommer att kräva noggrant övervägande och ytterligare säkerhetsåtgärder.

Relaterade guider och frågesporter

AI-agenterAI utbildningVad är AI?Testa vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?