Tilbake til Nyheter
InnovasjonAI Understanding orientering

Google slipper åpen kildekode EnvHarness for adaptiv AI-agentopplæring

Google Cloud AI Research har gitt ut EnvHarness, et Apache 2.0-lisensiert rammeverk som dynamisk modifiserer statiske treningsmiljøer for å målrette mot spesifikke AI-agentsvakheter, og forbedre ytelsen på tvers av fem benchmarks.

4 min readRead the original reporting
Source-provided image accompanying Google releases open-source EnvHarness for adaptive AI agent training
Tilskrevet rapporteringKilde registrert
Utgiver
venturebeat.com
Kilde lenke
venturebeat.comhttps://venturebeat.com/orchestration/googles-open-source-envharness-lets-ai-agents-train-against-environments-that-evolve-with-them
Kildetype
Rapportering fra en nyhetskanal - ikke et førstepartsdokument.

Det vi ikke kunne bekrefte uavhengig: Dette kravet tilskrives det navngitte utsalgsstedet. Vi har ikke verifisert det mot et førstepartsdokument. (venturebeat.com)

KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

AI-agent
Et programvaresystem som kan observere, resonnere og iverksette tiltak for å oppnå et mål, ofte ved hjelp av verktøy og minne.
Forsterkende læring
Trening med belønningssignaler der en agent lærer handlinger som maksimerer langsiktig avkastning.
Grunnsannhet
Pålitelige referanseetiketter som brukes til å trene eller evaluere modellutdata.
Test deg selvAI Agents Quiz

Hva skjedde

Google Cloud AI Research og akademiske partnere ga ut EnvHarness, et åpen kildekode-rammeverk under Apache 2.0-lisensen. Verktøyet setter inn et programmerbart lag mellom en AI-agent og dens treningsmiljø, slik at miljøet kan tilpasse seg dynamisk til agentens spesifikke feil. Ved å bruke en komponent kalt EnvRigger for å diagnostisere svakheter og endre oppgavebetingelser uten å endre den underliggende verifikatoren, gjør rammeverket det mulig for agenter å øve på målrettede ferdigheter. I testing på tvers av fem benchmarks, inkludert SWE-bench Verified og WebArena, viste agenter trent med EnvHarness ytelsesgevinster på opptil 9 poeng og reduserte antall trinn som kreves for å fullføre oppgaver sammenlignet med statiske miljøer.

Forskere fra Google Cloud AI Research utviklet EnvHarness for å løse problemet med statiske treningsmiljøer. Tradisjonelle miljøer forblir faste selv når agenter forbedrer seg, noe som gjør det vanskelig å finne utfordrende edge-saker. EnvHarness introduserer et programmerbart lag som kan endre starttilstander, filtrere handlinger og endre oppgavevarighetene uten å endre kjernemiljøet eller verifikatoren.

Rammeverket inkluderer EnvRigger, som automatiserer tilpasningsprosessen. Den følger en Observer, Diagnostiser, Skriv og Valider loop. EnvRigger analyserer agentbaner for å identifisere tilbakevendende feilmønstre, og komponerer deretter spesifikke EnvHarness-komponenter for å avsløre eller korrigere disse feilene. Den validerer disse endringene for å sikre at oppgaver forblir løsbare og nyttige før de tas i bruk.

Testing ble utført på fem benchmarks: ALFWorld, WebArena, SWE-bench Verified, OfficeQA og SpreadsheetBench. Agenter som er trent med EnvHarness, overgikk de som ble trent i statiske miljøer på tvers av alle fem. På SWE-bench Verified sank gjennomsnittlig banelengde fra 55,01 til 49,61 trinn. Rammeverket overgikk også andre miljøgenererende systemer som SWE-smith og GenEnv i både nøyaktighet og effektivitet.

Koden, eksperimentkonfigurasjonene og implementeringen av forsterkende læring er tilgjengelig på GitHub under Apache 2.0-lisensen. Rammeverket krever en bro for å integreres med eksisterende miljøer, med initial støtte for Docker-basert SWE-bench, OfficeQA og SpreadsheetBench. Den er designet for digitale sandkasser der utrullinger er billige og tilstanden kan gjenopprettes, for eksempel kodings- og webautomatiseringsmiljøer.

Kildedetaljer: venturebeat.com ↗

Hvorfor det betyr noe

Denne utgivelsen adresserer en betydelig flaskehals i utviklingen av AI-agenter: de høye kostnadene og den reduserte avkastningen ved å bygge statiske treningsmiljøer. Etter hvert som agenter forbedrer seg, blir faste miljøer for enkle, noe som tvinger utviklere til å lage nye, dyre simulatorer. EnvHarness tilbyr et praktisk alternativ ved å forsterke nytten av eksisterende, pålitelige miljøer. For bedriftsteam betyr dette at de kan trekke ut mer treningsverdi fra sin nåværende infrastruktur uten å gjenoppbygge simulatorer fra bunnen av. Rammeverket bevarer integriteten til sannhetsverifikatorer, samtidig som det dynamisk introduserer utfordringer som tvinger agenter til å overvinne spesifikke atferdssnarveier, for eksempel å hoppe over tester eller manglende informasjon. Denne tilnærmingen reduserer utviklingskostnader og gir en skalerbar vei for å forbedre agentpålitelighet i komplekse oppgaver i den virkelige verden.

Å bygge nye treningsmiljøer er dyrt og tidkrevende. EnvHarness lar team gjenbruke eksisterende miljøer av høy kvalitet ved å dynamisk omforme dem rundt en agents nåværende svakheter. Dette reduserer behovet for kontinuerlig å bygge nye simulatorer fra bunnen av.

Rammeverket bevarer integriteten til pålitelige verifikatorer. Ved å endre betingelsene som en agent opererer under i stedet for selve oppgaven, sikrer EnvHarness at suksess fortsatt bestemmes av den opprinnelige, pålitelige grunnsannheten. Dette er avgjørende for å opprettholde gyldigheten av treningssignaler.

For enterprise AI-team tilbyr denne tilnærmingen en praktisk måte å forbedre agentytelsen på uten betydelige infrastrukturendringer. Den kan integreres i eksisterende CI/CD-rørledninger som en lettvekts plugin, noe som muliggjør kontinuerlig forbedring av agenter i kontrollerte, trygge miljøer.

Den dynamiske naturen til EnvHarness hjelper til med å løse problemet med agenter som tar snarveier. Ved å automatisk lage begrensninger som tvinger agenter til å øve på spesifikke ferdigheter, for eksempel å kjøre tester før de sender inn kode, oppmuntrer rammeverket til mer robust og pålitelig oppførsel.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Hva du skal se neste

Utviklere bør overvåke GitHub-depotet for nye Bridge-implementeringer som støtter flere miljøtyper. Bedrifter som bruker containeriserte CI/CD-rørledninger bør evaluere hvordan EnvHarness integreres med eksisterende Docker- eller Kubernetes-oppsett. I tillegg vil fellesskapet sannsynligvis utforske å kombinere EnvHarness med optimaliseringsrammeverk på agentsiden for å skape tilbakemeldingssløyfer der miljøutfordringer og agentevner utvikler seg sammen. Den langsiktige innvirkningen vil avhenge av om beregningskostnaden for EnvRigger-diagnoseløkken forblir håndterbar ettersom agentkompleksiteten øker.

Tilgjengeligheten av nye broer for ulike miljøtyper vil avgjøre rammeverkets brede anvendelighet. Foreløpig er støtte begrenset til spesifikke benchmarks, men utvidelse til andre domener vil være nøkkelen til adopsjonen.

Beregningskostnaden for EnvRigger-løkken er en avveining. Etter hvert som modellene forbedres, forventes kostnadene for utforming og validering av modifikasjoner å falle, men teamene må overvåke dette for å sikre at det forblir levedyktig for storskala distribusjoner.

Integrasjon med optimaliseringsrammeverk på agentsiden kan skape kraftige tilbakemeldingssløyfer. Selv om det ikke er testet sammen i denne artikkelen, kan det å kombinere EnvHarness med systemer som modifiserer agentens interne sele føre til mer omfattende forbedringer i agentens evner.

Rammeverkets egnethet for ulike typer miljøer vil være et fokus. Den er best egnet for digitale sandkasser med billige utrullinger og gjenopprettelige tilstander. Bruken på miljøer med irreversible bivirkninger eller dyre tilbakestillinger vil kreve nøye vurdering og ytterligere sikkerhetstiltak.

Relaterte guider og quizer

AI-agenterAI treningHva er AI?Test det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?