Torna alle notizie
InnovazioneAI Understanding briefing

Google rilascia EnvHarness open source per la formazione adattiva degli agenti IA

Google Cloud AI Research ha rilasciato EnvHarness, un framework con licenza Apache 2.0 che modifica dinamicamente gli ambienti di training statici per colpire specifici punti deboli dell'agente AI, migliorando le prestazioni su cinque benchmark.

4 min readRead the original reporting
Source-provided image accompanying Google releases open-source EnvHarness for adaptive AI agent training
Segnalazione attribuitaFonte registrata
Editore
venturebeat.com
Collegamento alla fonte
venturebeat.comhttps://venturebeat.com/orchestration/googles-open-source-envharness-lets-ai-agents-train-against-environments-that-evolve-with-them
Tipo di fonte
Segnalazione da parte di un organo di stampa, non un documento di prima parte.

Ciò che non abbiamo potuto confermare in modo indipendente: Questa affermazione è attribuita al punto vendita indicato. Non lo abbiamo verificato rispetto a un documento di prima parte. (venturebeat.com)

ContestoComprendilo in 60 secondi

Inizia qui

Termini chiave

Agente dell'IA
Un sistema software in grado di osservare, ragionare e intraprendere azioni per raggiungere un obiettivo, spesso utilizzando strumenti e memoria.
Apprendimento per rinforzo
Formazione tramite segnali di ricompensa in cui un agente apprende azioni che massimizzano il rendimento a lungo termine.
Verità fondamentale
Etichette di riferimento affidabili utilizzate per addestrare o valutare gli output del modello.
Mettiti alla provaQuiz sugli agenti IA

Cosa è successo

Google Cloud AI Research e partner accademici hanno rilasciato EnvHarness, un framework open source con licenza Apache 2.0. Lo strumento inserisce un livello programmabile tra un agente AI e il suo ambiente di addestramento, consentendo all'ambiente di adattarsi dinamicamente ai guasti specifici dell'agente. Utilizzando un componente chiamato EnvRigger per diagnosticare i punti deboli e modificare le condizioni delle attività senza alterare il verificatore sottostante, il framework consente agli agenti di esercitare competenze mirate. Nei test su cinque benchmark, tra cui SWE-bench Verified e WebArena, gli agenti formati con EnvHarness hanno mostrato miglioramenti prestazionali fino a 9 punti e hanno ridotto il numero di passaggi necessari per completare le attività rispetto agli ambienti statici.

I ricercatori di Google Cloud AI Research hanno sviluppato EnvHarness per risolvere il problema degli ambienti di allenamento statici. Gli ambienti tradizionali rimangono fissi anche se gli agenti migliorano, rendendo difficile trovare casi limite impegnativi. EnvHarness introduce un livello programmabile che può modificare gli stati iniziali, filtrare le azioni e modificare la durata delle attività senza alterare l'ambiente principale o il suo verificatore.

Il framework include EnvRigger, che automatizza il processo di adattamento. Segue un ciclo Osserva, Diagnostica, Scrivi e Convalida. EnvRigger analizza le traiettorie degli agenti per identificare modelli di errore ricorrenti, quindi compone componenti EnvHarness specifici per esporre o correggere tali errori. Convalida queste modifiche per garantire che le attività rimangano risolvibili e utili prima di applicarle.

I test sono stati condotti su cinque benchmark: ALFWorld, WebArena, SWE-bench Verified, OfficeQA e SpreadsheetBench. Gli agenti formati utilizzando EnvHarness hanno sovraperformato quelli formati in ambienti statici in tutti e cinque i casi. Su SWE-bench Verified, la lunghezza media della traiettoria è diminuita da 55,01 a 49,61 passi. Il framework ha inoltre sovraperformato altri sistemi di generazione di ambienti come SWE-smith e GenEnv sia in termini di precisione che di efficienza.

Il codice, le configurazioni dell'esperimento e l'implementazione dell'apprendimento per rinforzo sono disponibili su GitHub con la licenza Apache 2.0. Il framework richiede un Bridge per l'integrazione con gli ambienti esistenti, con il supporto iniziale per SWE-bench basato su Docker, OfficeQA e SpreadsheetBench. È progettato per sandbox digitali in cui le implementazioni sono economiche e lo stato può essere ripristinato, come ambienti di codifica e automazione web.

Dettagli della fonte: venturebeat.com ↗

Perché è importante

Questa versione risolve un collo di bottiglia significativo nello sviluppo degli agenti IA: i costi elevati e i rendimenti decrescenti della creazione di ambienti di formazione statici. Man mano che gli agenti migliorano, gli ambienti fissi diventano troppo facili, costringendo gli sviluppatori a creare nuovi e costosi simulatori. EnvHarness offre un'alternativa pratica amplificando l'utilità degli ambienti esistenti e affidabili. Per i team aziendali, ciò significa che possono estrarre più valore formativo dalla loro attuale infrastruttura senza ricostruire i simulatori da zero. Il quadro preserva l’integrità dei verificatori della verità sul terreno introducendo dinamicamente sfide che costringono gli agenti a superare scorciatoie comportamentali specifiche, come saltare test o informazioni mancanti. Questo approccio riduce i costi di sviluppo e fornisce un percorso scalabile per migliorare l'affidabilità degli agenti in attività complesse del mondo reale.

Costruire nuovi ambienti di formazione è costoso e richiede molto tempo. EnvHarness consente ai team di riutilizzare ambienti esistenti e di alta qualità rimodellandoli dinamicamente in base alle attuali debolezze di un agente. Ciò riduce la necessità di costruire continuamente nuovi simulatori da zero.

Il framework preserva l’integrità dei verificatori affidabili. Modificando le condizioni in cui opera un agente piuttosto che l'attività stessa, EnvHarness garantisce che il successo sia ancora determinato dalla verità di base originale e affidabile. Questo è fondamentale per mantenere la validità dei segnali di addestramento.

Per i team di intelligenza artificiale aziendali, questo approccio offre un modo pratico per migliorare le prestazioni degli agenti senza modifiche significative dell'infrastruttura. Può essere integrato nelle pipeline CI/CD esistenti come plug-in leggero, consentendo il miglioramento continuo degli agenti in ambienti controllati e sicuri.

La natura dinamica di EnvHarness aiuta ad affrontare il problema degli agenti che prendono scorciatoie. Creando automaticamente vincoli che costringono gli agenti a mettere in pratica competenze specifiche, come l'esecuzione di test prima di inviare il codice, il framework incoraggia comportamenti più robusti e affidabili.

Interactive Mechanism

Meccanismo interattivo: come funziona realmente

Esplora la tecnologia alla base di questo sviluppo in modo interattivo.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Verifica concettuale interattiva+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Cosa guardare dopo

Gli sviluppatori dovrebbero monitorare il repository GitHub per nuove implementazioni Bridge che supportano tipi di ambiente aggiuntivi. Le aziende che utilizzano pipeline CI/CD containerizzate dovrebbero valutare come EnvHarness si integra con le configurazioni Docker o Kubernetes esistenti. Inoltre, la comunità probabilmente esplorerà la possibilità di combinare EnvHarness con strutture di ottimizzazione lato agente per creare cicli di feedback in cui le sfide ambientali e le capacità degli agenti si evolvono insieme. L’impatto a lungo termine dipenderà dal fatto che il costo computazionale del ciclo diagnostico EnvRigger rimanga gestibile con l’aumento della complessità dell’agente.

La disponibilità di nuovi Bridge per diversi tipi di ambiente determinerà l'ampia applicabilità del framework. Attualmente, il supporto è limitato a parametri di riferimento specifici, ma l’espansione ad altri ambiti sarà fondamentale per la sua adozione.

Il costo computazionale del ciclo EnvRigger è un compromesso. Man mano che i modelli migliorano, si prevede che i costi di progettazione e convalida delle modifiche diminuiranno, ma i team dovranno monitorare questo aspetto per garantire che rimanga fattibile per implementazioni su larga scala.

L'integrazione con i framework di ottimizzazione lato agente potrebbe creare potenti cicli di feedback. Anche se non sono stati testati congiuntamente in questo documento, la combinazione di EnvHarness con sistemi che modificano il cablaggio interno dell'agente potrebbe portare a miglioramenti più completi nelle capacità dell'agente.

L'idoneità del quadro per diversi tipi di ambienti sarà un punto focale. È più adatto per sandbox digitali con implementazioni economiche e stati ripristinabili. La sua applicazione ad ambienti con effetti collaterali irreversibili o ripristini costosi richiederà un'attenta considerazione e misure di sicurezza aggiuntive.

Guide e quiz correlati

Agenti dell'intelligenza artificialeFormazione sull'intelligenza artificialeCos'è l'intelligenza artificiale?Metti alla prova ciò che sai: prova un quiz gratuito sull'intelligenza artificialeCerca un termine AI nel nostro glossarioSegui il tracker del rilascio del modello AI
Lo hai trovato utile?