Cosa è successo
NVIDIA afferma di aver integrato BioNeMo Agent Toolkit con Claude Science di Anthropic in modo che gli agenti possano scoprire e chiamare microservizi NIM BioNeMo locali o remoti. Il suo post tecnico dimostra un flusso di lavoro che recupera sequenze proteiche, genera allineamenti evolutivi, esegue previsioni OpenFold3 e Boltz-2 e preserva gli artefatti risultanti per la revisione.
Il post tecnico di NVIDIA del 31 agosto descrive BioNeMo Agent Toolkit come un pacchetto di modelli, librerie e flussi di lavoro di scienze della vita che possono essere esposti come competenze richiamabili dall'agente. L’azienda afferma che il toolkit copre la biologia, la chimica, la genomica e la scoperta di farmaci ed è progettato per funzionare con diversi framework di agenti.
Nella configurazione dimostrata, Claude Science orchestra tre microservizi NIM NVIDIA: MSA Search per allineamenti evolutivi, OpenFold3 per la previsione della struttura e Boltz-2 per un secondo set di previsioni. NVIDIA afferma che i interni hanno aumentato la correttezza delle attività dal 60% al 100% e hanno quasi raddoppiato l'efficienza dei token; tali cifre sono riportate dall'azienda e non sono testate in modo indipendente per posta. Il tutorial richiede Claude Science, una chiave API NVIDIA e l'accesso a una workstation o a un computer cloud con una GPU NVIDIA L40S o H100. NVIDIA stima circa 700 GB di spazio di archiviazione per il flusso di lavoro, inclusi circa 490 GB per un database solo UniRef30 e 30-40 GB per i contenitori Boltz-2 e OpenFold3. Il post descrive anche le alternative in cui Claude Science viene eseguito su un laptop mentre si connette a una GPU remota tramite SSH, infrastruttura HPC o cloud computing.
Il tutorial utilizza contenitori Docker locali collegati alla GPU host e richiede controlli di integrità prima che gli endpoint vengano approvati. Per il suo esempio biologico, il flusso di lavoro confronta la proteina Seh1 C1GY11 di Paracoccidioides lutzii da sola e con un partner proposto, C1HCX1. NVIDIA riporta che l'agente ha recuperato sequenze di 384 e 976 residui, rispettivamente, e ha trovato 202 sequenze per ciascuna proteina durante le ricerche MSA. Ha creato allineamenti spaiati per le singole catene e un allineamento di specie accoppiate per il caso a due catene. Il flusso di lavoro ha quindi eseguito previsioni di monomeri ed eteromeri senza modelli, ligandi, tasche o altri vincoli strutturali, utilizzando l'output mmCIF e conservando richieste, risposte, strutture, metriche ed errori.
Il post riporta che OpenFold3 ha prodotto un'interfaccia pTM, o iPTM, di 0,86 per l'eteromero con input MSA, mentre Boltz-2 ha prodotto 0,82. In ulteriori confronti tra cinque campioni, i valori riportati di MSA rispetto a nessun MSA erano 0,85 rispetto a 0,14 per OpenFold3 e 0,82 rispetto a 0,19 per Boltz-2. NVIDIA afferma che i campioni erano raggruppati strettamente, con deviazioni standard non superiori a 0,006, e che budget di campionamento più generosi non hanno cambiato materialmente il modello. Le due famiglie di modelli utilizzano architetture diverse e gestiscono l'accoppiamento MSA in modo diverso, ma i punteggi dell'interfaccia supportata da MSA erano entro 0,03 nel confronto descritto.
Dettagli della fonte: developer.nvidia.com ↗
Perché è importante
L’esempio mostra come un agente di ricerca sull’intelligenza artificiale può collegare modelli biologici specializzati in un flusso di lavoro riproducibile anziché limitarsi a riassumere la letteratura scientifica. Riferisce inoltre che l'allineamento evolutivo è stato decisivo per l'interfaccia proteica prevista in questo test, chiarendo al contempo che l'accordo del modello non è la prova di un'interazione biologica.
Il significato pratico è il livello di orchestrazione. Il ripiegamento delle proteine e la previsione complessa richiedono input specializzati, formati specifici del modello e parametri che un agente generico potrebbe non sapere come selezionare o applicare. Nel racconto di NVIDIA, Claude Science identifica i servizi necessari, prepara le sequenze e gli allineamenti, avvia gli endpoint, invia le previsioni e registra gli artefatti. Ciò rende l’agente AI un operatore di una pipeline scientifica, non semplicemente un’interfaccia conversazionale verso un singolo modello.
I risultati illustrano anche perché la qualità dell’input può essere importante tanto quanto la selezione del modello. Nel test di NVIDIA, la rimozione dell’MSA ha causato un brusco calo della confidenza dell’interfaccia eteromero prevista sia in OpenFold3 che in Boltz-2. Il pLDDT del monomero riportato da OpenFold3 è sceso da 82,3 con MSA a 36 senza di esso, mentre il valore corrispondente di Boltz-2 è passato da 0,79 a 0,73 sulla scala 0-1. Il confronto suggerisce che le informazioni evolutive sono state particolarmente importanti per stabilire il contatto tra le due catene, sebbene si tratti di risultati di fiducia provenienti da servizi di previsione piuttosto che di misurazioni di un reale complesso biologico.
Il confronto strutturale aggiunge un’ipotesi più specifica. NVIDIA afferma che entrambi i modelli hanno posizionato un gruppo di filamenti beta C1HCX1 vicino al bordo aperto dell'elica beta WD40 di Seh1, in una posizione associata alla chiusura della pala finale. Secondo quanto riferito, la sovrapposizione dei core Seh1 ha prodotto RMSD C-alfa di 0,68 angstrom per OpenFold3 e 0,65 angstrom per Boltz-2 sulla maggior parte della catena. L'azienda interpreta questo come se il partner completasse una piega esistente anziché rimodellarla sostanzialmente. L'accordo tra modelli computazionali indipendenti rende la geometria proposta più utile come obiettivo per l'indagine, ma non stabilisce che le proteine si leghino nelle cellule viventi o svolgano insieme la funzione proposta.
Meccanismo interattivo: come funziona realmente
Esplora la tecnologia alla base di questo sviluppo in modo interattivo.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Cosa guardare dopo
Le principali domande aperte sono se il flusso di lavoro si generalizza oltre una coppia di proteine, quanto costa e quanto tempo ci vuole per eseguirlo e se gli esperimenti di laboratorio confermano l’associazione prevista. NVIDIA riporta i interni del toolkit e i punteggi di confidenza del modello, ma il post non fornisce replica indipendente, misurazioni di runtime o convalida sperimentale.
La limitazione più evidente è la validazione biologica. NVIDIA afferma esplicitamente che il flusso di lavoro prevede un'interazione C1GY11–C1HCX1 e che il risultato non è stato verificato sperimentalmente. L'esempio è motivato da una precedente osservazione strutturale che coinvolge Seh1 e un partner della famiglia Mio, ma questo post stesso riporta un'analisi computazionale.
Il lavoro di follow-up richiederebbe prove di laboratorio, come test biochimici o cellulari, per determinare se l’associazione prevista esiste e se ha un ruolo biologico. Anche la generalizzazione è irrisolta. La dimostrazione è incentrata su una coppia di proteine di una specie fungina, un profilo del database UniRef30 e impostazioni di ricerca e campionamento specificate. I cambiamenti di confidenza riportati mostrano che gli MSA erano portanti in questo caso, ma non stabiliscono che ogni complesso proteico benefici allo stesso modo o che un punteggio elevato di interfaccia preveda in modo affidabile il legame tra diverse proteine.
Allo stesso modo, i dati interni sulla correttezza delle attività e sull'efficienza dei token di NVIDIA non dispongono della definizione di , del set di test, della linea di base di confronto e della valutazione indipendente necessari per valutarne il significato più ampio. I dettagli operativi determineranno se questo sarà utilizzabile al di fuori di una dimostrazione. Il post richiede un notevole spazio di archiviazione locale, GPU NVIDIA compatibili, download di contenitori, una chiave API e l'approvazione manuale degli endpoint.
Dice che i parametri di runtime erano presenti ma vuoti per le esecuzioni segnalate, quindi i lettori non possono dedurre la latenza, il consumo di energia, il costo del cloud o la velocità effettiva. Boltz-2 e OpenFold3 riportano anche valori di confidenza su scale diverse ed espongono campi diversi, il che limita il confronto numerico diretto. Le prossime prove significative sarebbero analisi riproducibili da parte di ricercatori esterni, misurazioni delle risorse pubblicate, test più ampi sui complessi proteici e conferma sperimentale dell’ipotesi strutturale.