무슨 일이 일어났나요?
NVIDIA는 BioNeMo Agent Toolkit을 Anthropic의 Claude Science와 통합하여 에이전트가 로컬 또는 원격 BioNeMo NIM 마이크로서비스를 검색하고 호출할 수 있다고 밝혔습니다. 기술 게시물에서는 단백질 서열을 검색하고, 진화적 정렬을 생성하고, OpenFold3 및 Boltz-2 예측을 실행하고, 검토를 위해 결과 아티팩트를 보존하는 워크플로우를 보여줍니다.
NVIDIA의 8월 31일 기술 게시물에서는 BioNeMo Agent Toolkit을 에이전트 호출 가능 기술로 노출될 수 있는 생명 과학 모델, 라이브러리 및 워크플로 패키지로 설명합니다. 회사는 이 툴킷이 생물학, 화학, 유전체학 및 약물 발견을 다루며 다양한 에이전트 프레임워크와 작동하도록 설계되었다고 밝혔습니다.
시연된 설정에서 Claude Science는 3개의 NVIDIA NIM 마이크로서비스(진화 정렬을 위한 MSA 검색, 구조 예측을 위한 OpenFold3, 두 번째 예측 세트를 위한 Boltz-2)를 조율합니다. NVIDIA는 내부 벤치마크가 작업 정확성을 60%에서 100%로 높이고 토큰 효율성을 대략 두 배로 높였다고 말합니다. 해당 수치는 회사에서 보고한 것이며 게시물에서 독립적으로 테스트되지 않았습니다. 튜토리얼을 진행하려면 Claude Science, NVIDIA API 키, 그리고 NVIDIA L40S 또는 H100 GPU가 있는 워크스테이션 또는 클라우드 머신에 대한 액세스가 필요합니다. NVIDIA는 UniRef30 전용 데이터베이스의 경우 약 490GB, Boltz-2 및 OpenFold3 컨테이너의 경우 30~40GB를 포함하여 워크플로용 스토리지를 약 700GB로 추정합니다. 이 게시물에서는 SSH, HPC 인프라 또는 클라우드 컴퓨팅을 통해 원격 GPU에 연결하면서 Claude Science가 노트북에서 실행되는 대안도 설명합니다.
이 자습서에서는 호스트 GPU에 연결된 로컬 Docker 컨테이너를 사용하며 엔드포인트가 승인되기 전에 상태 확인이 필요합니다. 생물학적 예를 위해 워크플로우는 Paracoccidioides lutzii의 Seh1 단백질 C1GY11을 자체적으로 비교하고 파트너인 C1HCX1과 비교합니다. NVIDIA는 에이전트가 각각 384개와 976개 잔기의 서열을 검색했으며 MSA 검색 중에 각 단백질에 대해 202개의 서열을 발견했다고 보고합니다. 이는 개별 사슬에 대해 짝을 이루지 않은 정렬을 생성하고 두 사슬 사례에 대해 종 쌍 정렬을 생성했습니다. 그런 다음 워크플로우는 템플릿, 리간드, 포켓 또는 기타 구조적 제약 없이 mmCIF 출력을 사용하고 요청, 응답, 구조, 메트릭 및 오류를 유지하면서 단량체 및 이종체 예측을 실행했습니다.
게시물에서는 OpenFold3이 MSA 입력이 있는 이종체에 대해 0.86의 인터페이스 pTM 또는 iPTM을 생성한 반면 Boltz-2는 0.82를 생성했다고 보고했습니다. 추가 5개 샘플 비교에서 보고된 MSA 대 비MSA 값은 OpenFold3의 경우 0.85 대 0.14, Boltz-2의 경우 0.82 대 0.19였습니다. NVIDIA는 샘플이 0.006 이하의 표준 편차로 밀접하게 클러스터되어 있으며 더 많은 샘플링 예산이 패턴을 실질적으로 변경하지 않았다고 말합니다. 두 모델 제품군은 서로 다른 아키텍처를 사용하고 MSA 페어링을 다르게 처리하지만 설명된 비교에서 MSA 지원 인터페이스 점수는 0.03 이내였습니다.
소스 세부정보: developer.nvidia.com ↗
왜 중요한가요?
이 예는 AI 연구 에이전트가 단순히 과학 문헌을 요약하는 것이 아니라 특수한 생물학적 모델을 재현 가능한 워크플로에 연결할 수 있는 방법을 보여줍니다. 또한 이 테스트에서 예측된 단백질 인터페이스에 대해 진화적 정렬이 결정적이었다고 보고하는 동시에 모델 일치가 생물학적 상호작용의 증거가 아니라는 점을 분명히 했습니다.
실질적인 중요성은 오케스트레이션 레이어입니다. 단백질 폴딩 및 복합 예측에는 특수한 입력, 모델별 형식 및 범용 에이전트가 선택하거나 적용하는 방법을 알 수 없는 매개변수가 필요합니다. NVIDIA의 계정에서 Claude Science는 필요한 서비스를 식별하고, 시퀀스와 정렬을 준비하고, 엔드포인트를 시작하고, 예측을 제출하고, 아티팩트를 기록합니다. 따라서 AI 에이전트는 단순히 단일 모델에 대한 대화형 인터페이스가 아닌 과학적 파이프라인의 운영자가 됩니다.
결과는 또한 입력 품질이 모델 선택만큼 중요한 이유를 보여줍니다. NVIDIA의 테스트에서 MSA를 제거하면 OpenFold3와 Boltz-2 모두에서 예측된 이종체 인터페이스 신뢰도가 급격히 떨어졌습니다. OpenFold3의 보고된 단량체 pLDDT는 MSA가 있는 82.3에서 MSA가 없는 36으로 감소한 반면, Boltz-2의 해당 값은 0-1 척도에서 0.79에서 0.73으로 이동했습니다. 비교 결과에 따르면 진화 정보는 두 사슬 사이의 접촉을 배치하는 데 특히 중요했지만 이는 실제 생물학적 복합체를 측정한 것이 아니라 예측 서비스에서 나온 신뢰도 결과입니다.
구조적 비교는 보다 구체적인 가설을 추가합니다. NVIDIA는 두 모델 모두 Seh1의 WD40 베타 프로펠러의 열린 가장자리 근처, 최종 블레이드를 닫는 것과 관련된 위치에 C1HCX1 베타 가닥 그룹을 배치했다고 말합니다. Seh1 코어를 중첩하면 대부분의 체인에서 OpenFold3의 경우 0.68옹스트롬, Boltz-2의 경우 0.65옹스트롬의 C-알파 RMSD가 생성된 것으로 알려졌습니다. 회사는 이를 파트너가 기존 폴더를 실질적으로 리모델링하는 것이 아니라 기존 폴더를 완성하는 것으로 해석합니다. 독립적인 계산 모델 간의 일치는 제안된 기하학을 조사 대상으로 더 유용하게 만들지 만, 단백질이 살아있는 세포에 결합하거나 제안된 기능을 함께 수행한다는 것을 확립하지는 않습니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
다음에 무엇을 볼 것인가
주요 공개 질문은 작업 흐름이 하나의 단백질 쌍 이상으로 일반화되는지 여부, 비용과 실행 시간, 실험실 실험에서 예측된 연관성을 확인하는지 여부입니다. NVIDIA는 내부 툴킷 벤치마크 및 모델 신뢰도 점수를 보고하지만 게시물은 독립적인 복제, 런타임 측정 또는 실험적 검증을 제공하지 않습니다.
가장 명확한 한계는 생물학적 검증입니다. NVIDIA는 워크플로가 C1GY11–C1HCX1 상호 작용을 예측하고 그 결과가 실험적으로 검증되지 않았다고 명시적으로 말합니다. 이 예는 Seh1 및 Mio 가족 파트너와 관련된 이전 구조적 관찰에 의해 동기가 부여되었지만 이 게시물 자체는 전산 분석을 보고합니다.
후속 작업에는 예상 연관성이 존재하는지, 생물학적 역할이 있는지 여부를 확인하기 위해 생화학 또는 세포 테스트와 같은 실험실 증거가 필요합니다. 일반화도 해결되지 않았습니다. 데모에서는 한 가지 곰팡이 종의 한 단백질 쌍, 하나의 UniRef30 데이터베이스 프로필, 지정된 검색 및 샘플링 설정을 중심으로 진행됩니다. 보고된 신뢰도 변화는 MSA가 이 경우 부하를 지탱한다는 것을 보여 주지만 모든 단백질 복합체가 동일한 정도로 이익을 얻거나 높은 인터페이스 점수가 서로 다른 단백질 간의 결합을 안정적으로 예측한다는 것을 입증하지는 않습니다.
NVIDIA의 내부 작업 정확성 및 토큰 효율성 수치에는 마찬가지로 광범위한 의미를 평가하는 데 필요한 벤치마크 정의, 테스트 세트, 비교 기준 및 독립적인 평가가 부족합니다. 운영 세부 사항에 따라 데모 외부에서 사용할 수 있는지 여부가 결정됩니다. 게시물에는 상당한 로컬 스토리지, 호환 가능한 NVIDIA GPU, 컨테이너 다운로드, API 키 및 엔드포인트 수동 승인이 필요합니다.
보고된 실행에 대해 런타임 지표가 있지만 비어 있으므로 독자는 대기 시간, 에너지 사용, 클라우드 비용 또는 처리량을 추론할 수 없습니다. Boltz-2와 OpenFold3은 또한 다양한 규모의 신뢰도 값을 보고하고 다양한 필드를 노출하므로 직접적인 수치 비교가 제한됩니다. 다음으로 의미 있는 증거는 외부 연구자의 재현 가능한 실행, 발표된 자원 측정, 광범위한 단백질 복합체 테스트 및 구조 가설의 실험적 확인이 될 것입니다.