무슨 일이 일어났나요?
연구원들은 기존 AI 에이전트를 위한 작업별 하네스를 생성하기 위한 모델인 JIT-Agent를 출시했습니다. 하네스는 메모리 관리, 계획, 작업 프로토콜 및 도구 조정과 같은 기능을 제어합니다.
8월 26일 제출된 arXiv 논문에서는 JIT-Agent를 "하네스 인텔리전스 모델"로 설명합니다. 그 목적은 기성 에이전트 대형 언어 모델을 사용하여 현재 작업에 대해 작동하는 에이전트 하네스를 생성하는 것입니다. 저자는 하네스를 기초 모델 자체가 아닌 메모리, 계획, 작업, 도구 및 기술을 관리하는 주변 시스템으로 정의합니다. 해당 프레임에서 모델과 하네스는 전체 에이전트 시스템의 별도 부분입니다. 따라서 제안은 기존 모델을 중심으로 운영 계층을 생성하고 해당 계층이 수행해야 하는 작업을 결정하는 데 중점을 둡니다.
제안된 시스템은 하네스를 고정된 4개 모듈 프로토콜에 의해 관리되는 구성 가능한 아티팩트로 나타냅니다. 논문에 따르면 JIT-Agent는 특정 작업에 맞게 해당 아티팩트를 사용자 정의하고, 실행이 불안정할 때 이를 복구하고, 이전 구성의 확장 아카이브에서 성능 신호를 추출하여 향후 하네스를 개선할 수 있습니다. 이렇게 하면 하네스 자체가 모델에 의해 생성되고 구체화될 수 있는 개체가 됩니다. 설명에서는 이러한 구성을 일회성 지침이 아닌 재사용 가능한 소프트웨어 구조로 취급합니다. 또한 동일한 일반적인 하네스 중심 접근 방식 내에 생성, 수리 및 개선 단계를 배치합니다.
저자는 다른 통제된 평가 중에서 DeepSearchQA 및 OdysseyBench에 대한 결과를 보고합니다. 하네스 지원을 제공하는 JIT-Agent를 통해 DeepSeek-V4-Flash는 DeepSearchQA에서 9.1포인트, OdysseyBench에서 4.3포인트로 GPT-5.6을 능가했다고 합니다. 또한 DeepSeek V4, Mimo-V2.5 및 Qwen3.6 모델 제품군 전반에 걸쳐 일관된 개선과 함께 GLM-5.2에 대해 최대 20.2포인트의 이득을 보고했습니다. 이 논문에서는 생성된 하네스가 OpenCode 및 Claude Code를 포함한 성숙한 에이전트 런타임과 경쟁적이라고 밝혔습니다. 종합하면, 이러한 결과는 평가된 설정에서 생성된 하네스의 역할에 대한 증거로 제시되는 반면, 소스는 보고된 비교의 기초로 남아 있습니다.
왜 중요한가요?
이 논문에서는 에이전트 성능이 기본 언어 모델 이상의 것에 달려 있다고 주장합니다. 보고된 결과가 유지된다면 주변 하네스를 개선하는 것이 기본 모델 자체를 변경하지 않고 에이전트 기능을 확장하는 또 다른 방법이 될 수 있습니다.
이 논문의 핵심 주장은 에이전트 능력이 모델만으로 결정되지 않는다는 것입니다. 실제 시스템에서 에이전트의 행동은 정보를 저장하고, 작업을 분해하고, 도구를 선택하고, 결정을 작업으로 변환하는 방법에 따라 달라집니다. 이는 단일 모델 리더보드에서 모델을 에이전트로 작동시키는 전체 소프트웨어 계층으로 관심을 이동시킵니다. 이 보기에서는 주변 워크플로의 변경 사항이 동일한 기본 모델이 작업을 처리하는 방식에 영향을 미칠 수 있습니다. 하네스는 상담원의 행동과 결과를 평가할 때 검사해야 하는 부분이 됩니다.
이 접근 방식을 독립적으로 재현할 경우 개발자는 기본 모델을 재교육하거나 교체하지 않고도 에이전트를 개선할 수 있는 새로운 방법을 제공할 수 있습니다. 작업 적응형 하네스는 동일한 모델이 연구, 코딩 또는 기타 워크플로에서 다르게 작동하는 데 도움이 될 수 있습니다. 보고된 결과는 또한 상대적으로 강력한 모델이 더 나은 오케스트레이션을 통해 여전히 실질적인 이점을 얻을 수 있음을 시사합니다. 이러한 가능성은 에이전트 시스템을 구축하는 팀이 사용할 수 있는 엔지니어링 선택 범위를 넓혀줍니다. 또한 메모리, 계획, 작업 및 도구의 디자인을 개발 프로세스에서 더욱 눈에 띄는 부분으로 만듭니다.
이 아이디어는 AI 시스템을 비교하는 방법에 영향을 미칩니다. 벤치마크 결과는 모델뿐만 아니라 모델을 둘러싼 메모리, 계획 및 도구 사용 프레임워크도 반영할 수 있습니다. 자동으로 생성된 하네스는 실험을 가속화할 수 있지만, 서로 다른 시스템이 실질적으로 서로 다른 런타임 스캐폴딩을 사용하는 경우 비교가 더 어려워질 수도 있습니다. 소스는 JIT-Agent가 기존 접근 방식보다 저렴하고 안전하며 신뢰할 수 있다는 것을 입증하지 않습니다. 결과적으로 보고된 이득의 중요성은 하네스 기여가 비교되는 모델 및 런타임의 기능과 어떻게 분리되는지에 따라 달라집니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
다음에 무엇을 볼 것인가
주요 질문은 작성자의 평가 외부에서 이득이 복제되는지 여부, JIT-Agent에 필요한 계산 및 엔지니어링 양, 자동 생성된 하네스가 익숙하지 않은 작업에서 안정적이고 안전하게 유지되는지 여부입니다.
이 논문은 arXiv 시험판이며, 소스는 동료 검토 상태, 독립적 복제 또는 외부 평가를 제공하지 않습니다. 따라서 보고된 개선 사항은 확정된 증거가 아니라 작성자의 주장으로 처리되어야 합니다. 또한 소스는 통계적 유의성, 평가 분산 또는 GPT-5.6과의 비교가 어떻게 제어되었는지 평가할 수 있는 충분한 세부 정보를 제공하지 않습니다. 이러한 제한은 벤치마크 결과의 해석에 적용되며 보고된 평가 외부에서 조사되는 방식을 공개합니다. 확인을 위해서는 출처에서 확인된 누락된 검토 및 비교 형식이 필요합니다.
중요한 구현 세부 사항은 소스 텍스트에서 알 수 없는 상태로 남아 있습니다. JIT-Agent를 훈련하거나 실행하는 데 필요한 컴퓨팅, 하네스 생성에 필요한 시간, 자체 진화에 사용되는 아카이브의 크기 또는 구성, 코드 및 평가 자료가 공개적으로 사용 가능한지 여부는 명시하지 않습니다. 이러한 요소는 이 방법이 소규모 연구팀과 생산 사용자에게 실용적인지 여부를 결정합니다. 또한 기존 하네스 및 에이전트 런타임과 함께 접근 방식을 평가하는 방법에도 영향을 미칩니다. 이러한 세부 정보가 없으면 보고된 성능 자체만으로는 이를 달성하는 데 필요한 리소스나 엔지니어링 노력을 보여줄 수 없습니다.
신뢰성과 보안 역시 공개 질문입니다. 자체 계획, 메모리 또는 도구 조정 동작을 변경하는 하네스는 특히 이전 아카이브에 표시되지 않은 작업에서 새로운 오류 모드를 도입할 수 있습니다. 추가 작업에서는 생성된 하네스가 제약 조건을 유지하고 검토를 위해 변경 사항을 공개하며 도구가 실패하거나 입력이 적대적일 때 견고성을 유지하는지 테스트해야 합니다. 소스는 성능 결과를 보고하지만 안전 테스트, 실제 배포 또는 상업적 가용성은 보고하지 않습니다. 이러한 답변되지 않은 질문은 생성된 소프트웨어의 동작과 사용자가 이를 의존할 수 있는 조건 모두에 관련됩니다. 이는 보고된 평가와 광범위한 사용 사이의 격차의 일부로 남아 있습니다.