무슨 일이 일어났나요?
연구원들은 Model Context Protocol 서버를 통해 시뮬레이션된 하드웨어 설계 워크플로우에서 로컬로 배포된 7개의 오픈 소스 언어 모델을 테스트했습니다. 벤치마크에서는 개별 편집, 다단계 종속성 체인, 잘못된 요청, 철자가 틀린 프롬프트 및 여러 도구 서버에 걸친 작업을 다루었습니다. 이 논문에서는 강력한 모델이 일부 워크플로에서 거의 완전한 예상 통화 범위를 달성했지만 프롬프트 및 에이전트 설계에 따라 성능이 크게 변경되었다고 보고합니다.
8월 25일 arXiv에 제출된 이 논문은 로컬에 배포된 대규모 언어 모델로 구동되는 AI 에이전트가 업계 현실적인 도구 호출 설정에서 전문가가 정의한 하드웨어 설계 워크플로를 안정적으로 자동화할 수 있는지 묻습니다. 소스는 이러한 워크플로를 구성 요소 생성, 포트 추가 및 연결 연결을 포함하여 반복적이고 종속성 순서가 지정된 작업으로 설명합니다. 대상은 상태 저장 설계 환경과 상호 작용하는 에이전트이기 때문에 연구에서는 모델이 그럴듯한 텍스트를 생성할 수 있는지 여부보다 더 많은 것을 평가합니다. 에이전트가 환경의 상태와 종속성을 존중하면서 예상되는 도구 호출 순서를 수행하는지 여부를 검사합니다.
테스트 환경을 만들기 위해 연구원들은 임베디드 시스템 개발에 사용되는 독점 하드웨어 설계 도구의 상태 및 종속성 논리를 재현하는 MCP 서버를 구축했습니다. 벤치마크에는 단일 작업 편집, 다단계 종속성 체인, 잘못된 요청, 철자가 틀린 프롬프트, 다중 서버 도구 컨텍스트 등 오류에 민감한 여러 조건이 포함되어 있습니다. 도구 호출이 잘못된 순서로 수행되거나 유효하지 않은 개체를 대상으로 하거나 워크플로 초기에 수행된 변경 사항을 고려하지 못하는 경우 도구 호출은 구문적으로 그럴듯하지만 여전히 사용할 수 없기 때문에 이 구조가 중요합니다. 소스는 독점 도구를 식별하지 않거나 제공된 텍스트에서 벤치마크의 작업 수를 제공하지 않습니다.
연구원들은 7개의 오픈 소스 모델을 평가하고 여러 에이전트 파이프라인 선택을 비교했습니다. 여기에는 시스템 프롬프트의 표현 및 완전성, 도구 설명의 세부사항 정도, 모델에 제공되는 컨텍스트의 범위, 작업이 단일 에이전트에 의해 처리되는지 아니면 여러 에이전트 간에 분할되는지 여부가 포함됩니다. 백서의 요약에 따르면 벤치마크는 모델 기능과 구성을 모두 검사하도록 설계되었습니다. 엄격하게 정의된 도구 환경에서 모델의 성능은 주변 지침, 사용 가능한 기록 또는 작업 분업이 변경되면 변경될 수 있기 때문에 이러한 구별이 중요합니다.
이 백서는 여러 구성에 따른 결과를 보고합니다. 강력한 모델은 벤치마크된 워크플로에서 거의 완전한 예상 통화 범위를 달성했지만 안정성은 작업 구조와 상담원 구성에 크게 좌우되었습니다. 보다 포괄적인 도구 설명을 통해 지속적으로 오류가 감소했습니다. 몇 번의 메시지 표시로 인해 일부 모델에서는 심각한 무작동이 발생했으며, 누적된 컨텍스트는 제한된 모델에 해를 끼쳤습니다. 다중 에이전트 분해는 추가 호출이 필요하기는 하지만 약한 작업자나 긴 세션에 도움이 되었습니다. 이러한 결과는 사전 인쇄에서 주장한 것입니다. 제공된 소스는 기본 백분율, 모델별 순위, 통계적 불확실성 또는 오류의 예를 제공하지 않습니다.
왜 중요한가요?
이 연구는 하드웨어 개발에서 호스팅 AI를 사용하는 데 있어 실질적인 장벽을 다룹니다. 즉, 기밀 구성 요소 사양 및 명명 규칙에 따라 로컬 배포가 필요할 수 있습니다. 연구 결과에 따르면 안정적인 도구 사용은 모델 기능뿐만 아니라 도구 설명 방식, 에이전트가 받는 컨텍스트 양, 작업이 여러 에이전트 간에 분할되는지 여부에 따라 달라집니다. 이를 통해 엔지니어링 팀은 상태 저장 워크플로를 통해 에이전트를 신뢰하기 전에 테스트할 수 있는 구체적인 설계 선택을 제공합니다.
이 연구는 중요한 하드웨어 설계 정보를 호스팅된 독점 API로 보낼 수 없는 조직과 관련이 있습니다. 이 문서에서는 구성 요소 사양 및 명명 규칙에 대한 기밀성 제약이 종종 로컬 배포에 동기를 부여한다고 말합니다. 그러한 환경에서 문제는 단순히 AI 시스템이 코드를 제안하거나 회로를 설명할 수 있는지 여부가 아닙니다. 시스템은 통제된 도구 환경 내에서 작동하고 종속성을 유지하며 다른 설계 단계에서 사용할 수 있도록 변경해야 합니다. 이러한 제약 조건을 목표로 하는 벤치마크는 벤치마크가 생산 성능을 예측한다는 사실을 소스에 표시하지 않더라도 일반 언어 모델 점수보다 더 실질적으로 목표가 됩니다.
또한 이번 연구 결과는 모델 선택에서 에이전트 시스템 설계로 관심을 옮깁니다. 상세한 도구 설명은 실패를 줄이는 것으로 나타나며, 이는 모델과 설계 도구 간의 인터페이스가 신뢰성 문제의 일부임을 시사합니다. 과도한 누적 컨텍스트로 인해 보고된 피해는 에이전트에 더 많은 기록을 제공하는 것이 특히 제한된 모델의 경우 자동으로 유익하지 않다는 것을 나타냅니다. 몇 번의 메시지 표시에 대한 혼합된 결과는 또 다른 유용한 경고입니다. 즉, 한 시스템에 도움이 되는 예는 다른 시스템의 작동을 중단시킬 수 있습니다. 따라서 에이전트를 평가하는 팀은 기본 모델을 유일한 변수로 취급하기보다는 프롬프트, 컨텍스트 정책 및 도구 스키마를 함께 테스트해야 합니다.
결과는 AI가 하드웨어를 독립적으로 설계했다는 증거가 아니라 주로 배포 지침으로 중요합니다. 보고된 지표는 예상 호출 범위이며, 요약에서는 결과 설계가 전기, 타이밍, 제조, 안전 또는 검증 요구 사항을 충족하는지 여부를 밝히지 않습니다. 또한 인간 엔지니어, 기존 자동화, 호스팅 모델 또는 결정론적 스크립트와의 비교도 보고하지 않습니다. 이 논문은 또한 arXiv 사전 인쇄이므로 해당 주장은 여기에서 동료 검토 결과로 확립되지 않았습니다. 가장 강력한 공개 가치는 하드웨어 팀이 조사할 수 있는 구체적인 신뢰성 트레이드오프를 식별하는 동시에 최종 엔지니어링 출력의 품질과 안전성을 해결하지 않은 상태로 두는 것입니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
다음에 무엇을 볼 것인가
결과는 독점 하드웨어 설계 도구의 상태 및 종속성 논리를 재현하는 단일 사전 인쇄 및 시뮬레이션 서버에서 나온 것입니다. 소스는 시스템이 제조 가능한 설계를 생성했는지, 엔지니어링 시간이 단축되었는지, 생산에서 안전하게 작동했는지 확인하지 않았습니다. 벤치마크의 작업 수, 모델 ID, 오류율, 재현성, 실제 도구 검증 및 다중 에이전트 실행 비용에 대한 추가 조사가 필요합니다.
전체 문서에서는 벤치마크가 성공을 어떻게 정의하는지, 얼마나 많은 작업과 종속성 체인이 포함되어 있는지, 어떤 7개 모델을 테스트했는지, 결과가 유효한 요청, 유효하지 않은 요청, 철자가 틀린 요청에 따라 어떻게 다른지 명확히 해야 합니다. 제공된 arXiv 페이지는 논문 제목, 저자, 제출 날짜 및 초록을 확인하지만 자세한 표나 실험 프로토콜은 확인하지 않습니다. 이러한 세부 정보는 "거의 완전한" 예상 통화 범위가 제한된 시뮬레이션 워크플로 세트에서 광범위한 견고성 또는 강력한 성능을 반영하는지 여부를 결정합니다.
중요한 다음 단계는 실제 하드웨어 설계 소프트웨어와 보다 다양한 엔지니어링 작업에 대한 검증입니다. MCP 서버는 독점 도구의 상태 및 종속성 논리를 재현하는 것으로 설명되지만 소스는 도구의 전체 동작이나 실제 프로젝트의 복잡성과 동등성을 설정하지 않습니다. 유용한 후속 증거에는 대규모 설계, 요구 사항 변경, 잘못된 도구 응답, 호출 실패 후 복구 및 생성된 설계 상태에 대한 독립적 검증과 관련된 테스트가 포함됩니다. 결과에는 대기 시간, 토큰 및 도구 호출 비용도 보고되어야 합니다. 왜냐하면 다중 에이전트 분해가 추가 호출 비용으로 일부 사례를 개선한다고 논문에 나와 있기 때문입니다.
유사한 시스템을 고려하는 조직은 에이전트가 되돌릴 수 있는 편집으로 제한되는지, 모든 상태 변경 작업이 검증되는지, 인간 엔지니어가 다운스트림 사용 전에 출력을 검토하는지 여부를 관찰해야 합니다. 소스는 프로덕션 배포, 안전 정책 또는 액세스 제어 모델을 설명하지 않으므로 이러한 안전 장치를 가정할 수 없습니다. 또한 로컬 배포에서 기밀성이 어떻게 보호되는지, 그리고 더 큰 컨텍스트 창이나 더 강력한 모델이 보고된 약점을 제거하는지 여부도 공개됩니다. 향후 작업의 핵심 질문은 상담원이 예상한 전화를 걸 수 있는지 여부뿐만 아니라 전체 하드웨어 설계 프로세스에서 일관되고 경제적이며 검증 가능하게 전화를 걸 수 있는지 여부입니다.