무슨 일이 일어났나요?
Databricks는 AI 에이전트가 코딩 및 기타 워크플로에 사용하는 내부 도구에서 7가지 버그를 발견했다고 밝혔습니다. 회사는 실패로 인해 약 499,000달러의 토큰 낭비와 약 12,000시간의 연간 에이전트 대기 시간이 발생했다고 추정하며, 이는 생산성 손실로 약 120만 달러에 해당합니다.
Databricks는 코딩 및 기타 워크플로에 사용되는 AI 에이전트의 비용에 대한 내부 조사를 설명합니다. 회사에서는 에이전트가 시스템 로그, 사용 테이블, 지원 티켓 및 위키와 같은 아티팩트 작업을 위한 도구를 제공하는 기반 모델 및 MCP 서버에 액세스한다고 밝혔습니다. 사용량이 증가함에 따라 Databricks는 에이전트가 중지하는 대신 오류를 해결하거나 다시 시도하는 경우가 많기 때문에 실패한 도구 호출로 인해 숨겨진 비용이 발생한다고 의심했습니다.
회사에서는 Unity Gateway가 MCP 도구 호출에 대한 OpenTelemetry 추적을 자동으로 생성했다고 밝혔습니다. Databricks에 따르면 이러한 기록에는 도구 이름, 인수, 오류, 토큰 수, 대기 시간 및 세션 식별자가 포함되어 있습니다. 추적은 테이블에 저장되어 회사는 개별 실패를 이후 재시도, 토큰 사용 및 대기 시간과 연결할 수 있습니다. Databricks는 Genie One을 사용하면 엔지니어가 SQL 쿼리를 수동으로 작성하는 대신 자연어로 해당 데이터를 쿼리할 수 있다고 말합니다.
Databricks는 단일 24시간 창에서 Jira 및 Google Drive 또는 Docs 서버에서 하루에 1,409개의 도구 오류를 식별했다고 밝혔습니다. 회사는 7개의 반복되는 버그로 인해 연간 토큰 비용 약 499,000달러와 연간 대기 시간 12,023시간이 발생했다고 밝혔습니다. 나열된 가장 큰 소스는 필드 매개변수와 관련된 Jira 검색 실패였습니다. 서버는 쉼표로 구분된 문자열을 예상했지만 에이전트는 JSON 목록을 전달했습니다. Databricks는 오류가 하루에 535번 발생했으며 복구하는 데 평균 12턴이 걸렸다고 말합니다.
보고된 다른 오류로는 Jira 필드 누락, 지원되지 않는 analyze_prompt 인수, 잘못된 Google 드라이브 필드 선택, Google Docs 매개변수 누락, 바이트 대 문자열 불일치 등이 있습니다. Databricks는 Genie One이 오류 순위 목록과 오류를 유발한 입력을 생성한 후 코딩 에이전트가 도구 서버 전체에 수정 사항을 적용했다고 밝혔습니다. 회사에서는 문제를 찾아 정량화하고 수정하는 전 과정을 약 1시간 정도 소요된다고 설명합니다.
왜 중요한가요?
이 계정은 AI 운영 비용의 눈에 띄지 않는 소스, 즉 재시도, 추측 또는 대체 접근 방식을 시도하여 손상된 도구 호출을 복구하는 에이전트를 강조합니다. 또한 도구 서버는 모든 불일치를 호출자 오류로 처리하기보다는 모델 생성 입력의 합리적인 변형을 수용해야 함을 시사합니다.
핵심 실용적인 점은 AI 에이전트 작업이 성공적으로 보일 수 있으면서도 여전히 비효율적일 수 있다는 것입니다. Databricks는 기존 비용 대시보드에서는 토큰 사용이 약간만 증가하여 일반적인 사용량 증가처럼 보일 수 있다고 말합니다. 대신 오류, 재시도, 대기 시간 및 세션을 연결하는 추적을 통해 추가 지출이 생산적인 작업을 반영하는지 또는 인프라 결함으로부터의 반복적인 복구를 반영하는지 확인할 수 있습니다.
또한 이 예는 도구 신뢰성에 대한 일반적인 가정에 도전합니다. Databricks는 잘못된 것으로 표시된 일부 호출이 느슨하게 지정된 인터페이스에 대한 합리적인 해석이라고 말합니다. 예를 들어 특정 서버가 쉼표로 구분된 문자열만 허용하도록 작성된 경우에도 배열은 필드 목록의 자연스러운 JSON 표현입니다. 이러한 상황에서 소스는 실패가 단순한 모델 실수가 아니라 부분적으로 도구의 호환성 문제라고 주장합니다.
조직에서 상담원에게 더 많은 운영 시스템에 대한 액세스 권한을 제공하므로 이는 중요합니다. 실패한 호출은 모델 토큰을 소비하고, 워크플로를 지연시키고, 인프라 사용량을 늘리고, 동작을 감사하기 어렵게 만들 수 있습니다. 명확한 오류 메시지는 복구 시간을 단축할 수 있지만, Databricks는 예측 가능한 입력 변화를 처리하고, 합리적인 기본값을 제공하고, 에이전트에 유용한 지침을 제공하는 방식으로 지원되지 않는 인수를 거부하는 도구를 설계하는 것이 보다 내구성 있는 해결책이라고 말합니다.
소스는 홍보하는 솔루션의 일부인 도구가 있는 Databricks의 제품 계정이기도 합니다. 해당 수치는 연간 비용 및 생산성에 대한 내부 추적 및 가정을 기반으로 한 추정치입니다. 이 계정은 독립적인 감사, 120만 달러 수치에 대한 자세한 비용 변환 방법 또는 워크로드, 모델, 도구 서버 또는 인건비가 다른 조직에서 동일한 절감 효과가 발생할 것이라는 증거를 제공하지 않습니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
다음에 무엇을 볼 것인가
절감 수치는 독립적으로 감사된 결과가 아닌 자체 에이전트 플릿에서 Databricks가 추정한 것입니다. 수정 후 실패 감소, 수정이 시간이 지나도 계속 작동하는지 여부, 접근 방식이 다른 에이전트 시스템, 도구 및 운영 환경에 얼마나 광범위하게 적용되는지에 대한 추가 증거가 필요합니다.
가장 중요한 후속 조치는 Databricks가 수정 후 실제 결과를 측정했는지 여부입니다. 출처는 교정 전 예상 낭비를 설명하지만 사후 수정 오류율, 토큰 감소, 복구 차례 변경 또는 검증된 연간 절감액은 보고하지 않습니다. 이러한 측정은 타당한 진단과 지속적인 운영 개선을 구별하는 데 도움이 됩니다.
접근 방식을 평가하는 팀은 추적 데이터의 신뢰성과 분석 경계도 조사해야 합니다. 소식통에 따르면 Unity Gateway는 도구 인수, 오류, 토큰, 대기 시간 및 세션 ID를 기록하지만 샘플링, 추적 누락, 개인 정보 보호 제어, 보존 또는 민감한 인수 처리 방법에 대해서는 논의하지 않습니다. 추적에 지원 티켓, 로그, 문서 또는 기타 비즈니스 데이터가 포함될 때 이러한 세부 정보가 중요합니다.
기본 제품의 가용성 상태도 채택에 영향을 미칠 수 있습니다. Databricks는 Unity Gateway가 일반적으로 사용 가능하고 통합 추적 테이블이 베타 버전이지만 소스에서는 가격, 서비스 제한, 배포 요구 사항 또는 다른 관찰 시스템과의 비교 결과를 제공하지 않는다고 말합니다. 또한 Genie One이 임의의 추적 스키마 전반에 걸쳐 동일한 질문에 안정적으로 답할 수 있다는 것도 확립하지 못했습니다.
보다 광범위하게, 이 사례는 에이전트 개발자에게 질문을 제기합니다. 허용 강제로 인해 새로운 안전 또는 정확성 위험이 발생하기 전에 도구가 얼마나 많은 유연성을 수용해야 합니까? 입력을 자동으로 변환하거나 예상치 못한 인수를 무시하면 낭비를 줄일 수 있지만 실제 실수를 숨길 수도 있습니다. 향후 기술 문서 또는 독립적인 테스트에서는 이러한 호환성 수정 사항이 더 큰 위험이 따르는 워크플로에서 어떻게 제한되고, 기록되고, 검증되는지 보여주어야 합니다.