Какво стана
Databricks казва, че е открил седем грешки във вътрешните инструменти, използвани от AI агенти за кодиране и други работни процеси. Компанията изчислява, че неизправностите са причинили около $499 000 пропилени токени и приблизително 12 000 часа годишно време за изчакване на агента, което оценява на около $1,2 милиона загубена производителност.
Databricks описва вътрешно разследване на разходите за AI агенти, използвани за кодиране и други работни процеси. Компанията казва, че нейните агенти имат достъп до базови модели и MCP сървъри, които предоставят инструменти за работа с артефакти като системни регистрационни файлове, таблици за използване, билети за поддръжка и wiki. С нарастването на употребата Databricks подозираше, че неуспешните извиквания на инструменти създават скрити разходи, тъй като агентите често опитват отново или заобикалят грешките, вместо да спрат.
Компанията казва, че Unity Gateway автоматично генерира следи на OpenTelemetry за извиквания на MCP инструмент. Тези записи включват имена на инструменти, аргументи, грешки, брой токени, латентност и идентификатори на сесии, според Databricks. Следите бяха съхранени в таблица, позволявайки на компанията да свърже отделни грешки с по-късни повторни опити, използване на токени и време за изчакване. Databricks казва, че след това Genie One позволява на инженерите да заявяват тези данни на естествен език, вместо да пишат ръчно SQL заявки.
За един 24-часов прозорец Databricks казва, че е идентифицирал 1409 грешки в инструмента на ден в Jira и Google Drive или Docs сървъри. Компанията приписва приблизително 499 000 долара годишни разходи за токени и 12 023 часа годишно време за изчакване на седем повтарящи се грешки. Най-големият изброен източник беше неуспешно търсене на Jira, включващо параметър за полета: сървърът очакваше низ, разделен със запетая, докато агентът предава JSON списък. Databricks казва, че тази грешка е възникнала 535 пъти на ден и са били необходими средно 12 хода за възстановяване.
Други докладвани грешки включват липсващи полета на Jira, неподдържан аргумент analysis_prompt, невалидни селекции на полета Google Drive, липсващ параметър Google Docs и несъответствие на байтове срещу низ. Databricks казва, че кодиращите агенти са приложили корекции в сървърите на инструменти, след като Genie One е изготвил класиран списък с грешки и входните данни, които са ги задействали. Компанията характеризира пълния процес на намиране, количествено определяне и коригиране на проблемите като отнемащ около един час.
Детайли за източника: databricks.com ↗
Защо има значение
Акаунтът подчертава по-малко видим източник на оперативни разходи за AI: агенти, които се възстановяват от повредени извиквания на инструменти чрез повторен опит, отгатване или изпробване на алтернативни подходи. Той също така предполага, че сървърите на инструменти трябва да приемат разумни вариации в генерираните от модел входове, вместо да третират всяко несъответствие като грешка на повикващия.
Централната практическа точка е, че задача на AI-агент може да изглежда успешна, но все още е неефективна. Databricks казва, че конвенционалното табло за управление на разходите може да покаже само скромно увеличение на използването на токени и да изглежда като обикновено нарастване на използването. Следите, които свързват грешки, повторни опити, закъснение и сесии, вместо това могат да разкрият дали допълнителните разходи отразяват продуктивна работа или повтарящо се възстановяване от дефекти в инфраструктурата.
Примерите също оспорват общото предположение за надеждността на инструмента. Databricks казва, че някои обаждания, които са били етикетирани като неправилни, са били разумни интерпретации на свободно определени интерфейси. Масивът е естествено JSON представяне на списък от полета, например, дори ако даден сървър е написан да приема само низ, разделен със запетая. В тази ситуация, твърди източникът, повредата е отчасти проблем със съвместимостта в инструмента, а не просто грешка на модела.
Това има значение, тъй като организациите дават на агентите достъп до повече оперативни системи. Неуспешното повикване може да изразходва токени за модел, да забави работен поток, да увеличи използването на инфраструктурата и да направи поведението по-трудно за одит. Ясните съобщения за грешка могат да намалят времето за възстановяване, но Databricks казва, че по-трайното решение е да се проектират инструменти, които обработват предвидими вариации на входа, предоставят разумни настройки по подразбиране и отхвърлят неподдържани аргументи по начин, който дава на агента полезни насоки.
Източникът също е продуктов акаунт от Databricks, чиито инструменти са част от решението, което популяризира. Цифрите са приблизителни, базирани на вътрешни следи и предположения за годишни разходи и производителност. Акаунтът не предоставя независим одит, подробен метод за преобразуване на разходите за цифрата от 1,2 милиона долара или доказателство, че същите спестявания биха възникнали в организации с различно работно натоварване, модели, сървъри с инструменти или разходи за труд.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Какво да гледате след това
Данните за спестяванията са прогнози на Databricks от собствения флот на агенти, а не независимо одитиран резултат. Ще са необходими допълнителни доказателства за намаляването на грешките след коригиране, дали корекциите са продължили да работят с течение на времето и колко широко се прилага подходът към други агентни системи, инструменти и операционни среди.
Най-важното проследяване е дали Databricks измерва действителните резултати след корекциите. Източникът описва очакваните отпадъци преди отстраняването, но не отчита процент грешки след коригиране, намаление на токена, промяна в оборотите за възстановяване или проверени годишни спестявания. Тези измервания биха помогнали да се разграничи правдоподобна диагноза от трайно оперативно подобрение.
Екипите, оценяващи подхода, трябва също така да проучат надеждността на данните за проследяване и границите на анализа. Източникът казва, че Unity Gateway записва аргументи на инструмента, грешки, токени, латентност и идентификатори на сесии, но не обсъжда вземане на проби, липсващи следи, контроли за поверителност, задържане или как се обработват чувствителни аргументи. Тези подробности имат значение, когато следите включват билети за поддръжка, регистрационни файлове, документи или други бизнес данни.
Състоянието на наличност на основните продукти също може да повлияе на приемането. Databricks казва, че Unity Gateway е общодостъпен и неговата унифицирана таблица за проследяване е в бета версия, но източникът не дава цени, лимити на услугите, изисквания за внедряване или сравнителни резултати спрямо други системи за наблюдение. Той също така не установява, че Genie One може надеждно да отговори на едни и същи въпроси в произволни схеми за проследяване.
По-общо казано, случаят повдига въпрос за разработчиците на агенти: колко гъвкавост трябва да приеме инструментът, преди разрешителната принуда да създаде нов риск за безопасността или коректността? Автоматичното преобразуване на входове или игнорирането на неочаквани аргументи може да намали отпадъците, но може също така да прикрие истински грешки. Бъдещата техническа документация или независимото тестване трябва да покаже как тези корекции за съвместимост са ограничени, регистрирани и валидирани в работни потоци с по-високи залози.