Что случилось
Исследователи из DX (дочерней компании Atlassian), Capital One, GitHub, Google и Университета Виктории представили структуру CAFE(S), опубликованную в ACM Queue. Платформа предоставляет диагностический словарь для оценки качества контекста, предоставляемого агентам кодирования ИИ, определяя пять конкретных аспектов качества контекста, которые влияют на производительность агентов.
Структура CAFE(S) была разработана межинституциональной командой, в которую вошли исследователи из DX, Capital One, GitHub, Google и Университета Виктории. Он предназначен для того, чтобы помочь командам разработчиков платформ и разработчикам программного обеспечения оценить информационную среду, которая питает агентов кодирования ИИ.
Согласно исследованию, сбои в выполнении задач при кодировании ИИ часто ошибочно связывают с ограничениями модели или проблемами оркестровки, тогда как они часто вызваны качеством контекста, предоставленного модели. Структура устанавливает пять измерений качества контекста, чтобы помочь командам выявлять и устранять эти проблемы.
Авторы утверждают, что ИИ увеличивает стоимость плохого управления знаниями, поскольку агенты, вынужденные работать с неоднозначными или устаревшими данными, с большей вероятностью будут совершать ошибки, которые затем придется исправлять людям.
Подробности об источнике: natlawreview.com ↗
Почему это важно
Структура CAFE(S) устраняет критическое узкое место в разработке программного обеспечения с помощью ИИ: ухудшение производительности моделей из-за низкого качества входных данных. Создавая общий словарь для «качества контекста», платформа смещает акцент с возможностей модели на проектирование информационных сред. Это важно, поскольку даже продвинутые модели часто терпят неудачу, если им предоставляются неоднозначные, неполные или устаревшие данные, что приводит к переделке разработчиками и увеличению стоимости токенов. Платформа призвана рассматривать качество контекста как формальную инженерную дисциплину, позволяющую командам систематически диагностировать, почему агенты терпят неудачу, и повышать надежность рабочих процессов кодирования, управляемых ИИ.
Платформа призвана действовать как «карта показателей качества», которая находится поверх существующих стеков разработки программного обеспечения. Стандартизируя язык, используемый для обсуждения контекста, авторы надеются обеспечить более продуманное проектирование и обслуживание конвейеров данных, поддерживающих агентов ИИ.
Практическим следствием для инженерных групп является переход к обращению с информационной средой как с первоклассной инженерной задачей. Этот подход направлен на сокращение «потери токенов» и рисков надежности, потенциально повышая окупаемость инвестиций для организаций, масштабирующих использование инструментов кодирования ИИ.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
Что посмотреть дальше
В настоящее время эта структура служит диагностическим словарем, а не системой количественных измерений. Будущие разработки будут сосредоточены на создании надежных показателей для оценки этих пяти измерений в масштабе и определения того, как конкретные улучшения качества контекста коррелируют с измеримыми результатами в доставке программного обеспечения, производительности разработчиков и организационной эффективности.
В исследовании прямо отмечается, что CAFE(S) представляет собой основу для определения, а не систему автоматического измерения. Отрасли необходимо будет следить за последующими исследованиями или инструментами, которые попытаются количественно оценить эти пять измерений.
Наблюдателям следует следить за тем, принята ли эта структура основными платформами разработки или интегрирована в существующие рабочие процессы агента кодирования ИИ, чтобы обеспечить стандартизированную диагностическую отчетность.