Що сталося
Дослідники з DX (дочірня компанія Atlassian), Capital One, GitHub, Google і Університету Вікторії представили структуру CAFE(S), опубліковану в ACM Queue. Фреймворк надає діагностичний словник для оцінки якості контексту, що надається агентам кодування ШІ, ідентифікуючи п’ять конкретних вимірів якості контексту, які впливають на продуктивність агента.
Фреймворк CAFE(S) був розроблений багатоінституційною командою, включаючи дослідників з DX, Capital One, GitHub, Google та Університету Вікторії. Він розроблений, щоб допомогти командам платформ та розробникам програмного забезпечення оцінити інформаційні середовища, які живлять агентів кодування ШІ.
Згідно з дослідженням, помилки завдань у кодуванні штучного інтелекту часто неправильно пояснюються обмеженнями моделі або проблемами оркестровки, коли вони часто спричинені якістю контексту, наданого моделі. Структура встановлює п’ять вимірів якості контексту, щоб допомогти командам визначити та виправити ці проблеми.
Автори стверджують, що штучний інтелект збільшує вартість поганого управління знаннями, оскільки агенти, змушені працювати з неоднозначними або застарілими даними, з більшою ймовірністю створять помилки, які люди повинні потім виправити.
Деталі джерела: natlawreview.com ↗
Чому це важливо
Інфраструктура CAFE(S) усуває важливе вузьке місце в розробці програмного забезпечення за допомогою штучного інтелекту: погіршення продуктивності моделі через вхідні дані низької якості. Встановлюючи спільний словник для «якості контексту», структура зміщує фокус з можливостей моделі на розробку інформаційних середовищ. Це важливо, оскільки навіть просунуті моделі часто виходять з ладу, якщо надають неоднозначні, неповні або застарілі дані, що призводить до переробки розробниками та збільшення вартості маркерів. Фреймворк має на меті розглядати якість контексту як формальну інженерну дисципліну, що дозволяє командам систематично діагностувати, чому агенти виходять з ладу, і підвищувати надійність робочих процесів кодування, керованих ШІ.
Фреймворк призначений для того, щоб діяти як «картка показників якості», яка розташовується поверх існуючих стеків розробки програмного забезпечення. Стандартизуючи мову, яка використовується для обговорення контексту, автори сподіваються забезпечити більш продуманий дизайн і підтримку конвеєрів даних, які підтримують агентів ШІ.
Практичним наслідком для команд інженерів є перехід до розгляду інформаційного середовища як першокласної інженерної проблеми. Цей підхід має на меті зменшити «втрату маркерів» і ризики надійності, потенційно підвищуючи рентабельність інвестицій для організацій, які масштабують використання інструментів кодування ШІ.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
Що дивитися далі
В даний час система слугує діагностичним словником, а не системою кількісного вимірювання. Подальші розробки будуть зосереджені на створенні надійних показників для оцінки цих п’яти вимірів у масштабі та визначення того, як конкретні покращення якості контексту співвідносяться з вимірними результатами в постачанні програмного забезпечення, продуктивності розробників та ефективності організації.
Дослідження чітко зазначає, що CAFE(S) є основою для визначення, а не системою для автоматизованого вимірювання. Галузь повинна стежити за подальшими дослідженнями чи інструментами, які намагатимуться кількісно визначити ці п’ять вимірів.
Спостерігачі повинні стежити за тим, чи ця структура прийнята основними платформами розробки чи інтегрована в існуючі робочі процеси агентів кодування AI для надання стандартизованих діагностичних звітів.