Какво стана
Изследователи от DX (дъщерно дружество на Atlassian), Capital One, GitHub, Google и Университета на Виктория представиха рамката CAFE(S), публикувана в ACM Queue. Рамката предоставя диагностичен речник за оценка на качеството на контекста, предоставен на агентите за кодиране на AI, като идентифицира пет специфични измерения на качеството на контекста, които влияят на производителността на агента.
Рамката CAFE(S) е разработена от мултиинституционален екип, включващ изследователи от DX, Capital One, GitHub, Google и Университета на Виктория. Той е предназначен да помогне на платформените екипи и софтуерните инженери да оценят информационните среди, които захранват агентите за кодиране на AI.
Според изследването неуспешните задачи при кодирането с изкуствен интелект често се приписват погрешно на ограничения на модела или проблеми с оркестрацията, когато често са причинени от качеството на контекста, предоставен на модела. Рамката установява пет измерения на качеството на контекста, за да помогне на екипите да идентифицират и коригират тези проблеми.
Авторите твърдят, че AI увеличава цената на лошото управление на знанието, тъй като агентите, принудени да работят с двусмислени или остарели данни, е по-вероятно да генерират грешки, които хората трябва след това да коригират.
Детайли за източника: natlawreview.com ↗
Защо има значение
Рамката CAFE(S) адресира критично тясно място в разработката на софтуер, подпомаган от AI: влошаване на производителността на модела поради входни данни с лошо качество. Чрез установяване на споделен речник за „качество на контекста“, рамката измества фокуса от възможностите на модела към инженерството на информационни среди. Това е важно, тъй като дори усъвършенстваните модели често се провалят, когато са предоставени двусмислени, непълни или остарели данни, което води до преработване на разработчиците и увеличени разходи за токени. Рамката има за цел да третира качеството на контекста като официална инженерна дисциплина, позволяваща на екипите систематично да диагностицират защо агентите се провалят и да подобрят надеждността на работните процеси за кодиране, управлявани от AI.
Рамката е предназначена да действа като „карта с показатели за качество“, която стои на върха на съществуващите стекове за разработка на софтуер. Чрез стандартизиране на езика, използван за обсъждане на контекста, авторите се надяват да позволят по-съзнателно проектиране и поддръжка на тръбопроводите за данни, които поддържат AI агенти.
Практическото значение за инженерните екипи е преминаване към третиране на информационната среда като първокласна инженерна грижа. Този подход има за цел да намали „разхищението на токени“ и рисковете за надеждността, потенциално подобрявайки възвръщаемостта на инвестициите за организациите, които мащабират използването на инструменти за кодиране на AI.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
Какво да гледате след това
Понастоящем рамката служи като диагностичен речник, а не като система за количествено измерване. Бъдещите разработки ще се съсредоточат върху създаването на надеждни показатели за оценка на тези пет измерения в мащаб и определяне как специфичните подобрения в качеството на контекста корелират с измеримите резултати в доставката на софтуер, производителността на разработчиците и организационната ефективност.
Изследването изрично отбелязва, че CAFE(S) е рамка за дефиниция, а не система за автоматизирано измерване. Индустрията ще трябва да следи за последващи изследвания или инструменти, които се опитват да определят количествено тези пет измерения.
Наблюдателите трябва да наблюдават дали тази рамка е възприета от основните платформи за разработка или е интегрирана в съществуващите работни потоци на агенти за кодиране на ИИ, за да предоставят стандартизирани диагностични доклади.