ДалееСледующее руководство
Тесты SWE-bench и Coding Agent
Технический
Техническое РУКОВОДСТВО
Оценка агентов ИИ означает измерение того, насколько хорошо многоэтапная система достигает целей в реалистичных условиях.
Это касается того, выполнил ли он задачу, был ли выбранный путь разумным, правильно ли он использовал инструменты, сколько это стоило и остался ли он в безопасности. Агенты выполняют множество шагов и имеют побочные эффекты, поэтому проверки одного ответа по ссылке недостаточно, и хорошие оценки обычно запускают агент в контролируемой среде и проверяют конечное состояние.
Оценка агента учитывает несколько вещей. Успех задачи определяет, была ли цель действительно достигнута, в идеале это проверяется путем последующего просмотра среды: тесты пройдены, правильная запись существует, файл имеет правильное содержимое. Качество траектории определяет, были ли шаги разумными, без петель, бессмысленных вызовов или удачных догадок. Корректность использования инструментов проверяет, выбрал ли агент правильные инструменты с действительными аргументами и обработал ошибки. Стоимость и задержка отслеживают токены, звонки и время на настенных часах. Безопасность проверяет, избегал ли агент вредных или несанкционированных действий и сопротивлялся быстрому внедрению. Экологические критерии стали ведущим подходом. SWE-bench от исследователей из Принстона просит агентов решить реальные проблемы GitHub и сверяет результаты с тестами проекта, а SWE-bench Verified — это подмножество, проверенное человеком. WebArena предоставляет автономные веб-сайты для задач просмотра. OSWorld тестирует агентов, работающих с полноценными компьютерными рабочими столами. GAIA ставит вопросы, требующие многоэтапных исследований и инструментов. Пакет tau-bench имитирует пользователей и политику домена, а также вводит метрику pass^k, которая определяет, добивается ли агент успеха в каждой из k повторных попыток. При выставлении оценок используются три основных вида проверок: проверки результатов на основе кода, которые являются точными и дешевыми; системы оценивания на основе моделей, которые оценивают транскрипты по критериям, которые являются гибкими, но требуют проверки на основе человеческого мнения; и человеческая проверка, которая является наиболее заслуживающей доверия и самой медленной. Распространенной ошибкой является доверие только к публичным спискам лидеров. Контрольные показатели могут просочиться в данные обучения, стать насыщенными или не соответствовать вашей собственной рабочей нагрузке. Еще одна ошибка — считать один прогон правдой, поскольку агенты недетерминированы, и небольшие различия в вероятности успеха могут оказаться шумом. Команды получают максимальную пользу от частного набора оценок, созданного на основе их собственных реальных задач и неудач, запускаемого неоднократно и отслеживаемого с течением времени.
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
По мере того, как агенты берутся за более длительные задачи, оценки смещаются в сторону более длинных горизонтов, более реалистичных сред и показателей надежности и стоимости, а также пиковых возможностей. Перенасыщение и загрязнение тестов, вероятно, будут продолжать подталкивать разработчиков создавать новые задачи и больше полагаться на частные наборы тестов, специфичные для конкретной предметной области. Оценкам безопасности и защищенности, включая устойчивость к быстрому внедрению, уделяется все больше внимания по мере того, как агенты получают доступ к реальным системам. Не существует согласованного стандарта для оценки поведения агентов с открытым исходным кодом, поэтому сочетание проверок результатов, калиброванных моделей и анализа человеком, вероятно, останется обычной практикой.
Команда агента кодирования оценивает каждую попытку по тому, пройдены ли скрытые тесты репозитория после исправления агента, как это делает SWE-bench, вместо того, чтобы судить, правильно ли выглядит разница.
Агент по обслуживанию клиентов работает с симулированными пользователями и фиктивной базой данных бронирования. Оценщики проверяют, соответствует ли окончательное состояние базы данных правильному результату и соблюдает ли агент политику возврата средств.
Команда инженеров запускает каждую задачу пять раз и сообщает, как часто агент успешно справляется со всеми пятью, что демонстрирует нестабильное поведение, которое можно было бы скрыть за один раз.
Компания добавляет пакет безопасности, в котором задачи включают в себя внедренную инструкцию по удалению файлов или утечке данных, и она считает успешный запуск как неудачный, если агент подчинился.
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Оценка агентов ИИ означает измерение того, насколько хорошо многоэтапная система достигает целей в реалистичных условиях. Это касается того, выполнил ли он задачу, был ли выбранный путь разумным, правильно ли он использовал инструменты, сколько это стоило и остался ли он в безопасности. Агенты выполняют множество шагов и имеют побочные эффекты, поэтому проверки одного ответа по ссылке недостаточно, и хорошие оценки обычно запускают агент в контролируемой среде и проверяют конечное состояние.
Многоэтапные действия меняют окружение, поэтому вам нужно проверять, что на самом деле произошло и как, а не только окончательный текст.
Проверки на основе среды (в данном случае тесты проекта) определяют, действительно ли исправление работает.
Требование успеха всех k попыток позволяет измерить согласованность, что важно для агентов, развернутых для реальных пользователей.
Проверки траектории оценивают пройденный путь, улавливая петли и потери, которые не учитываются только при проверке результатов.
Оценщики моделей обладают гибкостью, но их следует проверять на предмет человеческого суждения и следить за систематической предвзятостью.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Тесты SWE-bench и Coding Agent
Технический