Вернуться к новостям
ИнновацииAI Understanding брифинг

Тест SWE-bench Science выявил проблемы программистов с научным программным обеспечением

В новом препринте arXiv представлен тест из 119 задач для тестирования агентов кодирования научного программного обеспечения и сообщается, что наиболее эффективный агент набрал менее 50% при проходе @1.

5 min readRead the primary source
Source-provided image accompanying SWE-bench Science benchmark finds coding agents struggle with scientific software
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.19799
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
Токен
Фрагмент текста, обрабатываемый языковыми моделями, например фрагмент слова или символ.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

Препринт arXiv представляет SWE-bench Science, тест на уровне репозитория, охватывающий 119 задач из 98 репозиториев GitHub в 20 научных областях. Авторы сообщают, что самый эффективный агент по их оценке, Claude Code с Opus-5 (макс.), получил балл pass@1 ниже 50%.

В своем анализе в документе идентифицируются четыре механизма повторяющихся отказов. Это дефицит научных знаний или абстракции; ошибочная разведка или ремонт на уровне поверхности; неполный ремонт или системная интеграция; и неспособность обобщить научные знания за пределами наблюдаемых случаев. В совокупности этот список описывает четыре различных причины, по которым восстановление может оказаться неудовлетворительным: агент может не иметь соответствующего научного понимания, следовать неадекватным или поверхностным путем, не справиться со всем восстановлением или его интеграцией или не суметь перенести знания из случаев, которые он видел, в случаи, выходящие за их рамки. В своем анализе источник представляет их как повторяющиеся механизмы, поэтому они являются частью описания неудач в статье, а не утверждением, что каждая задача демонстрирует каждый механизм.

Авторы также проводят парную абляцию, которая удаляет явные научные указания, сохраняя при этом репозиторий и исполняемый инженерный контекст. Таким образом, сравнение сохраняет инженерный контекст репозитория и исполняемого файла, изменяя при этом наличие явных научных указаний. Эта настройка используется для изучения того, что происходит, когда компонент руководства удаляется из контекста задачи, который в противном случае сохраняется. Он изолирует роль, назначенную руководству в отчетном сравнении, без изменения описания эталонных задач или добавления отдельного результата агента. Ключевым моментом в статье является контраст между сохранением инженерного контекста и удалением явного научного руководства.

Они сообщают, что хорошо обоснованное руководство может ограничить ремонт и повысить среднюю производительность и эффективность токена, в то время как плохо согласованное руководство может вызвать привязку и не обязательно улучшает точный успех ремонта. Таким образом, сообщаемый эффект является скорее условным, чем однозначно положительным: руководство может быть полезным, когда оно хорошо обосновано, но плохо выверенное руководство может управлять ремонтом посредством закрепления, не обеспечивая более точного успеха ремонта. Результат касается средней производительности и эффективности токена, а также точного успеха восстановления, и источник различает эти результаты, а не рассматривает их как взаимозаменяемые. Это полная квалификация, прилагаемая к результату руководства в предоставленном тексте.

Подробности об источнике: arxiv.org

Почему это важно

Научное программное обеспечение может функционировать как часть инструмента, используемого для получения доказательств. Тест показывает, что агенты кодирования сталкиваются с проблемами, выходящими за рамки обычного восстановления кода, включая научные рассуждения, широкий охват исправлений, системную интеграцию и применение знаний в незнакомых случаях.

Навигационная абляция также усложняет предположение о том, что добавление дополнительной научной информации автоматически сделает агент более безопасным или точным. По словам источника, полезные рекомендации улучшили среднюю производительность и эффективность токенов, но плохо согласованные рекомендации могут закрепить процесс восстановления и не обеспечить точный успех ремонта. Подразумевается не то, что научная информация не имеет ценности; дело в том, что его ценность зависит от того, насколько хорошо руководство соответствует предпринятой попытке ремонта. Таким образом, источник оставляет читателю условный результат: одна и та же общая практика предоставления указаний может быть связана с улучшением в одних обстоятельствах и с закреплением без точного исправления улучшения в других.

Этот вывод имеет практическое значение для людей, которые предоставляют заметки по предметной области, описания проблем или генерируют объяснения агентам кодирования. Эти материалы представляют собой формы научного руководства в широком смысле, используемом в обсуждении, поэтому абляция делает их качество и пригодность соответствующими процессу восстановления. Примечание, описание или пояснение могут быть предназначены для того, чтобы помочь ограничить ремонт, но сообщаемый результат означает, что одного лишь присутствия такого материала недостаточно для более точного определения успеха ремонта. Соответствующее различие проводится между полезным руководством, которое хорошо соответствует задаче, и руководством, которое плохо с ней связано. Это различие соответствует описанию источника о производительности, эффективности токена, привязке и точном успехе восстановления.

Руководство может помочь, если оно точное и хорошо соответствует задаче, в то время как дополнительный контекст все равно может направить агента к неправильному ремонту. В статье не показано абстрактно, как часто возникал каждый результат. Следовательно, предоставленный текст поддерживает квалифицированную интерпретацию, а не общее правило о добавленном контексте: он фиксирует возможные улучшения и возможное закрепление, оставляя при этом частоту этих результатов неуказанной. Важность результата заключается в этом неразрешенном состоянии. Именно согласованность указаний, а не просто наличие большего количества слов вокруг задачи, является тем, что обсуждение определяет как имеющее отношение к сообщаемому поведению.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Что посмотреть дальше

Полный документ необходим для оценки набора задач, сравнения агентов, протокола оценки и точных оценок. Важные открытые вопросы включают в себя то, насколько репрезентативны хранилища, переносятся ли результаты в реальные научные рабочие процессы и насколько надежно научное руководство улучшает ремонт, не вызывая привязки.

Результат руководства заслуживает тщательного изучения в будущих оценках. Источник сообщает о средних показателях производительности и эффективности токенов, но в аннотации не дается количественная оценка улучшения, не определяется, что считается хорошо обоснованным или плохо согласованным руководством, а также не показывается ли эффект в зависимости от научной области или парадигмы задачи. Эти упущения определяют конкретную информацию, которая все еще необходима для интерпретации результата: размер заявленного изменения, критерии для двух описаний рекомендаций и степень, в которой эффект различается в разных областях или парадигмах. До тех пор, пока эти точки не будут доступны, руководящие выводы остаются квалифицированным результатом предоставленного отчета, а не полностью определенным измерением.

Также неизвестно, приводят ли более высокие показатели производительности к более надежным научным выводам на практике. Поэтому лучший результат по эталону и более надежный вывод не представлены в прилагаемом тексте как эквивалентные результаты. Открытым остается вопрос о переходе от измерения производительности на испытательном стенде к практической научной работе, в том числе о том, говорит ли результат теста что-нибудь о надежности выводов. В проекте не представлены доказательства, разрешающие этот вопрос, поэтому он остается предметом рассмотрения наряду с деталями направляющей абляции и ее оценкой.

Препринт представляет собой испытательный стенд для изучения возможностей и недостатков агента кодирования; Судя по предоставленному тексту, он не демонстрирует безопасное развертывание, автономное научное открытие или подтвержденные улучшения опубликованных исследований. Эти ограничения определяют, что можно и что нельзя сделать из препринта, как описано здесь. За испытательным стендом можно наблюдать, что он показывает о возможностях и недостатках, в то время как более сильные утверждения, перечисленные в предложении, остаются недоказанными в предоставленном тексте. Поэтому в будущем внимание следует сосредоточить на заявленных контрольных показателях и результатах руководства, не рассматривая их как доказательство безопасности развертывания, автономного открытия или улучшения опубликованных исследований.

Сопутствующие руководства и викторины

ИИ-агентыОбъяснение моделей искусственного интеллектаОбучение искусственному интеллектуПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.
Нашли это полезным?